Een XML-sitemap is een bestand dat de URL’s van een website opsomt die bedoeld zijn om door zoekmachines te worden gecrawld. De structuur ervan bepaalt hoe snel Google de pagina’s ontdekt, crawlt en indexeert. Een slecht gebouwde sitemap veroorzaakt geen zichtbare fouten, maar vertraagt stilletjes de indexering van strategische inhoud.
Verouderde tags in de XML-sitemap: wat te verwijderen
De oorspronkelijke specificatie van het sitemaps.org-protocol voorziet in verschillende optionele tags voor elke URL. Onder deze tags worden priority en changefreq nu genegeerd door Google. Het behouden van deze tags in het bestand biedt geen voordelen en verzwart onnodig het document.
De tag priority kende een waarde toe tussen 0.0 en 1.0 om de relatieve belangrijkheid van een pagina aan te geven. Google houdt hier geen rekening meer mee bij het plannen van zijn bezoeken. De tag changefreq, die bedoeld is om de frequentie van updates aan te geven (dagelijks, wekelijks, maandelijks), wordt op dezelfde manier behandeld: de bot negeert deze.
Het verwijderen van deze twee velden vermindert de bestandsgrootte en elimineert een valse indruk van controle over de crawl. De informatie van de site actuweb fr illustreert goed hoe een opgeruimde sitemap eruitziet, gericht op de URL’s en hun daadwerkelijk gebruikte metadata.
De enige optionele tag die een echte waarde behoudt, is lastmod, op voorwaarde dat deze correct wordt gebruikt, wat het onderwerp is van de volgende sectie.

Lastmod van de sitemap: het enige betrouwbare versheidsignaal
Het veld lastmod geeft de datum van de laatste significante wijziging van een pagina aan. Wanneer deze datum betrouwbaar is, gebruikt Googlebot deze om de recrawl van recent bijgewerkte inhoud te prioriteren. Dit is de meest directe hefboom die een webmaster heeft om de opname van een wijziging te versnellen.
Lastmod mag alleen de werkelijke wijzigingen in de inhoud weerspiegelen, niet de datum van automatische regeneratie van het bestand. Een sitemap waarin alle URL’s de datum van vandaag weergeven, geeft een tegenstrijdig signaal: als alles is veranderd, is er niets veranderd. Google negeert uiteindelijk het veld volledig voor dit domein.
Veelvoorkomende fouten met lastmod
- Lastmod bijwerken na een cosmetische wijziging (correctie van een spatie, wijziging van de footer) zonder de redactionele inhoud van de pagina aan te raken
- De sitemap dagelijks regenereren via een cronjob die de datum van vandaag op alle invoeren toepast, zelfs op diegene die al maanden onveranderd zijn
- Lastmod leeg laten op recent herwerkte pagina’s, waardoor Google de update niet kan detecteren
Een exacte lastmod op een bijgewerkte productpagina (nieuwe prijs, nieuwe voorraad, nieuwe beschrijving) versnelt de recrawl van deze pagina. Bij een blogartikel dat opnieuw is gepubliceerd met bijgewerkte gegevens, is het effect hetzelfde.
URL-filtering: welke pagina’s in de sitemap opnemen
Een goed presterende sitemap somt niet alle URL’s van de site op. Het bevat alleen de pagina’s die het waard zijn om in de zoekresultaten te verschijnen. Elke URL in de sitemap moet een HTTP 200-code retourneren en een meta robots index-tag bevatten.
Het opnemen van pagina’s in noindex, 301-omleidingen, gecanonicaliseerde URL’s naar andere pagina’s of 404-foutpagina’s vervuilt het bestand. De bot besteedt crawlbudget aan URL’s die nooit tot indexering zullen leiden.
Pagina’s die systematisch moeten worden uitgesloten
- Pagina’s met interne zoekresultaten, facetfilters of diepe paginering zonder unieke inhoud
- Pagina’s die zijn beschermd door een login of die een omleiding naar de inlogpagina geven
- URL’s met trackingparameters (utm, sessie-ID) die pagina’s dupliceren die al aanwezig zijn zonder parameter
- Pagina’s in concept, staging of alleen toegankelijk via een preprod-subdomein
Op een e-commerce site met duizenden productpagina’s wordt filtering een regelmatig werk. De pagina’s van definitief uitverkochte producten, die 404 zijn gegaan of zijn omgeleid, moeten bij elke update uit de sitemap worden verwijderd.

Sitemap-index en segmentatie per type inhoud
Het protocol staat maximaal 50.000 URL’s per sitemapbestand toe. Daarboven, of wanneer de site verschillende soorten inhoud bevat (artikelen, producten, afbeeldingen, video’s), maakt een sitemap-index die meerdere subsitemaps verwijst het diagnosticeren en volgen gemakkelijker.
Segmenteren per type inhoud (een sitemap voor artikelen, een voor categorieën, een voor productpagina’s) maakt het snel mogelijk om te identificeren welk segment een indexeringsprobleem in Google Search Console veroorzaakt. Als het indexeringspercentage daalt op de product-sitemap maar stabiel blijft op de artikel-sitemap, is het probleem gelokaliseerd.
Gespecialiseerde sitemaps voor afbeeldingen en video’s
De sitemaps voor afbeeldingen en video’s gebruiken extensies van het XML-protocol. Ze geven Google aan dat media in de pagina’s zijn geïntegreerd, wat hun zichtbaarheid in Google Afbeeldingen en Google Video verbetert. Voor een site waarvan het verkeer sterk afhankelijk is van visuele inhoud (portfolio, mode-e-commerce, recepten), verhoogt een speciale afbeeldingssitemap het indexeringsoppervlak zonder de inhoud van de pagina’s te wijzigen.
De videositemap vereist specifieke metadata: titel, beschrijving, URL van de miniatuur, duur. Zonder deze informatie houdt Google de invoer niet in aanmerking.
Indiening en verificatie van de sitemap in Search Console
De sitemap in het robots.txt-bestand verklaren via de richtlijn Sitemap: gevolgd door de absolute URL van het bestand blijft de eenvoudigste en meest universele methode. Het werkt voor alle zoekmachines die compatibel zijn met het protocol.
Handmatige indiening via Google Search Console of Bing Webmaster Tools biedt een extra voordeel: een statusrapport dat het aantal ingediende URL’s, het aantal geïndexeerde URL’s en eventuele gedetecteerde fouten aangeeft. Het verschil tussen ingediende URL’s en geïndexeerde URL’s is de eerste kwaliteitsindicator van de sitemap.
Een aanhoudend verschil signaleert problematische URL’s: duplicaatinhoud, te dunne inhoud, pagina’s geblokkeerd door robots.txt of intermitterende serverfouten. Het corrigeren van deze verschillen komt neer op het schoonmaken van de sitemap net zo goed als het corrigeren van de pagina’s zelf.
De regelmatige controle van dit rapport, gekoppeld aan een update van de sitemap na elke batch publicaties of verwijderingen van pagina’s, houdt de consistentie tussen het bestand en de werkelijke staat van de site in stand. Een sitemap die de indexeerbare structuur van een site nauwkeurig weerspiegelt, geeft Googlebot een betrouwbare kaart, en een betrouwbare kaart verkort de weg naar indexering.



