Googlebot leest niet altijd je volledige robots.txt-bestand, en dat kan ongemerkt gevolgen hebben voor je zichtbaarheid in Google. Google-medewerker John Mueller legt uit dat Googlebot een harde bestandsgrens van 500 kilobyte hanteert: alles wat daarna in het bestand staat, wordt genegeerd alsof het er nooit heeft gestaan.
Voor de meeste websites is dat geen probleem, maar bij grote platforms met automatisch gegenereerde robots.txt-bestanden kan het cruciale disallow-regels onzichtbaar maken voor Google. Het gevolg: pagina's die je bewust wilde afschermen, verschijnen alsnog in de zoekresultaten.
De 500 kilobyte grens in de praktijk
Google documenteert deze limiet al langer in de officiële richtlijnen voor robots.txt, maar in de praktijk weten weinig sitebeheerders dat hun bestand er daadwerkelijk tegenaan kan lopen. Een robots.txt van 500 kilobyte staat voor duizenden regels tekst, dus het klinkt als een ruime marge.
Toch groeien sommige bestanden sneller dan verwacht, vooral wanneer regels automatisch worden toegevoegd door een CMS, plugin of build-proces zonder enige controle op de totale omvang.
Waarom dit vaker voorkomt dan je zou verwachten
Het risico zit hem niet in kleine bedrijfswebsites, maar in platforms waar URL-structuren explosief groeien. Denk aan filters, zoekparameters en sessie-ID's die elk hun eigen regel krijgen in plaats van te worden afgevangen met een patroon.
- E-commerce sites met uitgebreide gefacetteerde navigatie en filtercombinaties
- Platforms die per productvariant of sessie automatisch nieuwe disallow-regels genereren
- Sites waar test- en staging-paden stelselmatig worden toegevoegd zonder opschoning
- CMS-plugins die URL-uitsluitingen toevoegen zonder limiet op het totale bestand
In al deze gevallen groeit het bestand geleidelijk, tot het ergens de 500 kilobyte overschrijdt zonder dat iemand het merkt. De regels die dan wegvallen, staan vaak onderaan, en dat zijn niet per definitie de minst belangrijke.
Zo controleer je of jouw robots.txt risico loopt
De controle kost weinig tijd en voorkomt een vervelende verrassing in Search Console. Begin met het opvragen van de bestandsgrootte en test vervolgens welke regels Google daadwerkelijk verwerkt.
- Open het bestand direct via jouwdomein.nl/robots.txt en controleer de bestandsgrootte in de browser
- Gebruik de robots.txt-tester in Google Search Console om te zien tot welk punt Google het bestand leest
- Zet de belangrijkste disallow-regels bovenaan, niet onderaan het bestand
- Vervang lange opsommingen van losse URL's door wildcardpatronen waar mogelijk
- Controleer periodiek of automatisch gegenereerde regels niet ongecontroleerd blijven groeien
Een robots.txt-bestand is techniek uit de begindagen van het web, maar de manier waarop Google het interpreteert, blijft direct van invloed op moderne SEO-resultaten. Wie grote of automatisch beheerde sites runt, doet er goed aan deze grens gewoon een keer na te meten in plaats van erop te vertrouwen dat het wel goed zit.
Bron: Search Engine Journal
