Naar hoofdinhoud
Home/Blog/Waarom Google robots.txt soms negeert (en SEO schaadt)
SEO

Waarom Google robots.txt soms negeert (en SEO schaadt)

A
Angelo van Cleef
·25 juli 2026·3 min leestijd
Waarom Google robots.txt soms negeert (en SEO schaadt)
Direct antwoord
Googlebot kan robots.txt-regels negeren wanneer het bestand groter is dan 500 kilobyte, want alles na die grens wordt simpelweg niet meer gelezen. John Mueller van Google waarschuwt dat automatisch gegenereerde robots.txt-bestanden hierdoor belangrijke disallow-regels kunnen verliezen, waardoor pagina's die eigenlijk geblokkeerd moesten zijn alsnog door Google geïndexeerd raken.

Googlebot leest niet altijd je volledige robots.txt-bestand, en dat kan ongemerkt gevolgen hebben voor je zichtbaarheid in Google. Google-medewerker John Mueller legt uit dat Googlebot een harde bestandsgrens van 500 kilobyte hanteert: alles wat daarna in het bestand staat, wordt genegeerd alsof het er nooit heeft gestaan.

Voor de meeste websites is dat geen probleem, maar bij grote platforms met automatisch gegenereerde robots.txt-bestanden kan het cruciale disallow-regels onzichtbaar maken voor Google. Het gevolg: pagina's die je bewust wilde afschermen, verschijnen alsnog in de zoekresultaten.

De 500 kilobyte grens in de praktijk

Google documenteert deze limiet al langer in de officiële richtlijnen voor robots.txt, maar in de praktijk weten weinig sitebeheerders dat hun bestand er daadwerkelijk tegenaan kan lopen. Een robots.txt van 500 kilobyte staat voor duizenden regels tekst, dus het klinkt als een ruime marge.

Toch groeien sommige bestanden sneller dan verwacht, vooral wanneer regels automatisch worden toegevoegd door een CMS, plugin of build-proces zonder enige controle op de totale omvang.

Waarom dit vaker voorkomt dan je zou verwachten

Het risico zit hem niet in kleine bedrijfswebsites, maar in platforms waar URL-structuren explosief groeien. Denk aan filters, zoekparameters en sessie-ID's die elk hun eigen regel krijgen in plaats van te worden afgevangen met een patroon.

  • E-commerce sites met uitgebreide gefacetteerde navigatie en filtercombinaties
  • Platforms die per productvariant of sessie automatisch nieuwe disallow-regels genereren
  • Sites waar test- en staging-paden stelselmatig worden toegevoegd zonder opschoning
  • CMS-plugins die URL-uitsluitingen toevoegen zonder limiet op het totale bestand

In al deze gevallen groeit het bestand geleidelijk, tot het ergens de 500 kilobyte overschrijdt zonder dat iemand het merkt. De regels die dan wegvallen, staan vaak onderaan, en dat zijn niet per definitie de minst belangrijke.

Zo controleer je of jouw robots.txt risico loopt

De controle kost weinig tijd en voorkomt een vervelende verrassing in Search Console. Begin met het opvragen van de bestandsgrootte en test vervolgens welke regels Google daadwerkelijk verwerkt.

  • Open het bestand direct via jouwdomein.nl/robots.txt en controleer de bestandsgrootte in de browser
  • Gebruik de robots.txt-tester in Google Search Console om te zien tot welk punt Google het bestand leest
  • Zet de belangrijkste disallow-regels bovenaan, niet onderaan het bestand
  • Vervang lange opsommingen van losse URL's door wildcardpatronen waar mogelijk
  • Controleer periodiek of automatisch gegenereerde regels niet ongecontroleerd blijven groeien

Een robots.txt-bestand is techniek uit de begindagen van het web, maar de manier waarop Google het interpreteert, blijft direct van invloed op moderne SEO-resultaten. Wie grote of automatisch beheerde sites runt, doet er goed aan deze grens gewoon een keer na te meten in plaats van erop te vertrouwen dat het wel goed zit.

Bron: Search Engine Journal

Gerelateerde artikelen

A
Geschreven door
Professioneel full-stack developer & oprichter van CreativeDeals

Angelo van Cleef is full-stack developer met 25+ jaar ervaring in o.a. PHP, JavaScript, TypeScript en Golang. Hij combineert softwareontwikkeling met SEO, SEA en platformgroei. Op het CreativeDeals-blog deelt hij praktische kennis voor ondernemers en developers.

Online:
Akira