Naar hoofdinhoud
Home/Nieuws/Common Crawl: meeste llms.txt-bestanden zijn nutteloze sjablonen
SEO

Common Crawl: meeste llms.txt-bestanden zijn nutteloze sjablonen

A
Angelo van Cleef
·8 september 2026·3 min leestijd
Direct antwoord
Common Crawl analyseerde 584.107 llms.txt-bestanden en concludeert dat de meeste generieke sjablonen zijn zonder eigen inhoud. Veel bestanden missen links naar pagina's, en sommige bevatten crawler-regels die het formaat niet kan afdwingen, in tegenstelling tot robots.txt dat wél technische handhaving kent.

Common Crawl doorzocht 584.107 llms.txt-bestanden op het open web en trekt een nuchtere conclusie: de meeste zijn kopieën van een sjabloon, missen links naar echte content en sommige eigenaren proberen er zelfs crawler-regels in te stoppen die het bestand technisch niet kan afdwingen. Het format dat AI-modellen moest helpen jouw site beter te begrijpen, wordt in de praktijk regelmatig verward met robots.txt, terwijl de twee weinig met elkaar te maken hebben.

Wat Common Crawl vond in de dataset

Het onderzoeksteam van Common Crawl doorzocht zijn webarchief op bestanden met de naam llms.txt en verzamelde er ruim een half miljoen. Bij het doorlichten van die bestanden viel vooral op hoe weinig variatie er zit tussen de verschillende sites.

Een groot deel van de bestanden bevat vrijwel identieke openingszinnen en structuur, wat erop wijst dat ze rechtstreeks uit generatoren of voorbeeldbestanden zijn gekopieerd zonder verdere aanpassing.

Sjablonen zonder eigen inhoud

Het idee achter llms.txt is dat een site in eigen woorden en met concrete links aangeeft welke pagina's relevant zijn voor AI-modellen. In de praktijk gebeurt dat volgens Common Crawl maar sporadisch.

  • Veel bestanden herhalen generieke voorbeeldzinnen zonder site-specifieke details
  • Een aanzienlijk deel bevat geen enkele link naar producten, documentatie of artikelen
  • Bestanden zijn vaak niet bijgewerkt sinds de eerste, automatisch gegenereerde versie

Zonder links en zonder unieke inhoud heeft zo'n bestand feitelijk geen functie meer. Het staat er, maar het stuurt niemand ergens naartoe.

Verwarring met robots.txt

Opvallender is dat een deel van de site-eigenaren llms.txt gebruikt om crawler-instructies in te zetten, alsof het om robots.txt gaat. Denk aan regels die AI-bots zouden moeten weren van bepaalde delen van de site.

Robots.txt is een protocol dat serieuze crawlers al decennialang respecteren. Llms.txt heeft die status niet: er is geen standaardisatieorgaan dat het format afdwingt en de meeste AI-crawlers lezen het bestand niet eens actief in hun beslissingsproces.

Wie dus verwacht dat een Disallow-achtige regel in llms.txt bots weghoudt, komt bedrogen uit. Het bestand is in de kern een aanbeveling, geen slot op de deur.

Wat dit betekent voor jouw site

De conclusie van Common Crawl is niet dat llms.txt waardeloos is, maar dat de meeste implementaties het potentieel simpelweg niet benutten.

  • Vul het bestand met eigen, specifieke tekst in plaats van sjabloontaal over te nemen
  • Voeg concrete links toe naar de pagina's die je écht onder de aandacht wilt brengen
  • Gebruik robots.txt voor daadwerkelijke toegangsbeperkingen, niet llms.txt
  • Behandel llms.txt als experimenteel onderdeel van je SEO-strategie, niet als verplichting

Zolang er geen brede, technische handhaving achter het format zit, blijft llms.txt vooral een kans om je site helder te presenteren aan AI-systemen, niet een manier om ze te sturen of te weren.

Bron: Search Engine Journal

Gerelateerde artikelen

A
Geschreven door
Professioneel full-stack developer & oprichter van CreativeDeals

Angelo van Cleef is full-stack developer met 25+ jaar ervaring in o.a. PHP, JavaScript, TypeScript en Golang. Hij combineert softwareontwikkeling met SEO, SEA en platformgroei. Op het CreativeDeals-blog deelt hij praktische kennis voor ondernemers en developers.

Online:
Josh