Common Crawl doorzocht 584.107 llms.txt-bestanden op het open web en trekt een nuchtere conclusie: de meeste zijn kopieën van een sjabloon, missen links naar echte content en sommige eigenaren proberen er zelfs crawler-regels in te stoppen die het bestand technisch niet kan afdwingen. Het format dat AI-modellen moest helpen jouw site beter te begrijpen, wordt in de praktijk regelmatig verward met robots.txt, terwijl de twee weinig met elkaar te maken hebben.
Wat Common Crawl vond in de dataset
Het onderzoeksteam van Common Crawl doorzocht zijn webarchief op bestanden met de naam llms.txt en verzamelde er ruim een half miljoen. Bij het doorlichten van die bestanden viel vooral op hoe weinig variatie er zit tussen de verschillende sites.
Een groot deel van de bestanden bevat vrijwel identieke openingszinnen en structuur, wat erop wijst dat ze rechtstreeks uit generatoren of voorbeeldbestanden zijn gekopieerd zonder verdere aanpassing.
Sjablonen zonder eigen inhoud
Het idee achter llms.txt is dat een site in eigen woorden en met concrete links aangeeft welke pagina's relevant zijn voor AI-modellen. In de praktijk gebeurt dat volgens Common Crawl maar sporadisch.
- Veel bestanden herhalen generieke voorbeeldzinnen zonder site-specifieke details
- Een aanzienlijk deel bevat geen enkele link naar producten, documentatie of artikelen
- Bestanden zijn vaak niet bijgewerkt sinds de eerste, automatisch gegenereerde versie
Zonder links en zonder unieke inhoud heeft zo'n bestand feitelijk geen functie meer. Het staat er, maar het stuurt niemand ergens naartoe.
Verwarring met robots.txt
Opvallender is dat een deel van de site-eigenaren llms.txt gebruikt om crawler-instructies in te zetten, alsof het om robots.txt gaat. Denk aan regels die AI-bots zouden moeten weren van bepaalde delen van de site.
Robots.txt is een protocol dat serieuze crawlers al decennialang respecteren. Llms.txt heeft die status niet: er is geen standaardisatieorgaan dat het format afdwingt en de meeste AI-crawlers lezen het bestand niet eens actief in hun beslissingsproces.
Wie dus verwacht dat een Disallow-achtige regel in llms.txt bots weghoudt, komt bedrogen uit. Het bestand is in de kern een aanbeveling, geen slot op de deur.
Wat dit betekent voor jouw site
De conclusie van Common Crawl is niet dat llms.txt waardeloos is, maar dat de meeste implementaties het potentieel simpelweg niet benutten.
- Vul het bestand met eigen, specifieke tekst in plaats van sjabloontaal over te nemen
- Voeg concrete links toe naar de pagina's die je écht onder de aandacht wilt brengen
- Gebruik robots.txt voor daadwerkelijke toegangsbeperkingen, niet llms.txt
- Behandel llms.txt als experimenteel onderdeel van je SEO-strategie, niet als verplichting
Zolang er geen brede, technische handhaving achter het format zit, blijft llms.txt vooral een kans om je site helder te presenteren aan AI-systemen, niet een manier om ze te sturen of te weren.
Bron: Search Engine Journal