Cloudflare heeft een nieuwe instelling gelanceerd waarmee website-eigenaren AI-crawlers de toegang tot hun content voor trainingsdoeleinden kunnen weigeren, zonder daarmee ook crawlers te blokkeren die nodig zijn om in zoekmachines te blijven verschijnen. De functie heet "Disallow AI Training" en maakt onderscheid tussen crawlers die alleen voor zoekindexering dienen en crawlers die dezelfde content gebruiken om taalmodellen te trainen. Google en Apple respecteren dat onderscheid al, bij Bing moet Microsoft de ondersteuning via robots.txt nog toevoegen.
Het probleem dat Cloudflare oplost
Grote techbedrijven sturen crawlers die meerdere doelen tegelijk dienen. Googlebot haalt pagina's op voor de zoekindex, maar diezelfde crawlinginfrastructuur voedt ook Google's eigen AI-modellen.
Wie AI-training volledig wilde weren, liep tot nu toe het risico de hele crawler te blokkeren en daarmee ook zichtbaarheid in zoekresultaten kwijt te raken. Dat spanningsveld hield veel sites tegen om robots.txt-regels tegen AI-scraping in te stellen.
Hoe Disallow AI Training werkt
Met de nieuwe instelling geef je via het Cloudflare-dashboard aan dat je content niet voor AI-training gebruikt mag worden, terwijl crawlers voor zoekmachine-indexering gewoon toegang houden. Cloudflare vertaalt die keuze naar de juiste signalen richting de afzonderlijke crawlers van elke aanbieder.
- Zoekmachine-indexering blijft intact
- AI-trainingscrawlers krijgen een expliciete weigering
- Geen technische kennis van losse user-agents nodig
Google en Apple doen mee, Microsoft nog niet
Google en Apple honoreren de opt-out al voor hun respectieve AI-trainingscrawlers. Sites die de instelling activeren, kunnen erop rekenen dat hun content buiten de trainingsdata van die modellen blijft.
Microsoft biedt die ondersteuning via robots.txt nog niet aan. Bing-crawlers reageren dus vooralsnog niet op dit specifieke signaal, en wanneer dat verandert is niet bekendgemaakt.
Wat betekent dit voor jouw website
Voor site-eigenaren die zich zorgen maken over het scrapen van content voor AI-training, maar wel afhankelijk zijn van organisch zoekverkeer, is dit een praktische tussenoplossing. Je hoeft niet langer te kiezen tussen zichtbaarheid in Google en controle over hergebruik van je content.
Zolang Bing niet meedoet, blijft je content mogelijk alsnog bruikbaar voor Microsoft's AI-trainingsdoeleinden, tenzij je daarvoor apart maatregelen neemt in robots.txt.
Bron: Search Engine Journal