Een anekdotische melding uit de SEO-gemeenschap doet stof opwaaien: het blokkeren van AI-trainingsbots via Cloudflare zou in bepaalde gevallen ook Googlebot buitensluiten, met als gevolg dat pagina's niet meer geïndexeerd worden. Concreet bewijs in de vorm van grootschalig onderzoek ontbreekt nog, maar het signaal is duidelijk genoeg om serieus te nemen als je Cloudflare gebruikt om je site tegen AI-scrapers te beschermen.
Wat is er precies gemeld?
Een website-eigenaar merkte een terugval in geïndexeerde pagina's op nadat Cloudflare's instellingen voor het weren van AI-bots waren geactiveerd. Bij nader onderzoek bleek dat niet alleen scrapers voor taalmodellen werden geblokkeerd, maar ook verzoeken van Googlebot zelf.
Het rapport is anekdotisch en niet onafhankelijk geverifieerd, maar het sluit aan bij een breder patroon: naarmate meer sites AI-crawlers actief weren, groeit ook het risico op onbedoelde nevenschade aan reguliere zoekmachinebots.
Waarom zou een AI-bot filter Googlebot raken?
Cloudflare onderscheidt in theorie geverifieerde bots zoals Googlebot van categorieën voor AI-crawlers, denk aan scrapers die content verzamelen om taalmodellen te trainen. Die scheiding werkt op basis van bot-verificatie en user-agent herkenning.
Het probleem ontstaat vermoedelijk niet bij de standaardinstellingen, maar bij aanpassingen daarop. Wie eigen firewallregels toevoegt op basis van user-agent patronen, IP-reeksen of ASN-blokkades, loopt het risico dat die regels breder uitpakken dan bedoeld en ook legitieme crawlers raken.
Daarnaast speelt de recente opkomst van functies als de Content Signals Policy in robots.txt een rol: deze maakt onderscheid tussen toestemming voor indexering en toestemming voor AI-training, en een verkeerde interpretatie of implementatie daarvan kan indexering onbedoeld blokkeren.
Wat kun je zelf controleren?
Gebruik je Cloudflare om AI-bots te weren, dan is het verstandig om regelmatig te controleren of Googlebot nog ongehinderd toegang heeft. Dat voorkomt dat een beveiligingsmaatregel zich tegen je eigen zichtbaarheid keert.
- Controleer in Google Search Console via de URL-inspectietool of pagina's nog correct gecrawld en geïndexeerd worden.
- Bekijk de firewalllogs in Cloudflare op geweigerde verzoeken afkomstig van Googlebot user-agents of geverifieerde Google-IP-reeksen.
- Test nieuwe firewallregels eerst op een beperkte set pagina's voordat je ze site-breed uitrolt.
- Vermijd brede blokkades op basis van generieke trefwoorden in user-agents, aangezien die ook legitieme crawlers kunnen raken.
- Houd je robots.txt en eventuele Content Signals Policy actueel en stem die af op wat je werkelijk wilt toestaan of weren.
Wat betekent dit voor sites die Cloudflare gebruiken?
Het risico op onbedoelde blokkade van Googlebot is geen reden om AI-botbeheer helemaal te laten varen. Veel sites hebben legitieme redenen om ongecontroleerde scraping voor AI-training te beperken, zeker met het oog op serverbelasting en content-bescherming.
Wel is het verstandig om wijzigingen aan bot-instellingen te behandelen als een technische SEO-aangelegenheid, met dezelfde zorgvuldigheid als een robots.txt-aanpassing of een migratie. Een kleine misconfiguratie kan anders zorgen voor een indexeringsprobleem dat pas na weken zichtbaar wordt in je organische verkeer.
Bron: Search Engine Journal
