Een vermelding in jouw robots.txt-bestand garandeert niet langer dat ChatGPT jouw website met rust laat. Recente data en bijgewerkte documentatie van OpenAI tonen aan dat gerichte fetch bots content blijven ophalen wanneer een gebruiker daar direct om vraagt.
Webmasters ontdekten recent dat ChatGPT-bots pagina's bezoeken die via standaard crawlinstructies expliciet zijn geblokkeerd. Dit onderscheid tussen geautomatiseerde datawinning en real-time browsen zorgt voor verwarring in de SEO-wereld.
Het cruciale verschil tussen crawlers en fetch bots
OpenAI maakt een strikt technisch onderscheid tussen het trainen van modellen en het live ophalen van webpagina's. Veel website-eigenaren gaan er ten onrechte van uit dat één enkele regel in robots.txt alle interacties met het AI-platform blokkeert.
De crawler genaamd GPTBot respecteert robots.txt zorgvuldig. Deze bot verzamelt op grote schaal data voor het trainen van toekomstige taalmodellen en slaat jouw pagina's over zodra er een Disallow-regel staat.
De situatie verandert echter zodra een eindgebruiker een directe URL in de chatinterface plakt. Op dat moment treedt de ChatGPT-User bot in werking om de specifieke pagina direct uit te lezen.
Waarom robots.txt faalt bij live interacties
Volgens de documentatie van OpenAI fungeert het systeem bij een gerichte browse-opdracht als een vertegenwoordiger van de individuele gebruiker. De bot handelt vergelijkbaar met een traditionele webbrowser die door een mens wordt aangestuurd.
Omdat robots.txt historisch is ontworpen om serveroverbelasting door autonome zoekmachinecrawlers te voorkomen, beschouwt OpenAI deze richtlijnen niet als bindend voor acties op verzoek van gebruikers. Het protocol is simpelweg nooit opgezet als autorisatiemechanisme.
Hierdoor kunnen gebruikers via ChatGPT alsnog samenvattingen of analyses opvragen van artikelen die via robots.txt zijn afgeschermd. Dit leidt tot frustratie bij uitgevers die dachten hun intellectuele eigendom volledig te hebben beveiligd.
Effectieve manieren om jouw website echt te beschermen
Als je wilt voorkomen dat OpenAI jouw webpagina's kan inzien, volstaat een tekstbestand in de rootdirectory van jouw server niet. Je moet overstappen op actieve serverbeveiliging en toegangscontrole.
- Gebruik authenticatielagen zoals een inlogscherm of een betaalmuur om content af te schermen.
- Configureer jouw Web Application Firewall om IP-adressen van OpenAI direct te blokkeren.
- Blokkeer specifieke User-Agents via webserverconfiguraties in Nginx of Apache.
- Zet Cloudflare of vergelijkbare diensten in om AI-browsers automatisch uit te filteren.
Technische beveiliging vereist een proactieve houding van webmasters. Vertrouwen op de welwillendheid van geautomatiseerde bots is in het huidige AI-tijdperk niet langer voldoende.
Bron: Search Engine Journal
