Google's crawlers beperken zich niet tot de klassieke GET- en POST-verzoeken. Gary Illyes, analist bij Google, bevestigde op LinkedIn dat ook HEAD, OPTIONS, PUT, PATCH en DELETE-verzoeken voorkomen in het verkeer van Googlebot en andere Google-crawlers, al blijft hun gezamenlijke aandeel onder de 1,5 procent van het totale aantal requests.
De verklaring is technisch van aard: JavaScript op pagina's initieert deze verzoeken tijdens het renderproces, waarna Google's systemen ze simpelweg afhandelen.
Wat Illyes precies meldde
Illyes reageerde op een reeks vragen die hij de afgelopen weken kreeg over het requestgedrag van Google's crawlers. "The short answer is yes, they do, but HEAD, OPTIONS, PUT, PATCH, and DELETE account for less than 1.5% of the total number of requests all Google's crawlers send", schreef hij.
Daarmee bevestigt hij voor het eerst publiekelijk cijfers over deze minder besproken kant van het crawlgedrag van Google. De meeste site-eigenaren gaan er standaard van uit dat crawlers alleen pagina's ophalen via GET, dus deze toelichting geeft een completer beeld.
JavaScript als aanjager van deze verzoeken
Volgens Illyes ligt de oorzaak niet bij een bewuste crawlstrategie van Google, maar bij de code op de websites zelf. "Basically it seems that some JavaScript nonsense is initiating these requests and rendering does its rendering things", aldus Illyes.
Met andere woorden: wanneer Google een pagina rendert zoals een browser dat zou doen, voert het ook scripts uit die schrijfacties of statuscontroles proberen uit te voeren, denk aan formulieren, API-aanroepen of frameworks die bij het laden automatisch verzoeken versturen. Google's renderer volgt die code gewoon, zonder daar zelf een aparte crawlstrategie voor te ontwerpen.
Gevolgen voor serverbeheer en logbestanden
Voor de meeste websites verandert er weinig, maar wie serverlogs analyseert of firewallregels beheert, doet er goed aan hier rekening mee te houden.
- PUT-, PATCH- en DELETE-verzoeken van een Googlebot-useragent hoeven niet per definitie kwaadaardig te zijn.
- Sommige beveiligingsregels blokkeren deze methoden standaard, wat onbedoeld ook legitiem crawlverkeer kan raken.
- Bij JavaScript-zware frameworks (React, Vue, Angular) is de kans groter dat dit soort verzoeken ontstaan tijdens het renderen door Google.
- Loganalyses die alleen GET-verzoeken meetellen, geven een onvolledig beeld van het volledige crawlverkeer.
Praktisch advies voor webmasters
Het is verstandig om periodiek te controleren welke HTTP-methoden in je serverlogs voorkomen vanuit bekende Google-useragents, en te verifiëren of firewallregels deze niet zonder reden weigeren.
Grote actie is zelden nodig: het gaat om een klein percentage van het totale verkeer, en Google presenteert dit niet als een nieuwe crawlfunctie maar als een bijeffect van hoe rendering en JavaScript samenwerken.
Bron: Search Engine Roundtable
