Hoe ik log-file-analyse inzet voor crawl-budget en bot-gedrag.
Server-logs zijn de enige bron die laat zien wat Googlebot écht doet. Geen Search Console-samenvatting, geen schattingen — letterlijk elke hit, met timestamp, status en user-agent.
01 — basisWat is log-file-analyse?
Log-file-analyse betekent dat je de raw server-logs uitleest om te zien welke URL's bots bezoeken, hoe vaak en met welk resultaat. Het is de enige manier om écht te weten waar Google crawl-budget aan besteedt. Via een technische SEO-analyse kom je hier altijd op uit.
Voor sites onder 1.000 URL's is dit overkill. Voor middelgrote tot grote sites (10k+ pagina's) is het de meest onthullende analyse die je kunt doen. Zie ook de rol van een SEO-specialist — dit is geavanceerd werk.
02 — log-mockupHoe een log-file eruitziet
Hier zie je een fragment uit een typische Apache/Nginx access-log. Elke regel = één request. Ik markeer in deze view direct welke regels relevant zijn: groen = bot crawlt succesvol, rood = error, oranje = redirect-chain. Lees meer over crawlfouten vinden.
De truc: filter eerst op user-agent (alleen Googlebot, Bingbot, GPTBot), dan op status-code, dan op URL-patroon. Voor moderne SEO is ook AI-bot-traffic relevant geworden.
- Successful crawl
- Redirect-chain
- Error (4xx/5xx)
03 — crawl-budgetWaar gaat het crawl-budget heen?
Eén van de eerste analyses die ik doe: aggregeer alle Googlebot-hits per pagina-type. Op grote sites zie je vaak dat 30-40% van het budget naar pagina's gaat die je niet eens wilt laten ranken. Lees meer over crawl-budget.
Deze verdeling toont een voorbeeld van een e-commerce site met 40k URL's. Filter-URL's en pagineringen vreten budget op — fix dat via categorie-optimalisatie en robots.txt-regels.
04 — bot-frequencyWelke bots bezoeken je site?
Niet alleen Google crawlt. In 2026 zie ik AI-bots (GPTBot, ClaudeBot, PerplexityBot) sterk in volume groeien. Voor generatieve SEO (GEO) is dit waardevol — die bots scrapen content voor LLM-antwoorden.
Wat je zoekt: een gezonde mix van zoekmachine-bots en AI-crawlers. Te veel scraper-traffic kan op serverkosten drukken. Voor Search Console zie je alleen Google — logs tonen het echte plaatje.
05 — patronen5 patronen die ik altijd zoek
In elke analyse hou ik dezelfde 5-checklist. De patronen geven in 80% van de gevallen technische winst — weken-snel zichtbaar in Search Console. Zie ook indexering controleren.
Minstens 3 van 5 vind ik in bijna elke audit. Voor een complete audit combineer ik logs met crawler-data.
4xx/5xx op gecrawlde URL's
Budget aan dood. Fixen via redirects.
grep " 404 \| 500 " access.log301-chains van 2+ hops
Extra hops kosten budget. Platslaan.
awk '$9==301' | sort | uniqFilter-URL's met queryparams
Eindeloos gecrawld. Blokkeer in robots.txt.
grep "?" access.log | grep "Googlebot"Belangrijke pagina's nauwelijks bezocht
Verbeteren via interne linking en sitemap-priority.
sort | uniq -c | sort -rnPlotselinge crawl-spikes
Correleer met Search Console-data.
awk '{print $4}' | sort | uniq -c06 — workflowMijn 5-stappen workflow
Van raw logs naar actie-lijst in 5 stappen. Stap 1 is logs verzamelen (90 dagen minimum), stap 5 is de actie-lijst opleveren met prioriteit. Voor een complete technische audit combineer ik dit met Screaming Frog.
Realistische tijd: 1-2 dagen voor een site van 10k URL's. Voor enterprise-sites schaal je naar Big-Query of een dedicated log-analyse tool. Zie ook de rol van een specialist.
Logs verzamelen
90 dagen ophalen via hosting.
SCP / SFTPFilteren
Bot-traffic + IP-verificatie.
awk / grepAggregeren
Per URL-pattern en bot-type.
Screaming FrogPatronen
5-checklist doorlopen.
spreadsheetActie-lijst
Impact × effort matrix.
Jira / Notion07 — actieWat doe je met de bevindingen?
De analyse is pas waardevol als er actie volgt. Ik clusteren bevindingen in drie buckets: direct fixen (errors, chains), structureel oplossen (filter-URL's, paginatie) en monitoren (AI-bot-groei, spikes). Zie ook crawlfouten oplossen.
Realistisch impact-traject: 4-8 weken voor de meeste fixes zichtbaar in Search Console. Voor meten of SEO werkt houd ik na implementatie de crawl-stats per pagina-type in de gaten.
Errors & chains
4xx/5xx wegwerken. 301-chains platslaan.
+8-15% effectieve crawlsCrawl-budget terugwinnen
Filter-URL's blokkeren, soft-404 wegwerken.
+20-30% naar gewenste pagina'sAI-bot-groei tracken
GPTBot/ClaudeBot bijhouden voor GEO.
vooruitkijken op GEO-trends