Logfile-analyse in het tijdperk van AI-bots: welke crawlers tellen nog? | Ralfvanveen.com
4,9 ★★★★★ 97 reviews
Technische SEO · advanced

Hoe ik log-file-analyse inzet voor crawl-budget en bot-gedrag.

Server-logs zijn de enige bron die laat zien wat Googlebot écht doet. Geen Search Console-samenvatting, geen schattingen — letterlijk elke hit, met timestamp, status en user-agent.

Door Ralf van Veen Update: 16 mei 2026 Leestijd: 11 min

01 — basisWat is log-file-analyse?

Log-file-analyse betekent dat je de raw server-logs uitleest om te zien welke URL's bots bezoeken, hoe vaak en met welk resultaat. Het is de enige manier om écht te weten waar Google crawl-budget aan besteedt. Via een technische SEO-analyse kom je hier altijd op uit.

Voor sites onder 1.000 URL's is dit overkill. Voor middelgrote tot grote sites (10k+ pagina's) is het de meest onthullende analyse die je kunt doen. Zie ook de rol van een SEO-specialist — dit is geavanceerd werk.

02 — log-mockupHoe een log-file eruitziet

Hier zie je een fragment uit een typische Apache/Nginx access-log. Elke regel = één request. Ik markeer in deze view direct welke regels relevant zijn: groen = bot crawlt succesvol, rood = error, oranje = redirect-chain. Lees meer over crawlfouten vinden.

De truc: filter eerst op user-agent (alleen Googlebot, Bingbot, GPTBot), dan op status-code, dan op URL-patroon. Voor moderne SEO is ook AI-bot-traffic relevant geworden.

access.log fragment12 mei 2026 · 09:14 UTC
~/logs/access.log · tail -f · gefilterd op bot-traffic
001# Googlebot crawlt belangrijke categorie-pagina
00266.249.66.1 - - [12/May/2026:09:14:02] "GET /seo/ HTTP/2" 200 24820 "-" "Googlebot/2.1"
00366.249.66.4 - - [12/May/2026:09:14:03] "GET /seo/technische-seo/ HTTP/2" 200 18204 "-" "Googlebot/2.1"
004157.55.39.12 - - [12/May/2026:09:14:05] "GET /blog/ HTTP/2" 200 12044 "-" "bingbot/2.0"
005# Redirect-chain — verspilde crawl
00666.249.66.1 - - [12/May/2026:09:14:07] "GET /oude-url/ HTTP/2" 301 0 "-" "Googlebot/2.1"
00766.249.66.1 - - [12/May/2026:09:14:07] "GET /tussen-url/ HTTP/2" 301 0 "-" "Googlebot/2.1"
00866.249.66.1 - - [12/May/2026:09:14:08] "GET /nieuwe-url/ HTTP/2" 200 15820 "-" "Googlebot/2.1"
009# 404 op interne link — fix dit eerst
01066.249.66.4 - - [12/May/2026:09:14:11] "GET /seo/oud-artikel/ HTTP/2" 404 1820 "-" "Googlebot/2.1"
01152.91.4.220 - - [12/May/2026:09:14:14] "GET /seo/geo/ HTTP/2" 200 28412 "-" "GPTBot/1.0"
01252.91.4.220 - - [12/May/2026:09:14:15] "GET /seo/ai-overviews/ HTTP/2" 200 19400 "-" "GPTBot/1.0"
013# 500-error — server-probleem, urgent fixen
01466.249.66.1 - - [12/May/2026:09:14:18] "GET /api/products/ HTTP/2" 500 0 "-" "Googlebot/2.1"
01566.249.66.3 - - [12/May/2026:09:14:22] "GET /sitemap.xml HTTP/2" 200 84120 "-" "Googlebot/2.1"
  • Successful crawl
  • Redirect-chain
  • Error (4xx/5xx)

03 — crawl-budgetWaar gaat het crawl-budget heen?

Eén van de eerste analyses die ik doe: aggregeer alle Googlebot-hits per pagina-type. Op grote sites zie je vaak dat 30-40% van het budget naar pagina's gaat die je niet eens wilt laten ranken. Lees meer over crawl-budget.

Deze verdeling toont een voorbeeld van een e-commerce site met 40k URL's. Filter-URL's en pagineringen vreten budget op — fix dat via categorie-optimalisatie en robots.txt-regels.

Googlebot · 30 dagene-commerce · 40k URL's
1.4M
Hits · 30 dagen
Productpagina's30%420k
Categorie-pagina's22%308k
Filter-URL's ⚠ verspilling18%252k
Content/blog14%196k
Paginatie ⚠ deels verspilling12%168k
Overig4%56k

04 — bot-frequencyWelke bots bezoeken je site?

Niet alleen Google crawlt. In 2026 zie ik AI-bots (GPTBot, ClaudeBot, PerplexityBot) sterk in volume groeien. Voor generatieve SEO (GEO) is dit waardevol — die bots scrapen content voor LLM-antwoorden.

Wat je zoekt: een gezonde mix van zoekmachine-bots en AI-crawlers. Te veel scraper-traffic kan op serverkosten drukken. Voor Search Console zie je alleen Google — logs tonen het echte plaatje.

Bot-hits 30 dagen% van totaal bot-traffic
G
Googlebot
68% · 950k
B
Bingbot
14% · 196k
AI
AI-bots (GPT/Claude)
11% · 154k
!
Scrapers/ongewenst
4% · 56k
·
Overig (Yandex etc.)
3% · 42k

05 — patronen5 patronen die ik altijd zoek

In elke analyse hou ik dezelfde 5-checklist. De patronen geven in 80% van de gevallen technische winst — weken-snel zichtbaar in Search Console. Zie ook indexering controleren.

Minstens 3 van 5 vind ik in bijna elke audit. Voor een complete audit combineer ik logs met crawler-data.

5 patronenchecklist per audit
Patroon 01 · errors

4xx/5xx op gecrawlde URL's

Budget aan dood. Fixen via redirects.

grep " 404 \| 500 " access.log
Patroon 02 · chains

301-chains van 2+ hops

Extra hops kosten budget. Platslaan.

awk '$9==301' | sort | uniq
Patroon 03 · verspilling

Filter-URL's met queryparams

Eindeloos gecrawld. Blokkeer in robots.txt.

grep "?" access.log | grep "Googlebot"
Patroon 04 · weeskind

Belangrijke pagina's nauwelijks bezocht

Verbeteren via interne linking en sitemap-priority.

sort | uniq -c | sort -rn
Patroon 05 · spikes

Plotselinge crawl-spikes

Correleer met Search Console-data.

awk '{print $4}' | sort | uniq -c

06 — workflowMijn 5-stappen workflow

Van raw logs naar actie-lijst in 5 stappen. Stap 1 is logs verzamelen (90 dagen minimum), stap 5 is de actie-lijst opleveren met prioriteit. Voor een complete technische audit combineer ik dit met Screaming Frog.

Realistische tijd: 1-2 dagen voor een site van 10k URL's. Voor enterprise-sites schaal je naar Big-Query of een dedicated log-analyse tool. Zie ook de rol van een specialist.

Workflow1-2 dagen doorlooptijd
Stap 01

Logs verzamelen

90 dagen ophalen via hosting.

SCP / SFTP
Stap 02

Filteren

Bot-traffic + IP-verificatie.

awk / grep
Stap 03

Aggregeren

Per URL-pattern en bot-type.

Screaming Frog
Stap 04

Patronen

5-checklist doorlopen.

spreadsheet
Stap 05

Actie-lijst

Impact × effort matrix.

Jira / Notion

07 — actieWat doe je met de bevindingen?

De analyse is pas waardevol als er actie volgt. Ik clusteren bevindingen in drie buckets: direct fixen (errors, chains), structureel oplossen (filter-URL's, paginatie) en monitoren (AI-bot-groei, spikes). Zie ook crawlfouten oplossen.

Realistisch impact-traject: 4-8 weken voor de meeste fixes zichtbaar in Search Console. Voor meten of SEO werkt houd ik na implementatie de crawl-stats per pagina-type in de gaten.

3 actie-bucketsna elke log-analyse
Direct fixen

Errors & chains

4xx/5xx wegwerken. 301-chains platslaan.

+8-15% effectieve crawls
Structureel

Crawl-budget terugwinnen

Filter-URL's blokkeren, soft-404 wegwerken.

+20-30% naar gewenste pagina's
Monitoren

AI-bot-groei tracken

GPTBot/ClaudeBot bijhouden voor GEO.

vooruitkijken op GEO-trends