De voorwaardelijke invloed van de Robots.txt op SEO
4,9 ★★★★★ 97 reviews
Begrippenlijst · Robots.txt · Live URL-tester

Wat is robots.txt?

Robots.txt uitleg: live URL-tester met rule-builder, 6 preset-templates, syntax-validation en de SEO-impact.

Door Ralf van VeenUpdate: 15 oktober 2024Leestijd: 7 min

01 — testerRobots.txt — live URL-tester

Robots.txt is een tekstbestand op de root van je domein (example.com/robots.txt) dat crawlers vertelt welke URLs ze WEL of NIET mogen crawlen. Het is het oudste + bekendste protocol voor crawler-control (sinds 1994). Belangrijk: robots.txt blokkeert CRAWLING, niet INDEXING. Voor indexing-block gebruik je meta robots noindex. Bouw hieronder je robots.txt + test elke URL. Voor breder context op crawling zie zoekmachine.

Live · editor + URL-testermatch-checker
robots.txt · edit + test live
🔍URL-tester
Googlebot
Bingbot
GPTBot
ClaudeBot
* (alle)
BLOCKED
URL geblokkeerd voor deze crawler

Belangrijke nuance: dit is een EDUCATIEVE tester. Voor productie-validation gebruik Google's officiële Robots.txt Tester in Search Console (Settings → Crawling → robots.txt). Google's parser kent edge-cases die educatieve tools niet altijd correct simuleren.

02 — directives5 robots.txt directives

5 directives · syntax + use-casespec
Directive
Wat doet het?
Voorbeeld
User-agent
Specificeer voor welke crawler de regels gelden. * = alle crawlers
User-agent: Googlebot
User-agent: *
Disallow
Specificeer welke URLs NIET gecrawld mogen worden. Leeg = alles toestaan
Disallow: /admin/
Disallow: /*.pdf$
Allow
Override van een Disallow. Voor specifieke URLs binnen een geblokkeerde dir
Disallow: /wp-content/
Allow: /wp-content/uploads/
Sitemap
Verwijs naar XML-sitemap locatie. Optioneel maar aanbevolen
Sitemap: https://site.nl/sitemap.xml
Crawl-delay
Pauze in seconds tussen crawl-requests. Google negeert · Bing/Yandex honoreert
Crawl-delay: 10

Wildcard-patterns: * match elke char-sequence, $ match URL-end. Bv: Disallow: /*.pdf$ blokkeert alle PDF-URLs. Disallow: /*? blokkeert alle URLs met query-parameters.

03 — bp5 best-practices voor robots.txt

5 best-practices · tactisch2026
1
Gebruik robots.txt NIET om noindex te bereiken
Common mistake: Disallow gebruiken om pagina's "te verbergen". Robots.txt blokkeert crawling, NIET indexing. Page kan nog steeds in zoekresultaten verschijnen via backlinks. Voor index-block: meta robots noindex.
2
Reference Sitemap altijd
Voeg "Sitemap: https://example.com/sitemap.xml" toe. Helpt crawlers buiten Google + Bing om je sitemap te vinden. Twee regels werk, grote voordelen voor discovery.
3
Test elke wijziging via Search Console
Search Console → Settings → Crawling → robots.txt Tester. Catch syntax-fouten + verifieer dat critical URLs niet per ongeluk geblokkeerd zijn. Een verkeerde regel = volledige site uit Google.
4
Block crawl-traps + niet quality-pages
Filter-URLs (kleur/maat/prijs), search-results-pages, gefilterde category-pages — blok via robots.txt. NIET blokkeren: thin-content (gebruik noindex), duplicates (gebruik canonical).
5
Overweeg AI-crawler-policy
GPTBot, ClaudeBot, PerplexityBot, Google-Extended (Bard) zijn nieuwe AI-crawlers. Decide: training-data verstrekken of blokkeren. Block met user-agent-specifieke disallow.

04 — faqVeelgestelde vragen

FAQ · 3 vragenklik om te openen
Moet ik AI-crawlers blokkeren?
Strategische keuze. Vijf overwegingen. (1) PROS van blokkeren: jouw content gaat niet in AI-training data. Bescherming van intellectueel eigendom. Vooral relevant voor news-publishers + premium-content. (2) CONS van blokkeren: jouw brand wordt niet genoemd in AI-antwoorden (ChatGPT, Perplexity, Claude). Verlies aan visibility voor AI-search users. (3) Hybrid-approach: blokkeer training-bots (GPTBot, Google-Extended) maar STA browsing-bots toe (OAI-SearchBot, ClaudeBot voor real-time-search). Best of both. (4) Common AI-crawler user-agents: GPTBot (ChatGPT-training), OAI-SearchBot (ChatGPT-browse), ClaudeBot (Anthropic), CCBot (Common Crawl), Google-Extended (Gemini), PerplexityBot (Perplexity). (5) Industry-trend: news-sites blokkeren AI-training-bots maar laten browse-bots toe. Marketing-sites laten meestal alles toe voor max visibility. Voor breder context zie AI-impact op SEO.
Wat is verschil tussen robots.txt en meta robots tag?
Verschillende doelen. Vijf nuances. (1) Robots.txt = crawl-control. Vertelt crawlers welke URLs te crawlen. Geen invloed op indexing. (2) Meta robots = index-control. In <head> van HTML-page. Vertelt crawlers wat met de page te DOEN na crawling: index, noindex, follow, nofollow. (3) Practical: voor "page mag niet in zoekresultaten" gebruik meta robots noindex. Voor "deze hele directory hoeft niet gecrawld" gebruik robots.txt Disallow. (4) Combinatie-error: page met Disallow IN robots.txt + meta noindex op page = crawler kan noindex-tag niet lezen want page wordt niet gecrawld! Page kan dan TOCH in index verschijnen via backlinks. (5) Best practice: voor noindex-pages, ZORG dat robots.txt NIET blokkeert. Anders werkt noindex-tag niet. Voor breder context zie SEO-technieken.
Welke fouten kosten mij meeste organic-traffic?
Specifieke fail-patterns. Vijf veelvoorkomende mistakes. (1) "Disallow: /" zonder iets verder = ALLES blokkeren. Heeft volledige sites uit Google gehaald. Vaak per ongeluk na staging→production-deploy. CRITICAL fout. (2) JS/CSS blokkeren: vroeger praktijk, nu fatal. Google needs JS+CSS om page te renderen voor mobile-first-indexing. Block deze NIET. (3) Sitemap-discrepancy: URLs in sitemap die geblokkeerd zijn in robots.txt = mixed-signals voor Google. Synchroniseer beide. (4) Trailing-slash issues: /admin vs /admin/ — Google ziet als verschillende paths. Gebruik trailing slash consistently. (5) Case-sensitivity: /Admin/ vs /admin/ — robots.txt IS case-sensitive op path-section. Verifieer exact casing van URLs. Voor breder context zie SEO audit.

Robots.txt + crawl-optimization audit?

Volledig crawl-control-traject: audit van huidige robots.txt-setup, identification van mis-blocked URLs via Search Console, AI-crawler-policy-implementation, crawl-budget-optimization voor enterprise-sites, plus monthly rapportage op crawl-coverage.

Plan een gesprek met Ralf →