Robots Exclusion Standard en hoe ik dit inzet voor SEO✴️
4,9 ★★★★★ 97 reviews
Begrippenlijst · Robots.txt · Technische SEO

Wat is de Robots Exclusion Standard?

De Robots Exclusion Standard (RES) is het protocol dat vastlegt hoe robots.txt-bestanden worden geschreven en geïnterpreteerd. Live syntax-checker — plak je robots.txt en zie direct welke regels geldig, onbekend of fout zijn.

Door Ralf van VeenLeestijd: 5 min

01 — checkerLive robots.txt syntax-checker

De Robots Exclusion Standard werd in 1994 geïntroduceerd door Martijn Koster als informeel protocol. In 2022 publiceerde Google een formele RFC (RFC 9309) die de standaard codificeert. Het protocol definieert hoe robots.txt-bestanden worden opgebouwd: user-agent-blokken, directives, commentaarregels en de volgorde van interpretatie. Plak hier jouw robots.txt voor directe validatie.

Live · robots.txt syntax-validatieRFC 9309

De Robots Exclusion Standard is een aanbeveling, geen technisch afdwingbaar protocol. Goedwillende crawlers (Google, Bing, yandex) respecteren het. Kwaadwillende bots negeren het volledig. Gebruik robots.txt voor crawl-budget-beheer, niet als beveiligingsmaatregel.

02 — directives4 directives uitgelegd

4 directives · RFC 9309robots.txt syntax
User-agent:
Welke crawler?
Bepaalt voor welke crawler(s) de volgende regels gelden. * betekent alle crawlers. Specifieke crawlers (Googlebot, Bingbot) overschrijven de *-regels.
User-agent: *
User-agent: Googlebot
Disallow:
Verbied dit pad
Verbiedt de crawler het opgegeven pad te crawlen. Leeg (Disallow:) betekent niets geblokkeerd — volledige toegang. Zie ook disallow.
Disallow: /admin/
Disallow: /intern/
Allow:
Sta dit subpad toe
Heft een Disallow op voor een specifieker subpad. Allow-regels winnen van Disallow-regels als ze langer (specifieker) zijn voor hetzelfde pad.
Allow: /admin/ajax.php
Sitemap:
XML-sitemap locatie
Vertelt crawlers waar de XML-sitemap te vinden is. Niet onderdeel van de originele RES maar breed geadopteerd. Kan meerdere keren voorkomen voor meerdere sitemaps.
Sitemap: https://voorbeeld.nl/sitemap.xml

03 — regelsSyntaxregels en interpretatie

Vijf regels die bepalen hoe robots.txt wordt geïnterpreteerd:

5 syntaxregels · RFC 9309parseerregels
1
Meest-specifieke regel wint
Bij conflicterende regels wint de langste (meer-specifieke) match. Allow: /admin/ajax.php wint van Disallow: /admin/ voor dat specifieke bestand.
2
Case-sensitive paden
Padnamen zijn case-sensitive. Disallow: /Admin/ blokkeert niet /admin/. Altijd het exacte pad gebruiken zoals het in de URL staat.
3
Wildcards en $-ankering
* matcht alles. $ ankert aan het einde van de URL. Disallow: /*.pdf$ blokkeert alle URLs die eindigen op .pdf. Niet alle crawlers ondersteunen wildcards volledig.
4
Blokgroepen per User-agent
Regels zijn gegroepeerd per User-agent-blok. Een crawler past alleen de regels toe die van toepassing zijn op zijn User-agent (of op *). Specifieke crawler-regels overschrijven de *-regels volledig.
5
Maximale bestandsgrootte: 500 KB
Google leest maximaal 500 KB van robots.txt. Regels daarna worden genegeerd. Bij grote sites met veel regels: consolideren en wildcards gebruiken om het bestand compact te houden.

04 — faqVeelgestelde vragen

FAQ · 3 vragenklik om te openen
Wat is het verschil tussen robots.txt en meta-robots?
Verschillende niveaus van instructie. Vier punten. (1) Robots.txt: bestandsniveau. Controleert welke URLs gecrawld mogen worden. Werkt als een poort: de crawler mag een pad niet eens betreden. (2) Meta-robots: paginaniveau. Controleert wat Google doet met een individuele pagina die het al heeft gecrawld (indexeren of niet, links volgen of niet). (3) Interactie: robots.txt-geblokkeerde pagina's worden niet gecrawld → meta-robots-tag op die pagina wordt niet gelezen → noindex op een geblokkeerde pagina werkt niet. (4) Prioriteit: robots.txt is de eerste filter. Meta-robots is de verfijning voor pagina's die crawlbaar zijn. Zie ook noindex-pagina.
Is de Robots Exclusion Standard juridisch bindend?
Nee — het is een vrijwillig protocol. Drie punten. (1) Geen wettelijke verplichting: de RES is een technische conventie zonder juridische afdwingbaarheid. Kwaadwillende bots kunnen robots.txt volledig negeren. (2) Goedwillende crawlers: Google, Bing, Yandex en andere legitieme zoekmachines respecteren robots.txt als beleidsrichtsnoer. Het is een wederzijdse afspraak. (3) Veiligheidsimplicaties: robots.txt op een publiek-toegankelijke URL publiceren openbaart ook welke paden je wil verbergen. Gebruik robots.txt niet als beveiliging — gebruik HTTP-authenticatie voor werkelijke toegangscontrole.
Hoe blokkeert u een AI-trainingscrawler met robots.txt?
Via specifieke User-agent-blokken. Vier populaire AI-crawlers en hun User-agents. (1) OpenAI/ChatGPT: User-agent: GPTBot + Disallow: / — blokkeert ChatGPT-datacollectie. (2) Google Bard/Gemini: User-agent: Google-Extended + Disallow: /. (3) Common Crawl: User-agent: CCBot + Disallow: /. (4) Anthropic: User-agent: ClaudeBot + Disallow: /. Plaatsen voor elke blokkering is een zakelijke keuze — het beïnvloedt of jouw content wordt meegenomen in AI-trainingsdata. Voor SEO-crawlers (Googlebot, Bingbot) is blokkering schadelijk voor rankings. Zie ook disallow.

Robots.txt-configuratie controleren?

Via een technische SEO-audit controleer ik jouw robots.txt op fouten, onnodige blokkeringen en crawl-budget-verspilling.

Plan een gesprek met Ralf →