Veel sites blokkeerden in 2023 uit voorzorg alle AI-bots in robots.txt. In 2026 kost dat vindbaarheid: de bots die antwoorden mét bronvermelding geven, zijn dezelfde bots die je blokkeert. Kort antwoord: laat de zoek-bots toe (OAI-SearchBot, PerplexityBot, Bingbot, Googlebot), beslis bewust over de trainings-bots (GPTBot, ClaudeBot, Google-Extended), en zie llms.txt als een nuttige samenvatting zonder bewezen rankingeffect.
Er zijn twee soorten AI-crawlers. Zoek-crawlers halen pagina's op om een antwoord met bronvermelding te geven; blokkeer je die, dan word je niet geciteerd. Trainings-crawlers verzamelen tekst om modellen te trainen; blokkeren daarvan heeft geen effect op je citaties in live zoekantwoorden. De user-agents lopen door elkaar, dus het loont om ze uit elkaar te houden.
GPTBot verzamelt trainingsdata. OAI-SearchBot indexeert voor ChatGPT-zoekresultaten met bronvermelding. ChatGPT-User haalt een pagina op wanneer een gebruiker er live om vraagt. Wil je geciteerd worden, laat dan minimaal OAI-SearchBot en ChatGPT-User toe.
Perplexity crawlt live en citeert altijd. PerplexityBot blokkeren betekent onzichtbaar zijn op het platform dat het vaakst doorkliks oplevert.
ClaudeBot verzamelt data; Claude-User haalt pagina's op tijdens een gesprek met webzoeken. Zakelijke gebruikers zetten Claude veel in voor onderzoek; toelaten van Claude-User is verstandig.
Google AI Overviews gebruiken de gewone Google-index via Googlebot; daar is geen aparte opt-in voor. Google-Extended regelt alleen of je content gebruikt mag worden voor het trainen van Gemini-modellen. Blokkeren van Google-Extended raakt je AI Overviews niet.
Eén crawler voor Bing, Copilot en de zoekfunctie van ChatGPT. Bingbot blokkeren is het slechtste wat je voor AI-vindbaarheid kunt doen. Gebruik IndexNow om nieuwe pagina's direct te melden.
Applebot voedt Siri en Apple Intelligence. CCBot (Common Crawl) levert datasets aan veel modellen. Bytespider (ByteDance) crawlt agressief; blokkeren is gebruikelijk en kost geen vindbaarheid in Nederland.
Het voorstel llms.txt (llmstxt.org, 2024) is een Markdown-bestand in de root van je site dat taalmodellen in één pagina vertelt wat je site is, welke pagina's het belangrijkst zijn en waar de kerninformatie staat. Vergelijk het met een sitemap voor mensen: korte omschrijving, gegroepeerde links met één regel uitleg, optioneel een uitgebreide variant (llms-full.txt) met de volledige tekst van je belangrijkste pagina's.
Wat het niet is: een officieel ondersteunde standaard. Geen van de grote platforms heeft bevestigd dat llms.txt de crawl of de citaties stuurt, en er is geen meetbaar rankingeffect aangetoond. Wat het wel is: goedkoop, onschadelijk en een handige oefening. Wie zijn site in twintig regels moet samenvatten, ontdekt snel welke pagina's onduidelijk zijn. Op ons eigen netwerk staat op elke site een llms.txt; we zien er geen nadeel van, en de bestanden worden door meerdere AI-crawlers opgehaald.
# Voorbeeld robots.txt voor AI-vindbaarheid User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Bingbot Allow: / # Trainingsdata: eigen keuze User-agent: GPTBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Bytespider Disallow: / Sitemap: https://www.jouwdomein.nl/sitemap.xml
Controleer na elke wijziging of je eigen content nog wordt opgehaald; wat je precies moet meten staat in AI-citaties meten. De volledige lijst controles vind je in de AI-SEO checklist.
Bij elke site die we bouwen of overnemen stellen we robots.txt expliciet in per bot: zoek-crawlers toe, trainings-crawlers volgens de wens van de klant, agressieve scrapers geblokkeerd. We plaatsen een llms.txt met de kernpagina's en melden nieuwe URL's via IndexNow bij Bing. Daarna meten we of de pagina's worden opgehaald en geciteerd. Wil je weten wat er nu in jouw robots.txt staat en wat dat kost aan zichtbaarheid? Vraag een AI-SEO-scan aan.
Dat is een eigen keuze. GPTBot verzamelt trainingsdata en heeft geen invloed op of ChatGPT je citeert in zoekantwoorden; daarvoor zijn OAI-SearchBot en ChatGPT-User bepalend. Wil je niet dat je teksten in trainingsdata terechtkomen, blokkeer dan GPTBot en laat de andere twee toe.
Er is geen aangetoond effect op citaties of rankings. Het bestand is een voorstel dat door platforms niet officieel wordt ondersteund. Het kost weinig, kan geen kwaad en dwingt je om je site helder samen te vatten.
In de serverlogs (access.log) op user-agent: zoek op GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeBot en Bingbot. Veel hostingpanelen tonen dit ook onder statistieken. Zie je de zoek-bots nooit, controleer dan robots.txt en je indexatie in Bing.
Ja. AI Overviews gebruiken de gewone Google-index via Googlebot. Google-Extended regelt alleen het gebruik van je content voor het trainen van Gemini-modellen.
We controleren welke bots je toelaat, of je in Bing staat en of AI-platforms je pagina's ophalen. Vrijblijvende scan.