Home Portfolio websitesPortfolio softwareDiensten PrijzenWerkwijzeSEOToolsAI-vindbaarheidFAQ Over DigitaleWegContactGratis opzet aanvragen →

← AI-vindbaarheid

AI-vindbaarheid · Techniek

llms.txt en AI-crawlers: welke bots laat je toe?

Veel sites blokkeerden in 2023 uit voorzorg alle AI-bots in robots.txt. In 2026 kost dat vindbaarheid: de bots die antwoorden mét bronvermelding geven, zijn dezelfde bots die je blokkeert. Kort antwoord: laat de zoek-bots toe (OAI-SearchBot, PerplexityBot, Bingbot, Googlebot), beslis bewust over de trainings-bots (GPTBot, ClaudeBot, Google-Extended), en zie llms.txt als een nuttige samenvatting zonder bewezen rankingeffect.

Er zijn twee soorten AI-crawlers. Zoek-crawlers halen pagina's op om een antwoord met bronvermelding te geven; blokkeer je die, dan word je niet geciteerd. Trainings-crawlers verzamelen tekst om modellen te trainen; blokkeren daarvan heeft geen effect op je citaties in live zoekantwoorden. De user-agents lopen door elkaar, dus het loont om ze uit elkaar te houden.

De bots

Wie komt er langs en waarvoor

OpenAI: GPTBot, OAI-SearchBot, ChatGPT-User

GPTBot verzamelt trainingsdata. OAI-SearchBot indexeert voor ChatGPT-zoekresultaten met bronvermelding. ChatGPT-User haalt een pagina op wanneer een gebruiker er live om vraagt. Wil je geciteerd worden, laat dan minimaal OAI-SearchBot en ChatGPT-User toe.

Perplexity: PerplexityBot en Perplexity-User

Perplexity crawlt live en citeert altijd. PerplexityBot blokkeren betekent onzichtbaar zijn op het platform dat het vaakst doorkliks oplevert.

Anthropic: ClaudeBot en Claude-User

ClaudeBot verzamelt data; Claude-User haalt pagina's op tijdens een gesprek met webzoeken. Zakelijke gebruikers zetten Claude veel in voor onderzoek; toelaten van Claude-User is verstandig.

Google: Googlebot en Google-Extended

Google AI Overviews gebruiken de gewone Google-index via Googlebot; daar is geen aparte opt-in voor. Google-Extended regelt alleen of je content gebruikt mag worden voor het trainen van Gemini-modellen. Blokkeren van Google-Extended raakt je AI Overviews niet.

Microsoft: Bingbot

Eén crawler voor Bing, Copilot en de zoekfunctie van ChatGPT. Bingbot blokkeren is het slechtste wat je voor AI-vindbaarheid kunt doen. Gebruik IndexNow om nieuwe pagina's direct te melden.

Overige: Applebot, Bytespider, CCBot

Applebot voedt Siri en Apple Intelligence. CCBot (Common Crawl) levert datasets aan veel modellen. Bytespider (ByteDance) crawlt agressief; blokkeren is gebruikelijk en kost geen vindbaarheid in Nederland.

llms.txt

Wat het llms.txt-voorstel wel en niet doet

Het voorstel llms.txt (llmstxt.org, 2024) is een Markdown-bestand in de root van je site dat taalmodellen in één pagina vertelt wat je site is, welke pagina's het belangrijkst zijn en waar de kerninformatie staat. Vergelijk het met een sitemap voor mensen: korte omschrijving, gegroepeerde links met één regel uitleg, optioneel een uitgebreide variant (llms-full.txt) met de volledige tekst van je belangrijkste pagina's.

Wat het niet is: een officieel ondersteunde standaard. Geen van de grote platforms heeft bevestigd dat llms.txt de crawl of de citaties stuurt, en er is geen meetbaar rankingeffect aangetoond. Wat het wel is: goedkoop, onschadelijk en een handige oefening. Wie zijn site in twintig regels moet samenvatten, ontdekt snel welke pagina's onduidelijk zijn. Op ons eigen netwerk staat op elke site een llms.txt; we zien er geen nadeel van, en de bestanden worden door meerdere AI-crawlers opgehaald.

# Voorbeeld robots.txt voor AI-vindbaarheid
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Bingbot
Allow: /
# Trainingsdata: eigen keuze
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
Sitemap: https://www.jouwdomein.nl/sitemap.xml

Controleer na elke wijziging of je eigen content nog wordt opgehaald; wat je precies moet meten staat in AI-citaties meten. De volledige lijst controles vind je in de AI-SEO checklist.

Wat wij doen

Hoe wij robots.txt en llms.txt inrichten

Bij elke site die we bouwen of overnemen stellen we robots.txt expliciet in per bot: zoek-crawlers toe, trainings-crawlers volgens de wens van de klant, agressieve scrapers geblokkeerd. We plaatsen een llms.txt met de kernpagina's en melden nieuwe URL's via IndexNow bij Bing. Daarna meten we of de pagina's worden opgehaald en geciteerd. Wil je weten wat er nu in jouw robots.txt staat en wat dat kost aan zichtbaarheid? Vraag een AI-SEO-scan aan.

Veelgestelde vragen

AI-crawlers en robots.txt

Moet ik GPTBot blokkeren?

Dat is een eigen keuze. GPTBot verzamelt trainingsdata en heeft geen invloed op of ChatGPT je citeert in zoekantwoorden; daarvoor zijn OAI-SearchBot en ChatGPT-User bepalend. Wil je niet dat je teksten in trainingsdata terechtkomen, blokkeer dan GPTBot en laat de andere twee toe.

Heeft llms.txt effect op mijn vindbaarheid in AI?

Er is geen aangetoond effect op citaties of rankings. Het bestand is een voorstel dat door platforms niet officieel wordt ondersteund. Het kost weinig, kan geen kwaad en dwingt je om je site helder samen te vatten.

Hoe zie ik welke AI-bots mijn site bezoeken?

In de serverlogs (access.log) op user-agent: zoek op GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeBot en Bingbot. Veel hostingpanelen tonen dit ook onder statistieken. Zie je de zoek-bots nooit, controleer dan robots.txt en je indexatie in Bing.

Kom ik in Google AI Overviews als ik Google-Extended blokkeer?

Ja. AI Overviews gebruiken de gewone Google-index via Googlebot. Google-Extended regelt alleen het gebruik van je content voor het trainen van Gemini-modellen.

Weten wat jouw robots.txt kost aan zichtbaarheid?

We controleren welke bots je toelaat, of je in Bing staat en of AI-platforms je pagina's ophalen. Vrijblijvende scan.

Geschreven door Bart van der Ark, oprichter van DigitaleWeg. Bouwt sinds 2020 websites, webshops en maatwerk-software en beheert een eigen portfolio van meer dan 15 productiesites. Alle prijzen op deze pagina komen uit onze eigen prijslijst en worden bij elke wijziging bijgewerkt.