← Alle artikelen

Hoe je je website leesbaar maakt voor AI-crawlers

31 juli 2026 · 6 min leestijd

Een AI-crawler leest je pagina als platte tekst. Twee dingen bepalen of er iets te lezen valt. Je kerncontent staat server-side in de ruwe HTML, en je robots.txt laat de AI-crawlers toe en wijst naar je sitemap. Daarna volgen llms.txt in de root en een sitemap.xml met actuele lastmod-timestamps, en daarna de rest van de basis.

Die rest is geen noindex op belangrijke pagina's, HTTPS met cachebare publieke pagina's en een redelijke laadtijd zonder loginmuur op je content. Deze volgorde is de volgorde van belang.

Bij IT-bedrijven zien we meestal hetzelfde beeld. In de browser staat er een volledige productpagina. In de ruwe HTML staat een leeg div-element, en de robots.txt zegt niets over AI-crawlers.

Waarom moet je kerncontent in de ruwe HTML staan?

De ruwe HTML is wat de server terugstuurt voordat er één regel JavaScript is uitgevoerd. Een browser voert die JavaScript daarna netjes uit. AI-crawlers doen dat vaak niet.

Content die alleen client-side laadt, bestaat voor die crawlers niet. Je prijstabel, je productbeschrijving, je FAQ-antwoorden en je documentatie zijn dan onzichtbaar.

Dit is het punt waar het bij software- en SaaS-bedrijven het vaakst stukloopt. Het is ook het punt dat het meeste oplevert als je het oplost. Alles wat daarna komt, werkt alleen op tekst die er al staat.

Eén vraag aan je dev-team volstaat. Welke pagina's renderen we server-side, en welke niet? Dat antwoord vertelt je waar je staat.

Welke AI-crawlers laat je toe in robots.txt?

Toelaten is een keuze. Het gebeurt niet automatisch. Staat een crawler niet expliciet op de lijst, dan houdt een firewall of een default-regel hem alsnog buiten.

Dit zijn de crawlers waar het om gaat.

CrawlerHoort bij
GPTBotOpenAI, voor indexatie en training
OAI-SearchBotOpenAI, voor de zoekfunctie in ChatGPT
ChatGPT-UserOpenAI, als een gebruiker een pagina laat ophalen
ClaudeBotAnthropic, voor Claude
PerplexityBotPerplexity
Google-ExtendedGoogle, voor Gemini
CCBotCommon Crawl, waar veel modellen uit lezen

In diezelfde robots.txt hoort een regel die naar je sitemap wijst. Dat is de goedkoopste manier om een crawler te vertellen welke pagina's bestaan.

Blokkeer je een van deze crawlers bewust, dan is dat een geldige keuze. Dan is de uitkomst ook geen verrassing meer.

Wat is llms.txt en wat hoort erin?

llms.txt is een tekstbestand in de root van je domein. Het staat op /llms.txt en het beschrijft in markdown wie je bent, wat je doet en welke pagina's je belangrijkste antwoorden bevatten. Het werkt als een leeswijzer voor een model dat je site voor het eerst tegenkomt.

Wat erin hoort. Een korte, feitelijke omschrijving van je bedrijf. Je diensten of modules in gewone woorden. Voor wie je werkt, en in welke markt. Een handvol links naar de pagina's die je vragen echt beantwoorden, met per link één regel uitleg. Contactinformatie.

Wat er niet in hoort. Marketingclaims zonder onderbouwing. Een dump van je hele sitemap. Instructies aan het model over de woorden waarmee het je beschrijft.

Eén waarschuwing die we in de praktijk zien. Een llms.txt die vooral bestaat uit een lange lijst met oude content-URL's vertelt een model iets anders dan de kop bovenaan. Bovenaan staat dat je een security-partner voor de zorg bent. Daaronder staat een rij blogtitels uit 2019 over printerbeheer. Het model leest beide.

Titels in zo'n lijst zijn inhoud, geen bijlage. Wat je opsomt, is wat je zegt te zijn.

Hoe houd je de rest van de basis op orde?

De overige punten zijn kleiner, en ze kosten je IT-team weinig tijd.

  1. Sitemap.xml actueel houden. Elke publieke pagina staat erin, met een lastmod-timestamp die echt meebeweegt als je de pagina wijzigt. Een lastmod die bij elke build op vandaag springt, is net zo waardeloos als een lastmod uit 2021.
  2. Noindex controleren. We treffen regelmatig een noindex aan op een prijzenpagina of een documentatiesectie, overgebleven uit een staging-omgeving. Die pagina doet dan niet mee.
  3. HTTPS en cachebaarheid. Publieke pagina's leveren via HTTPS, met cache-headers die een crawler laten hergebruiken wat niet veranderd is.
  4. Laadtijd en loginmuren. Een crawler wacht niet lang. Content achter een login of een cookiewall haalt hij niet op, dus alles waarop je gevonden wilt worden, staat publiek.

Wat er misgaat

Drie dingen zien we telkens terugkomen.

De site is technisch prima, maar de content zit in een JavaScript-bundel. Het dev-team meldt terecht dat alles werkt. In de ruwe HTML staat niets. Onze test daarvoor staat in Waarom je SaaS-site onzichtbaar is voor AI.

De robots.txt blokkeert AI-crawlers zonder dat iemand daarvoor koos. Vaak staat er nog een oude regel van een securityleverancier of een WAF. Niemand kijkt ernaar tot je het opzoekt.

De llms.txt is een export. Iemand heeft de sitemap in een tekstbestand geplakt en het klaar genoemd. Dan lees je vooral je archief voor.

Checklist voor je IT-team

Deze lijst kun je letterlijk doorsturen.

  • [ ] Staat de kerncontent van onze belangrijkste pagina's in de ruwe HTML, dus zonder JavaScript uit te voeren?
  • [ ] Laat onze robots.txt GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended en CCBot toe?
  • [ ] Staat er in robots.txt een verwijzing naar onze sitemap?
  • [ ] Blokkeert onze WAF, CDN of bot-protectie een van deze crawlers alsnog?
  • [ ] Staat er een llms.txt op de root van het domein, met een omschrijving van het bedrijf en links naar onze belangrijkste pagina's?
  • [ ] Bevat die llms.txt geen dump van oude blog-URL's?
  • [ ] Is sitemap.xml compleet, en beweegt lastmod mee met echte wijzigingen?
  • [ ] Staat er nergens een noindex op een pagina die we juist willen laten vinden?
  • [ ] Zijn alle publieke pagina's bereikbaar via HTTPS, met werkende cache-headers?
  • [ ] Zit er content achter een login, een cookiewall of een formulier die publiek zou moeten staan?

Tien vinkjes. De meeste zijn in een middag te zetten.

Veelgestelde vragen

Kun je AI-crawlers beter toelaten of blokkeren?

Wil je in AI-antwoorden voorkomen, dan hebben die crawlers toegang nodig tot je publieke pagina's. Blokkeren is een geldige keuze voor bedrijven die hun content niet in modellen willen zien. Beide kanten kiezen, en dan de robots.txt daarop laten kloppen, werkt beter dan de standaardinstelling laten staan.

Is llms.txt verplicht?

Nee, het is geen standaard die iemand handhaaft. Het kost een uur en het geeft een model een schone samenvatting van wie je bent. Wij zetten hem daarom altijd neer, met een korte omschrijving en een selectie links.

Hoe snel is het effect van deze technische aanpassingen zichtbaar?

Reken op drie tot zes maanden voordat het effect zichtbaar en stabiel is. Crawlers moeten opnieuw langskomen, en modellen updaten op hun eigen tempo. De technische basis is de voorwaarde waarop de rest kan werken.

Verder lezen

Wil je weten wat een AI-crawler nu van je site leest, dan kun je de gratis AI-zichtbaarheidsscan op /geo-scanner/ gebruiken. Die geeft je de technische stand plus de punten die als eerste in de weg zitten. Liever meteen met iemand meekijken, dan staat een audit-call open via /contact.

Weet je niet of AI jouw bedrijf al noemt?

Je kunt het gratis laten meten in vier assistenten. Je ziet op welke vragen je gemist wordt en welke concurrenten er nu in het antwoord staan.

Check je AI-zichtbaarheid