Een AI-crawler leest je pagina als platte tekst. Twee dingen bepalen of er iets te lezen valt. Je kerncontent staat server-side in de ruwe HTML, en je robots.txt laat de AI-crawlers toe en wijst naar je sitemap. Daarna volgen llms.txt in de root en een sitemap.xml met actuele lastmod-timestamps, en daarna de rest van de basis.
Die rest is geen noindex op belangrijke pagina's, HTTPS met cachebare publieke pagina's en een redelijke laadtijd zonder loginmuur op je content. Deze volgorde is de volgorde van belang.
Bij IT-bedrijven zien we meestal hetzelfde beeld. In de browser staat er een volledige productpagina. In de ruwe HTML staat een leeg div-element, en de robots.txt zegt niets over AI-crawlers.
De ruwe HTML is wat de server terugstuurt voordat er één regel JavaScript is uitgevoerd. Een browser voert die JavaScript daarna netjes uit. AI-crawlers doen dat vaak niet.
Content die alleen client-side laadt, bestaat voor die crawlers niet. Je prijstabel, je productbeschrijving, je FAQ-antwoorden en je documentatie zijn dan onzichtbaar.
Dit is het punt waar het bij software- en SaaS-bedrijven het vaakst stukloopt. Het is ook het punt dat het meeste oplevert als je het oplost. Alles wat daarna komt, werkt alleen op tekst die er al staat.
Eén vraag aan je dev-team volstaat. Welke pagina's renderen we server-side, en welke niet? Dat antwoord vertelt je waar je staat.
Toelaten is een keuze. Het gebeurt niet automatisch. Staat een crawler niet expliciet op de lijst, dan houdt een firewall of een default-regel hem alsnog buiten.
Dit zijn de crawlers waar het om gaat.
| Crawler | Hoort bij |
|---|---|
| GPTBot | OpenAI, voor indexatie en training |
| OAI-SearchBot | OpenAI, voor de zoekfunctie in ChatGPT |
| ChatGPT-User | OpenAI, als een gebruiker een pagina laat ophalen |
| ClaudeBot | Anthropic, voor Claude |
| PerplexityBot | Perplexity |
| Google-Extended | Google, voor Gemini |
| CCBot | Common Crawl, waar veel modellen uit lezen |
In diezelfde robots.txt hoort een regel die naar je sitemap wijst. Dat is de goedkoopste manier om een crawler te vertellen welke pagina's bestaan.
Blokkeer je een van deze crawlers bewust, dan is dat een geldige keuze. Dan is de uitkomst ook geen verrassing meer.
llms.txt is een tekstbestand in de root van je domein. Het staat op /llms.txt en het beschrijft in markdown wie je bent, wat je doet en welke pagina's je belangrijkste antwoorden bevatten. Het werkt als een leeswijzer voor een model dat je site voor het eerst tegenkomt.
Wat erin hoort. Een korte, feitelijke omschrijving van je bedrijf. Je diensten of modules in gewone woorden. Voor wie je werkt, en in welke markt. Een handvol links naar de pagina's die je vragen echt beantwoorden, met per link één regel uitleg. Contactinformatie.
Wat er niet in hoort. Marketingclaims zonder onderbouwing. Een dump van je hele sitemap. Instructies aan het model over de woorden waarmee het je beschrijft.
Eén waarschuwing die we in de praktijk zien. Een llms.txt die vooral bestaat uit een lange lijst met oude content-URL's vertelt een model iets anders dan de kop bovenaan. Bovenaan staat dat je een security-partner voor de zorg bent. Daaronder staat een rij blogtitels uit 2019 over printerbeheer. Het model leest beide.
Titels in zo'n lijst zijn inhoud, geen bijlage. Wat je opsomt, is wat je zegt te zijn.
De overige punten zijn kleiner, en ze kosten je IT-team weinig tijd.
Drie dingen zien we telkens terugkomen.
De site is technisch prima, maar de content zit in een JavaScript-bundel. Het dev-team meldt terecht dat alles werkt. In de ruwe HTML staat niets. Onze test daarvoor staat in Waarom je SaaS-site onzichtbaar is voor AI.
De robots.txt blokkeert AI-crawlers zonder dat iemand daarvoor koos. Vaak staat er nog een oude regel van een securityleverancier of een WAF. Niemand kijkt ernaar tot je het opzoekt.
De llms.txt is een export. Iemand heeft de sitemap in een tekstbestand geplakt en het klaar genoemd. Dan lees je vooral je archief voor.
Deze lijst kun je letterlijk doorsturen.
Tien vinkjes. De meeste zijn in een middag te zetten.
Wil je in AI-antwoorden voorkomen, dan hebben die crawlers toegang nodig tot je publieke pagina's. Blokkeren is een geldige keuze voor bedrijven die hun content niet in modellen willen zien. Beide kanten kiezen, en dan de robots.txt daarop laten kloppen, werkt beter dan de standaardinstelling laten staan.
Nee, het is geen standaard die iemand handhaaft. Het kost een uur en het geeft een model een schone samenvatting van wie je bent. Wij zetten hem daarom altijd neer, met een korte omschrijving en een selectie links.
Reken op drie tot zes maanden voordat het effect zichtbaar en stabiel is. Crawlers moeten opnieuw langskomen, en modellen updaten op hun eigen tempo. De technische basis is de voorwaarde waarop de rest kan werken.
Wil je weten wat een AI-crawler nu van je site leest, dan kun je de gratis AI-zichtbaarheidsscan op /geo-scanner/ gebruiken. Die geeft je de technische stand plus de punten die als eerste in de weg zitten. Liever meteen met iemand meekijken, dan staat een audit-call open via /contact.
Je kunt het gratis laten meten in vier assistenten. Je ziet op welke vragen je gemist wordt en welke concurrenten er nu in het antwoord staan.