Kennis
Begrippen
Robots.txt
Robots.txt is een tekstbestand in de hoofdmap van je website (jouwbedrijf.nl/robots.txt) dat crawlers van zoekmachines en AI-diensten vertelt welke delen van de site ze wel of niet mogen bezoeken.
Hoe werkt robots.txt?
Het bestand bevat regels per crawler (user-agent), zoals Disallow voor paden die niet bezocht mogen worden. Vaak staat er ook een verwijzing naar de XML-sitemap in. Nette crawlers houden zich aan de regels; het is geen beveiliging, want het bestand is voor iedereen leesbaar.
Robots.txt en AI-crawlers
Diensten als OpenAI, Google en Anthropic hebben eigen crawlers met een eigen naam. Via robots.txt bepaal je of die je content mogen lezen. Wie zichtbaar wil zijn in AI Search, blokkeert deze crawlers niet zonder bewuste keuze.
Veelgemaakte fouten
- Een Disallow: / van de testomgeving die na livegang blijft staan.
- CSS- en JavaScript-bestanden blokkeren, waardoor Google de pagina niet goed kan weergeven.
- Robots.txt gebruiken om pagina's uit Google te halen; daarvoor is noindex bedoeld.
Begrippen
Gerelateerd
