Hoe zoekmachines en AI je website lezen: crawlen, indexeren en toegang

Onderwerp

GEO & AI Search

Voordat je gevonden kunt worden, moet je website gelezen kunnen worden. Uitleg over crawlen, indexeren, crawl budget en AI-crawlers.

Artikel

Inhoud

Of het nu om Google gaat of om een AI-zoekdienst: je content kan pas gebruikt worden als die gevonden, opgehaald en begrepen kan worden. Veel vindbaarheidsproblemen ontstaan niet door slechte teksten, maar doordat systemen de pagina's niet (goed) kunnen lezen.

Drie stappen: ontdekken, crawlen, indexeren

  1. Ontdekken. Een zoekmachine vindt nieuwe pagina's via links en via je XML-sitemap.
  2. Crawlen. Een crawler haalt de pagina op en leest de inhoud en de links.
  3. Indexeren. De zoekmachine beoordeelt de pagina en neemt die wel of niet op in de index. Alleen geïndexeerde pagina's kunnen in de resultaten verschijnen.

Een pagina die gecrawld is, is dus niet automatisch geïndexeerd. Search Console laat per pagina zien wat de status is. Zie pagina niet geïndexeerd oplossen.

Wat de weg blokkeert

  • Noindex of blokkades in robots.txt, vaak achtergebleven uit de bouwfase.
  • Inhoud die alleen via JavaScript verschijnt, waardoor een crawler een lege of halve pagina ziet.
  • Trage of instabiele pagina's, met time-outs of foutcodes als gevolg.
  • Dubbele content en onduidelijke canonicals, waardoor niet duidelijk is welke versie telt.
  • Wezen: pagina's waar geen enkele interne link naartoe wijst.

Crawl budget: wanneer speelt het?

Zoekmachines besteden per site een beperkte hoeveelheid tijd aan crawlen. Voor een website met enkele honderden pagina's is dat zelden een probleem. Bij grote webshops met filters, sorteeropties en duizenden varianten wel. Dan is het belangrijk om onnodige URL-varianten te beperken, zodat de aandacht naar de pagina's gaat die ertoe doen.

AI-crawlers

Naast zoekmachines bezoeken ook crawlers van AI-bedrijven je website. Sommige gebruiken content voor het trainen van modellen, andere halen actuele informatie op om een vraag te beantwoorden. Via robots.txt kun je per crawler aangeven of die welkom is. Dat is een bewuste afweging: wie alles blokkeert, wordt ook minder snel als bron gebruikt in AI-antwoorden. Wie alles toestaat, geeft content vrij voor hergebruik. Er is geen standaard goed antwoord; het hangt af van je organisatie en je content.

Snelheid en stabiliteit

Snelle, stabiele pagina's worden makkelijker en vaker gecrawld en zijn prettiger voor bezoekers. Core Web Vitals geven een goed beeld van de ervaring van gebruikers. Lees meer in een snellere website.

Zo controleer je de basis

  • Koppel je site aan Google Search Console en dien je sitemap in.
  • Bekijk het rapport Pagina-indexering en onderzoek uitgesloten pagina's.
  • Controleer robots.txt en de indexeerinstellingen per pagina.
  • Test belangrijke pagina's met de URL-inspectietool.

Verder

Een technische controle brengt dit soort problemen snel in kaart. Bekijk wat een SEO-audit oplevert of lees meer over Technische SEO. Liever direct overleggen? Plan een gesprek.

Verder lezen