Crawlen en indexeren uitgelegd: zo komt je pagina in Google

Onderwerp

SEO

Hoe crawlt, rendert en indexeert Google je website? Uitleg over canonicals, noindex, robots.txt, XML-sitemaps, Search Console en AI-crawlers als GPTBot.

Artikel

Inhoud

Laatst gecontroleerd: 5 oktober 2026

Voordat een pagina in Google kan verschijnen, moet Google haar vinden en ophalen (crawlen), verwerken en weergeven (renderen) en opslaan in de index (indexeren). Pas daarna kan de pagina getoond worden bij een zoekopdracht. Gaat er in een van die stappen iets mis, dan helpt de beste content niet: de pagina doet dan simpelweg niet mee.

In het kort

  • Crawlen is ophalen, renderen is de pagina uitvoeren zoals een browser, indexeren is opslaan en begrijpen.
  • robots.txt regelt wat gecrawld mag worden, noindex regelt wat niet in de index mag. Dat is niet hetzelfde.
  • Een canonical geeft aan welke versie van dubbele content de voorkeur heeft; Google ziet het als sterk signaal, niet als bevel.
  • Een XML-sitemap helpt Google je belangrijke URL's te vinden.
  • In Search Console zie je per pagina of en waarom die wel of niet geïndexeerd is.

Stap 1: crawlen

Googlebot ontdekt nieuwe URL's via links op pagina's die al bekend zijn, via sitemaps en via eerdere bezoeken. Vervolgens haalt Googlebot de pagina op. Daarbij kijkt Google eerst in je robots.txt of het die URL mag ophalen.

Wat crawlen in de praktijk lastig maakt:

  • Pagina's zonder interne links (zogenoemde weespagina's) worden slecht gevonden.
  • Eindeloze URL-varianten door filters, sorteringen of parameters kosten crawlcapaciteit zonder iets op te leveren.
  • Serverfouten en trage reacties kunnen ertoe leiden dat Google minder vaak of minder diep crawlt.

Stap 2: renderen

Veel websites laden inhoud met JavaScript. Google voert die JavaScript uit met een actuele (evergreen) versie van Chromium om te zien wat een bezoeker ziet. Dat gebeurt niet altijd direct na het crawlen: een pagina kan volgens Google een paar seconden, maar ook langer, in de wachtrij voor rendering staan. Belangrijke inhoud en links die alleen na interactie verschijnen, bijvoorbeeld pas na een klik, worden mogelijk niet meegenomen.

Ons advies: zorg dat de kerninhoud, titels en interne links al in de HTML staan die de server uitlevert. Dat is betrouwbaarder voor Google en ook voor AI-crawlers: van die crawlers is niet gedocumenteerd dat ze JavaScript uitvoeren, dus reken er niet op. Meer daarover in hoe zoekmachines en AI je website lezen.

Stap 3: indexeren

Bij indexeren analyseert Google de inhoud van de pagina, bepaalt waar die over gaat en of het een duplicaat is van een andere pagina. Niet elke gecrawlde pagina wordt geïndexeerd. Google kiest uit vergelijkbare pagina's er één als canonieke versie en maakt keuzes op basis van kwaliteit en relevantie.

Je ziet dat terug in het rapport Pagina-indexering in Search Console, met statussen als "Gecrawld, momenteel niet geïndexeerd" of "Duplicaat, Google heeft een andere canonieke pagina gekozen dan de gebruiker". Hoe je daarmee omgaat, staat in pagina niet geïndexeerd in Search Console.

robots.txt, noindex en canonical: het verschil

Deze drie worden vaak door elkaar gehaald. Ze doen elk iets anders:

  • robots.txt vertelt crawlers welke URL's ze niet mogen ophalen. Het is geen manier om een pagina uit Google te houden: een geblokkeerde URL kan toch in de index komen als andere pagina's ernaar linken, alleen zonder inhoud. Zie robots.txt.
  • noindex (als meta-tag of HTTP-header) vertelt Google dat een pagina niet in de index mag. Google moet de pagina daarvoor wel kunnen crawlen. Blokkeer je dezelfde pagina in robots.txt, dan ziet Google de noindex nooit.
  • Canonical geeft aan welke URL de voorkeursversie is als er meerdere vergelijkbare versies bestaan, bijvoorbeeld met en zonder parameters. De andere varianten worden dan meestal samengevoegd. Controleer dit met canonical-tag controleren.

Voorbeeld: stel, een webshop wil filterpagina's als "?kleur=rood" niet in Google. Die URL's blokkeren in robots.txt én een noindex geven werkt tegen elkaar in. Beter is een bewuste keuze: canonical naar de categoriepagina, noindex op varianten zonder zoekwaarde, of crawlen beperken als crawlcapaciteit het probleem is.

XML-sitemaps

Een XML-sitemap is een lijst met URL's die je door Google geïndexeerd wilt zien. Het is een hulpmiddel bij het ontdekken, geen garantie op indexering. Zet er alleen canonieke, indexeerbare pagina's in die een 200-status geven. Verwijs naar je sitemap in robots.txt en dien hem in via Search Console. Zo zie je ook hoeveel van de ingediende URL's daadwerkelijk geïndexeerd zijn.

Search Console als controlepaneel

Met Google Search Console zie je hoe Google je site verwerkt. De onderdelen die wij het meest gebruiken:

  • URL-inspectie: per URL zien of hij geïndexeerd is, welke canonical Google koos en hoe de gerenderde pagina eruitziet. Je kunt ook om opnieuw crawlen vragen.
  • Pagina-indexering: overzicht van welke pagina's niet geïndexeerd zijn en waarom.
  • Sitemaps: status van ingediende sitemaps.
  • Prestaties: vertoningen en klikken, inclusief verkeer uit AI Overviews en AI Mode, dat volgens Google meetelt onder zoektype "Web".

Nog niet ingesteld? Volg Google Search Console instellen.

En AI-crawlers?

Naast Googlebot bezoeken ook AI-crawlers je site. Volgens OpenAI gebruikt OAI-SearchBot pagina's om websites te tonen in de zoekfuncties van ChatGPT, en is GPTBot bedoeld voor het trainen van generatieve modellen. Die instellingen zijn onafhankelijk: je kunt OAI-SearchBot toestaan en GPTBot blokkeren. Bij Google gaat Google-Extended over het gebruik van content voor Gemini-modellen, niet over ranking in Search. Voor AI Overviews en AI Mode geldt volgens Google dat een pagina geïndexeerd moet zijn en in aanmerking moet komen voor een snippet. Het verschil tussen de OpenAI-crawlers lees je in GPTBot versus OAI-SearchBot.

Veelgestelde vragen

Hoe lang duurt het voordat een nieuwe pagina geïndexeerd is?

Dat varieert van dagen tot weken. Interne links vanaf belangrijke pagina's, een actuele sitemap en een indexeringsverzoek via URL-inspectie helpen, maar garanderen niets.

Haalt een disallow in robots.txt een pagina uit Google?

Nee. Gebruik noindex en laat de pagina crawlbaar tot Google de noindex heeft verwerkt. Voor snel tijdelijk verbergen heeft Search Console een verwijderingstool.

Waarom kiest Google een andere canonical dan ik?

Canonicals zijn een signaal. Als interne links, sitemap en redirects naar een andere URL wijzen, of als pagina's vrijwel identiek zijn, kan Google anders kiezen. Maak alle signalen consistent.

Bronnen

Verder lezen

Twijfel je of Google en AI-crawlers je belangrijkste pagina's goed kunnen lezen? Vraag een gratis SEO & GEO Quickscan aan