Robots.txt en noindex: wat is het verschil?
Veel technische SEO problemen ontstaan niet doordat een website te weinig instellingen heeft, maar doordat de verkeerde instelling voor het verkeerde probleem wordt gebruikt. Robots.txt en noindex zijn daar goede voorbeelden van. Ze worden vaak in één adem genoemd, maar ze doen iets anders.
Met robots.txt geef je crawlers aan welke delen van je website ze wel of niet mogen opvragen. Met noindex geef je aan dat een pagina niet in de zoekresultaten mag worden opgenomen. Dat lijkt op elkaar, maar het verschil is groot. Een pagina blokkeren voor crawlers is niet hetzelfde als een pagina uit Google houden.
Dat verschil moet je snappen. Anders kun je per ongeluk belangrijke pagina’s blokkeren, of juist denken dat een pagina uit Google verdwijnt terwijl dat niet gebeurt.
In deze blog:
Wat is robots.txt?
Robots.txt is een tekstbestand op je website waarmee je crawlers instructies geeft over welke URL’s ze wel of niet mogen bezoeken. Het bestand staat meestal op een vaste plek, bijvoorbeeld:
Zoekmachines bekijken dit bestand voordat ze bepaalde URL’s op je website crawlen. In het bestand kun je bijvoorbeeld aangeven dat crawlers een bepaalde map niet mogen opvragen.
Een eenvoudig voorbeeld:
Dit betekent dat alle crawlers de map /admin/ niet mogen crawlen. Let op: dit betekent niet automatisch dat URL’s uit die map nooit in Google kunnen verschijnen. Robots.txt stuurt crawling aan. Het is geen betrouwbare manier om indexatie te blokkeren.
Wat doet robots.txt wel?
Robots.txt is vooral bedoeld om crawling te sturen. Je gebruikt het wanneer je niet wilt dat crawlers bepaalde delen van je website opvragen. Dat kan nuttig zijn bij technische URL’s, interne zoekresultaten, filtercombinaties of om te voorkomen dat crawlers onnodig veel systeemachtige pagina’s bezoeken.
Robots.txt kan helpen bij:
- Het beperken van crawlactiviteit op onbelangrijke URL’s
- Het blokkeren van technische mappen
- Het voorkomen dat crawlers interne zoekresultaten crawlen
- Het sturen van crawlers bij grote websites met veel URL varianten
- Het beperken van crawling op filter en sorteer URL’s
- Het verwijzen naar je XML sitemap
Een robots.txt bestand kan dus nuttig zijn, vooral bij grotere websites. Maar je moet het precies inzetten. Eén verkeerde regel kan ervoor zorgen dat belangrijke pagina’s niet meer gecrawld worden.
Wat doet robots.txt niet?
De grootste misvatting is dat robots.txt pagina’s uit Google houdt. Dat is niet hoe je het moet gebruiken. Als een URL geblokkeerd is in robots.txt, kan Google de pagina niet crawlen. Maar als Google de URL via interne links, externe links of een sitemap kent, kan de URL soms alsnog als URL in de zoekresultaten verschijnen. Google kan de inhoud dan niet goed lezen, maar de URL kan wel bekend zijn.
Daarom is robots.txt niet geschikt voor pagina’s die echt uit Google moeten blijven. Denk aan bedankpagina’s, testpagina’s, interne zoekresultaten of pagina’s met gevoelige informatie. Voor pagina’s die niet in Google mogen verschijnen, gebruik je noindex of scherm je de pagina af met login of wachtwoordbeveiliging.
Gebruik robots.txt dus niet voor:
- Pagina’s die echt uit Google moeten verdwijnen
- Privacygevoelige pagina’s
- Testomgevingen die niet openbaar mogen zijn
- Bedankpagina’s die niet geïndexeerd mogen worden
- Pagina’s waarop Google eerst een noindex tag moet kunnen lezen
Dat laatste is belangrijk. Als je een pagina blokkeert via robots.txt, kan Google de noindex tag op die pagina niet zien. Je blokkeert dan juist de route waarmee Google moet begrijpen dat de pagina niet geïndexeerd mag worden.
Wat is noindex?
Noindex is een instructie waarmee je aangeeft dat een pagina niet in de zoekresultaten mag worden opgenomen. Dat kan via een robots meta tag in de HTML van de pagina of via een HTTP header.
Een voorbeeld van een noindex meta tag:
Deze tag plaats je in de <head> van de pagina. Google moet de pagina wel kunnen crawlen om deze tag te lezen. Als de pagina tegelijkertijd geblokkeerd is in robots.txt, kan Google de noindex instructie mogelijk niet verwerken.
Noindex gebruik je dus wanneer een pagina bereikbaar mag zijn voor gebruikers, maar niet zichtbaar hoeft te zijn in Google.
Wanneer gebruik je noindex?
Noindex is geschikt voor pagina’s die wel mogen bestaan, maar geen plek in de zoekresultaten nodig hebben. Denk aan pagina’s die nuttig zijn voor gebruikers binnen een proces, maar geen zelfstandige SEO waarde hebben.
Voorbeelden:
- Bedankpagina’s na een formulier
- Interne zoekresultaten
- Loginpagina’s
- Accountpagina’s
- Winkelwagen en checkout pagina’s
- Filterpagina’s zonder unieke waarde
- Testpagina’s die tijdelijk openbaar staan
- Pagina’s met dunne of tijdelijke inhoud
- Pagina’s die je bewust buiten Google wilt houden
Noindex is een duidelijke keuze: de pagina mag worden gecrawld, maar niet worden geïndexeerd. Dat maakt het een andere oplossing dan robots.txt.
Robots.txt of noindex?
De keuze hangt af van wat je wilt bereiken. Wil je crawling beperken? Dan kijk je naar robots.txt. Wil je indexatie voorkomen? Dan gebruik je noindex. Wil je voorkomen dat iets überhaupt toegankelijk is? Dan is geen van beide genoeg en moet je de pagina afschermen.
Een praktische vuistregel:
- Gebruik robots.txt als crawlers een URL niet hoeven op te vragen.
- Gebruik noindex als een pagina niet in Google mag staan.
- Gebruik wachtwoordbeveiliging of login als informatie niet openbaar mag zijn.
- Gebruik een redirect als een pagina definitief is vervangen.
- Gebruik een canonical als meerdere vergelijkbare URL’s naar één hoofdversie moeten wijzen.
Dit onderscheid voorkomt veel technische SEO fouten. Robots.txt, noindex, canonical en redirects lijken soms op elkaar, maar ze lossen andere problemen op.
Robots.txt en noindex samen gebruiken
In veel gevallen moet je robots.txt en noindex juist niet samen gebruiken op dezelfde pagina. Dat klinkt tegenstrijdig, maar het is logisch. Google moet een pagina kunnen crawlen om de noindex tag te zien. Als robots.txt die pagina blokkeert, kan Google de tag niet lezen.
Voorbeeld van wat vaak fout gaat:
En op de testpagina zelf:
Je denkt dan misschien dat je extra veilig zit, maar in werkelijkheid kan Google de noindex tag mogelijk niet zien omdat de pagina geblokkeerd is voor crawling. Wil je dat Google de pagina uit de index haalt, laat Google dan crawlen en gebruik noindex. Wil je alleen crawlactiviteit beperken op URL’s die niet geïndexeerd hoeven te worden en geen noindex verwerking nodig hebben, dan kan robots.txt logisch zijn.
Veelgebruikte robots.txt regels
Een robots.txt bestand hoeft niet ingewikkeld te zijn. Sterker nog: hoe ingewikkelder het bestand, hoe groter de kans op fouten. Voor veel websites is een eenvoudige robots.txt voldoende.
Voorbeeld waarbij alles toegankelijk is:
Voorbeeld waarbij een technische map wordt geblokkeerd:
Voorbeeld waarbij interne zoekresultaten worden geblokkeerd:
Let op met standaardvoorbeelden. Wat voor de ene website logisch is, kan voor een andere website verkeerd zijn. Vooral bij WordPress, WooCommerce, Shopify, Magento of maatwerk websites moet je controleren welke URL’s echt worden geraakt.
Robots.txt bij WordPress
Bij WordPress zie je vaak dat /wp-admin/ wordt geblokkeerd. Dat is meestal logisch, omdat crawlers niets te zoeken hebben in de adminomgeving. Tegelijk moet je oppassen dat je geen bestanden blokkeert die nodig zijn om pagina’s goed te renderen, zoals belangrijke CSS, JavaScript of afbeeldingen.
Google moet een pagina kunnen renderen om goed te begrijpen wat gebruikers zien. Als je belangrijke resources blokkeert, kan dat problemen geven. Blokkeer daarom niet zomaar complete mappen zonder te weten wat erin zit.
Voor WordPress is dit vaak een veilige basis:
Maar ook hier geldt: controleer altijd de echte situatie. SEO plugins, caching plugins, thema’s en maatwerk kunnen invloed hebben op wat verstandig is.
Robots.txt bij webshops
Bij webshops is robots.txt vaak belangrijker dan bij kleine websites. Webshops kunnen veel URL varianten hebben door filters, sorteringen, zoekfuncties, productvarianten en tracking parameters. Als Google al die URL’s gaat crawlen, kan dat voor ruis zorgen.
Denk aan URL’s zoals:
/categorie/schoenen/?kleur=zwart/categorie/schoenen/?maat=42/categorie/schoenen/?sort=prijs/zoeken?q=hardloopschoenen/product/nike-air-max/?utm_source=mail
Niet elke parameter URL is slecht. Sommige filterpagina’s kunnen SEO waarde hebben. Bijvoorbeeld als er zoekvraag is naar “zwarte hardloopschoenen” en je daar een sterke landingspagina voor hebt. Maar eindeloze combinaties van kleur, maat, sortering en prijs leveren vaak weinig waarde op.
Voor webshops moet je dus niet blind alles blokkeren. Je moet bepalen welke URL’s zelfstandig vindbaar mogen zijn en welke URL’s vooral crawlruis veroorzaken. Robots.txt kan helpen om crawlactiviteit te beperken, maar canonical tags, noindex, interne linkstructuur en URL strategie spelen vaak ook mee.
Wat is X-Robots-Tag?
Naast de robots meta tag bestaat ook de X-Robots-Tag. Die werkt via de HTTP header. Dit is vooral handig voor bestanden waar je geen HTML meta tag in kunt plaatsen, zoals PDF’s, afbeeldingen of andere bestandstypen.
Een voorbeeld:
Met een X-Robots-Tag kun je bijvoorbeeld aangeven dat een PDF niet geïndexeerd moet worden. Voor gewone HTML pagina’s is een meta robots tag vaak eenvoudiger. Voor bestanden of serverniveau instellingen kan een HTTP header juist beter zijn.
Gebruik dit zorgvuldig. Een verkeerde serverregel kan veel bestanden tegelijk op noindex zetten.
Nofollow, noindex en robots.txt
Nofollow wordt ook vaak in dit rijtje genoemd, maar het is weer iets anders. Noindex gaat over indexatie. Nofollow gaat over het volgen van links. Robots.txt gaat over crawling.
Een meta robots tag kan bijvoorbeeld zo worden ingesteld:
Daarmee zeg je: indexeer deze pagina niet, maar volg de links op de pagina wel. In veel gevallen is dat logischer dan noindex, nofollow, omdat je interne linkwaarde niet onnodig wilt afsluiten.
Gebruik nofollow op paginaniveau alleen als je echt wilt dat crawlers de links op die pagina niet volgen. Voor individuele links bestaat ook het linkattribuut rel="nofollow", maar dat is een ander onderwerp.
Robots.txt en staging websites
Een veelgemaakte fout is een staging website blokkeren met robots.txt en daarna denken dat alles veilig is. Dat is onvoldoende. Robots.txt voorkomt crawling, maar het beveiligt niets. Iedereen die de URL kent, kan de omgeving nog steeds openen.
Een staging omgeving hoort achter een login of wachtwoord te staan. Eventueel kun je daarnaast noindex gebruiken, maar de echte bescherming moet toegangsbeveiliging zijn.
Na livegang gaat het vaak andersom mis. Tijdens ontwikkeling stond de site op noindex of was crawling geblokkeerd, en na livegang wordt dat vergeten. Dan staat de nieuwe website technisch live, maar Google kan hem niet goed crawlen of indexeren.
Controleer bij livegang altijd:
- Staat er geen noindex meer op belangrijke pagina’s?
- Blokkeert robots.txt geen belangrijke delen van de site?
- Zijn canonicals aangepast naar de live URL’s?
- Staat de sitemap op de juiste locatie?
- Kan Google belangrijke pagina’s renderen?
- Ziet Search Console de live pagina’s goed?
Dit is één van de simpelste fouten om te voorkomen, maar ook één van de vervelendste als hij blijft liggen.
Robots.txt en Search Console
Google Search Console helpt om te controleren of Google pagina’s kan crawlen en indexeren. Bij de URL inspectie kun je zien of een pagina geblokkeerd is door robots.txt, of Google de pagina kan ophalen en of de pagina geïndexeerd is.
Let vooral op meldingen zoals:
- Geblokkeerd door robots.txt
- Uitgesloten door noindex tag
- Gevonden, momenteel niet geïndexeerd
- Gecrawld, momenteel niet geïndexeerd
- Alternatieve pagina met correcte canonical tag
Die meldingen vragen niet altijd om dezelfde oplossing. Een pagina die is uitgesloten door noindex doet precies wat je hebt ingesteld. Een belangrijke pagina die geblokkeerd is door robots.txt kan juist een serieus probleem zijn. Een URL die gecrawld maar niet geïndexeerd is, vraagt eerder om inhoudelijke of technische beoordeling.
Search Console laat dus zien wat er gebeurt, maar jij moet beoordelen of het gewenst is.
Veelgemaakte fouten met robots.txt en noindex
Robots.txt en noindex zijn niet ingewikkeld, maar verkeerd gebruik kan veel schade doen. Vooral bij migraties, redesigns en webshops zie je regelmatig fouten die organische zichtbaarheid raken.
Robots.txt gebruiken om pagina’s uit Google te houden
Dit is de grootste denkfout. Robots.txt blokkeert crawling, maar is geen betrouwbare manier om indexatie te voorkomen. Als een pagina echt niet in Google mag staan, gebruik dan noindex of scherm de pagina af.
Noindex plaatsen op belangrijke pagina’s
Tijdens ontwikkeling worden pagina’s soms op noindex gezet. Als dat na livegang blijft staan, kunnen belangrijke pagina’s uit Google verdwijnen. Controleer daarom altijd templates en belangrijke paginatypes na een release.
Robots.txt te breed instellen
Een regel zoals Disallow: / blokkeert de hele website. Dat kan tijdelijk bewust zijn op een testomgeving, maar op een live website is het meestal rampzalig. Ook bredere regels zoals Disallow: /blog/ of Disallow: /product/ kunnen grote gevolgen hebben als je niet precies weet wat je doet.
Noindex en robots.txt combineren op dezelfde pagina
Als je een pagina via robots.txt blokkeert, kan Google de noindex tag op die pagina mogelijk niet lezen. Wil je een pagina uit de index krijgen, laat Google de pagina crawlen en gebruik noindex.
Belangrijke resources blokkeren
Sommige websites blokkeren CSS, JavaScript of afbeeldingen die nodig zijn om de pagina goed te renderen. Daardoor kan Google de pagina minder goed begrijpen. Blokkeer alleen wat echt geblokkeerd moet worden.
Robots.txt zien als beveiliging
Robots.txt is openbaar. Iedereen kan het bestand bekijken. Zet er dus geen gevoelige paden in waarvan je eigenlijk niet wilt dat mensen weten dat ze bestaan. Gebruik voor gevoelige informatie altijd echte afscherming, zoals login of wachtwoordbeveiliging.
Vergeten om noindex te verwijderen na livegang
Dit gebeurt vaak bij nieuwe websites. De staging omgeving stond op noindex en die instelling verhuist mee naar live. Het gevolg: de site is live, maar Google mag belangrijke pagina’s niet indexeren.
Hoe controleer je robots.txt en noindex?
Je kunt robots.txt simpel controleren door naar /robots.txt te gaan op je domein. Voor noindex moet je de broncode bekijken of een SEO tool gebruiken. Bij grotere websites is crawl software handig, omdat je dan ziet of noindex of robots instellingen per template onverwacht voorkomen.
Controleer minimaal:
- Staat robots.txt op de juiste locatie?
- Blokkeert robots.txt geen belangrijke pagina’s?
- Staan belangrijke pagina’s niet per ongeluk op noindex?
- Zijn staging instellingen verwijderd na livegang?
- Worden belangrijke CSS en JavaScript bestanden niet geblokkeerd?
- Kloppen de meldingen in Search Console?
- Worden sitemaps genoemd in robots.txt?
- Zijn noindex, canonical en redirects logisch gecombineerd?
Bij kleine websites is dit vaak snel te controleren. Bij webshops, platformen en maatwerk websites moet je dit structureler aanpakken.
Wanneer zijn robots.txt en noindex prioriteit?
Robots.txt en noindex zijn vooral prioriteit wanneer pagina’s niet goed worden geïndexeerd, Search Console meldingen toont of er net technische wijzigingen zijn geweest. Ook bij websites met veel filters, interne zoekresultaten of URL parameters is dit onderwerp belangrijk.
Geef dit extra aandacht bij:
- Nieuwe websites
- Migraties
- Redesigns
- Webshops met filters en sorteringen
- Websites met staging omgevingen
- Websites met veel indexatieproblemen
- Pagina’s die uit Google moeten verdwijnen
- Pagina’s die juist niet zichtbaar worden
- Structured data pagina’s die Google niet goed kan bereiken
Als belangrijke pagina’s niet worden gecrawld of geïndexeerd, heeft content optimalisatie weinig zin. Dan moet je eerst zorgen dat Google de pagina’s kan bereiken en mag opnemen in de index.
Conclusie
Robots.txt en noindex worden vaak door elkaar gehaald, maar ze hebben een ander doel. Robots.txt stuurt crawling. Noindex stuurt indexatie. Dat verschil is belangrijk voor technische SEO. Wil je voorkomen dat crawlers bepaalde URL’s opvragen? Dan gebruik je robots.txt. Wil je voorkomen dat een pagina in Google verschijnt? Dan gebruik je noindex. Wil je informatie echt afschermen? Dan gebruik je login of wachtwoordbeveiliging.
De juiste vraag is dus niet: moeten we dit blokkeren? De juiste vraag is: willen we crawling beperken, indexatie voorkomen of toegang afschermen? Als je die keuze goed maakt, voorkom je veel technische SEO problemen. Zeker bij migraties, webshops, filterpagina’s en staging omgevingen kan dit het verschil maken tussen een schone index en een website die zichzelf tegenwerkt.
Neem contact op