Wat is de robots exclusion standard?

De Robots Exclusion Standard (ook wel bekend als het Robots Exclusion Protocol) is een wereldwijde internetstandaard die website-eigenaren de mogelijkheid biedt om instructies te geven aan web-robots en crawlers. Via een speciaal tekstbestand genaamd robots.txt, dat in de hoofdmap van de server wordt geplaatst, kun je aangeven welke pagina’s of mappen van je website wel of juist niet gecrawld en geïndexeerd mogen worden.

Geen keiharde garantie, wel gerespecteerd

Het is belangrijk om te begrijpen dat het protocol werkt op basis van vrijwilligheid; het is een richtlijn en geen technische blokkade. Of de aanwijzingen worden opgevolgd, hangt volledig af van de robot zelf. Gelukkig respecteren de crawlers van alle grote, legitieme zoekmachines (zoals Google en Bing) deze standaarden strikt. Malafide bots of spambots negeren het robots.txt-bestand echter vaak.

Het alternatief: de robots-metatag

Als je absolute zekerheid wilt dat een specifieke pagina niet in de zoekresultaten van Google verschijnt, is het robots.txt-bestand soms niet voldoende. In dat geval kun je beter gebruikmaken van een robots-metatag (zoals noindex) in de HTML-code van de specifieke pagina zelf. Hiermee geef je de zoekmachine direct bij het laden van de pagina de dwingende instructie om de pagina uit de index te laten.

Dit bericht is gepost in . Bookmark de link.