Qu'est-ce que le fichier robots.txt standard ?
Un fichier robots.txt est un fichier qui permet de contrôler quels fichiers de votre site web peuvent être accessibles par des soi-disant crawlers. Le fichier robots.txt se trouve dans le Document-Root du site web, c'est-à-dire dans le répertoire où se trouvent tous les fichiers d'une page web. Dans l'exemple du site www.meine-domain.ch, le fichier robots.txt se trouve donc à l'emplacement suivant : www.meine-domain.ch/robots.txt. Dans votre serveur web, cela correspondra au chemin : /var/www/vhosts/meine-domain.ch/httpdocs/robots.txt
Le fichier robots.txt est un fichier texte pur sans mise en forme, qui respecte la « Norme d'Exclusion des Robots » (voir https://de.wikipedia.org/wiki/Robots_Exclusion_Standard). Dans ce fichier, des règles sont définies pour autoriser ou bloquer l'accès d'un certain crawler au Document-Root du domaine ou du sous-domaine. Si rien n'est spécifié dans le fichier robots.txt, tous les fichiers peuvent être explorés.
Que contient ce fichier ?
Si vous n'avez pas défini votre propre version du fichier robots.txt pour votre site web, la version standard de Emubox sera livrée (version par défaut). Celle-ci définit un Crawl-Delay (délai entre les appels en secondes), afin que les bots ne puissent pas envoyer leurs requêtes consécutivement sans attendre entre chaque requête. De plus, le Emubox par défaut permet d'accéder à tous les fichiers.
(Veuillez noter que le Crawl-Delay n'est pas une norme et qu'il peut arriver qu'il ne soit pas pris en compte par tous les bots.)
Un autre exemple d'un fichier Robots.txt créé :
User-agent: *
Disallow: /cgi-bin/
Disallow: /errdocs/
Disallow: /js/
Disallow: /jss/
Disallow: /img/
Disallow: /images/
Disallow: /webalizer/
Disallow: /*.gif$
Disallow: /*.jpg$
Disallow: /*.doc$
Disallow: /*.xls$
Disallow: /*.pdf$
Disallow: /*.txt$
Disallow: /*.zip$
Disallow: /Impressum.*
Disallow: /Widerrufsrecht.*
Disallow: /Datenschutz.*
Disallow: /AGB.*
Disallow: /BGBW.*
Disallow: /Rechtsinformation.*
Comment puis-je remplacer la version standard du fichier robots.txt ?
Si vous souhaitez créer votre propre fichier robots.txt, vous pouvez l'établir dans le répertoire de votre site web et y définir vos propres règles à votre convenance.
Pour plus d'informations utiles sur le fichier robots.txt, vous pouvez consulter le lien suivant : https://moz.com/learn/seo/robotstxt.