En este nuevo artículo voy a hablarte acerca del archivo robots.txt y sobre su importancia para el eficiente rastreo de un sitio web.
Además conocerás su sintaxis o ”lenguaje” y una serie de buenas prácticas para que optimices al máximo el presupuesto de rastreo asignado a tu página web.
Qué es el archivo robots.txt
El robots.txt es un archivo de texto que contiene indicaciones para los bots de los motores de búsqueda acerca de que áreas de una página web o archivos deben o no rastrearse.
Por ello, cuando el crawler (por ejemplo, Googlebot) de un motor de búsqueda, en este caso de Google, llega a nuestra web, lo primero que hace es buscar en la raíz del sitio el archivo robots.txt para comprobar las restricciones.
Las indicaciones que encontrará el bot en este archivo, básicamente le sugerirán “permitiendo” o “denegando” que carpetas deben ser rastreadas o no en el sitio web.
Estas órdenes podemos diferenciarlas según el tipo de crawler e incluso pueden servir para ajustar la velocidad de rastreo de algunos bots (entre los cuales no se encuentra Googlebot).
Para qué sirve el archivo robots.txt
El archivo robots.txt se usa principalmente para reducir u optimizar el tráfico de rastreo de una web y no para controlar la indexación de las páginas.
Incluso indicando en el archivo robots.txt el bloqueo o no permiso de acceso a una URL concreta, no es garantía de que Google no la indexe, si realmente no se quiere indexar una URL hay que utilizar el recurso meta noindex
Para encontrar el archivo robots.txt de una web (si existe, claro está) utiliza esta ruta, sustituyendo tusitioweb.com por el dominio de la web:
https://tusitioweb.com/robots.txt
Qué sintaxis tienen los robots.txt
La sintaxis del archivo robots.txt contiene los siguientes campos o comandos:
User-agent: Indica a que rastreador se aplican las reglas o directivas de rastreo
Disallow: Este comando se utiliza para indicar que no se rastree determinados directorios o páginas del dominio raíz
Allow: Este comando se utiliza para indicar que directorios o páginas del dominio raíz deben rastrearse. Sirve para anular el comando Disallow
Sitemap: (opcional) Sirve para indicar la ubicación del sitemap del sitio web
Crawl-delay: (opcional) Sirve para determinar el número de segundos que debe esperar un bot antes de cargar y rastrear el contenido de cada página
Cómo crear un archivo robots.txt
Para poder crear este archivo, es necesario acceder a la raíz del dominio y subir el archivo al directorio raíz de primer nivel, en formato de texto con el nombre “robots.txt”
Tal como indica su extensión, el archivo robots.txt es un fichero de texto plano (sin formato) que se puede crear con cualquier editor de texto, por ejemplo: con el Bloc de notas, WordPad o con Notepad ++
En él incluiremos todos los comandos necesarios para informar a Google de que secciones de una web se deben o no rastrear.
Desde este enlace puedes acceder a Ayuda de Google sobre cómo escribir y enviar un archivo robots.txt
Entre la sintaxis de comandos más utilizados en robots.txt. podemos encontrar:
Damos indicaciones a todos los bots
User-agent: *
Damos indicaciones específicas al bot de Google
User-agent: googlebot
Estamos bloqueando un sitio web al completo
Disallow: /
Estamos bloqueando todas las URLs del panel de administración
Disallow: /wp-admin/
Dentro de la prohibición anterior, los buscadores sí deben rastrear admin-ajax-php
Allow: /wp-admin/admin-ajax.php/
Estamos bloqueando un directorio y todo su contenido
Disallow: /directorio/
Estamos bloqueando una URL concreta del sitio web
Disallow: /url-ejemplo/
Estamos bloqueando URLs que terminen de una forma concreta
Disallow: /*.pdf$
Estamos indicando la ruta o ubicación del Sitemap
Sitemap: https://tusitioweb.com/sitemap_index.xml
Es muy importante que una vez generado el archivo compruebes si tienes errores, para ello puedes hacerlo desde esta herramienta gratuita:
https://technicalseo.com/tools/robots-txt/
Cómo debemos usar el archivo robots.txt en una web
- En una web solo debe haber un archivo robots.txt, en caso de tener subdominios, cada subdominio debe tener su propio robots.txt
- No podemos cambiarle el nombre (robots.txt) ni la ubicación (raíz del sitio) porque entonces será como si no existiera
- El archivo es sensible a las mayúsculas y minúsculas, por lo que hay que tener cuidado a la hora de incorporar las instrucciones
- Se ignoran los espacios al comienzo y al final de la línea
- Entre cada bloque de instrucciones debe existir una línea en blanco
- Las reglas más específicas prevalecen sobre las genéricas, y en caso de haber conflicto, Google usa la directriz menos restrictiva
- Especial atención en bloquear archivos necesarios para renderizar la página
Y hasta aquí llegamos con este artículo sobre el archivo robots.txt en el que espero haber podido explicarte de forma clara y entendible cada uno de los puntos tratados.
De todos modos, al igual que siempre… Si tienes alguna duda te leo en comentarios.