Qué es el archivo robots.txt y para qué sirve

Inicio / Qué es el archivo robots.txt y para qué sirve

En este nuevo artículo voy a hablarte acerca del archivo robots.txt y sobre su importancia para el eficiente rastreo de un sitio web.

Además conocerás su sintaxis o ”lenguaje” y una serie de buenas prácticas para que optimices al máximo el presupuesto de rastreo asignado a tu página web.

Qué es el archivo robots.txt

El robots.txt es un archivo de texto que contiene indicaciones para los bots de los motores de búsqueda acerca de que áreas de una página web o archivos deben o no rastrearse.

Por ello, cuando el crawler (por ejemplo, Googlebot) de un motor de búsqueda, en este caso de Google, llega a nuestra web, lo primero que hace es buscar en la raíz del sitio el archivo robots.txt para comprobar las restricciones.

Las indicaciones que encontrará el bot en este archivo, básicamente le sugerirán “permitiendo” o “denegando” que carpetas deben ser rastreadas o no en el sitio web.

Estas órdenes podemos diferenciarlas según el tipo de crawler e incluso pueden servir para ajustar la velocidad de rastreo de algunos bots (entre los cuales no se encuentra Googlebot).

Para qué sirve el archivo robots.txt

El archivo robots.txt se usa principalmente para reducir u optimizar el tráfico de rastreo de una web y no para controlar la indexación de las páginas.

Incluso indicando en el archivo robots.txt el bloqueo o no permiso de acceso a una URL concreta, no es garantía de que Google no la indexe, si realmente no se quiere indexar una URL hay que utilizar el recurso meta noindex

Para encontrar el archivo robots.txt de una web (si existe, claro está) utiliza esta ruta, sustituyendo tusitioweb.com por el dominio de la web:

https://tusitioweb.com/robots.txt

Qué sintaxis tienen los robots.txt

La sintaxis del archivo robots.txt contiene los siguientes campos o comandos:

User-agent: Indica a que rastreador se aplican las reglas o directivas de rastreo

Disallow: Este comando se utiliza para indicar que no se rastree determinados directorios o páginas del dominio raíz

Allow: Este comando se utiliza para indicar que directorios o páginas del dominio raíz deben rastrearse. Sirve para anular el comando Disallow

Sitemap: (opcional) Sirve para indicar la ubicación del sitemap del sitio web

Crawl-delay: (opcional) Sirve para determinar el número de segundos que debe esperar un bot antes de cargar y rastrear el contenido de cada página

Cómo crear un archivo robots.txt

Para poder crear este archivo, es necesario acceder a la raíz del dominio y subir el archivo al directorio raíz de primer nivel, en formato de texto con el nombre “robots.txt”

Tal como indica su extensión, el archivo robots.txt es un fichero de texto plano (sin formato) que se puede crear con cualquier editor de texto, por ejemplo: con el Bloc de notas, WordPad o con Notepad ++

En él incluiremos todos los comandos necesarios para informar a Google de que secciones de una web se deben o no rastrear.

Desde este enlace puedes acceder a Ayuda de Google sobre cómo escribir y enviar un archivo robots.txt

Entre la sintaxis de comandos más utilizados en robots.txt. podemos encontrar:

Damos indicaciones a todos los bots

User-agent: *

Damos indicaciones específicas al bot de Google

User-agent: googlebot

Estamos bloqueando un sitio web al completo

Disallow: /

Estamos bloqueando todas las URLs del panel de administración

Disallow: /wp-admin/

Dentro de la prohibición anterior, los buscadores sí deben rastrear admin-ajax-php

Allow: /wp-admin/admin-ajax.php/

Estamos bloqueando un directorio y todo su contenido

Disallow: /directorio/

Estamos bloqueando una URL concreta del sitio web

Disallow: /url-ejemplo/

Estamos bloqueando URLs que terminen de una forma concreta

Disallow: /*.pdf$

Estamos indicando la ruta o ubicación del Sitemap

Sitemap: https://tusitioweb.com/sitemap_index.xml

 

Es muy importante que una vez generado el archivo compruebes si tienes errores, para ello puedes hacerlo desde esta herramienta gratuita:

https://technicalseo.com/tools/robots-txt/

Cómo debemos usar el archivo robots.txt en una web

  • En una web solo debe haber un archivo robots.txt, en caso de tener subdominios, cada subdominio debe tener su propio robots.txt
  • No podemos cambiarle el nombre (robots.txt) ni la ubicación (raíz del sitio) porque entonces será como si no existiera
  • El archivo es sensible a las mayúsculas y minúsculas, por lo que hay que tener cuidado a la hora de incorporar las instrucciones
  • Se ignoran los espacios al comienzo y al final de la línea
  • Entre cada bloque de instrucciones debe existir una línea en blanco
  • Las reglas más específicas prevalecen sobre las genéricas, y en caso de haber conflicto, Google usa la directriz menos restrictiva
  • Especial atención en bloquear archivos necesarios para renderizar la página

 

Y hasta aquí llegamos con este artículo sobre el archivo robots.txt en el que espero haber podido explicarte de forma clara y entendible cada uno de los puntos tratados.

De todos modos, al igual que siempre… Si tienes alguna duda te leo en comentarios.

Por favor, no te vayas sin puntuar este artículo ¡Muchas gracias! 😊

(Votos: 3 Promedio: 5)

Consultor SEO Freelance. Ayudando a negocios a conseguir más clientes, a aumentar su visibilidad en Internet e incrementar sus ventas en el medio Online. Puedes conocerme mejor y descubrir mi lado más personal en la página "SOBRE MÍ"

Deja un comentario

Marca esta casilla sí has leído y aceptas la política de privacidad y protección de datos. *

Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible.

La información de las cookies se almacena en tu navegador, y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

No almacenamos información personal.

Tienes toda la información sobre privacidad, derechos legales y cookies en: