Glossan

¿Qué es el robots.txt?

También llamado: archivo robots, robots exclusion protocol

Definición

El robots.txt es un archivo de texto en la raíz de una web que indica a los rastreadores de los buscadores qué partes del sitio pueden recorrer y cuáles no.

Antes de rastrear una web, los bots legítimos (Googlebot, Bingbot…) leen https://example.com/robots.txt. Es una petición de buena voluntad: los bots maliciosos lo ignoran, así que no sirve para ocultar ni proteger nada.

Ejemplo

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /buscar?

Sitemap: https://example.com/sitemap.xml

Bloquear el rastreo no es desindexar

Si bloqueas una URL en robots.txt, Google no la rastrea, pero puede seguir mostrándola en los resultados si otras webs la enlazan (sin descripción). Para que una página no aparezca, déjala rastrear y usa la etiqueta:

<meta name="robots" content="noindex">

Errores habituales

¿Tienes un producto o servicio relacionado con robots.txt? Anúnciate en este término.

Términos relacionados

Categorías: Web