¿Qué es el robots.txt?
También llamado: archivo robots, robots exclusion protocol
Definición
El robots.txt es un archivo de texto en la raíz de una web que indica a los rastreadores de los buscadores qué partes del sitio pueden recorrer y cuáles no.
Antes de rastrear una web, los bots legítimos (Googlebot, Bingbot…) leen https://example.com/robots.txt. Es una petición de buena voluntad: los bots maliciosos lo ignoran, así que no sirve para ocultar ni proteger nada.
Ejemplo
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /buscar?
Sitemap: https://example.com/sitemap.xml
User-agent— a qué bot se aplica el bloque (*es cualquiera).Disallow/Allow— rutas prohibidas o permitidas; gana la regla más específica.Sitemap— dónde está el mapa del sitio.
Bloquear el rastreo no es desindexar
Si bloqueas una URL en robots.txt, Google no la rastrea, pero puede seguir mostrándola en los resultados si otras webs la enlazan (sin descripción). Para que una página no aparezca, déjala rastrear y usa la etiqueta:
<meta name="robots" content="noindex">
Errores habituales
Disallow: /olvidado al publicar una web que venía de un entorno de staging. Toda la web desaparece poco a poco de Google.- Bloquear las carpetas de CSS y JavaScript: Google necesita verlas para entender cómo se muestra la página.
- Usar robots.txt para «esconder» una zona privada: el archivo es público y señala exactamente dónde está.
¿Tienes un producto o servicio relacionado con robots.txt? Anúnciate en este término.
Términos relacionados
- Sitemap XMLUn sitemap XML es un archivo que lista las URL de una web que...
- URL canónicaLa URL canónica es la versión principal de una página cuando el mismo contenido...
- Entorno de stagingUn entorno de staging es una copia de tu web o aplicación, lo más...
- Error 404El error 404 (Not Found) es la respuesta del servidor cuando la página o...
Categorías: Web