Guía Técnica: Protocolo de Exclusión Robots.txt (RFC 9309)
1. ¿Qué es robots.txt y cómo funciona el RFC 9309?
Robots.txt es un archivo de texto plano ubicado en la raíz del servidor web (`https://dominio.com/robots.txt`). Indica a los bots y arañas de búsqueda qué secciones del sitio web pueden o no pueden rastrear mediante directivas `User-agent`, `Allow` y `Disallow`.
2. Disallow vs Meta Tag noindex: El Gran Error Común
Un error frecuente es asumir que bloquear una URL en `robots.txt` evita que aparezca en Google. Si otros sitios enlazan a esa URL, Google puede indexarla mostrando la URL sin contenido. Para evitar totalmente la indexación, se debe permitir el rastreo y colocar `<meta name="robots" content="noindex">` en la página HTML.