Robots.txt explicado: qué bloquea realmente (y qué no)

Prueba AuditMe en vivo — Escaneo instantáneo gratuito
Pega cualquier URL a continuación y obtén una puntuación SEO real en unos 60 segundos. Sin registro: es el mismo motor descrito en este artículo.
El archivo que confunde a más SEOs que cualquier otro
He perdido la cuenta de las auditorías donde la primera bandera roja era un archivo robots.txt que alguien escribió con buenas intenciones y que rompió el sitio. Uno de mis favoritos de todos los tiempos: un cliente cuyo sitemap completo estaba bloqueado, no porque lo quisiera, sino porque copió un robots.txt "de mejores prácticas" de un foro que deshabilitaba /sitemap/, mientras que su sitemap real vivía en /sitemap.xml.
Una barra diferente. Eso fue todo lo que hizo falta. Google rastreó su página de inicio, vio que la URL del sitemap estaba deshabilitada y, silenciosamente, dejó de descubrir la mitad de su contenido.
¿La parte frustrante? Nada parecía mal. El sitio seguía posicionando bien las páginas que Google ya conocía. ¿Pero páginas nuevas? Iban a parar a un vacío. Me llevó tres horas descubrir por qué el contenido nuevo de un cliente no se indexaba, y la respuesta era una línea en un archivo de texto que llevaba seis meses siendo incorrecta.
Qué hace realmente robots.txt
Robots.txt es un conjunto de reglas que indica a los rastreadores qué rutas pueden y qué rutas no pueden solicitar. Lo leen Googlebot, Bingbot y la mayoría de los demás rastreadores antes de empezar a obtener el sitio.
Lo fundamental que debes entender: robots.txt no es control de acceso. Es una petición. Un cartel amable en la puerta, no un candado. Y, crucialmente, bloquear una URL en robots.txt NO la elimina del índice. Si una página ya está indexada y la bloqueas, Google la sigue mostrando en los resultados — solo que ya no puede rastrearla, lo que significa que no puede ver el título, la descripción ni las actualizaciones de contenido. Obtienes un listado con el fragmento que Google guardó por última vez.
Robots.txt sirve para ahorrar presupuesto de rastreo y mantener a Googlebot fuera de la basura. Las páginas que de verdad no quieres en los resultados merecen una etiqueta noindex, no un disallow.
La estructura, desmitificada
Un archivo robots.txt es aburrido a propósito:
User-agent: *
Disallow: /private/
Allow: /private/public/
Sitemap: https://tusitio.com/sitemap.xml- User-agent indica a qué rastreador se aplican las reglas.
- Disallow lista las rutas que el rastreador no debe obtener.
- Allow crea excepciones dentro de un área deshabilitada.
- Sitemap apunta a los rastreadores hacia tu sitemap.
Googlebot admite comodines — $ para "termina en" y * para "cualquier carácter" — pero muchos SEOs los usan en exceso y terminan con reglas que bloquean más de lo previsto.
Los errores que te perjudican en silencio
1. Bloquear tu sitemap
Tu sitemap nunca debería estar deshabilitado. De verdad no sé por qué tantos archivos de ejemplo lo incluyen. Bloquear el sitemap es como decirle a Googlebot "no vengas a mirar mi lista de todo".
2. Disallow en páginas que quieres indexar
Todo lo que quieras en el índice de Google debe ser rastreable. Si lo deshabilitas, Google no podrá descubrirlo desde tu sitio. Suena obvio, pero he visto sitios bloquear todo su directorio de blog, sus categorías, sus productos. A veces por una regla vieja que nadie recuerda haber añadido.
3. Usar robots.txt en lugar de noindex
Como dije: disallow no es noindex. Si quieres una página fuera del índice, ponle una etiqueta noindex y déjala rastreable. Si la bloqueas en robots.txt, la etiqueta noindex se vuelve invisible para Google (no puede obtener la página para leer la etiqueta), y quedas en un estado peor que el inicial.
4. Bloquear a Googlebot en lugar de solo los recursos lentos
Bloquear un archivo JS o CSS completo para "ahorrar ancho de banda" es una jugada de 2013. El Googlebot moderno renderiza páginas, y si bloqueas los recursos que permiten renderizarla, acabas con una página que Google no puede entender. Bloquea los archivos de recursos que de verdad desperdician presupuesto de rastreo, no los que construyen tus páginas.
5. Sin línea de sitemap en absoluto
La directiva Sitemap no es obligatoria, pero si tu sitio es grande o complejo, es ayuda gratuita. Los rastreadores encontrarán tu sitemap desde tu robots.txt, desde tu envío en Search Console o desde los enlaces de tu página de inicio. No les hagas trabajar para encontrarlo.
Cómo revisar tu robots.txt correctamente
Esta es la pasada de validación que ejecuto:
- Obtén tu robots.txt y lee cada regla línea por línea.
- Confirma que la ruta del sitemap coincide exactamente con la ubicación real del sitemap.
- Comprueba que ninguna regla bloquee /, /sitemap.xml o tus directorios principales.
- Asegúrate de que cualquier Disallow que tengas sea para páginas que de verdad no quieres que se rastreen.
- Prueba algunas URLs reales contra tus reglas con un comprobador de robots.
- Verifica que aún puedes obtener tus páginas en un navegador de incógnito — robots.txt también bloquea tu propio navegador si estás en una ruta deshabilitada.
El comprobador de robots.txt de AuditMe hace los pasos del 1 al 5 por ti. Dale un dominio, obtiene el archivo, evalúa las reglas contra tus rutas clave y señala las minas — incluido el clásico del bloqueo del sitemap.
¿Deberías simplemente eliminar el archivo?
Si tu robots.txt es un desastre y no estás seguro de qué reglas conviene conservar, la respuesta honesta suele ser sí, elimínalo entero y empieza de cero. Un archivo vacío significa "rastrea todo lo que puedas encontrar", que es el valor por defecto correcto para el 95% de los sitios. Luego añade de vuelta solo las reglas que puedas explicar en voz alta en una frase.
Para sitios que necesitan estructura — un área de preparación, una ruta de administración privada, un agujero negro de paginación infinita — mantén el archivo mínimo y comenta tu razonamiento para que la siguiente persona no tenga que hacer ingeniería inversa.
FAQ
¿Bloquear una página en robots.txt la elimina de Google?
No. Solo evita que Google la rastree. La página puede permanecer en el índice con contenido desactualizado. Usa noindex si quieres que la página desaparezca.
¿Debe listarse mi sitemap en robots.txt?
Sí, y la ruta debe coincidir exactamente. Es una pequeña comodidad que evita que los rastreadores tengan que buscarlo.
¿Puede robots.txt evitar que Google renderice JavaScript?
Sí, indirectamente. Si deshabilitas los archivos JS o CSS, Googlebot no puede renderizar la página correctamente, lo que puede hacer invisible tu contenido aunque el HTML sea rastreable.
Valida antes de que te cueste
Los bugs más caros del SEO son los que parecen sanos. Un mal robots.txt es el ejemplo perfecto: el sitio "funciona", el tráfico está bien y nadie nota que el contenido nuevo no se está indexando silenciosamente. Ejecuta una comprobación de robots.txt en tu dominio hoy, lee cada regla y elimina cualquier cosa que no puedas explicar. Tu yo del futuro te lo agradecerá.

Eduard Tymchenko
SEO Expert & Founder of AuditMe
“I built AuditMe after 10+ years of manual SEO audits — every check in this report is one I used to run by hand.”
Specializes in technical SEO, Core Web Vitals, and WordPress optimization.
Ejecuta tu auditoría SEO gratuita
Obtén un análisis SEO completo de cualquier URL en 60 segundos. Sin registro.
O abre el analizador completo con más detalles
Analiza tu sitio gratisHerramientas SEO gratuitas
Artículos relacionados
Continúa aprendiendo con estas guías y tutoriales de SEO:
Your Website Was Seen 116,181 Times and Clicked 9 Times. Here's What Search Engines and AI Systems Are Actually Doing.
A first-party 2026 investigation from AuditMe into the Visibility Gap: how crawling, indexing, retrieval, ranking, AI citations, clicks, trust, and conversions form one measurable website intelligence system.
21 min read
How AI Systems Read the Web in 2026: Discovery, Retrieval, Citations and Agents
An evidence-first guide to AI search, GEO, retrieval, entity clarity, citations and agent-ready websites — with a practical framework, implementation patterns and a proposed open benchmark methodology.
45 min read
The New SEO: When Search Engines Stop Reading Websites and Start Using Them
Search is moving from ranking pages to running them as machine interfaces. This guide explains the six-dimension Website Intelligence framework — discoverability, understanding, verification, actionability, reliability, and observability — that makes your site machine-readable, verifiable, and actionable for AI search engines and agents.
23 min read
AI Readiness Guide: llms.txt, AI Bot Access & Semantic HTML for AI Search in 2026
Is your website ready for AI search? Complete guide to llms.txt, AI bot access, semantic HTML, and content architecture for ChatGPT, Claude, Perplexity, and Gemini in 2026.
24 min read
