¿Prefieres una llamada?
SEO

Lo aburrido que sí funciona (y que probablemente tienes roto)

Fer Balcázar18 de septiembre de 20269 min de lectura

La semana pasada te hablé de llms.txt: nadie confirma que sirva, no te cuesta nada tenerlo, y quien te diga que es indispensable probablemente te está vendiendo algo. Hoy es al revés. Hoy te voy a hablar de algo que sí funciona, que lleva más de 20 años funcionando, y que la mayoría de los sitios tiene roto sin saberlo. Es el sitemap. Y sí, ya sé que suena al tema más aburrido del mundo.

Qué es un sitemap (sin hacerlo complicado)

Un sitemap es, literalmente, un mapa de tu sitio. Un archivo XML que lista todas las páginas importantes para que quien lo lea no tenga que ir descubriendo una por una siguiendo links. Es como el índice de un libro: no lees el índice para entender el libro, pero sin él tendrías que revisar página por página hasta encontrar lo que buscas.

Google lleva usando sitemaps desde 2005. Le ayuda a encontrar tus páginas nuevas más rápido, sobre todo si tu sitio es grande o si tu contenido no está bien enlazado entre sí. Imagina que publicas un artículo nuevo en tu blog pero no hay ningún link que apunte a él desde el resto del sitio. Sin sitemap, Google podría tardar semanas en descubrirlo. Con sitemap, lo ve en días.

Esa es la versión que todo mundo conoce. La versión de 2026 es diferente, y es la razón por la que estoy escribiendo esto hoy.

Lo que cambió: los crawlers de IA también lo están leyendo

[Un análisis de 48 días de logs de servidor](https://www.wislr.com/articles/ai-bot-behavior-log-analysis/) encontró algo llamativo: ClaudeBot — el crawler de Anthropic — y GPTBot — el de OpenAI — empezaron a solicitar el sitemap por primera vez el mismo día. Es un solo sitio, así que no prueba una regla. Pero sí es una pista bastante clara de hacia dónde va la forma en que esas plataformas descubren contenido.

Dicho de otra forma: el sitemap dejó de ser exclusividad de Google. Ahora es una de las primeras cosas que revisa cualquier sistema que quiera entender la estructura de tu sitio, ya sea un motor de búsqueda tradicional, un crawler de IA generativa o un auditor automatizado.

Esto importa porque ChatGPT, Claude y Perplexity no funcionan como Google. No tienen un índice dinámico que se actualiza cada hora. Cuando un modelo de lenguaje decide qué fuentes conoce y a cuáles recurre, parte de ese proceso viene de lo que sus crawlers pudieron descubrir y procesar. Si tu sitemap los lleva a páginas rotas, a contenido que ya no existe o a una estructura que nunca se actualizó desde que se lanzó el sitio, esa es la primera impresión que tienen de ti. Y es una mala impresión.

El arma de dos filos que nadie quiere ver

Aquí viene la parte que a nadie le gusta escuchar: el sitemap puede trabajar en tu contra.

Si tu sitio tiene páginas mal hechas, contenido duplicado, landing pages de campañas viejas que ya no corres, versiones anteriores de páginas que nunca se eliminaron correctamente, o URLs que simplemente ya no existen — todo eso puede estar en tu sitemap. Y si está en tu sitemap, cualquier crawler que lo lea va a intentar visitarlas.

Conozco empresas que llevan años sin revisar su sitemap. El sitio fue rediseñado dos veces, el equipo cambió, la agencia que lo hizo ya no existe, y el sitemap sigue apuntando a URLs de 2019 que regresan un error 404. Nadie lo sabe porque nadie lo revisa. Nadie lo revisa porque nadie lo ve. Y nadie lo ve porque está escondido en una URL que termina en «/sitemap.xml» y que el 95% de los dueños de sitio nunca han visitado en su vida.

Mi opinión, no necesariamente amable:

El sitemap es exactamente el tipo de cosa técnica que la industria del marketing digital ignora porque no es glamorosa. No tiene un dashboard bonito. No genera un reporte colorido. No es noticia en ningún blog de tendencias. Pero es una de las piezas más fundamentales de cómo los motores — de búsqueda y de IA — entienden la arquitectura de tu sitio.

Yo veo constantemente situaciones donde se invierten recursos serios en producir contenido, en campañas, en rediseños, y el sitemap sigue apuntando a páginas que ya no existen. Es como renovar toda la fachada de tu negocio y no limpiar el letrero roto de la entrada.

Lo que me parece especialmente llamativo es que en 2025 y 2026, con todo el ruido alrededor de GEO — Generative Engine Optimization — y de cómo aparecer en las respuestas de los modelos de IA, mucha gente está invirtiendo en estrategias sofisticadas mientras ignora que sus crawlers llegan a su sitio, piden el sitemap, y reciben una lista de URLs rotas como bienvenida. Si quieres profundizar en qué es GEO y cómo se diferencia del SEO tradicional, en el glosario SEO/GEO lo tenemos explicado sin jerga.

El sitemap ya no es solo para Google

ClaudeBot y GPTBot lo están solicitando activamente para descubrir la estructura de tu sitio. Si el tuyo tiene URLs rotas o páginas que ya no existen, esa es la primera impresión que tienen de ti. Y no tienen segunda visita programada.

Qué puede estar mal en tu sitemap ahora mismo

No tienes que ser técnico para entender los problemas más comunes. Los que aparecen con más frecuencia son:

  • URLs que regresan 404: páginas que ya no existen pero siguen listadas en el sitemap.
  • URLs redirigidas: el sitemap debería apuntar a la URL final, no a una que redirecciona a otra.
  • Páginas noindex incluidas: si una página tiene la instrucción «no indexar», no debería estar en el sitemap — es una contradicción que confunde a los crawlers.
  • URLs de versiones anteriores del sitio: de rediseños pasados que nadie limpió.
  • Sitemaps que nunca se actualizaron: se generaron automáticamente al lanzar el sitio y nunca más se tocaron, aunque el sitio haya cambiado varias veces.

Lo frustrante es que muchos CMS generan el sitemap de forma automática, lo cual da una falsa sensación de seguridad. Que exista no significa que esté bien. WordPress, por ejemplo, genera un sitemap por defecto desde la versión 5.5, pero incluye todo: páginas de autor, archivos de categorías, etiquetas, páginas de resultados internos. Cosas que probablemente no quieres que Google ni los crawlers de IA visiten.

Cómo saber si el tuyo está bien (o mal)

La forma más rápida es buscarlo. En la mayoría de los sitios está en «/sitemap.xml» o en «/sitemap_index.xml». Si no lo encuentras ahí, revisa el archivo «robots.txt» de tu dominio — normalmente el sitemap está referenciado ahí.

Una vez que lo tienes, el siguiente paso es validarlo. Y aquí es donde la mayoría de la gente se detiene porque implica revisar cientos o miles de URLs manualmente. Para eso construí un validador de sitemap en AEON42: encuentra tu sitemap, revisa cada URL que lista, y te dice cuáles apuntan a páginas que ya no existen o que tienen problemas. Sin registro, sin cuenta, en menos de un minuto.

No es magia. Es simplemente automatizar algo que a mano tomaría horas. Y el resultado es una lista concreta de qué está roto y qué hay que arreglar.

Qué hacer cuando encuentras los problemas

1

Identifica las URLs rotas

Cualquier URL que regrese 404 en tu sitemap es un problema inmediato. Los crawlers la intentan visitar, fallan, y eso puede afectar cómo evalúan la calidad general de tu sitio. Estas hay que eliminarlas del sitemap o corregir a dónde apuntan.

2

Revisa las redirecciones

Si una URL en tu sitemap termina redireccionando a otra URL, actualiza el sitemap para apuntar directamente al destino final. Una redirección no es un error crítico, pero es señal de que el sitemap no está limpio.

3

Elimina las páginas que no quieres indexar

Páginas con etiqueta noindex, páginas de resultados de búsqueda interna, páginas de administración o páginas de archivo que no aportan contenido — fuera del sitemap. El sitemap debe ser una lista curada de lo mejor de tu sitio, no un inventario de todo.

4

Configura la regeneración automática correctamente

Si usas un CMS, revisa cuándo y cómo se actualiza el sitemap. Ideally, debería regenerarse cuando publicas contenido nuevo o cuando haces cambios a la estructura del sitio. Un sitemap estático que nunca cambia no sirve de mucho en un sitio que sí cambia.

5

Envíalo a Google Search Console

Una vez que el sitemap está limpio, envíalo manualmente desde Google Search Console. Esto le avisa a Google que hay un sitemap actualizado y acelera el proceso de re-crawl. Para los crawlers de IA no hay un panel equivalente hoy, pero un sitemap bien formado en la URL estándar es suficiente para que lo encuentren.

La pregunta que nadie hace: ¿vale la pena el tiempo?

Siempre. Y no porque sea urgente en el sentido de que tu sitio va a colapsar si no lo haces hoy. Sino porque es una de las pocas cosas técnicas que tiene un costo de implementación bajo y un impacto potencial real.

Piénsalo así: si un crawler de IA visita tu sitio hoy para decidir si eres una fuente que vale la pena citar, y lo primero que hace es leer tu sitemap y encontrar 40 URLs que regresan 404, ese crawler ya tiene una señal negativa sobre la calidad de tu sitio. Puede que no sea determinante. Puede que haya otros factores que lo compensen. Pero es una señal que no necesitas regalar.

Si ya tienes una estrategia de contenido seria, si ya estás trabajando SEO técnico y posicionamiento en buscadores, si ya piensas en cómo aparecer en las respuestas de los modelos de IA — entonces el sitemap es el tipo de cosa que no puedes tener descuidada. Es la base, no el techo.

Y si no estás haciendo nada de eso todavía, el sitemap es un buen lugar por donde empezar porque te da un diagnóstico honesto del estado actual de tu sitio. Lo que encuentres ahí te va a decir mucho sobre qué tan bien o qué tan mal está mantenido el resto.

Si prefieres que alguien revise esto contigo y proponga qué arreglar primero, el equipo de Play.Interactive puede ayudarte — con o sin sitemap roto.

Preguntas frecuentes

No necesariamente, pero la mayoría de los sitios construidos en los últimos 10 años sí lo tienen, aunque el dueño nunca lo haya visto. Los CMS como WordPress, Shopify, Wix o Squarespace lo generan automáticamente. Que exista no significa que esté bien configurado o actualizado.

Sí. Hay evidencia documentada en logs de servidor de que tanto GPTBot como ClaudeBot solicitan el sitemap para descubrir las URLs de un sitio, en lugar de seguir únicamente links internos. Es el mismo comportamiento que tiene Googlebot desde hace décadas, y ahora los crawlers de IA lo están adoptando también.

Encontrar los problemas puede tomar menos de un minuto con un validador automatizado. Arreglarlos depende de cuántas URLs rotas tengas y de qué tan fácil sea modificar el sitemap en tu CMS. Para un sitio de 50-100 páginas bien mantenido, una tarde es suficiente. Para sitios grandes con años de acumulación, puede ser un proyecto de varios días.

No. Eliminar una URL del sitemap no hace que desaparezca de Google ni que pierda su posicionamiento actual. El sitemap le dice a Google dónde buscar, no determina qué páginas indexa. Puedes limpiar tu sitemap con confianza sin afectar las páginas que ya están bien posicionadas.

El archivo es el mismo. No existe un formato diferente para crawlers de IA versus Googlebot. La diferencia está en qué tan limpio y preciso está ese archivo: un sitemap con URLs rotas afecta a todos los crawlers por igual, y uno bien mantenido beneficia a todos por igual. No hay configuración especial que hacer para cada uno.

¿Listo para implementarlo?

Diagnóstico gratuito de presencia en buscadores e IA

Analizamos tu sitio, tu visibilidad en ChatGPT y Perplexity, y te entregamos una hoja de ruta priorizada. Sin compromiso.