SEO

MARKDOWN VS. HTML PARA SEO Y LLMS: ¿DEBERÍA TU SITIO WEB PUBLICARSE EN MARKDOWN?

El equipo de Search Relations de Google es claro: Markdown es un formato para redactar contenido, no para publicar un sitio web. Explicamos por qué HTML sigue siendo la base para el rastreo, el SEO y el descubrimiento por agentes de IA.

Publicado el
MARKDOWN VS. HTML PARA SEO Y LLMS: ¿DEBERÍA TU SITIO WEB PUBLICARSE EN MARKDOWN?

Con el auge de los modelos de lenguaje (LLMs) y los agentes de IA que navegan la web, ha surgido una pregunta recurrente entre los equipos de desarrollo: ¿deberíamos publicar nuestro sitio directamente en Markdown, o incluso mantener una versión paralela en .md o llms.txt, para que la IA “entienda mejor” nuestro contenido? Es una discusión legítima, pero la evidencia y la postura del propio equipo de Search Relations de Google apuntan en una dirección distinta a la intuición inicial.

¿Qué es Markdown y de dónde viene?

Markdown fue creado en 2004 por John Gruber, con aportaciones de Aaron Swartz, como un formato de texto plano simple y legible que se puede convertir de forma programática a HTML. Nació para resolver un problema muy concreto: escribir HTML a mano, con todas sus etiquetas y corchetes angulares, es tedioso.

Sus características principales:

  • Semántico por defecto. Define encabezados, listas y enlaces separando la estructura del texto de su presentación visual.
  • Rol de intermediario. Se usa constantemente en generadores de sitios estáticos como capa de autoría, no como formato final de entrega.
  • Minimalismo. Elimina estilos y maquetación para enfocarse solo en el texto y su jerarquía.

Markdown vs. HTML: la comparación real

CaracterísticaMarkdownHTML
Propósito principalRedacción y legibilidad del contenidoEstructura, layout e interactividad del sitio
Metadatos y contextoLimitado al propio documentoIncluye navegación, encabezados y pie de página de todo el sitio
PresentaciónSepara estilo de contenido; sin layoutIntegra layout, colores y estilos complejos
Descubrimiento / SEODébil para arquitectura de sitio y descubrimientoBase de la web; ideal para el rastreo
InteractividadNinguna; requiere inyectar HTML o JSSoporta widgets, aplicaciones y lógica compleja

El espejismo de la optimización para LLMs

Existe la percepción de que convertir un sitio a Markdown, o publicar una versión en llms.txt, facilita que los sistemas de IA “ingieran” el contenido. Es cierto que Markdown reduce el número de tokens que una máquina debe procesar al eliminar etiquetas HTML. Pero esa ventaja de tokens no compensa lo que se pierde: contexto de sitio, jerarquía de navegación y señales de confianza.

El problema de mantener versiones paralelas

Mantener dos versiones del mismo contenido —una para personas, otra para máquinas— es, en palabras del propio equipo de Google, “terrible para la web”. Las razones son concretas:

  • Deuda técnica. Este enfoque recuerda a los fallidos experimentos de “renderizado dinámico” del pasado, difíciles de depurar y de mantener sincronizados.
  • Problemas de integridad. Si la versión para máquinas se rompe, es probable que nadie lo note, porque ningún usuario humano reportará el error.
  • Confianza. Un buscador o un LLM no puede confiar de forma inherente en un archivo “solo para IA”, ya que podría manipularse para mostrar información distinta a la que ve el usuario real.

El obstáculo del descubrimiento para los rastreadores

Los rastreadores usan la estructura que rodea al contenido —menús de navegación, barras laterales, pies de página— para entender cómo se conecta una página con el resto del sitio y de la web. Como Markdown se enfoca únicamente en el cuerpo del texto, un sitio publicado solo en Markdown perdería gran parte de su capacidad de ser descubierto. El HTML con todos sus enlaces y navegación es crítico para entender la arquitectura de un sitio y cómo se conecta con el resto de internet.

Casos de uso reales y estándares emergentes

Markdown no se recomienda como estrategia general de optimización web (por ejemplo, para un catálogo de productos o un sitio de retail), pero sí tiene aplicaciones específicas:

  • Documentación técnica y APIs. Para desarrolladores, publicar documentación en Markdown puede ser útil: agentes de IA o programadores la usan para entender rápido ejemplos de código y pasos de implementación. Aquí el flujo recomendado es tener una única fuente de verdad: redactar en Markdown y generar el HTML de forma programática, evitando así que ambas versiones se desincronicen (“content drift”).
  • Estándares en discusión. La industria explora propuestas para mejorar la interacción entre sitios y agentes de IA, aunque ninguna se ha consolidado todavía como estándar universal: llms.txt (un archivo que ayuda a un LLM que ya está en el sitio a descubrir más contenido), Web MCP (una interfaz programática para que agentes interactúen con una URL específica) y distintas variantes de JSON como formatos de datos legibles por agentes.

Nuestra conclusión en Bvgaboo

Para la gran mayoría de sitios web comerciales, la estrategia más efectiva para ser descubierto tanto por buscadores como por sistemas de IA sigue siendo el HTML estándar y bien estructurado:

  • HTML es la base. Es el fundamento de la web y el formato que los rastreadores están mejor equipados para procesar.
  • Markdown es una herramienta de creación. Úsalo en el proceso de redacción, pero publica en HTML para la entrega final.
  • Evita duplicados exclusivos para IA. No crees archivos de texto o Markdown separados para LLMs, salvo en documentación técnica especializada, porque el riesgo de mantenimiento supera el beneficio percibido.

Es exactamente el principio detrás de nuestro stack: construimos con Astro, generando HTML completo desde el primer request, sin depender de archivos paralelos que nadie audita. Si te preocupa cómo tu sitio actual es visto por rastreadores y agentes de IA, podemos hacer una auditoría técnica.

Cotiza tu proyecto ¿Necesitas asistencia?