Volver al blog

Cómo usar llms.txt en AEO sin confundirlo con SEO técnico

Guía práctica para crear un llms.txt útil, coordinarlo con robots.txt, sitemaps y contenido citable, y evitar expectativas falsas sobre motores de respuesta.

  • AEO
  • llms.txt
  • SEO técnico
  • IA generativa
Ilustración editorial de documentos canónicos, rastreadores de IA y paneles de respuesta conectados para explicar llms.txt en AEO

llms.txt no es una etiqueta mágica para aparecer en ChatGPT, Gemini, Perplexity, Copilot o Google AI Overviews. Es mejor entenderlo como un mapa editorial para sistemas de IA: una forma sencilla de señalar qué páginas, definiciones, guías y fuentes representan mejor una entidad, una marca o un tema.

Esa distinción importa. En AEO, el problema no suele ser solo que un motor de respuesta pueda rastrear una URL. El problema es que pueda identificar qué contenido es canónico, qué página resuelve una intención concreta, qué definiciones son citables y qué señales de confianza reducen la ambigüedad. Un buen llms.txt ayuda en esa capa de contexto. Un mal llms.txt solo añade otro archivo desactualizado.

llms.txt es un índice editorial legible por humanos y modelos que prioriza el contenido que una IA debería usar para entender un sitio, pero no sustituye a robots.txt, sitemap, enlazado interno, datos estructurados ni contenido útil.

Qué es llms.txt y qué no es

La propuesta original de llms.txt plantea un archivo Markdown en la raíz del dominio que resume el sitio y enlaza recursos clave. Su valor está en la selección. En lugar de obligar a un sistema a inferir qué URLs importan entre cientos de páginas, el editor ofrece una lista curada de páginas canónicas, documentación, definiciones, políticas, casos de uso y archivos fáciles de ingerir.

No conviene venderlo como un factor de ranking. Google indica en su documentación sobre funciones de IA en Search que no hace falta crear archivos especiales de texto para IA ni un schema específico para aparecer en AI Overviews o AI Mode. Para Google, siguen contando fundamentos clásicos: rastreo permitido, indexación, contenido textual accesible, enlazado interno, datos estructurados coherentes con el contenido visible y elegibilidad de snippet.

Por eso el uso sensato de llms.txt en AEO no consiste en reemplazar el SEO técnico, sino en añadir una capa de contexto encima de una base que ya funciona.

Dónde encaja dentro de una estrategia AEO

Los motores de respuesta trabajan con recuperación, síntesis y citación. Para una marca, eso crea tres necesidades: que las páginas sean accesibles, que el contenido sea fácil de interpretar y que la fuente resulte lo bastante fiable como para ser usada en una respuesta. llms.txt se sitúa sobre todo en la segunda necesidad: ayuda a organizar el corpus y a decir qué piezas tienen prioridad.

El archivo es especialmente útil en sitios con documentación, glosarios, recursos técnicos, comparativas, páginas metodológicas o contenido evergreen. En esos casos, un modelo o agente puede beneficiarse de una entrada compacta que responda: qué es este sitio, qué cubre con autoridad, qué páginas son pilares y dónde está el contenido completo en formato más limpio.

La pila correcta: robots.txt, sitemap y llms.txt

Uno de los errores más frecuentes es mezclar funciones. Cada archivo resuelve una pregunta distinta.

  • robots.txt expresa preferencias de acceso para rastreadores. Puede permitir o bloquear user agents concretos, aunque su cumplimiento depende del rastreador salvo que se combine con controles técnicos.
  • El sitemap ayuda a descubrir URLs indexables y a entender la arquitectura de publicación del sitio.
  • llms.txt prioriza recursos útiles para modelos y agentes, con una estructura de lectura más cercana a un índice editorial que a un listado exhaustivo de URLs.
  • Los datos estructurados explican entidades, relaciones y atributos, siempre que coincidan con el contenido visible de la página.
  • El enlazado interno transmite jerarquía, contexto semántico y caminos de descubrimiento para buscadores, usuarios y sistemas de recuperación.

En AEO, la mejor práctica es que estos elementos se refuercen entre sí. Si una página aparece como recurso principal en llms.txt, debería estar indexable, enlazada internamente, incluida en el sitemap cuando proceda y respaldada por señales claras de autoría, entidad, fecha de actualización cuando sea relevante y evidencia.

Qué dicen las plataformas sobre acceso y contexto

Las plataformas no tratan todos los rastreadores igual. OpenAI separa OAI-SearchBot, orientado a búsqueda y aparición en ChatGPT Search, de GPTBot, asociado al rastreo que puede usarse para entrenamiento. Perplexity documenta PerplexityBot como un crawler orientado a mostrar y enlazar sitios en sus resultados, no como crawler de entrenamiento de modelos fundacionales. Google, por su parte, insiste en que la inclusión en sus experiencias de IA parte de los requisitos habituales de Search.

Microsoft ha ido en otra dirección complementaria: ofrecer informes de rendimiento de IA en Bing Webmaster Tools con métricas como citaciones, páginas citadas y grounding queries, y ampliar esa visibilidad con señales de intención, temas y citation share. Esa evolución confirma una idea importante: la AEO operativa se mide en capas, no solo en rankings ni en sesiones.

Cloudflare añade otra pieza al debate al recordar que robots.txt expresa preferencias, pero no impide técnicamente el acceso por sí solo. Sus Content Signals buscan separar usos como búsqueda, grounding de respuestas y entrenamiento. Para una estrategia AEO, la conclusión práctica es clara: decide qué quieres permitir, documenta esa decisión y comprueba que tus archivos públicos no se contradicen.

Cómo crear un llms.txt útil para AEO

1. Empieza por una definición canónica del sitio

El primer bloque debe explicar en pocas líneas qué es el sitio, a quién ayuda, qué temas cubre y cuál es su posicionamiento. Evita claims vagos como “líder global” si no están demostrados. Los motores de respuesta necesitan desambiguación, no marketing inflado.

2. Prioriza páginas pilar, no todo el sitio

Un llms.txt que enlaza cada URL acaba pareciéndose a un sitemap peor. Selecciona páginas que resuelvan intenciones importantes: definiciones, metodología, guías, estudios, páginas de producto o servicio, documentación, políticas y recursos que puedan sostener una respuesta citada.

3. Incluye contenido citable y fácil de resumir

Los motores de respuesta prefieren fragmentos claros. Conviene enlazar piezas que incluyan definiciones breves, listas verificables, comparativas, criterios, ejemplos, preguntas frecuentes y fuentes. Si una página solo contiene texto comercial genérico, probablemente no merece estar entre los recursos principales.

4. Separa acceso, entrenamiento y respuesta

No confundas permitir una aparición en búsqueda con permitir entrenamiento. Revisa user agents como OAI-SearchBot, GPTBot, ChatGPT-User, PerplexityBot, Googlebot, Bingbot y otros rastreadores relevantes para tu mercado. La política debe ser deliberada: puedes querer máxima visibilidad en respuestas y, al mismo tiempo, limitar ciertos usos de entrenamiento.

5. Mantén paridad entre idiomas

En un sitio bilingüe, llms.txt debería ayudar a descubrir los recursos equivalentes en cada idioma. Si el sitio tiene una guía canónica en español y otra en inglés, ambas deben aparecer con URLs correctas, hreflang coherente y contenido equivalente. La IA no debería tener que adivinar qué versión corresponde a cada mercado.

6. Añade una versión completa en texto si el proyecto lo permite

Para portales con mucho contenido evergreen, una exportación tipo llms-full.txt puede facilitar que un agente lea definiciones, páginas pilar, glosario y posts sin depender de navegación visual. No sustituye al HTML público, pero reduce fricción cuando el objetivo es responder con contexto fiable.

Una estructura práctica de llms.txt

  • Título del sitio y resumen breve de la propuesta de valor.
  • Páginas canónicas para preguntas principales del mercado.
  • Glosario o definiciones estables de conceptos importantes.
  • Metodología, criterios editoriales o fuentes de autoridad.
  • Recursos por idioma, si el sitio es multilingüe.
  • Posts evergreen que refuercen clusters temáticos.
  • Enlace a una exportación de texto completo, si existe y está mantenida.
  • Contacto, entidad legal o información corporativa cuando ayude a desambiguar la fuente.
Un llms.txt útil no dice “cítame”; demuestra qué contenido merece ser entendido primero.

Errores que reducen su valor

  • Copiar el sitemap completo sin curación editorial.
  • Enlazar páginas bloqueadas por robots.txt o marcadas como noindex.
  • Prometer autoridad que el contenido visible no demuestra.
  • Olvidar versiones equivalentes en otros idiomas.
  • No actualizar el archivo cuando cambian páginas pilar, slugs, servicios o definiciones.
  • Usar llms.txt como excusa para no mejorar títulos, encabezados, enlazado interno, schema y legibilidad.
  • Permitir rastreadores de búsqueda de IA por visibilidad y bloquearlos después por una regla global mal configurada.

Checklist AEO antes de publicarlo

  • Comprueba que las URLs enlazadas devuelven 200 y son canónicas.
  • Confirma que cada recurso importante está enlazado internamente desde páginas relacionadas.
  • Revisa robots.txt para no bloquear por accidente los bots que necesitas para visibilidad.
  • Asegura que los recursos seleccionados incluyen respuestas claras, definiciones citables y evidencia.
  • Verifica hreflang en sitios multilingües.
  • Mantén el archivo corto, escaneable y orientado a decisiones de contexto.
  • Programa una revisión cuando se publiquen nuevas páginas pilar o cambie la política de rastreo.

Recursos internos relacionados

Preguntas frecuentes

¿llms.txt mejora rankings en Google?

No hay una base sólida para tratarlo como factor de ranking. Google indica que no hacen falta archivos especiales para IA en sus funciones de Search. Su valor está en organizar contexto para modelos, agentes y flujos de recuperación que sí puedan usar ese archivo.

¿Puede sustituir al sitemap?

No. El sitemap ayuda al descubrimiento de URLs indexables. llms.txt selecciona recursos prioritarios para interpretación y contexto. Un sitio AEO sólido suele necesitar ambos, además de buen enlazado interno.

¿Qué páginas debería incluir primero?

Incluye páginas que una IA debería leer para explicar quién eres, qué haces, qué conceptos dominas y qué recursos son canónicos: página principal, metodología, glosario, guías pilar, recursos técnicos y contenido evergreen con evidencia.

¿Debo permitir todos los crawlers de IA?

Depende de tu política. La decisión debería separar búsqueda, agentes de usuario, grounding de respuestas y entrenamiento. Para ganar visibilidad en motores de respuesta, evita bloquear por accidente los bots que esas plataformas usan para descubrir y citar páginas.

Fuentes y lecturas recomendadas