UN MAPA BREVE PARA AGENTES DE IA

llms.txt: qué es, qué no hace y cómo crear el tuyo (con ejemplo)

llms.txt es una propuesta informal de archivo Markdown que señala a los agentes de IA las páginas más útiles de un sitio. No controla el rastreo ni la indexación, la Búsqueda de Google lo ignora y, en octubre de 2026, ni OpenAI ni Anthropic ni Perplexity documentan que lo lean para clasificar o citar sitios. Para sitios con mucha documentación sigue siendo un índice útil y barato.

Ilustración conceptual de una esfera de vidrio luminosa que lee una placa guía de color marfil, en blanco, a la entrada de una biblioteca de vidrio, con hilos verde menta que llevan a libros seleccionados.
Ilustración conceptual

llms.txt es un archivo Markdown, que normalmente se sirve en /llms.txt, con una lista breve y comentada de las páginas más útiles de un sitio para los agentes de IA. Se recomienda a menudo como forma de aparecer en las respuestas de la IA y se menciona mucho al hablar de posicionamiento en IA o de SEO para IA, pero lo que consta públicamente es más modesto: el formato es una propuesta informal, la Búsqueda de Google dice que ignora el archivo y la documentación de los rastreadores de OpenAI, Anthropic y Perplexity habla de robots.txt, no de llms.txt.

Eso no lo convierte en algo inútil. Para sitios de documentación y API es un índice barato que los agentes y las herramientas para desarrolladores pueden leer cuando lo necesitan. Esta guía explica el formato, en qué se diferencia de robots.txt y de sitemap.xml, cuándo merece la pena añadirlo, un ejemplo mínimo y qué importa más para las respuestas de IA. Lo que se cita de cada proveedor refleja sus páginas públicas consultadas el 1 de octubre de 2026.

Alcance de esta guía

Lo que dice cada proveedor refleja su documentación pública consultada el 1 de octubre de 2026. La comprobación de llms.txt de Sitelemetry solo confirma que el archivo está accesible y parece una lista de enlaces; no valida el formato, no prueba los enlaces ni muestra si algún sistema de IA lo lee.

Qué especifica la propuesta llms.txt

Jeremy Howard publicó la propuesta el 3 de septiembre de 2024. El texto actual en llmstxt.org es la versión 2, modificada el 10 de agosto de 2026. Es una descripción informal que se mantiene en un repositorio público de GitHub, abierta a aportaciones de la comunidad, no un estándar del IETF ni del W3C. Ningún buscador ni proveedor de IA está obligado a leerla.

El archivo está en Markdown, con sus partes en un orden fijo:

  1. Un H1 con el nombre del sitio o del proyecto. Es la única parte obligatoria.
  2. Un bloque de cita (blockquote) con un resumen breve de los datos clave.
  3. Párrafos o listas opcionales con más contexto, sin encabezados.
  4. Cero o más secciones H2 con listas de archivos: elementos de lista que contienen un enlace, seguido opcionalmente de dos puntos y una nota, como - [Precios](https://example.com/precios): planes y límites.

Una sección llamada Optional, con ese nombre en inglés, reúne enlaces secundarios que un agente puede omitir cuando necesita un contexto más corto.

El archivo puede estar en la raíz o bajo una ruta como /docs/llms.txt. Cubre las URL que hay bajo su ruta y, cuando se aplican varios archivos, los agentes deberían usar el más específico. La propuesta no usa /.well-known/, porque esas ubicaciones solo existen en la raíz del origen y muchos autores solo controlan una ruta dentro de un alojamiento compartido.

La propuesta sugiere también copias limpias en Markdown de las páginas, en la misma URL con .md añadido (page.html.md) o, desde la versión 2, sustituyendo la extensión (page.md). La versión 2 añade dos relaciones de enlace, enviadas como elementos <link> de HTML o en una cabecera HTTP Link: rel="alternate" type="text/markdown" para la copia y rel="describedby" para el llms.txt que cubre la página. El texto actual no define un archivo complementario como llms-full.txt; cuando una herramienta o una plataforma de documentación genera uno, es una convención propia.

En qué se diferencia llms.txt de robots.txt y de sitemap.xml

Los tres archivos hacen trabajos distintos para lectores distintos.

ArchivoQué haceQué no hace
robots.txtIndica a los rastreadores que cooperan qué URL pueden solicitar (protocolo de exclusión de robots, RFC 9309).No es un control de acceso. El RFC dice que sus reglas no son una forma de autorización de acceso.
sitemap.xmlLista las URL que consideras importantes para que los buscadores las descubran.Que una URL esté en la lista no significa que se vaya a rastrear o indexar.
llms.txtUna lista breve y comentada de páginas clave que un agente lee cuando necesita información.No permite ni bloquea el rastreo, no afecta a la indexación y nadie está obligado a leerlo.

La propuesta traza la misma línea: robots.txt dice qué acceso automatizado es aceptable, mientras que llms.txt se usa bajo demanda. Añade que un sitemap no lo sustituye, porque a menudo no incluye versiones en Markdown de las páginas, no contiene URL de otros sitios y suele abarcar más contenido del que cabe en la ventana de contexto de un modelo.

Así que, si quieres permitir o bloquear un rastreador de IA, edita robots.txt. Dejar una página fuera de llms.txt no la oculta, y listarla ahí no anula una regla de robots.txt que bloquea a un rastreador. La guía de robots.txt explica cómo se aplican las reglas.

Qué han dicho Google y los proveedores de IA sobre llms.txt

Esto es lo que dicen las fuentes primarias:

  • Búsqueda de Google. Su guía sobre las funciones de IA generativa (actualizada el 10 de julio de 2026) dice que no necesitas archivos legibles por máquina, archivos de texto para IA ni Markdown para aparecer en la Búsqueda de Google, incluidas sus funciones de IA, porque la Búsqueda no los usa. Menciona llms.txt de forma expresa: mantener uno para otros servicios que usan esos archivos no es un problema, pero no ayuda ni perjudica la visibilidad ni la clasificación en la Búsqueda de Google.
  • Chrome Lighthouse. La categoría experimental Agentic Browsing (Chrome 150 o posterior, sin puntuación de 0 a 100) tiene una auditoría de llms.txt que busca el archivo en la raíz del dominio. Un error del servidor se marca; un 404 se considera no aplicable, porque ofrecer el archivo es opcional. Es una comprobación de presencia en una herramienta para desarrolladores, no una declaración de que algún buscador o producto de IA use el archivo.
  • OpenAI. Su página sobre rastreadores explica los controles de robots.txt para OAI-SearchBot (resultados de búsqueda en ChatGPT) y GPTBot (entrenamiento), y señala que las visitas de ChatGPT-User, iniciadas por los usuarios, pueden no seguir robots.txt. No dice que OpenAI lea el llms.txt de un sitio.
  • Anthropic. Su artículo de ayuda enumera ClaudeBot, Claude-User y Claude-SearchBot y dice que respetan robots.txt. No menciona llms.txt.
  • Perplexity. Su documentación cubre PerplexityBot, para los resultados de búsqueda, y Perplexity-User, que se activa a petición del usuario y en general ignora robots.txt. No dice que Perplexity lea el llms.txt de un sitio.
  • Microsoft Bing. No se encontró ninguna indicación de Microsoft o de Bing sobre llms.txt. El anuncio de febrero de 2026 de AI Performance en Bing Webmaster Tools no menciona el archivo.

Hasta el 1 de octubre de 2026, ninguno de estos proveedores ha documentado que use el llms.txt de un sitio para clasificar, citar o responder. Varios publican uno para su propia documentación para desarrolladores (OpenAI, Anthropic, Perplexity y la documentación de la API de Gemini de Google), igual que Cloudflare. Publicar un archivo para tu propia documentación no es lo mismo que leer los archivos de otros sitios.

Cuándo merece la pena añadir llms.txt y cuándo puede esperar

El archivo es barato de escribir y, según Google, inofensivo en la Búsqueda. El coste real es mantenerlo correcto.

Tipo de sitioPrioridadPor qué
Documentación para desarrolladores, referencias de API, SDKMerece la penaLos desarrolladores dirigen a sus agentes de programación hacia la documentación. Un índice seleccionado evita que el agente tenga que adivinar qué página leer.
Productos de software con muchas páginas de configuración o integraciónMerece la penaUn mapa breve de configuración, límites y precios ayuda a un agente a responder preguntas prácticas a partir de páginas actuales.
Proyectos de código abiertoMerece la penaLa documentación suele estar ya en Markdown, así que el proceso de compilación puede generar el archivo y las copias de las páginas.
Pymes y webs corporativas sencillasPrioridad bajaUnas pocas páginas bien enlazadas ya son fáciles de leer.
Tiendas en línea, medios de noticias, blogsPrioridad bajaEl contenido cambia constantemente y una lista mantenida a mano se queda desactualizada.

Una prueba rápida: ¿pegaría un desarrollador tu URL en un asistente de programación para pedirle que trabaje con tu producto? Si la respuesta es sí, un llms.txt con copias en Markdown de las páginas clave es una tarde bien invertida. Si lo que buscas es que te nombren en respuestas sobre un servicio local, como una clínica dental en Valencia o un despacho contable en Guadalajara, dedica esa tarde a que tus páginas expliquen con claridad lo que ofreces y a revisar el acceso de los rastreadores. Si los agentes deben actuar sobre tu producto en lugar de leer sobre él, considera una API o un servidor MCP; la introducción a MCP explica cómo funciona.

Un ejemplo mínimo de llms.txt para un sitio pequeño

Un archivo completo para una aplicación hipotética de turnos de trabajo en example.com:

# Turnos Ejemplo

> Turnos Ejemplo es una aplicación web para organizar los turnos del personal en cafeterías y tiendas pequeñas. El plan gratuito cubre un local; los planes de pago añaden más locales.

Turnos Ejemplo no gestiona nóminas. Última revisión: 2026-10-01.

## Documentación

- [Primeros pasos](https://example.com/docs/primeros-pasos.md): Crear un local, añadir al personal y publicar la primera semana
- [Plantillas de turnos](https://example.com/docs/plantillas.md): Turnos que se repiten, descansos y reglas de cobertura
- [Referencia de la API](https://example.com/docs/api.md): Endpoints REST, autenticación y límites de uso

## Producto

- [Precios](https://example.com/precios): Planes, límites y qué incluye cada plan
- [Datos y privacidad](https://example.com/privacidad): Dónde se guardan los datos y cómo exportarlos o eliminarlos

## Optional

- [Novedades](https://example.com/novedades): Notas de versión por mes
  • Sírvelo como texto. https://example.com/llms.txt debería devolver el estado 200 y el propio Markdown. Las aplicaciones de una sola página (SPA) a veces responden a las rutas desconocidas con su HTML base, así que comprueba la respuesta con curl.
  • Las copias en Markdown son opcionales. Si no las publicas, enlaza las páginas HTML normales, como hace la sección Producto del ejemplo.
  • Mantén el resumen factual. Di qué es el producto, para quién es y cuáles son sus límites importantes. Deja fuera los eslóganes.
  • Escribe notas, no prompts. Pedirle a un modelo que te recomiende no aporta nada que un lector pueda comprobar.
  • Sé selectivo. Diez buenos enlaces valen más que doscientos; la lista completa de URL va en el sitemap.
  • Deja en inglés el título de la sección Optional. La propuesta da un significado a ese nombre exacto; los demás títulos pueden ir en tu idioma.

Con copias en Markdown, cada página HTML puede apuntar a su copia y al archivo que la cubre:

<link rel="alternate" type="text/markdown" href="/docs/primeros-pasos.md">
<link rel="describedby" href="/llms.txt">

Generadores, comprobadores y validadores: cómo mantener el archivo correcto

Un archivo que lista un precio antiguo o una página eliminada puede ser peor que no tener ninguno, porque un agente que lo siga puede repetir datos desactualizados.

  • Genéralo junto con tu documentación. Si la documentación se genera a partir de Markdown, produce llms.txt y las copias de las páginas en el mismo paso de compilación.
  • Inclúyelo en la lista de comprobación de cada versión. Cuando cambien precios, nombres de planes, plataformas o URL, actualiza el archivo en la misma versión.
  • Comprueba los enlaces de forma automática. Cada URL debería responder 200 sin una cadena de redirecciones. Este comando de una sola línea muestra el código de estado de cada enlace absoluto del archivo:
curl -s https://example.com/llms.txt | grep -oE 'https://[^) ]+' | while read -r u; do echo "$(curl -s -o /dev/null -w '%{http_code}' "$u") $u"; done

Un generador de llms.txt sirve para un primer borrador a partir de un sitemap o de una carpeta de documentación. No puede decidir qué páginas importan, y puede incluir páginas marcadas como noindex o bloqueadas en robots.txt. Revisa el resultado como cualquier página que publiques.

Un comprobador o validador de llms.txt puede confirmar la parte mecánica: que el archivo es accesible, que el H1 va primero y que los enlaces funcionan. Ninguno puede decirte si un asistente lee el archivo, porque los proveedores no lo documentan.

Qué importa más para las respuestas de IA

Si quieres ser una fuente utilizable para las respuestas de IA, esto va primero:

  1. Acceso de rastreo para los bots que quieras. Los rastreadores de IA se controlan en robots.txt, cada uno con su propio token. OpenAI separa OAI-SearchBot (búsqueda de ChatGPT) de GPTBot (entrenamiento), Anthropic separa Claude-SearchBot de ClaudeBot y Perplexity documenta PerplexityBot. El token Google-Extended es un control de robots.txt, no un rastreador aparte: decide si el contenido que rastrea Google se puede usar para el entrenamiento y la fundamentación (grounding) de Gemini y, según Google, no afecta a la inclusión ni a la clasificación en la Búsqueda de Google. Permitir los rastreadores de búsqueda y bloquear los de entrenamiento es una opción legítima. Ten en cuenta que un grupo User-agent: * con Disallow: / bloquea a todos los rastreadores que siguen robots.txt y no tienen un grupo propio. OpenAI dice que un cambio en robots.txt puede tardar unas 24 horas en llegar a sus sistemas.
  2. Autenticación para el contenido privado. Los agentes que se activan a petición del usuario, como ChatGPT-User y Perplexity-User, pueden no seguir robots.txt, y el RFC 9309 dice que las reglas de robots no son una autorización de acceso.
  3. Contenido claro en la página. Las indicaciones de Google para sus funciones de IA apuntan a contenido único y útil y a una estructura técnica clara, preparada para el descubrimiento y la indexación, no a archivos especiales. Responde de forma directa a preguntas reales en el HTML de una página accesible. La guía de visibilidad en IA lo desarrolla con un ejemplo.
  4. Datos estructurados que coincidan con la página. Google dice que los datos estructurados no son necesarios para su búsqueda con IA generativa y que no hace falta ningún marcado especial de schema.org; sigue recomendándolos para poder optar a los resultados enriquecidos en la Búsqueda. Si usas JSON-LD, mantenlo coherente con los datos visibles.
  5. Datos coherentes. El nombre, los precios, los planes, las regiones y los datos de contacto deberían coincidir en tus páginas, en tus datos estructurados y en tu llms.txt. Si tus propias páginas se contradicen, cualquier sistema que las resuma tiene que adivinar.

Ningún archivo puede hacer que un asistente te cite. Lo que controlas es que tus páginas sean accesibles, legibles y correctas; la guía de SEO técnico cubre lo básico del rastreo y la indexación.

Qué comprueba Sitelemetry sobre llms.txt

El área de visibilidad en IA de Sitelemetry forma parte de la auditoría de seis áreas (seguridad, SEO técnico, visibilidad en IA, accesibilidad, rendimiento e integraciones), que empieza en 49 USD al mes con el plan Starter. Su comprobación de llms.txt es limitada:

  • Solicita /llms.txt una vez en el origen e informa del estado y del tamaño.
  • El archivo solo cuenta como presente si devuelve un estado 2xx, no está vacío, no es HTML y parece una guía de enlaces: una línea que empieza por # o -, una URL o palabras como docs o sitemap. Un archivo ausente se indica como resultado parcial, con una recomendación.
  • No valida el formato, no sigue ni prueba los enlaces y no afirma que ningún sistema de IA lea el archivo.

La misma área revisa robots.txt en busca de bloqueos de todo el sitio contra 16 rastreadores de IA concretos, entre ellos GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended. Las reglas bajo User-agent: * y los bloqueos parciales no se atribuyen a rastreadores de IA concretos (un bloqueo de todo el sitio para todos los rastreadores se indica por separado), y la lista es fija, así que revisa tú mismo los rastreadores que no están en ella, como Claude-SearchBot o Claude-User. También informa de los datos estructurados JSON-LD sin validarlos contra schema.org. La auditoría lee el HTML estático de una muestra de páginas sin ejecutar JavaScript, y no consulta ChatGPT, Claude, Perplexity ni Google ni sigue las citas en las respuestas de IA.

El plan Free cubre solo comprobaciones de seguridad. El snapshot gratuito ejecuta ocho comprobaciones pasivas sin registro; no revisa llms.txt, robots.txt ni datos estructurados, y no es la auditoría de seis áreas. Los detalles de cada plan están en la página de precios.

Preguntas frecuentes

¿llms.txt es un estándar oficial?

No. Es una propuesta informal de Jeremy Howard, publicada por primera vez en septiembre de 2024; la versión 2 tiene fecha del 10 de agosto de 2026. No es un estándar del IETF ni del W3C, y ningún buscador ni proveedor de IA está obligado a leerla.

¿llms.txt hará que ChatGPT, Perplexity o las respuestas de IA de Google citen mi sitio?

Ningún proveedor ha documentado que sea así. La Búsqueda de Google dice que ignora llms.txt, así que el archivo no ayuda ni perjudica la visibilidad ahí. En su documentación consultada el 1 de octubre de 2026, OpenAI, Anthropic y Perplexity describen sus rastreadores en términos de robots.txt y no dicen que lean el llms.txt de un sitio.

¿Puede llms.txt bloquear los rastreadores de IA o el entrenamiento de IA?

No. No concede ni deniega acceso. Usa robots.txt con los tokens que documenta cada proveedor, como GPTBot o ClaudeBot para los rastreadores de entrenamiento, y mantén el contenido privado tras una autenticación, porque algunos agentes que actúan a petición del usuario pueden no seguir robots.txt.

¿Basta con un generador de llms.txt?

Para un primer borrador, sí. Aun así tienes que elegir las páginas que importan, escribir notas precisas, quitar todo lo que esté bloqueado en robots.txt o marcado como noindex y volver a generar el archivo cuando cambie la documentación.

¿Cómo puedo comprobar mi llms.txt?

Descárgalo y confirma un estado 200, Markdown en lugar de una página HTML, el H1 al principio y enlaces que funcionan. La auditoría experimental de Lighthouse y el área de visibilidad en IA de Sitelemetry comprueban que el archivo existe; ninguna de las dos puede decirte si un asistente concreto lo lee.

Fuentes y lecturas

  1. llmstxt.org: el archivo /llms.txt (propuesta, v2)llmstxt.org
  2. Google Search Central: optimizar tu sitio para las funciones de IA generativa de la Búsqueda de Googledevelopers.google.com
  3. Chrome for Developers: auditoría llms.txt de Lighthousedeveloper.chrome.com
  4. Chrome for Developers: puntuación de Agentic Browsing en Lighthousedeveloper.chrome.com
  5. OpenAI: resumen de los rastreadores de OpenAIdevelopers.openai.com
  6. Centro de ayuda de Claude: ¿Anthropic rastrea datos de la web y cómo pueden bloquear el rastreador los propietarios de sitios?support.claude.com
  7. Perplexity: rastreadores de Perplexitydocs.perplexity.ai
  8. RFC 9309: Robots Exclusion Protocolwww.rfc-editor.org
  9. Google Crawling Infrastructure: rastreadores comunes de Google (Google-Extended)developers.google.com
  10. Google Search Central: información sobre los sitemapsdevelopers.google.com
Equipo de Sitelemetry

Preparado por el equipo editorial de Sitelemetry. Consulta las fuentes enlazadas para profundizar.

SITELEMETRY

Pon en práctica lo aprendido.

Explora la estructura, configuración y señales de tu web con Sitelemetry.