llms.txt: qué es realmente este archivo, y qué no es
6 de agosto de 2026
Cada pocos meses aparece un archivo nuevo en la raíz de los sitios y todo el mundo hace las dos mismas preguntas: ¿es obligatorio y mejora mi posicionamiento? Para llms.txt las respuestas son no y no. Aun así vale la pena escribirlo, y la especificación explica por qué en unos dos párrafos, es decir, aproximadamente dos párrafos más de los que citan la mayoría de los artículos sobre el tema.
Los dos problemas que aborda
El primero es un límite duro. Como dice la especificación, los grandes modelos de lenguaje dependen cada vez más de la información de los sitios web, pero se topan con una limitación crítica: las ventanas de contexto son demasiado pequeñas para manejar la mayoría de los sitios en su totalidad. Un modelo que responde a una pregunta sobre tu producto no puede leer tu sitio. Puede leer una porción, y algo tiene que decidir cuál.
El segundo es de calidad. Convertir páginas HTML complejas, con navegación, anuncios y JavaScript, en texto plano apto para un modelo es difícil e impreciso a la vez. Incluso la parte que se lee llega degradada, mezclada con menús, avisos de cookies y todo lo que tu framework haya inyectado.
llms.txt responde a ambos de una vez, devolviéndote la decisión. En lugar de que un modelo adivine qué veinte páginas de tu sitio importan y las analice mal, le entregas una lista corta, limpia y elegida. Esa es toda la idea.
Dónde vive, y por qué importa la ubicación
El archivo va en la raíz del sitio, en la ruta /llms.txt, o eventualmente en una subruta. Una dirección predecible es justamente el objetivo: lo que lo busque lo encuentra sin que haya que indicárselo.
Es tentador archivarlo mentalmente junto a robots.txt, y la comparación ayuda mientras se mantenga la diferencia a la vista. robots.txt es una restricción: dice lo que un rastreador no puede descargar. llms.txt es una recomendación: dice lo que merece leerse primero. Uno es una valla, el otro una señal. Poner una señal no quita tu valla, y tampoco la construye.
La estructura es más ligera de lo que se cree
Casi toda la inquietud en torno a este archivo viene de suponer que impone un esquema exigente. No es así.
Un H1 con el nombre del proyecto o del sitio. La especificación señala que esa es la única sección obligatoria. Todo lo demás es opcional en sentido estricto.
Una cita con un resumen corto del proyecto, con la información clave necesaria para entender el resto del archivo. Es la frase que le dice al modelo qué tiene delante antes de leer un solo enlace, y es la parte que más merece reescribirse dos veces.
Cero o más secciones markdown delimitadas por títulos H2, con listas de enlaces. Agrupa según lo que un lector intentaría hacer: documentación, guías, referencia, precios. La agrupación transmite sentido, así que los títulos vagos lo desperdician.
La sección Optional es una instrucción real, no una etiqueta
Un nombre de sección tiene comportamiento definido, y es el que la gente entiende al revés. La especificación establece que la sección « Optional » tiene un significado especial: si se incluye, las URLs que allí figuran pueden omitirse cuando se necesita un contexto más corto.
Léela por lo que es: una instrucción de triaje que escribes tú. Le estás diciendo al modelo cuáles de tus enlaces descartar primero cuando se quede sin espacio. Poner ahí tus mejores páginas explicativas porque el título suena modesto es el único error que te perjudica de verdad: has marcado tu contenido más útil como lo primero que se puede tirar.
Es un archivo de inferencia, no de entrenamiento
Esta distinción zanja la mayoría de las objeciones que se le hacen a llms.txt, y los autores la enuncian sin rodeos: su expectativa es que llms.txt sea útil principalmente para la inferencia, es decir, en el momento en que un usuario busca ayuda, por oposición al entrenamiento.
El escenario al que sirve es, por tanto, estrecho y concreto. Alguien pregunta a un asistente. El asistente sale a buscar. Tu archivo es lo primero que encuentra, y decide qué se lee en los segundos siguientes. Si tu preocupación es más bien que los modelos se entrenen con tu contenido, este archivo es el instrumento equivocado, y son las directivas de robots.txt las que hay que discutir.
Lo que no hace
Es una convención propuesta. Nada obliga a un proveedor a leerla, y ningún buscador ha prometido nada a cambio de publicarla. Quien te presente este archivo como un factor de posicionamiento está describiendo una esperanza, no un mecanismo.
El argumento honesto para escribirlo es otro y, a nuestro juicio, más sólido: el coste es casi nulo, el inconveniente es ninguno, y el ejercicio de decidir qué veinte páginas representan realmente tu actividad merece hacerse aunque nada llegue a leer el resultado. La mayoría de los equipos descubren a mitad de camino que no se ponen de acuerdo sobre la lista. Esa es la parte útil.
Preguntas frecuentes
¿Qué problema resuelve realmente llms.txt?
Dos, y la especificación enuncia ambos. El primero es de tamaño: los grandes modelos de lenguaje dependen cada vez más de la información de los sitios web, pero se topan con una limitación crítica, a saber, que las ventanas de contexto son demasiado pequeñas para manejar la mayoría de los sitios en su totalidad. El segundo es de ruido: convertir páginas HTML complejas, con navegación, anuncios y JavaScript, en texto plano apto para un modelo es difícil e impreciso a la vez. llms.txt no es, por tanto, ni un archivo de posicionamiento ni un archivo de permisos. Es un mapa seleccionado, y ya limpio, de lo que importa en tu sitio.
¿Dónde debe ir el archivo?
En la raíz del sitio, en la ruta /llms.txt, o eventualmente en una subruta. Esa es toda la regla de ubicación. Convive con robots.txt en espíritu, en una dirección predecible, pero hace el trabajo contrario: robots.txt dice lo que un rastreador no puede descargar, llms.txt dice lo que merece leerse primero.
¿Qué estructura se exige?
Menos de lo que se supone. La especificación pide un H1 con el nombre del proyecto o del sitio, y precisa que esa es la única sección obligatoria. Después viene una cita con un resumen corto del proyecto, con la información clave necesaria para entender el resto del archivo, y luego cero o más secciones markdown delimitadas por títulos H2, que contienen listas de enlaces. Todo lo que sigue al H1 es opcional en sentido estricto, y por eso un llms.txt útil se escribe en veinte minutos.
¿Qué significa la sección Optional?
Es un nombre de sección con un comportamiento definido, no una etiqueta que uno inventa. La especificación es explícita: si se incluye, las URLs que allí figuran pueden omitirse cuando se necesita un contexto más corto. Es tu propia declaración de prioridad, que indica al modelo qué enlaces descartar primero cuando falta espacio. Poner allí tus páginas más importantes consigue justo lo contrario de lo que buscabas.
¿Sirve llms.txt para entrenar modelos con mi contenido?
No, y los autores lo dicen directamente: su expectativa es que llms.txt sea útil principalmente para la inferencia, es decir, en el momento en que un usuario busca ayuda, por oposición al entrenamiento. Es un archivo para el instante en que alguien hace una pregunta y un modelo sale a buscar una respuesta. Si tu preocupación es el entrenamiento, llms.txt es la palanca equivocada y son las directivas de robots.txt las que hay que discutir.
¿Usa Google llms.txt?
Ningún proveedor tiene la obligación de leerlo, y tratarlo como un factor de posicionamiento es malinterpretar lo que es. Es una convención propuesta, adoptada por quien quiera. Dicho esto, el coste de publicarlo es casi nulo y el inconveniente es ninguno, lo que es una combinación rara. Escríbelo porque hace tu contenido legible para lo que sí lo lea, no porque un buscador haya prometido algo.
El enunciado del límite de las ventanas de contexto, la descripción de la conversión de HTML a texto como difícil e imprecisa, la regla de ubicación en la raíz, el H1 obligatorio y su condición de única sección requerida, el resumen en cita, las secciones H2 con listas de enlaces, el significado especial de la sección « Optional », y la expectativa de que el formato sirva a la inferencia y no al entrenamiento, proceden todos de la especificación llms.txt, consultada en el momento de la redacción. Es una convención propuesta y puede cambiar.
El acompañamiento de ZAX en visibilidad ante la IA
Ayudamos a los equipos a hacer su contenido legible para las aplicaciones de IA: datos estructurados, llms.txt, servidores MCP que exponen los sistemas internos, y la medición que dice si algo de eso funciona.
Auditoría y encuadre. Una auditoría de IA gratuita de 30 minutos revisa qué encuentra hoy un asistente sobre ti, y en qué se equivoca.
Contáctanos para hablar de tu visibilidad ante la IA.
Artículos relacionados
Los servidores MCP explicados
El protocolo que conecta las aplicaciones de IA con tus sistemas, y qué estandariza.
Integración de la API de Claude en la empresa
Arquitectura, costes reales y buenas prácticas para integrar Claude.
Agentes de IA autónomos en la empresa
Lo que los agentes saben hacer hoy, y dónde siguen necesitando supervisión.
¿Tienes un Proyecto en Mente?
Hablemos de tus necesidades y veamos cómo podemos ayudarte a hacer realidad tu visión.
Contactar