¿Qué es llms.txt y cómo implementarlo en tu sitio web?
El archivo llms.txt es un mapa en formato Markdown que colocas en la raíz de tu sitio para que los modelos de lenguaje grande lean tu contenido de forma estructurada y eficiente. Contiene un título, un resumen breve y listas organizadas de enlaces a tus páginas más importantes, todo en un formato optimizado para el contexto limitado de los LLMs. Para equipos de SEO y marketing que buscan visibilidad en motores de IA como ChatGPT, Gemini o Perplexity, implementarlo correctamente es una ventaja de bajo costo y alta palanca.
¿Qué es llms.txt y para qué sirve?
El archivo llms.txt es una convención emergente que provee un resumen legible por máquinas del contenido de un sitio web, diseñado específicamente para LLMs y agentes de IA. Un modelo de lenguaje que quiere responder una pregunta sobre tu sitio tiene que trabajar con lo que puede rastrear, y la mayoría de las páginas web están saturadas de navegación, scripts y código que desperdician el contexto disponible. llms.txt ofrece un mapa limpio y priorizado: las páginas que importan, en Markdown puro, con descripciones de una línea.
El estándar fue propuesto en septiembre de 2024 por Jeremy Howard, cofundador de Answer.AI. La especificación oficial está alojada en llmstxt.org. Sigue siendo una convención de la comunidad, no un estándar ratificado por la W3C o el IETF.
¿En qué se diferencia llms.txt de robots.txt y sitemap.xml?
Los tres archivos conviven en la raíz de un sitio, pero cumplen funciones distintas:
| Archivo | Propósito principal | Audiencia | Formato |
|---|---|---|---|
| robots.txt | Controla qué bots pueden rastrear qué rutas | Crawlers de buscadores | Directivas Allow/Disallow |
| sitemap.xml | Lista todas las URLs indexables | Buscadores como Google | XML estructurado |
| llms.txt | Provee un índice curado y contextualizado | Modelos de lenguaje y agentes de IA | Markdown puro |
robots.txt se enfoca en controlar el acceso de crawlers de buscadores, pero no ayuda a que un modelo entienda el contenido. sitemap.xml lista todas las páginas indexables sin proveer contexto ni facilitar el procesamiento por IA. robots.txt decide qué crawlers llegan a tu sitio; llms.txt moldea qué reciben los agentes de IA una vez que lo hacen.
¿Por qué los motores de IA necesitan llms.txt para entender tu sitio?
Cuando alguien le hace una pregunta a Perplexity, ChatGPT o Gemini, el modelo necesita ingerir contenido rápido dentro de una ventana de contexto finita. El HTML es pesado: CSS, JavaScript, navegación, anuncios y banners de cookies consumen tokens que podrían llevar respuestas reales.
Sin este archivo, los agentes pueden pasar más tiempo rastreando el sitio para entender su estructura de alto nivel y su contenido principal. En lugar de obligar a un modelo a analizar cientos de páginas HTML para entender qué hace una empresa, el archivo provee un índice curado con contexto: quién es la marca, qué cubre el sitio y qué páginas tienen más señal.
¿Qué información debe incluir un archivo llms.txt bien estructurado?
La especificación de llmstxt.org define una estructura Markdown pequeña y estricta: un H1 con el nombre del sitio o proyecto (el único elemento obligatorio), un bloque de cita inmediatamente después con un párrafo breve que describe qué es el sitio y a quién sirve, y secciones H2 que agrupan páginas relacionadas como enlaces Markdown.
Los elementos que no deben faltar:
- Nombre del sitio o marca en H1
- Descripción en bloque de cita (
>) que explique qué ofreces y a quién - Secciones H2 por área temática (servicios, blog, documentación, contacto)
- Cada enlace con una descripción breve separada por dos puntos
- URLs absolutas, no relativas
Solo el H1 es obligatorio según la propuesta; el bloque de cita, el contexto y las secciones H2 con enlaces son opcionales pero recomendados. El archivo debe limitarse a aproximadamente 100 KB, codificarse en UTF-8 y escribirse en Markdown puro sin HTML.
Paso a paso: cómo crear e implementar llms.txt en tu sitio
Crear el archivo no requiere conocimientos avanzados de programación. Estos son los pasos esenciales:
- Abre un editor de texto plano (VS Code, Notepad++ o cualquier equivalente)
- Crea un archivo llamado exactamente
llms.txt(en minúsculas) - Escribe el contenido en Markdown siguiendo la estructura de la especificación
- Coloca el archivo en el directorio raíz de tu sitio web, de modo que quede accesible en
https://tudominio.com/llms.txt - Verifica que se sirva como
text/plaincon codificación UTF-8
Este es un ejemplo de archivo con sintaxis real y comentada:
# Nombre de tu Marca o Sitio
> Descripción breve de qué hace tu sitio y a quién va dirigido.
> Incluye tu propuesta de valor principal en dos o tres líneas.
## Servicios
- Servicio Principal: Descripción concisa de qué es y para quién.
- Página de Precios: Planes disponibles y rangos de inversión.
## Blog y Recursos
- Guía de llms.txt: Cómo implementar el archivo paso a paso.
- Glosario de IA: Términos clave para entender los motores de IA.
## Acerca de
- Sobre nosotros: Historia, equipo y enfoque de la empresa.
- Contacto: Formulario y datos de contacto directo.
La elección de Markdown no es arbitraria: la mayoría de los modelos de IA ya lo comprenden bien, por lo que el formato evita esquemas XML nuevos, JSON o formatos especializados que requieran parsers personalizados.
¿Cómo verificar que tu llms.txt está funcionando correctamente?
Visita https://tudominio.com/llms.txt directamente en el navegador: debe mostrarse como texto Markdown plano, retornar un código de estado HTTP 200 y renderizarse limpiamente. Confirma también que todos los enlaces dentro del archivo sean válidos y devuelvan códigos 200.
Para una validación más completa, revisa estos puntos:
- Las cabeceras HTTP deben indicar
Content-Type: text/plaincon charset UTF-8 - El archivo no debe estar protegido por autenticación ni detrás de un login
- El tiempo de respuesta debe ser menor a 200 ms y el tamaño del archivo, menor a 10 KB en la mayoría de los casos
- Revisa los logs del servidor para confirmar que crawlers de IA lo estén solicitando
Chrome Lighthouse 13.3.0 incorporó una categoría de auditoría llamada "Agentic Browsing" que verifica automáticamente la presencia y el formato correcto del archivo llms.txt en cualquier sitio. Usarla es una forma rápida de detectar errores de formato antes de que los agentes los encuentren.
Errores comunes al implementar llms.txt y cómo evitarlos
La mayoría de los fallos reales no son archivos ausentes, sino errores de formato: usar enlaces de texto plano en lugar de la sintaxis Markdown [Página de Precios](https://tudominio.com/precios): Planes disponibles y rangos de inversión. es la causa más frecuente de que el archivo no se procese correctamente.
Otros errores que se repiten con frecuencia:
- Confundir el formato con robots.txt e incluir directivas como "Disallow" o "User-agent". llms.txt no es un archivo de control de acceso, es una guía de contenido.
- Incluir todas las URLs del sitio. llms.txt es un briefing curado, no un sitemap; agregar cientos de enlaces diluye la señal y satura el contexto del modelo.
- Dejarlo desactualizado. Un archivo con servicios que ya no ofreces es peor que no tenerlo: el modelo citará información incorrecta con total confianza. Trátalo como código y actualízalo cada vez que cambies catálogo, precios o posicionamiento.
- Bloquear a los crawlers de IA en robots.txt y publicar llms.txt al mismo tiempo. Si GPTBot, ClaudeBot o PerplexityBot tienen
Disallow: /, el archivo es invisible para ellos. - Llenarlo de palabras clave sin contexto o usar tono publicitario. Los modelos reconocen ese patrón y le restan autoridad al contenido.
Preguntas frecuentes sobre llms.txt
¿Quién creó llms.txt y cuándo surgió?
Jeremy Howard, cofundador de Answer.AI y fast.ai, propuso la convención el 3 de septiembre de 2024. La especificación vive en llmstxt.org. En agosto de 2026 se publicó una versión 2 de la especificación.
¿Es obligatorio tener llms.txt?
No. llms.txt sigue siendo una convención de la comunidad, no un requisito de ningún organismo oficial. La especificación es de código abierto en GitHub, así que conviene tratarla como una práctica de bajo riesgo que vale la pena seguir, no como un requisito garantizado.
¿Qué pasa si no tengo llms.txt?
No es un factor de ranking. Ningún proveedor importante de IA ha confirmado que publicarlo mejore la frecuencia de citación. Conviene tratarlo como higiene de contenido, no como una palanca de optimización directa. Dicho esto, la ausencia del archivo obliga a los agentes a rastrear y parsear HTML completo, lo que reduce la probabilidad de que tu contenido sea leído con precisión.
¿Cómo sé si los motores de IA están leyendo mi llms.txt?
La forma más directa es revisar los logs del servidor y buscar peticiones de agentes como GPTBot, ClaudeBot o PerplexityBot al path /llms.txt. También puedes consultar directamente a modelos como ChatGPT o Perplexity sobre tu marca y observar si la información que devuelven coincide con lo que declaras en el archivo. Plataformas como Menciones.ai ofrecen monitoreo automatizado de menciones en ChatGPT, Gemini, AI Overviews, Grok, Claude y Perplexity como parte de su plataforma , lo que permite contrastar si los cambios en tu llms.txt se reflejan en cómo los motores de IA describen tu marca. Menciones.ai monitorea tu marca en los 6 motores de IA desde su plan base , con planes desde MXN $1,500 hasta $4,900 al mes, IVA incluido .