Respuesta breve
robots.txt es un mecanismo estandarizado de instrucciones para rastreadores cooperativos; llms.txt es una propuesta voluntaria de descubrimiento. Ninguno es una frontera de seguridad.
Se están confundiendo tres problemas
Los propietarios de sitios suelen meter `robots.txt`, `llms.txt` y el “control de rastreadores de IA” en el mismo saco, pero resuelven problemas distintos. El Robots Exclusion Protocol estandarizado en RFC 9309 es una convención para que un rastreador descubra reglas sobre qué rutas se le solicita que acceda. La documentación de Google describe el mismo uso práctico para sus rastreadores. El protocolo está ampliamente implementado, pero el RFC es explícito sobre un límite importante: estas reglas no son autorización de acceso. Una URL bloqueada puede seguir siendo accesible para cualquier persona o sistema que conozca la dirección, salvo que el propio servidor exija autenticación o rechace de otro modo la solicitud.
`llms.txt` es diferente tanto en finalidad como en madurez. El sitio del proyecto lo describe como una propuesta de archivo Markdown, normalmente en `/llms.txt`, que presenta enlaces útiles y contexto para sistemas de modelos de lenguaje. Está pensado como ayuda de descubrimiento y orientación, no como protocolo establecido de control de acceso. Eso significa que la comparación práctica no es “¿qué archivo bloquea mejor la IA?”. Las preguntas útiles son: qué rastreador respeta `robots.txt`; si una herramienta concreta decide leer `llms.txt`; y si el sitio web cuenta con controles del lado del servidor para el contenido que realmente debe ser privado.
Lo que estandariza robots.txt
RFC 9309 define cómo los rastreadores cooperativos pueden recuperar e interpretar `/robots.txt`, incluidos grupos de user-agent, reglas `Allow` y `Disallow` y comportamiento de coincidencia. El archivo vive en el nivel superior de un origin y las reglas se aplican dentro de ese ámbito. Esta estandarización importa porque una interpretación inconsistente puede producir comportamientos inesperados. Una empresa que use el archivo debería generar reglas simples, evitar conflictos accidentales de sintaxis y probar las rutas exactas que le importan. Los proveedores de búsqueda pueden publicar sus propias herramientas y documentación adicional, pero el protocolo en sí es un mecanismo de instrucciones para rastreadores y no un firewall general.
La distinción importa especialmente para material sensible. Una regla de robots no vuelve confidenciales una factura, un sitio staging, una exportación de clientes o un PDF privado. El RFC advierte que usar el protocolo como seguridad puede exponer rutas porque el archivo es público y las enumera. Si el contenido requiere protección, usa autorización real: acceso autenticado, controles de red, URLs firmadas con vidas adecuadas o respuestas del servidor que rechacen solicitudes no autorizadas. `robots.txt` puede reducir el rastreo de agentes que cooperan; nunca debería cargar con la tarea de mantener secretos. Del mismo modo, bloquear el rastreo no es la misma operación que solicitar la eliminación de un índice o borrar material recogido previamente.
Lo que Google dice que su archivo robots puede y no puede hacer
La documentación de Google Search explica que `robots.txt` se usa principalmente para gestionar el tráfico de rastreadores y evitar que determinados archivos sean solicitados por los rastreadores de Google. También advierte que el mecanismo no debe utilizarse para mantener una página web fuera de Google Search. Una URL bloqueada puede seguir siendo conocida a través de enlaces u otras señales incluso cuando su contenido no se rastrea. Para los editores, este es un modelo útil más allá de Google: permiso de rastreo, comportamiento de indexación, comportamiento de presentación y control de acceso son capas separadas y no deben tratarse como interruptores intercambiables.
Una implementación fiable empieza, por tanto, con el resultado deseado. Si el objetivo es reducir el rastreo de URLs facetadas duplicadas, una regla de robots puede ser apropiada. Si el objetivo es impedir el acceso público, la autorización corresponde al servidor. Si el objetivo es controlar la presentación en búsqueda, usa los mecanismos documentados por el servicio de búsqueda relevante en vez de asumir que un bloqueo de rastreo produce el mismo efecto. Los servicios de IA añaden otra capa porque una empresa puede operar user agents distintos para entrenamiento de modelos, recuperación de búsqueda o fetching solicitado por el usuario. El propietario del sitio debe consultar la documentación actual del proveedor y no inferir la finalidad por la palabra “IA”.
Lo que realmente ofrece llms.txt
La propuesta `llms.txt` se parece más a un mapa curado que a una puerta. Su especificación usa Markdown para que un editor pueda describir un proyecto y orientar herramientas de modelos de lenguaje hacia documentación u otros recursos importantes. Eso puede ser útil en sitios donde el material crítico está fragmentado en la navegación, generado en el cliente o rodeado de elementos de interfaz ineficientes para el consumo por máquinas. Un archivo conciso puede decir qué contiene el sitio e identificar recursos canónicos. Nada de esto obliga a un producto de IA a obtener, confiar o citar esos recursos, y la propuesta no sustituye la arquitectura web normal.
El proyecto se publicó por primera vez en 2024 y ha seguido cambiando; su propio registro de cambios debe tratarse, por tanto, como el lugar autoritativo para entender el formato actual de la propuesta. La adopción es voluntaria y desigual. Un editor no debería describir el archivo a las partes interesadas como una directiva de rastreo estándar de la industria ni como una garantía de visibilidad en motores de respuesta. Su valor se evalúa mejor empíricamente: añade un archivo bien formado si el coste de mantenimiento es bajo, mantén las páginas subyacentes útiles por sí mismas y observa si los servicios relevantes solicitan realmente el archivo o los recursos que referencia.
No conviertas llms.txt en un segundo sistema de contenidos
Un error de implementación común es redactar manualmente un resumen pulido en `llms.txt` que se va separando del sitio. Cambia la disponibilidad de un producto, se retira una versión de API o se actualiza una política, pero el archivo orientado a máquinas permanece congelado. Si se adopta, genéralo o revísalo desde el mismo inventario de fuentes canónicas usado para navegación y documentación. Evita incluir afirmaciones que no existan en páginas fuente accesibles. El archivo debe reducir la fricción de descubrimiento, no convertirse en una base de conocimiento paralela que contenga hechos únicos sin la gobernanza aplicada al contenido normal.
La misma regla se aplica a variantes llamadas `llms-full.txt` descritas por la propuesta. Las grandes exportaciones amigables para máquinas pueden ser cómodas, pero el tamaño no es automáticamente calidad. El material duplicado, obsoleto o inapropiado para el acceso puede empeorar la recuperación y crear riesgo de mantenimiento. Conserva procedencia, fechas de actualización y URLs estables cuando corresponda. Si algunos documentos no deben obtenerse ampliamente, no los incluyas solo porque un paquete legible por máquinas sea técnicamente fácil de generar. Las pistas de descubrimiento deben reflejar la arquitectura de información y el modelo de autorización del sitio, no anularlos.
Usa los logs del servidor para observar, no para asumir
La forma más concreta de saber qué está solicitando un sitio público es inspeccionar los logs de acceso HTTP o la telemetría equivalente de CDN y edge. Registra al menos marca temporal, ruta solicitada, estado de respuesta, user-agent, bytes, referrer cuando esté disponible, host e identificador de solicitud; conserva información IP solo bajo una política adecuada de privacidad y seguridad. Crea vistas para solicitudes a `/robots.txt`, `/llms.txt`, rutas importantes de contenido y user agents conocidos de rastreadores. Mide frecuencia, códigos de estado y qué páginas referenciadas se solicitan después del archivo de descubrimiento. Eso dice lo que observó tu servidor, algo más sólido que asumir que un servicio usó un archivo porque existe.
Los logs siguen necesitando interpretación. Una cadena de user-agent puede copiarla otro cliente, así que no es prueba criptográfica de identidad. Algunos grandes proveedores publican métodos para verificar IPs de rastreadores o DNS inverso; usa esos métodos específicos y actuales cuando la identidad importe. Los proxies y fetches iniciados por usuarios también pueden comportarse de forma diferente de los rastreadores autónomos. No equipares una solicitud de `llms.txt` con ingestión, entrenamiento, ranking o citación. Un fetch solo demuestra que una solicitud alcanzó el servidor. El uso posterior del contenido depende del comportamiento y las políticas documentadas del servicio solicitante.
Construye una matriz de verificación por servicio
Para cada servicio de búsqueda o IA que te importe, mantén una pequeña matriz: nombres documentados de rastreadores, fines declarados, comportamiento ante robots, método de verificación, controles relevantes, fecha de última revisión de documentación y lo que muestran realmente tus logs. Separa rastreadores orientados a entrenamiento de bots de búsqueda o recuperación y fetchers activados por usuarios cuando el proveedor lo haga. La matriz evita que una regla copiada de un blog antiguo se convierta en infraestructura permanente. También hace visibles contradicciones: por ejemplo, un proveedor puede documentar un bot mientras los logs muestran otro user-agent alcanzando las mismas rutas, lo que exige investigar en vez de asumir inmediatamente una política.
Prueba los cambios de forma deliberada. Guarda el archivo robots anterior, despliega una regla clara, anota la hora y observa las solicitudes posteriores. Usa una ruta de prueba no sensible en vez de depender de datos protegidos. Para `llms.txt`, registra solicitudes al archivo y a recursos enlazados distintivos. Ten en cuenta caché e intervalos de rastreo; la ausencia de una solicitud inmediata no demuestra que se ignore un control. Si la empresa tiene razones legales o contractuales para restringir el uso automatizado, involucra a asesores jurídicos y seguridad técnica en lugar de depender solo de convenciones voluntarias de rastreadores. La configuración del sitio es solo una parte de los derechos y obligaciones exigibles.
Una política práctica para 2026
Usa `robots.txt` para instrucciones basadas en estándares a rastreadores cooperativos y mantén sus reglas deliberadamente simples. Usa autenticación y autorización del lado del servidor para cualquier cosa que no deba ser pública. Considera `llms.txt` como una capa opcional de descubrimiento cuando el sitio tenga recursos canónicos bien gobernados que los sistemas de máquinas puedan beneficiarse de encontrar. No dupliques contenido confidencial en él y no prometas que publicarlo generará citas. Revisa por separado la documentación de rastreadores específica de cada proveedor, porque un archivo estándar no puede decirte por qué cada servicio de IA realiza una solicitud.
Después cierra el bucle con evidencia. Versiona ambos archivos, conserva las fechas de despliegue, inspecciona logs del servidor, verifica la identidad del rastreador cuando sea práctico y registra el comportamiento observado sin exagerar lo que ocurre después de un fetch. El núcleo de `llms.txt vs robots.txt` no es elegir entre dos sistemas de exclusión competidores. Uno es un protocolo estandarizado de instrucciones para rastreadores; el otro, una propuesta voluntaria de descubrimiento de contenidos. Ninguno es una frontera de seguridad. Cuando esos papeles se separan, la implementación se vuelve mucho menos misteriosa y mucho más fácil de probar.
Lista práctica
- Define si el objetivo real es controlar rastreo, indexación, descubrimiento o acceso.
- Mantén simples las reglas de robots.txt y nunca las uses para proteger rutas confidenciales.
- Trata llms.txt como metadatos opcionales de descubrimiento derivados del contenido canónico.
- Registra solicitudes a ambos archivos y a páginas representativas enlazadas.
- Verifica la identidad del rastreador con los métodos actuales del proveedor cuando importe.
- Versiona los cambios de configuración y registra las ventanas de observación.
Preguntas frecuentes
¿Puede robots.txt impedir que una empresa de IA acceda a una página?
Puede pedir a un rastreador cooperativo que no solicite una ruta, pero RFC 9309 no convierte esa petición en un mecanismo de autorización. El servidor puede seguir entregando la URL a cualquier cliente que, por lo demás, tenga permitido acceder a ella. Los distintos proveedores también operan rastreadores diferentes y publican sus propias políticas, por lo que el user agent relevante debe comprobarse contra la documentación vigente. Si la página debe ser privada, aplica autenticación u otro control del lado del servidor en lugar de depender de robots.txt.
¿Publicar llms.txt hace que un sitio tenga más probabilidades de ser citado por motores de respuesta?
No existe una garantía general. El proyecto llms.txt propone un mapa Markdown cómodo de recursos importantes, pero la adopción y el comportamiento posterior dependen de cada servicio. Una solicitud del archivo no demuestra que sus enlaces se hayan indexado, utilizado en una respuesta o citado. Los editores pueden tratarlo como un experimento de descubrimiento de bajo coste cuando puedan mantenerlo actualizado y después observar el comportamiento mediante logs de acceso y auditorías controladas de consultas. La calidad de las páginas canónicas y la evidencia factual deben sostenerse por sí mismas.
¿Cómo puedo saber si un rastreador de IA respetó un cambio?
Registra la hora exacta del despliegue, inspecciona los logs del servidor o CDN para el user agent y las rutas relevantes y deja margen para calendarios de rastreo y caché. Si el proveedor publica un procedimiento de verificación por IP o DNS, úsalo cuando la identidad del rastreador sea importante porque las cadenas de user-agent se pueden falsificar. Prueba en una ruta no sensible y compara solicitudes antes y después. El log puede establecer que una solicitud llegó al servidor; por sí solo no puede establecer qué hizo el servicio con contenido obtenido anteriormente.

