Que un asistente de IA te cite es un problema de rastreadores antes que un problema de contenido: si el bot no puede obtener y analizar la página, ninguna cantidad de buena escritura aparecerá en una respuesta. La buena noticia es que la capa técnica es pequeña: un puñado de reglas en robots.txt, opcionalmente un llms.txt, y un conjunto de señales a nivel de página que hacen que tu contenido sea trivialmente citable. Esta guía cubre exactamente eso, en el orden en que deberías hacerlo.
Está escrita desde la experiencia de ejecutar estos archivos en producción en aat.ee, incluidas las reglas para rastreadores de IA y el llms.txt que sirven a este sitio.
Cómo termina un asistente de IA citándote
Hay dos caminos, y deberías optimizar para ambos:
- Recuperación en vivo. El asistente busca u obtiene páginas en el momento de responder. Aquí es donde la rastreabilidad, la frescura y la estructura extraíble lo deciden todo. Si tu página está bloqueada, no se puede recuperar.
- Datos de entrenamiento. La asociación "categoría → productos líderes" se aprendió del texto con el que se entrenó el modelo. Los productos mencionados con frecuencia, en fuentes creíbles, en lenguaje claro, se convierten en las opciones predeterminadas a las que el modelo recurre. Este camino es más lento y menos controlable, y es la razón por la que la consistencia en toda la web importa.
La recuperación en vivo es la que puedes influir esta semana. Empieza por ahí.
Paso 1: Deja entrar a los rastreadores de IA
El primer fallo es el bloqueo excesivo silencioso. Muchos sitios prohíben "bots desconocidos" o copian un robots.txt que bloquea agentes de usuario de IA, y luego se preguntan por qué nunca se les menciona. Decide deliberadamente.
Conoce quién es quién
La distinción crítica: los rastreadores de entrenamiento y los agentes de obtención en vivo son agentes de usuario separados, y bloquear uno no bloquea al otro.
| Agente de usuario | Qué hace | Si lo bloqueas |
|---|
GPTBot | Rastreador de entrenamiento de OpenAI | Quedas excluido de futuros datos de entrenamiento |
ChatGPT-User | Obtención en vivo cuando el prompt de un usuario necesita una página | ChatGPT no puede leer tu página en respuestas que navegan |
ClaudeBot | Rastreo de Anthropic | Cobertura reducida de entrenamiento y recuperación |
Claude-User | Obtención en vivo activada por un usuario de Claude | Claude no puede leer la página bajo demanda |
PerplexityBot | El rastreador de Perplexity | Estás ausente de las respuestas con fuentes de Perplexity |
Google-Extended | Controla el uso de contenido rastreado por Google para entrenamiento de Gemini/Vertex | La Búsqueda de Google sigue funcionando, pero el uso para entrenamiento de Gemini queda desactivado |
CCBot | Common Crawl, un corpus en el que entrenan muchos modelos | Excluido de un corpus abierto ampliamente usado |
Si tu objetivo es que te recomienden, el valor predeterminado debería ser permitir para ambas clases. Si tienes una razón específica para rechazar el entrenamiento pero seguir siendo citable en respuestas en vivo, bloquea los agentes de entrenamiento (GPTBot, ClaudeBot, CCBot, Google-Extended) y permite explícitamente los agentes de obtención en vivo (ChatGPT-User, Claude-User, PerplexityBot). Esa es una postura coherente; solo tómala a propósito.
Un patrón funcional de robots.txt
Bloquea las rutas que debas (superficies privadas de la aplicación, admin, herramientas internas) y deja que todo lo demás se rastree. Mantén la misma lista de rutas privadas para los agentes de IA que para todos los demás, y declara tu sitemap:
User-agent: *
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Disallow: /settings/
Sitemap: https://example.com/sitemap.xml
User-agent: GPTBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Crawl-delay: 10
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Crawl-delay: 10
User-agent: PerplexityBot
Allow: /
Disallow: /api/
Disallow: /admin/
Crawl-delay: 10
Dos notas que ahorran tiempo real de depuración:
- Prueba el archivo en vivo, no el código fuente. Obtén
https://tusitio.com/robots.txt en un navegador y confirma la salida renderizada; la mayoría de los frameworks lo generan desde código, y un error en ese código es invisible hasta que lo miras.
- Un
Crawl-delay es una petición, no una garantía. Aun así vale la pena establecer un valor cortés: el rastreo agresivo de un sitio pequeño es como terminas con límite de velocidad o bloqueado por tu propio hosting.
Una cosa que eliminar
Si tienes una regla que prohíbe un patrón de URL y no estás seguro de por qué está ahí, comprueba si está bloqueando a un agente de IA antes de dejarla. Las reglas heredadas de robots.txt son una de las causas más comunes de "estamos indexados en Google pero ChatGPT nunca nos nombra".
Paso 2: Sirve un llms.txt (si se gana su lugar)
llms.txt es una convención propuesta, no un estándar: un archivo Markdown en /llms.txt que da a los modelos un mapa curado de tu sitio: qué eres, tus páginas más importantes y qué puede rastrearse y reutilizarse. No hay garantía de que un asistente determinado lo lea, y no deberías esperar que sustituya a páginas rastreables.
Aun así vale la pena publicarlo, por dos razones: cuesta alrededor de una hora, y es el único lugar donde puedes declarar, en lenguaje claro, cómo quieres que se atribuya tu contenido. Eso es útil para cualquier sistema que elija leerlo, y es una declaración pública limpia de tu política de rastreo.
Un llms.txt útil tiene cinco partes:
# llms.txt - AI/LLM Crawling Instructions for example.com
# About
> example.com is a [one-line description of what the site is and who it is for].
# Key pages
- [Product directory](https://example.com/categories)
- [Pricing](https://example.com/pricing)
- [Blog](https://example.com/blog)
- [Latest launches](https://example.com/trending)
# Crawling permissions
## Allowed
- Homepage, product pages, blog articles, categories, legal pages
## Restricted
- API endpoints, dashboard, settings, admin areas
# Usage policy
- AI training: with attribution
- Indexing and retrieval: allowed
- Attribution: cite "according to example.com"
# Contact
- Website: https://example.com
- Sitemap: https://example.com/sitemap.xml
Adáptalo a tus rutas reales. El error más común es publicar una plantilla que describe un sitio que no tienes: las rutas obsoletas son peores que ningún archivo.
No dejes que llms.txt se convierta en una excusa
La convención es seductora porque se siente como un interruptor que puedes accionar. No lo es. Un modelo que recupera páginas en vivo leerá tus páginas, no tu manifiesto. Publica llms.txt por la claridad de atribución, y luego ve a hacer el trabajo a nivel de página.
Paso 3: Haz que las páginas sean citables
Aquí es donde realmente se ganan las citas. Los sistemas de recuperación extraen declaraciones autocontenidas, así que estructura tus páginas para entregárselas.
- Respuesta de una frase al principio. El primer párrafo después del título debe definir la cosa en una sola frase, en lenguaje declarativo claro. Esa frase es la que se extrae en una respuesta.
- Encabezados con forma de pregunta. Usa la formulación que la gente realmente escribe — "¿Cuánto cuesta X?", "¿Es X mejor que Y?" — para que el encabezado y la respuesta se alineen.
- Tablas comparativas. Las tablas se corresponden directamente con preguntas de comparación y se citan de forma desproporcionada. Mantenlas estrechas (3–4 columnas) y completas.
- Una FAQ real. De cinco a ocho preguntas genuinas con respuestas directas. No texto de marketing en forma de pregunta.
- Fechas y versiones. "A partir de julio de 2026" le dice a un sistema de recuperación que la página está actualizada. Las páginas sin fecha compiten mal contra las que tienen fecha.
- Datos que coinciden en todas partes. El mismo nombre de producto, el mismo eslogan, la misma categoría, la misma URL canónica en tu sitio, tus listados en directorios y tus perfiles. La inconsistencia reduce la confianza de un modelo, y los modelos seguros de sí mismos nombran productos.
Paso 4: Dale una razón para preferir tu dominio
La rastreabilidad hace que te consideren; la credibilidad hace que te citen. Los insumos no son glamurosos y se acumulan:
- Listados permanentes y relevantes. Las páginas de directorio estructuradas son fáciles de analizar y se usan con frecuencia como fuentes (backlinks dofollow de directorios).
- Menciones en sitios autorizados y relevantes. Dónde aparece una mención pesa más que cuántas existen (domain rating y visibilidad en IA).
- Consistencia entre páginas. Los mismos datos en todas partes, para que nada tenga que reconciliarse.
- Frescura. Actualiza tus páginas clave con un calendario real; la recuperación favorece el contenido actual (el manual de GEO/AIEO).
Una lista de verificación de 90 minutos
Haz eso una vez, y el trabajo continuo es solo la frescura.
FAQ
¿Necesito llms.txt para que los asistentes de IA me citen?
No. Es una convención opcional sin lectores garantizados. Las páginas rastreables y el contenido extraíble son lo que realmente hace que te citen; trata llms.txt como un bono de bajo coste para la claridad de atribución.
¿Debería bloquear GPTBot o ClaudeBot?
Solo si deliberadamente no quieres que tu contenido se use para entrenamiento. Bloquear los rastreadores de entrenamiento reduce la frecuencia con la que los modelos aprenden tu asociación de categoría; por lo general, no impide que los agentes de obtención en vivo lean tus páginas en una respuesta. Si tu objetivo es que te recomienden, permitir ambos es el valor predeterminado pragmático.
¿Cuál es la diferencia entre ClaudeBot y Claude-User?
ClaudeBot es el rastreador de Anthropic, usado para construir y actualizar datos de entrenamiento. Claude-User es el agente que obtiene una página porque una persona le preguntó a Claude sobre ella ahora mismo. Bloquear el segundo te elimina de las respuestas en vivo mientras deja el entrenamiento intacto.
¿Google-Extended afecta a mi posicionamiento en búsquedas?
No. Google-Extended controla si el contenido rastreado por Google puede usarse para el entrenamiento de Gemini y Vertex AI. La indexación y el posicionamiento de la Búsqueda de Google se rigen por las reglas normales de Googlebot.
¿Cuánto tiempo hasta que vea resultados?
La recuperación en vivo puede reflejar una página nueva, indexada y bien estructurada en cuestión de días. Las asociaciones de datos de entrenamiento se construyen a lo largo de meses, a medida que se acumulan menciones creíbles en toda la web. Esa asimetría es exactamente la razón por la que haces el trabajo técnico ahora.
Haz que tu sitio sea fácil de citar: lista tu producto en aat.ee para conseguir un listado dofollow permanente que los rastreadores y asistentes puedan leer de verdad, o compara los niveles de directorio y GEO.