5 min read

Leer los registros del rastreador de IA: qué solicita realmente GPTBot

Los rastreadores de IA dejan patrones muy legibles en los registros de tu servidor. Cómo segmentar los bots, qué significa el patrón de rastreo de cada uno y las dos preguntas que vale la pena responder antes de tocar una herramienta de GEO.

GEOAI CrawlersTechnical SEOLogs
Leer los registros del rastreador de IA: qué solicita realmente GPTBot

La mayoría de los consejos sobre GEO empiezan por el contenido. Nosotros creemos que deberían empezar por los logs, porque tu servidor ya guarda el conjunto de datos más barato en visibilidad de IA: un registro con marca temporal de qué bots de asistentes accedieron a qué páginas, con qué frecuencia y en qué orden. Leerlo responde a dos preguntas que ningún panel puede responder — ¿nos está leyendo de verdad la IA de alguien? y ¿qué considera que merece la pena consultar?

Esta es la continuación práctica de nuestra guía sobre crawlers de IA. El mismo reparto de personajes; esta vez miramos qué hacen después del apretón de manos.

Primero: segmenta los bots, o los datos son ruido

El error habitual es tratar el "tráfico de IA" como un solo bloque. Los bots no se comportan ni remotamente igual, y mezclarlos produce promedios que no significan nada.

  • Crawlers de entrenamiento — GPTBot, ClaudeBot, anthropic-ai, Google-Extended, CCBot — rastrean de forma constante y amplia. Sus consultas alimentan los pesos de futuros modelos, no las respuestas de hoy.
  • Crawlers de búsqueda — OAI-SearchBot, PerplexityBot — construyen el índice del que citan las respuestas respaldadas por búsqueda. Estos son aquellos cuya atención quieres en las páginas nuevas esta semana.
  • Fetchers activados por el usuario — ChatGPT-User, Claude-User, Perplexity-User — consultan una página solo cuando la conversación de un usuario concreto la necesita. Cada impacto aquí es un recibo: una persona real preguntó por ti ahora mismo.

Los comandos

Sobre cualquier log de acceso (el formato nginx/Caddy sirve), una primera pasada:

# All AI crawler hits in the current log, newest last
grep -E "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|anthropic-ai|PerplexityBot|Perplexity-User|Google-Extended" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

Eso te da el ranking de volumen bruto. El corte interesante es bot × ruta:

# Which pages each bot fetches
grep "GPTBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

Dos patrones que buscar. Un crawler de entrenamiento que consulta /robots.txt y luego una distribución amplia y uniforme de páginas está indexando. Un crawler de búsqueda que consulta /, tu sitemap y luego un conjunto reducido de páginas específicas está siguiendo la relevancia — y las páginas que ignora son las que no considera citables.

Tres patrones que merece la pena diagnosticar

1. El bot de búsqueda nunca aparece. Si OAI-SearchBot o PerplexityBot tienen cero impactos durante un mes, las causas habituales son una lista de permitidos en robots.txt copiada de una plantilla antigua (deniega el patrón genérico bajo el que se engloban), o un sitio que cambia poco — los índices de búsqueda se saltan los sitios estáticos. La solución es el trabajo de robots.txt y llms.txt, más una cadencia de actualización visible.

2. Los impactos activados por el usuario se disparan en días en los que no hiciste nada. ChatGPT-User y Perplexity-User solo consultan cuando la conversación de un usuario en vivo necesita la página. Una ráfaga sin que hayas publicado nada por tu parte suele significar que alguien compartió o comentó tu producto — tráfico de comunidad que el panel de analítica no etiquetará como tal. Merece la pena hacer grep de tus referrers ese mismo día.

3. El crawler de entrenamiento consulta tus páginas privadas. Si GPTBot está accediendo a /dashboard o /settings, tu robots.txt no dice lo que crees que dice — una línea User-agent con una errata desactiva silenciosamente todo el grupo. Nuestra plantilla de robots.txt mantiene bloqueadas las rutas privadas mientras deja abiertas las páginas relevantes para citas.

Dos advertencias honestas

Las cadenas de user-agent son afirmaciones, no identidades. Cualquiera puede hacer curl con User-agent: GPTBot. Para fines de conteo esto está bien; para la paranoia de "¿un competidor ha raspado todo mi sitio?", verifica la propiedad como documentan los principales proveedores (DNS inverso para los que lo admiten) antes de sacar conclusiones.

El volumen no es un KPI. Un crawler de entrenamiento que consulta 4.000 páginas te dice que estás en la dieta de un modelo futuro. El número que paga el alquiler es el recuento de consultas activadas por el usuario y de búsqueda en las páginas que convierten — esa es la parte del pipeline donde una consulta hoy puede convertirse en un visitante mañana.

Las dos preguntas

Ejecuta la segmentación una vez, responde a estas y sabrás más que la mayoría de los sitios que han pagado una suscripción a GEO:

  1. ¿Los bots respaldados por búsqueda consultan mis páginas nuevas en cuestión de días tras publicarlas? Si no, el índice que alimenta las respuestas citables no sabe que existes.
  2. ¿Qué páginas no consultan nunca los bots de búsqueda? Esas páginas son invisibles para los asistentes, por muy bueno que sea su contenido.

Ambas soluciones son poco glamurosas — correcciones de robots.txt, enlaces internos, una cadencia de actualización —, que es exactamente por lo que merece la pena leer los logs antes que nada.

¿Has creado algo nuevo?

Lánzalo en aat.ee y hazte descubrir

Listado dofollow permanente en un directorio indexado
Nombrado y citado por asistentes de IA
Envía tu proyecto