Técnico

Cómo funcionan realmente los rastreadores de IA en 2026

Cada plataforma de IA importante envía rastreadores a buscar contenido web. Esos rastreadores alimentan los sistemas que generan las respuestas que ven tus compradores. Entender cómo funcionan es la base de cualquier estrategia de GEO o visibilidad en IA.

El panorama no es un solo tipo de bot. Hay rastreadores de entrenamiento que construyen el conocimiento general de un modelo, bots de citación que buscan una respuesta puntual en el momento de la consulta, y fetchers activados por el usuario que se disparan porque una persona real está esperando una respuesta ahora mismo.

Esta guía repasa qué rastreadores visitan realmente tu sitio, qué obtienen y qué se pierden, por qué tantas apps de una sola página parecen vacías para ellos, y una lista práctica para hacer que tu sitio sea genuinamente rastreable.

Los rastreadores que de verdad visitan tu sitio

Antes de optimizar nada, ayuda saber quién está llegando y con qué propósito. Estos son los rastreadores de IA que ve la mayoría de los sitios.

GPTBot (OpenAI, entrenamiento)

GPTBot rastrea páginas para ayudar a entrenar y actualizar los modelos detrás de ChatGPT. Se identifica con el user agent GPTBot, respeta robots.txt y no ejecuta JavaScript. Lee la respuesta HTML sin procesar y extrae texto, encabezados y cualquier dato estructurado que encuentre ahí.

ClaudeBot (Anthropic, entrenamiento)

ClaudeBot obtiene contenido para los modelos de Anthropic. También lee HTML sin procesar sin ejecutar JavaScript. Anthropic publica los rangos de IP de su rastreador, que muchos sitios usan para verificar el bot en lugar de confiar solo en el string del user agent.

OAI-SearchBot y PerplexityBot (citación, tiempo real)

OAI-SearchBot y PerplexityBot funcionan distinto a un rastreador de entrenamiento. A menudo obtienen una página en el momento exacto en que alguien hace una pregunta, buscando una respuesta concreta y citable. Aquí no hay periodo de gracia. Si la página no se puede leer en esa obtención, el motor de respuestas no tiene nada que citar de ella.

ChatGPT-User, Claude-User y Perplexity-User (fetches activados por el usuario)

Estos no son rastreadores autónomos. Se activan cuando una persona le pide a ChatGPT, Claude o Perplexity que abra o lea una página específica durante una conversación. Técnicamente se comportan como los rastreadores anteriores (una obtención HTTP, sin JavaScript), pero representan a una persona real esperando una respuesta en ese momento.

El rastreador de IA de Google y la excepción de JavaScript

Google usa un rastreador separado para sus sistemas de IA, distinto del Googlebot clásico. A diferencia de la mayoría de los rastreadores de IA, el rastreador de IA de Google y el de Apple pueden renderizar JavaScript en al menos algunos casos, de forma parecida a como Googlebot lleva años poniendo páginas en cola para renderizarlas. Eso los convierte en la excepción, no en la regla. No asumas que un rastreador de IA va a ejecutar tu JavaScript.

Bots de entrenamiento vs bots de citación: un trabajo distinto

El panorama de rastreadores de IA se divide en dos trabajos distintos. Los rastreadores de entrenamiento como GPTBot y ClaudeBot obtienen páginas en su propio calendario para construir o actualizar el conocimiento base de un modelo. Lo que leen hoy puede no aparecer en una respuesta durante meses, si es que aparece.

Los bots de citación como OAI-SearchBot y PerplexityBot, junto con los fetchers activados por el usuario como ChatGPT-User y Claude-User, trabajan en el momento de la consulta. Obtienen una página porque alguien hizo una pregunta justo ahora, y lo que encuentran en esa única obtención se convierte en la fuente, o se descarta, para esa respuesta concreta.

  • Los bots de entrenamiento moldean el conocimiento a largo plazo. Una página corregida hoy puede no cambiar de inmediato una respuesta alimentada por un bot de entrenamiento. Estos rastreadores corren en su propio ciclo.
  • Los bots de citación deciden la próxima respuesta. Una página rota, bloqueada o solo en JavaScript justo en el momento en que un bot de citación la obtiene puede perder esa cita puntual, aunque el contenido sea genuinamente bueno.
  • Ambos necesitan la misma base. Ninguno de los dos tipos se beneficia de contenido que solo existe después de correr un script. Arregla el problema de renderizado una vez y ambos tipos de rastreador se benefician.

Por qué casi ninguno ejecuta JavaScript

Un rastreador de IA es, en esencia, un cliente HTTP. Envía una solicitud, recibe una respuesta y lee lo que llegó. No hay motor de navegador debajo, ni DOM, ni runtime de JavaScript para GPTBot, ClaudeBot, PerplexityBot u OAI-SearchBot. Lo que tu servidor devuelve en esa primera respuesta es toda la página, en lo que respecta al rastreador.

Esto es distinto de cómo ha funcionado Googlebot durante años, donde una cola de renderizado separada eventualmente ejecuta JavaScript y vuelve a visitar la página. La mayoría de los rastreadores de IA no tienen un equivalente de esa segunda pasada. Lo que obtienen en la primera obtención es lo que obtienen.

Por qué las apps de una sola página con renderizado en el cliente se ven vacías

Una app en React, Vue o similar renderizada en el cliente normalmente entrega una carcasa HTML, como un div casi vacío y una etiqueta de script. Un navegador descarga esa carcasa, ejecuta el JavaScript y construye la página visible. Un rastreador de IA se detiene en la carcasa. Tu titular, la descripción del producto y el contenido de preguntas frecuentes técnicamente nunca existieron para esa obtención.

Los frameworks que soportan renderizado en servidor tampoco son automáticamente seguros. Una página de Next.js construida con componentes de servidor o generación estática envía contenido completo en la primera respuesta. La misma app con una página que obtiene datos en el cliente después de la carga inicial se comporta como una app de una sola página normal en esa ruta concreta. El modo de renderizado es una decisión por página, no una garantía por framework.

Robots.txt y sitemaps: cómo deciden los rastreadores qué obtener

Antes de leer tu contenido, un rastreador de IA suele revisar robots.txt para ese user agent. La mayoría de los rastreadores de IA importantes respetan estas directivas, así que una regla Disallow realmente mantiene fuera a un rastreador que las respeta. Ese control funciona en ambos sentidos. Una regla copiada de una plantilla, o una anulación de robots.txt añadida automáticamente por un CDN o proveedor de hosting, puede bloquear en silencio a un bot de citación al que sí quieres llegar.

Los sitemaps ayudan a los rastreadores a descubrir páginas más rápido y a priorizar qué obtener. Un sitemap preciso y actualizado que refleje tu estructura real de URLs reduce la probabilidad de que una página quede sin descubrir durante meses.

  • Revisa robots.txt para tus user agents de IA reales. No solo Googlebot. Busca específicamente GPTBot, ClaudeBot, PerplexityBot y OAI-SearchBot.
  • Vigila las anulaciones a nivel de CDN o hosting. Algunas plataformas inyectan sus propias reglas de robots.txt por encima de las tuyas, a veces bloqueando bots de citación por defecto sin avisarte.
  • Mantén tu sitemap preciso. Elimina URLs muertas, añade páginas nuevas con prontitud y asegúrate de que el sitemap sea accesible y esté referenciado desde robots.txt.

Una lista práctica para hacer tu sitio rastreable

  • Obtén tus propias páginas como un rastreador. Ejecuta algo como curl con el user agent de un rastreador de IA y lee la respuesta sin procesar. Si tu titular y datos clave no están en esa salida, un rastreador de IA tampoco puede verlos.
  • Sirve el contenido principal en la primera respuesta. El renderizado en servidor o la generación estática ponen tu texto real, encabezados y preguntas frecuentes en el HTML que un rastreador realmente recibe, sin necesitar JavaScript.
  • Mantén los datos estructurados en el HTML inicial. El JSON-LD y el markup de schema en el head deben renderizarse en el servidor, incluso en páginas donde parte del contenido del body se renderiza en el cliente.
  • Confirma que robots.txt permite a los rastreadores que quieres. Verifícalo para los nombres exactos de los bots, no solo con una regla genérica con comodín, y revísalo de nuevo tras cualquier cambio de CDN o plataforma.
  • Mantén tu sitemap actualizado y enlazado desde robots.txt. Esto ayuda a los rastreadores a encontrar páginas nuevas y actualizadas sin depender del descubrimiento incidental.
  • Prioriza las páginas que más importan. Inicio, páginas de producto o servicio, y contenido de comparación son las páginas que los bots de citación tienen más probabilidad de obtener cuando alguien hace una pregunta de compra.

Preguntas frecuentes: cómo funcionan los rastreadores de IA

¿Los rastreadores de IA como GPTBot ejecutan JavaScript?

No, los principales no. GPTBot, ClaudeBot, PerplexityBot y OAI-SearchBot obtienen HTML sin procesar y no corren un motor de JavaScript. El rastreador de IA de Google y el de Apple son excepciones conocidas que pueden renderizar JavaScript en al menos algunos casos, pero no debes asumir que cualquier rastreador de IA va a ejecutar tus scripts.

¿Cuál es la diferencia entre GPTBot y OAI-SearchBot?

GPTBot rastrea en su propio calendario para ayudar a entrenar y actualizar los modelos de OpenAI. OAI-SearchBot obtiene páginas en el momento en que alguien hace una pregunta, buscando una respuesta concreta para citar en esa respuesta. Uno moldea el conocimiento a largo plazo, el otro moldea la próxima respuesta.

¿Cómo puedo revisar qué ve realmente un rastreador de IA en mi página?

Obtén la página tú mismo con una solicitud HTTP simple usando el user agent de un rastreador de IA, por ejemplo con curl, y lee la respuesta sin procesar. Si tu titular, datos clave o preguntas frecuentes faltan en esa salida, el rastreador tampoco puede verlos.

¿Puedo bloquear rastreadores de IA con robots.txt?

Sí. La mayoría de los rastreadores de IA importantes respetan las directivas de robots.txt para su user agent específico. Esto también significa que una regla Disallow accidental, a veces añadida automáticamente por un CDN o plataforma de hosting, puede bloquear un bot de citación sin que te des cuenta.

¿Los rastreadores de entrenamiento y los bots de citación son lo mismo?

No. Los rastreadores de entrenamiento como GPTBot y ClaudeBot construyen o actualizan el conocimiento general de un modelo en su propio calendario. Los bots de citación como OAI-SearchBot y PerplexityBot, junto con fetchers activados por el usuario como ChatGPT-User, normalmente obtienen una página en tiempo real para respaldar una respuesta concreta.

¿Quieres ver qué rastreadores de IA están llegando realmente a tu sitio, y qué obtienen cuando lo hacen?