Seny Digital

Los rastreadores de IA, uno por uno: a quién dejáis entrar en vuestra web

OpenAI y Anthropic tienen tres rastreadores cada uno y hacen cosas distintas. Qué se pierde bloqueando el que no toca, y un robots.txt de ejemplo comentado.

Publicado por Seny Digital el Cómo escribimos esto

Seis nombres conviven en un robots.txt pensado para la IA, y cada uno lee la web para una cosa distinta. Uno entrena un modelo que se publicará dentro de meses. Otro va a buscar una página concreta porque alguien acaba de preguntarle algo a un asistente, ahora mismo. Un tercero indexa para un buscador propio. Meterlos a todos en el mismo saco —«los bots de IA»— es la manera más rápida de bloquear el que no tocaba.

Por qué hay más de uno

Entrenar, responder e indexar son tres trabajos que no se parecen. Entrenar significa guardar el texto para ajustar un modelo que se publicará meses o años después; nadie nota ese rastreo porque no deja ni una visita, ni una mención, ni una línea en ningún registro que podáis consultar. Responder ocurre en el mismo segundo en que una persona le pide a un asistente que lea algo, y si esa lectura falla, la respuesta sale coja delante de quien preguntaba, con vuestra web citada mal o directamente ignorada. Indexar es el tercero, el más parecido a lo que ya conocéis de Google: construir un índice propio para devolver resultados cuando alguien busca dentro de esa herramienta, con la ventaja de que ahí sí hay resultado visible y clic posible.

Confundir estos tres trabajos lleva a decisiones que se toman una sola vez y se olvidan durante meses. Un robots.txt no avisa cuando algo va mal: si bloqueáis el rastreador equivocado, el sitio sigue funcionando exactamente igual, solo que una puerta que queríais abierta se ha quedado cerrada sin que nadie lo note. OpenAI y Anthropic han resuelto este problema con un rastreador para cada trabajo, y los dos lo documentan por escrito, con el nombre exacto de cada uno. Quien bloquea de un plumazo todo lo que lleve «bot» en el nombre deja que la decisión la tome el primer tutorial que encontró.

Los tres de OpenAI

OAI-SearchBot es el que importa si os interesa aparecer en los resultados de búsqueda dentro de ChatGPT: bloquearlo os saca de ahí. GPTBot es el que entrena los modelos futuros de OpenAI, sin relación con lo anterior. ChatGPT-User sale a buscar una página en el instante en que una persona se la ha pedido a ChatGPT: es una petición puntual, distinta de un rastreo programado, y bloquearlo rompe esa respuesta concreta.

La documentación de bots de OpenAI lo deja literal: cada ajuste es independiente de los demás, y pone el ejemplo exacto de un sitio que permite OAI-SearchBot para salir en resultados de búsqueda mientras bloquea GPTBot. Se pueden combinar los tres de maneras distintas según lo que cada sitio quiera permitir, y esa es precisamente la gracia del diseño: nadie os obliga a tratarlos como un bloque. OpenAI recomienda permitir OAI-SearchBot y deja los otros dos a criterio de cada sitio.

Los tres de Anthropic

La misma lógica, con otros tres nombres. ClaudeBot entrena. Claude-User recupera una página cuando alguien le pregunta algo a Claude que necesita leerla primero, igual que ChatGPT-User en el caso de OpenAI. Claude-SearchBot indexa para los resultados de búsqueda de Claude, el equivalente exacto de OAI-SearchBot. Los tres se comportan como piezas sueltas: se puede permitir uno y bloquear otro sin que se toquen entre sí, y Anthropic declara que los tres respetan las directivas estándar del robots.txt. Lo explica la propia Anthropic, con el nombre exacto de cada uno y qué desactiva bloquearlo.

Si comparáis las dos listas, el patrón se repite letra por letra: un rastreador de entrenamiento, uno de búsqueda propia y uno que actúa por encargo de una persona concreta. Ese patrón viene de separar tres obligaciones que, mezcladas en un único robots.txt sin distinguirlas, acaban resolviéndose todas con el mismo Disallow.

Google-Extended, que no es lo que parece

Google-Extended suena a que gobierna toda la relación entre vuestra web y la IA de Google. En realidad decide una sola cosa: si vuestro contenido entra a entrenar los modelos de Google. La Búsqueda normal y las respuestas con IA que aparecen dentro de ella siguen su propio camino, sin mirar esta directiva para nada.

Ese camino tiene su propio interruptor, y vive en Search Console: es la casilla de incluir o excluir contenido de las funciones de IA generativa, con un comportamiento distinto al de Google-Extended y consecuencias distintas si la tocáis. Lo tenéis explicado en cómo excluir vuestra web de la IA de Google.

Lo que se pierde bloqueando el que no toca

Aquí está el error que de verdad cuesta caro: bloquear de golpe todo lo que suene a IA, sin haber decidido nunca, en serio, quedaros fuera de la búsqueda de ChatGPT o de Claude. Alguien copia un robots.txt genérico de un foro, ve seis nombres raros y los tira todos con Disallow: /, convencido de que está protegiendo el sitio de un raspado indiscriminado. Lo que ha hecho, en realidad, es apagar OAI-SearchBot y Claude-SearchBot a la vez que GPTBot. Esos dos primeros no entrenaban nada. Eran vuestra entrada a un resultado de búsqueda dentro de esas herramientas, y esa entrada se ha cerrado sin que nadie lo decidiera a propósito.

Bloquear estos seis rastreadores por sistema no resuelve nada por sí solo. Lo que sirve es mirar qué hace cada uno y decidir con esa información, no con el nombre. Quien no distingue ChatGPT-User de GPTBot antes de tocar el robots.txt está resolviendo un problema que no ha entendido, y eso se nota después, cuando alguien pregunta por qué el negocio no sale citado en ningún sitio y la respuesta estaba en un fichero de texto que nadie volvió a mirar.

Un robots.txt de ejemplo

Este es el que publica esta misma web, en public/robots.txt, así que se puede comprobar en vivo en cualquier momento:

User-agent: *
Allow: /

# Rastreadores de IA que citan la fuente. Se permiten a propósito: uno bloqueado no puede citar lo
# que no ha leído, y ninguno de estos influye en el posicionamiento de la Búsqueda de Google.
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: GPTBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Applebot-Extended
Allow: /

# Google-Extended solo decide si el contenido alimenta a Gemini; no toca la Búsqueda ni los
# resúmenes de IA que salen en ella. Se permite por el mismo motivo que los de arriba.
User-agent: Google-Extended
Allow: /

# Estos raspan para entrenar y no devuelven ni una visita ni una mención.
User-agent: Bytespider
Disallow: /

User-agent: CCBot
Disallow: /

Sitemap: https://senydigital.com/sitemap-index.xml

Los seis rastreadores que hemos ido viendo van permitidos, uno por uno, con el comentario que explica por qué se ha decidido así. PerplexityBot y Applebot-Extended entran por el mismo razonamiento, cada uno con su casa detrás. Los dos últimos —Bytespider y CCBot— van bloqueados por un motivo distinto al de todo lo anterior: alimentan conjuntos de entrenamiento genéricos sin citar ni devolver nada identificable, así que no hay nada que perder cerrándoles la puerta.

Este bloque conviene leerlo línea por línea antes de copiarlo, entender qué hace cada una y guardar el porqué en algún sitio, para poder cambiar una sola sin arrastrar las otras cinco la próxima vez que alguien lo retoque. Si queréis que alguien revise el vuestro con ese mismo criterio, así trabajamos la visibilidad en asistentes de IA.

¿Os habéis atascado en algún paso?

Trabajamos el SEO local y las fichas de Google para empresas del Camp de Tarragona. Contadnos dónde estáis y os decimos qué falta.