¿Qué es un AI crawler (GPTBot, ClaudeBot, PerplexityBot) y por qué debes permitirle acceso?
Un AI crawler es un programa automático que visita tu sitio para que una IA entrene modelos, indexe páginas o responda consultas. GPTBot, ClaudeBot y PerplexityBot son los nombres con que OpenAI, Anthropic y Perplexity se identifican ante tu servidor. Si los bloqueas sin querer, tu marca pierde oportunidades de aparecer en respuestas de IA.
¿Qué es un AI crawler y en qué se diferencia de un rastreador de buscador tradicional?
Un rastreador tradicional, como el de Google, recorre tu sitio para ordenar enlaces en una página de resultados. Un AI crawler lee tu contenido con otro propósito: alimentar modelos de lenguaje o construir las fuentes que una IA cita al responder.
La diferencia práctica es el resultado. Un buscador te devuelve una lista de enlaces y el usuario decide cuál abrir. Un asistente de IA redacta una respuesta y menciona unas pocas fuentes. Si tu sitio no está entre las páginas que el sistema pudo leer, es difícil que aparezcas ahí.
Ambos tipos de bot se rigen por el archivo robots.txt, que vive en la raíz de tu dominio (por ejemplo, tusitio.com.mx/robots.txt). Cada empresa de IA usa varios bots distintos, y cada uno se controla por separado. Ahí está el origen de la mayoría de los bloqueos accidentales.
¿Qué hacen GPTBot, ClaudeBot y PerplexityBot?
Cada bot cumple una de tres funciones: entrenamiento, índice de búsqueda o consulta en vivo. Conviene distinguirlas, porque permitir una no obliga a permitir las otras.
- Entrenamiento: GPTBot (OpenAI) y ClaudeBot (Anthropic) recopilan contenido que puede usarse para entrenar modelos.
- Índice de búsqueda: OpenAI usa OAI-SearchBot para mostrar sitios en la búsqueda de ChatGPT. Anthropic tiene Claude-SearchBot y Perplexity tiene PerplexityBot.
- Consulta en vivo: ChatGPT-User, Claude-User y Perplexity-User visitan una página cuando una persona hace una pregunta que la requiere.
Hay matices de cumplimiento. Anthropic indica que sus tres bots respetan robots.txt. OpenAI advierte que las reglas de robots.txt pueden no aplicar a ChatGPT-User. Perplexity dice que Perplexity-User responde a solicitudes de usuarios y, según otras fuentes, suele ignorar robots.txt.
¿Qué pasa si bloqueas a los AI crawlers y cómo saber si ya lo haces?
Bloquear los bots de búsqueda reduce tus posibilidades de ser citado. OpenAI señala que los sitios que se excluyen de OAI-SearchBot no aparecen en las respuestas de búsqueda de ChatGPT. Anthropic advierte que bloquear a Claude-SearchBot puede reducir tu visibilidad en sus resultados. En la práctica, tu marca queda fuera de la conversación cuando alguien pregunta por tu categoría.
Muchos bloqueos no son decisiones, sino herencias de una regla general o de un plugin de seguridad. Revisa estos cuatro puntos:
- robots.txt: busca líneas como
User-agent: *seguida deDisallow: /, o reglas que nombren a los bots. - CDN o WAF: revisa las reglas de bots y los desafíos automáticos en tu proveedor.
- Plugins de seguridad: en WordPress, algunos bloquean agentes desconocidos de fábrica.
- Logs del servidor: cuenta las visitas de cada bot y revisa si reciben códigos 403 o 429.
Para medir visitas en logs, este comando cuenta las solicitudes por bot:
grep -Eio "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|PerplexityBot" access.log | sort | uniq -c
Un user-agent puede falsificarse, así que compara las IP con los rangos que publica cada empresa.
¿Cómo permitirles acceso paso a paso?
Edita tu robots.txt y agrega un grupo por cada bot que quieras admitir. Este ejemplo abre tu sitio a los siete agentes mencionados:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://tusitio.com.mx/sitemap.xml
Para verificarlo, sigue esta lista de cinco puntos:
- Abre tusitio.com.mx/robots.txt en el navegador y confirma que muestra tus cambios.
- Revisa que ninguna regla de CDN o WAF bloquee a esos bots.
- Haz una prueba con
curl -A "GPTBot" -I https://tusitio.com.mxy confirma que responde 200. - Espera hasta un día, porque Perplexity indica que los cambios pueden tardar hasta 24 horas.
- Repite el comando de logs y comprueba que aparecen visitas con respuesta 200.
¿Conviene permitir todo?
No necesariamente. Permitir el acceso no significa abrir cada carpeta, y puedes decidir por ruta. Un criterio razonable es dejar abierto lo que quieres que se cite (blog, guías, páginas de producto) y cerrar lo demás.
Ejemplos de rutas que suelen restringirse: áreas de cliente, carritos y pagos, paneles de administración y contenido de pago. Con el mismo formato puedes cerrar solo esas carpetas:
User-agent: OAI-SearchBot
Allow: /
Disallow: /cuenta/
Disallow: /checkout/
Dos cuidados adicionales. Primero, robots.txt solo comunica preferencias y no autentica a nadie; no sirve como sistema de autorización, así que protege lo privado con inicio de sesión. Segundo, un grupo con nombre propio no hereda las reglas de User-agent: *, por lo que debes repetir ahí tus restricciones.
Sobre entrenamiento frente a visibilidad, OpenAI describe cada ajuste como independiente. Puedes permitir OAI-SearchBot para aparecer en ChatGPT y bloquear GPTBot para no aportar datos de entrenamiento. Si tu prioridad es ser citado, deja abiertos los bots de búsqueda y de consulta en vivo; la decisión sobre los de entrenamiento depende de tu política de contenido.
¿Basta con permitir el acceso?
No. El acceso es solo el requisito de entrada, y ninguna práctica asegura que una IA te cite. Estos elementos ayudan a que los bots entiendan tu contenido:
- Sitemap: declara tu sitemap en robots.txt para que los bots descubran tus páginas. Esa y otras recomendaciones para Claude-SearchBot coinciden en este punto.
- HTML legible: el contenido principal debe estar en el HTML inicial, no cargarse solo con JavaScript.
- Contenido claro: títulos descriptivos, respuestas directas y datos verificables facilitan que una IA extraiga la información.
- llms.txt: es un archivo opcional que resume tu sitio para modelos de lenguaje. Úsalo como complemento, sin esperar resultados concretos.
Una vez abierto el acceso, conviene medir qué ocurre. Menciones.ai, plataforma de visibilidad de marca en IA, monitorea menciones en ChatGPT, Gemini, AI Overviews, Grok, Claude y Perplexity , lo que permite comprobar si tus cambios se reflejan en las respuestas.
Preguntas frecuentes
¿Bloquear GPTBot impide que ChatGPT me cite?
No por sí solo. GPTBot se relaciona con entrenamiento, mientras que la búsqueda de ChatGPT depende de OAI-SearchBot. Revisa que ambos tengan la regla que quieres.
¿Permitir a los AI crawlers afecta mi SEO en Google?
Las reglas para estos bots son independientes de las de Googlebot. Agregar grupos para GPTBot o ClaudeBot no modifica lo que Googlebot puede rastrear.
¿Cada cuánto debo revisar mi robots.txt?
Conviene revisarlo cuando cambies de CDN, plugin de seguridad o plantilla, y de forma periódica con tus logs. Los nombres de los bots también cambian: Anthropic, por ejemplo, dejó atrás agentes anteriores como Claude-Web y anthropic-ai.