Configurar robots.txt para crawlers de IA
Un recorrido práctico por GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended y el resto: qué hace cada uno, y un robots.txt que puedes usar de verdad.
La mayoría de los sitios bloquean crawlers de IA por accidente, a través de una regla de WAF heredada o una plantilla de robots.txt copiada, o permiten todo sin pensar para qué sirve realmente cada bot. Esta guía soluciona ambos casos.
Comprobar mi acceso de crawlersDos tipos de crawler de IA, no uno
Las empresas de IA operan al menos dos tipos distintos de crawler, y tratarlos como una sola cosa es el error de robots.txt más común. Los crawlers de entrenamiento, como GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) y CCBot (Common Crawl, usado indirectamente por muchos modelos), visitan tu sitio según su propio calendario para recopilar datos para una futura versión del modelo. Bloquear uno no elimina nada ya aprendido en un rastreo anterior; solo te excluye del siguiente.
Los crawlers de recuperación en tiempo real funcionan de otra forma: OAI-SearchBot y ChatGPT-User (OpenAI), PerplexityBot (Perplexity), y las recuperaciones conectadas a búsqueda que hacen Claude y Gemini, se ejecutan todos en el momento en que un usuario hace una pregunta que necesita tu página ahora mismo. Bloquearlos tiene un efecto inmediato: el motor no puede leer tu página para esa respuesta, punto, aunque tu contenido fuera exactamente lo que necesitaba.
Por eso una regla general de 'bloquear todos los bots' suele ser un error, y una regla general de 'permitir todo' sin pensarlo también lo es. Un robots.txt bien hecho trata a cada crawler según lo que hace: permite los que generan citas y respuestas en tiempo real, y toma una decisión deliberada e informada, no una por defecto, sobre los dedicados solo al entrenamiento.
Qué decidir antes de editar robots.txt
Sabe qué tipo estás bloqueando
Antes de prohibir nada, comprueba si es un crawler de entrenamiento, que solo afecta a futuras versiones del modelo, o un recuperador en tiempo real, que afecta a si te citan en una respuesta ahora mismo. Ambos tienen consecuencias completamente distintas.
Verifica que el bot es real
Una cadena user-agent es solo texto — cualquiera puede enviar 'GPTBot' en una cabecera de solicitud. Para cualquier cosa más allá de una regla básica de robots.txt, como un bloqueo de WAF, verifica mediante los rangos de IP publicados o una lista de bots verificados de un CDN, no solo la cadena.
Comprueba tus logs de servidor, no solo robots.txt
robots.txt es una petición, no un candado — los bots bien educados lo respetan, pero la única forma de saber si tus reglas realmente funcionan es muestrear periódicamente los logs del servidor buscando respuestas 200 (no bloqueos silenciosos ni desafíos de WAF) de los bots que querías permitir.
Por qué vale la pena hacerlo bien
El bloqueo accidental es la norma, no la excepción
Una investigación independiente de Originality.ai encontró que GPTBot está bloqueado por más de un tercio de los 1.000 sitios web principales — y entrevistas con propietarios de sitios mostraron que muchos de esos bloqueos venían heredados de reglas WAF por defecto o plantillas copiadas, no de una decisión deliberada.
Normalmente un arreglo de cinco minutos
Una vez que sabes qué bots quieres permitir, el cambio real en robots.txt son un puñado de líneas. Lo difícil es saber qué escribir, no escribirlo.
Bloquear tiene un coste medible
Casos de estudio analizados por Hack/Hackers encontraron que los sitios que bloquearon crawlers de IA vieron después una caída notable en el tráfico de referencia procedente de motores de respuesta de IA. El crawler que bloqueas hoy es la cita que no consigues mañana.
Configura el acceso de crawlers de IA en 3 pasos
Decide bot por bot, no todo o nada
Haz una lista de qué crawlers quieres permitir. La mayoría de los sitios deberían permitir por defecto los recuperadores en tiempo real — OAI-SearchBot, ChatGPT-User y PerplexityBot — ya que bloquearlos te excluye inmediatamente de las respuestas en vivo.
Escribe reglas Allow explícitas
Añade un bloque User-agent por bot en lugar de depender de una regla comodín genérica heredada de una plantilla. Las reglas explícitas anulan los valores por defecto y hacen tu intención auditable más adelante.
Confirma con los logs del servidor
Después de desplegar, muestrea tus logs para los bots que permitiste. Busca respuestas 200, no 403 ni desafíos de WAF. Un bot que respeta robots.txt pero sigue siendo bloqueado en otra parte de tu infraestructura necesita una solución aparte.
Preguntas frecuentes sobre AI Crawler Access
¿Cuál es la diferencia entre un crawler de entrenamiento y un crawler de recuperación en tiempo real?
Un crawler de entrenamiento como GPTBot, ClaudeBot o Google-Extended recopila datos según su propio calendario para mejorar una futura versión del modelo — bloquearlo no tiene efecto en las citas que ocurren hoy. Un crawler de recuperación en tiempo real como OAI-SearchBot, ChatGPT-User o PerplexityBot se ejecuta en el momento en que la pregunta de un usuario necesita tu página — bloquearlo significa que esa respuesta concreta no puede usar tu contenido en absoluto.
¿Cómo es un robots.txt funcional para crawlers de IA?
Un ejemplo mínimo que permite los principales bots relevantes para citación: User-agent: GPTBot, Allow: /; User-agent: OAI-SearchBot, Allow: /; User-agent: ChatGPT-User, Allow: /; User-agent: ClaudeBot, Allow: /; User-agent: PerplexityBot, Allow: /; User-agent: Google-Extended, Allow: /; seguido de una línea Sitemap que apunte a tu sitemap.xml. Ajusta qué bots reciben Allow o Disallow según tu propia decisión sobre datos de entrenamiento.
¿Debería bloquear GPTBot para mantener a la IA fuera de mi contenido?
Para la mayoría de los sitios, no. GPTBot es el crawler de entrenamiento de OpenAI — bloquearlo impide que futuros modelos entrenen con contenido nuevo, pero no elimina nada ya aprendido, y no afecta a las citas en tiempo real de ChatGPT, que provienen en cambio de OAI-SearchBot y ChatGPT-User. Bloquearlo es una decisión deliberada de exclusión, no una medida de seguridad, y los datos de casos de estudio sugieren que puede costar tráfico de referencia real sin una ventaja clara para la mayoría de los editores.
¿Bloquear crawlers de IA afecta a mi posicionamiento en Google?
Bloquear GPTBot, ClaudeBot o PerplexityBot no tiene efecto directo en el posicionamiento de Google Search — Googlebot es un rastreador completamente distinto. Bloquear específicamente Google-Extended es diferente: impide que tu contenido se use en las propias funciones de IA de Google, como AI Overviews y Gemini, sin tocar tu posicionamiento normal en búsqueda, que depende de Googlebot.
¿Cómo sé si una solicitud que dice ser GPTBot es realmente GPTBot?
Nunca confíes solo en la cadena user-agent — es trivial falsificarla. Para cualquier cosa más allá de una regla básica de robots.txt, verifica con los rangos de IP publicados del crawler (OpenAI, Anthropic y otros los publican) o usa una lista de bots verificados de un CDN, como AI Crawl Control de Cloudflare, que comprueba más que solo la cabecera.
¿También necesito un archivo llms.txt?
llms.txt es una convención emergente y no oficial que algunos sitios usan para dirigir a los crawlers de IA hacia un resumen curado de su contenido. No es un estándar que ninguna gran empresa de IA haya confirmado que lee, y no sustituye a robots.txt, que es el mecanismo real de control de acceso que respetan los crawlers. Vale la pena vigilarlo, pero todavía no priorizarlo por encima de tener bien configurado tu robots.txt.
Comprueba si los crawlers de IA pueden leer tu sitio de verdad
GEO-Score inspecciona tu robots.txt, las respuestas del servidor y el contenido renderizado con JavaScript para mostrar exactamente qué bots de IA tienen acceso. Cinco comprobaciones de página por dominio son gratis cada 30 días.
Comprobar mi acceso de crawlers