¿Qué es el acceso de bots de IA?
El acceso de bots de IA mide si los crawlers de IA — GPTBot, ClaudeBot, PerplexityBot, Google-Extended, OAI-SearchBot, ChatGPT-User y otros — pueden realmente alcanzar y leer tus páginas. La verificación analiza cuatro capas: directivas en robots.txt, códigos de respuesta del servidor, bloqueo basado en IP desde CDNs y WAFs, y si el contenido está bloqueado detrás de JavaScript o muros de pago. Cada capa puede matar silenciosamente la visibilidad en IA, y muchos sitios están bloqueados en una o más sin darse cuenta.
Esta métrica es la guardiana de todo el GEO-Score. Una puntuación perfecta de 100/100 en schema, citas, frescura y estructura ofrece exactamente cero citas de IA si una sola línea Disallow en robots.txt o una regla WAF por defecto rechaza a los crawlers. Cloudflare reportó en julio de 2025 que su red ahora bloquea crawlers de IA por defecto para nuevos clientes — lo que significa que una porción significativa de la web se oscureció para la IA de la noche a la mañana.
Por qué importa el acceso de bots de IA
La búsqueda con IA es ahora una porción medible del tráfico web total, pero también es la fuente de tráfico más frágil — una sola regla mal configurada puede borrar tu presencia de ChatGPT, Claude y Perplexity simultáneamente. Tres fuerzas explican por qué el acceso de bots merece atención antes que cualquier otro trabajo GEO.
El acceso de bots es un filtro binario
Los crawlers de IA no indexan parcialmente un sitio bloqueado — lo omiten por completo. Si GPTBot, ClaudeBot o PerplexityBot recibe un 403, un Disallow en robots.txt o un desafío WAF, la página es tratada como inexistente para las respuestas de IA. No existe un resultado de "visibilidad reducida": es elegibilidad total para citas o ninguna en absoluto.
La mayoría de los bloqueos son accidentales
Originality.ai encontró que GPTBot está ahora bloqueado por el 35,7% de los 1.000 sitios web principales, pero entrevistas con propietarios de sitios muestran que muchos de esos bloqueos fueron heredados de conjuntos de reglas WAF por defecto, plantillas robots.txt copiadas y pegadas, o modos de bot-fight de CDN que clasifican a GPTBot como un scraper genérico. Pocos de estos propietarios se propusieron bloquear la IA; simplemente olvidaron permitirla.
Los crawlers de IA son agresivos — pero selectivos
Cloudflare reportó que GPTBot creció un 305% en solicitudes brutas entre mayo de 2024 y mayo de 2025, mientras que PerplexityBot creció un 157.490% desde una base pequeña. Ese volumen viene con un presupuesto: los bots priorizan sitios que responden rápido, devuelven 200s y sirven contenido en HTML inicial. Los sitios que ocasionalmente devuelven 5xx, ocultan contenido detrás de JavaScript o limitan la tasa de los bots de IA ven caer las citas incluso sin un bloqueo explícito.
Lo que dice la investigación
GPTBot aumentó su cuota de todo el tráfico de crawlers del 2,2% al 7,7%, con un incremento del 305% en solicitudes brutas en 12 meses — pasando del puesto #9 al puesto #3 entre todos los crawlers web. PerplexityBot mostró el crecimiento más explosivo, un 157.490% desde una base mínima. Sin embargo, solo el 14% de los dominios analizados tenía alguna directiva específica en robots.txt dirigida a bots de IA — dejando al otro 86% permitiendo o bloqueando el tráfico de IA de forma accidental y silenciosa.
João Tomé, Jorge Pacheco, Carlos Azevedo — From Googlebot to GPTBot: Who's Crawling Your Site in 2025, Cloudflare Blog, julio de 2025 — análisis de 3.816 dominios principales
GPTBot está ahora bloqueado por el 35,7% de los 1.000 sitios web principales, frente a solo el 5% cuando se introdujo por primera vez en agosto de 2023. El porcentaje de sitios que bloqueaban GPTBot aumentaba aproximadamente un 5% por semana en las primeras etapas tras el anuncio del bot. Muchos de estos bloqueos se heredaron de plantillas predeterminadas y reglas de CDN, en lugar de ser decisiones de política deliberadas.
Originality.ai — GPTBot Blocking Tracker, actualización de agosto de 2024 — estudio trimestral de los 1.000 sitios web principales de Quantcast desde el lanzamiento de GPTBot
El ratio de rastreo a referencia de Anthropic alcanzó un pico cercano a 500.000:1 a principios de 2025 antes de estabilizarse entre 25.000:1 y 100.000:1, mientras que el ratio de GPTBot de OpenAI se disparó a aproximadamente 3.700:1 en marzo de 2025. Este desequilibrio — los bots toman mucho más de lo que devuelven en visitas humanas — es la razón principal por la que los editores se sienten tentados a bloquear, pero para cualquier sitio que no sea una gran marca de noticias, bloquear elimina por completo la única vía hacia las citas en búsquedas con IA.
Cloudflare Radar — The crawl-to-click gap: AI bots, training, and referrals, 2025 — análisis de varios meses de los ratios de rastreo a referencia humana en toda la red de Cloudflare
Consejos rápidos para el acceso de bots de IA
Usa siempre reglas Allow explícitas por bot de IA — "User-agent: * / Allow: /" parece permisivo pero no señala intención y muchos WAFs lo anulan
Revisa el panel de tu CDN antes que robots.txt — el cambio de Cloudflare de julio de 2025 bloquea crawlers de IA por defecto para nuevos clientes, sin importar lo que diga tu robots.txt
Permite tanto bots de entrenamiento (GPTBot, ClaudeBot) como bots de búsqueda en tiempo real (OAI-SearchBot, ChatGPT-User, Claude-SearchBot, PerplexityBot) — sirven a diferentes partes del pipeline de respuestas de IA
No confíes en llms.txt como tu mecanismo principal de acceso — a finales de 2025 ningún crawler de IA importante lo lee; robots.txt sigue siendo el único estándar universalmente respetado
Renderiza contenido crítico en el servidor o vía SSG — solo Googlebot ejecuta JavaScript de forma fiable entre los crawlers principales, por lo que el contenido solo en JS es invisible para GPTBot, ClaudeBot y PerplexityBot
Muestrea tus logs de acceso semanalmente para las cadenas de user-agent de IA — una caída repentina a cero es la señal más temprana de un bloqueo accidental por una actualización de CDN o cambio de regla WAF
¿Debería bloquear GPTBot para proteger mi contenido del entrenamiento de IA?
▼
¿Cuál es el impacto de permitir bots de IA en mi GEO-Score?
▼
¿Cuál es la diferencia entre GPTBot, ChatGPT-User y OAI-SearchBot?
▼
¿Bloquear Google-Extended afecta mis rankings de Google Search?
▼
¿Por qué los bots de IA rastrean tanto mi sitio sin enviar tráfico de vuelta?
▼
¿Debería implementar un archivo llms.txt junto a robots.txt?
▼
Métricas relacionadas para explorar
Velocidad de página
Las respuestas lentas hacen que los crawlers de IA agoten el tiempo de espera — la velocidad de página convierte el acceso de "permitido" en "realmente rastreable"
Sitemap y descubribilidad
Una vez que los bots pueden acceder a tu sitio, tu sitemap y estructura de enlaces determinan qué páginas encuentran realmente
Validador de schema
El marcado de schema ayuda a los crawlers de IA a interpretar páginas accesibles — incluyendo anotaciones paywalledContent para modelos híbridos
Optimización para IA
La puntuación general que combina acceso de bots, schema, estructura y frescura en una sola señal de preparación para IA
¿Están los bots de IA realmente accediendo a tu sitio?
Ejecuta una verificación gratuita de GEO-Score para ver si GPTBot, ClaudeBot y PerplexityBot pueden leer tus páginas. El analizador inspecciona robots.txt, códigos de respuesta del servidor, comportamiento del CDN y contenido renderizado por JavaScript — diciéndote exactamente qué crawlers de IA están permitidos y cuáles están silenciosamente bloqueados.
Verifica tu acceso de bots de IA gratis