Este glosario explica en palabras sencillas todos los términos que encontrarás en un informe de GEO-Score o en cualquier otro lugar relacionado con la búsqueda con IA. Cubre cuatro grupos: los conceptos detrás de la búsqueda con IA, las 22 métricas que evaluamos, los términos técnicos y de schema.org, y los rastreadores de IA.
Cada definición es breve a propósito. Deberías poder leer una entrada y entenderla sin necesidad de leer el resto de la página.
Conceptos de búsqueda con IA y GEO
Las ideas detrás de la búsqueda con IA. Empieza aquí si todo este campo es nuevo para ti.
GEO (Generative Engine Optimization)
GEO es la práctica de estructurar tu contenido y tu presencia online para que los sistemas de IA generativa te citen y recomienden en sus respuestas. Estos sistemas incluyen ChatGPT, Perplexity, Gemini, Claude y Google AI Overviews. Se diferencia de la optimización de búsqueda clásica, que busca un lugar en una lista clasificada de enlaces.
AEO (Answer Engine Optimization)
AEO es la práctica de estructurar el contenido para que los motores de respuesta con IA puedan extraerlo y citarlo como una respuesta independiente. El término se usó primero para la búsqueda por voz y los featured snippets. En 2026, el sector suele tratar AEO como parte de GEO, o como otra forma de llamarlo, en lugar de como una disciplina separada, aunque no todo el mundo está de acuerdo con eso.
LLM SEO
LLM SEO es un nombre informal para GEO. Significa lo mismo: conseguir que los modelos de lenguaje grande muestren y citen tu contenido. No es un método distinto, solo una expresión que conecta mejor con una audiencia de SEO.
AI Overview
Un AI Overview es el resumen escrito por la IA de Google que se muestra encima de los resultados de búsqueda normales para muchas consultas. Extrae información de varios sitios web y los enlaza dentro del texto. Es el nombre de un producto específico de Google, no una palabra genérica para cualquier respuesta de IA en la búsqueda.
Motor de respuesta (Answer Engine)
Un motor de respuesta es un sistema de búsqueda o de IA que te da una respuesta directa y redactada en lugar de solo una lista de enlaces. Google AI Mode, ChatGPT y Perplexity son motores de respuesta. Algunos muestran enlaces junto a la respuesta, otros no.
Búsqueda generativa (Generative Search)
La búsqueda generativa es una experiencia de búsqueda en la que un modelo de IA redacta una respuesta nueva a tu pregunta en tiempo real. Construye esa respuesta a partir del contenido web que recupera y de lo que ya ha aprendido. No se limita a devolver enlaces o un fragmento copiado.
RAG (Generación Aumentada por Recuperación)
RAG es un diseño en el que un modelo de IA primero obtiene documentos o pasajes relevantes de una fuente externa y después redacta su respuesta a partir de ellos. Esa fuente puede ser un índice de búsqueda, una base de datos vectorial o la web en directo. Así es como la mayoría de los motores de respuesta con IA se mantienen anclados a contenido actual y citable, en lugar de depender solo de datos de entrenamiento antiguos.
Búsqueda sin clic (Zero-Click Search)
Una búsqueda sin clic es una búsqueda en la que el usuario obtiene su respuesta en la propia página de resultados y nunca visita un sitio web. Los featured snippets, los AI Overviews y los knowledge panels la provocan. Se pierde la visita, pero una cita en la respuesta puede seguir poniendo tu marca frente al usuario.
Alucinación (IA)
Una alucinación ocurre cuando un modelo de IA afirma algo que suena seguro y plausible pero que es incorrecto o no tiene respaldo. Es una debilidad conocida de la IA generativa. Importa para GEO porque los hechos densos y las fuentes claras le dan al modelo menos motivos para rellenar huecos con afirmaciones inventadas.
Embeddings
Un embedding es un fragmento de texto convertido en una lista de números que captura su significado. Las máquinas usan embeddings para medir cuán similares son dos piezas de contenido, en lugar de comparar palabras exactas. Los embeddings son lo que hace posible la búsqueda semántica y la recuperación en RAG.
Búsqueda semántica (Semantic Search)
La búsqueda semántica coincide con el significado detrás de una consulta, no con las palabras exactas que contiene. Usa embeddings para comparar significados. Por eso una búsqueda de «zapatillas para correr baratas» puede encontrar una página sobre «calzado deportivo económico».
Prompt
Un prompt es el texto que le das a un modelo de lenguaje grande para obtener una respuesta. Puede ser una pregunta, una instrucción o un bloque más largo de información de contexto. Otro sistema también puede enviar un prompt, no solo una persona.
Datos de entrenamiento frente a recuperación (Training Data vs. Retrieval)
Los datos de entrenamiento son lo que un modelo de IA aprendió durante su entrenamiento y almacenó en sus pesos, lo que significa que siempre están algo desactualizados. La recuperación (retrieval) es contenido obtenido en directo en el momento de tu pregunta y entregado al modelo como contexto. Estas son las dos formas en que un modelo puede «saber» algo, y por eso los motores de búsqueda con IA dependen tanto de la recuperación.
Chunking
Chunking significa dividir un documento largo en pasajes más pequeños antes de indexarlo para su recuperación. Así, un sistema de búsqueda o RAG puede extraer únicamente el párrafo más relevante en lugar de la página entera. Esta es una razón práctica por la que los encabezados claros y los párrafos autocontenidos te ayudan a conseguir citas.
Base de datos vectorial (Vector Database)
Una base de datos vectorial almacena embeddings y los busca por similitud en lugar de por coincidencia exacta. Encuentra los elementos más cercanos a un significado determinado. Es la infraestructura que hace que la búsqueda semántica y RAG sean rápidas a gran escala.
Query Fan-Out
Query fan-out es una técnica de Google AI Mode que expande una pregunta en varias subpreguntas relacionadas. Google recupera resultados para cada subpregunta y luego los combina en una sola respuesta. En la práctica, una página que cubre las preguntas de seguimiento de un tema tiene más formas de ser incorporada a esa respuesta que una página que solo cubre la pregunta literal planteada.
Las 22 métricas de GEO-Score
Estas son las 22 señales que mide un informe de GEO-Score. Cada una tiene su propia guía, así que las entradas aquí son solo indicaciones de una línea.
E-E-A-T
El marco de Google para Experiencia, Pericia, Autoridad y Confianza (E-E-A-T), que los motores de búsqueda con IA usan como señal para decidir si es seguro citar tu contenido.
Autoridad Temática (Topical Authority)
Con qué exhaustividad cubre todo tu dominio un área temática, no solo una página — los motores de IA favorecen los sitios que muestran experiencia en todo un tema.
Citabilidad (Citability)
Con qué facilidad se puede extraer y citar textualmente un pasaje concreto de tu contenido en una respuesta generada por IA.
Densidad Factual (Factual Density)
Cuántos hechos verificables, cifras y datos concretos contiene cada párrafo — a un modelo le resulta más fácil citar contenido denso que parafrasearlo.
Claridad Semántica (Semantic Clarity)
Con qué claridad puede un modelo de lenguaje interpretar el significado de tu página: entidades nombradas, relaciones sencillas y la menor ambigüedad posible.
Coincidencia del Tipo de Contenido (Content Type Matching)
Si el formato de tu página — lista, tabla, definición, guía paso a paso — coincide con el formato que los motores de IA prefieren extraer para ese tipo de pregunta.
Especificidad por Plataforma (Platform Specificity)
Con qué precisión se adapta tu contenido al comportamiento particular de cada plataforma de IA, como ChatGPT, Claude, Perplexity y Gemini.
Schema Validator (Datos Estructurados)
Si el marcado JSON-LD de schema.org de tu página está presente, es válido y está completo — una de las señales técnicas más fuertes que usan los motores de IA para entender una página.
Sitemap y Descubribilidad (Sitemap & Discoverability)
Si los rastreadores de IA y de búsqueda pueden encontrar tu página, a través de tu sitemap.xml y tus enlaces internos.
Velocidad de la Página (Page Speed)
Con qué rapidez responde tu página — las páginas lentas y los timeouts hacen que los rastreadores de IA se salten el contenido antes incluso de leerlo.
Completitud de la Respuesta (Answer Completeness)
Si una sección responde por sí sola a una pregunta probable, de modo que se pueda extraer sin que el lector necesite el resto de la página.
Exhaustividad (Comprehensiveness)
Con qué profundidad cubre tu página los subtemas y las preguntas de seguimiento de un tema, de modo que pueda satisfacer varios ángulos de la misma consulta.
Actualidad del Contenido (Content Freshness)
Con qué recientemente se publicó o se actualizó de forma significativa tu contenido — una señal de actualidad que varios motores de IA tienen en cuenta, en particular Perplexity y ChatGPT.
Estructura del Contenido (Content Structure)
Con qué claridad está organizada tu página mediante encabezados, listas y jerarquía, para que un rastreador de IA pueda encontrar rápido la sección correcta.
Texto Alternativo de Imágenes (Image Alt Text)
Alternativas de texto descriptivas para tus imágenes, que permiten a los sistemas de IA entender contenido visual que no pueden ver.
Palabras Clave Semánticas (LSI Keywords)
Términos y conceptos relacionados que aparecen de forma natural junto a tu tema, y que indican profundidad tanto a los motores de búsqueda como a los de IA. Nota: «LSI» (Latent Semantic Indexing) es una etiqueta heredada del SEO — los sistemas modernos usan comprensión semántica basada en embeddings, no el algoritmo LSI original de los años 90.
Legibilidad (Readability)
Con qué facilidad se puede procesar tu página, tanto para los modelos como para las personas, normalmente medida con una puntuación como el Flesch Reading Ease.
Cohesión del Contenido (Palabras de Transición)
Las palabras y frases que conectan tus ideas entre oraciones y párrafos, y que ayudan a un modelo de lenguaje a seguir tu razonamiento.
Acceso de Bots de IA (AI Bot Access)
Si los rastreadores de IA como GPTBot, ClaudeBot y PerplexityBot realmente pueden acceder a tu página, según tu robots.txt y las respuestas de tu servidor.
Optimización para IA (AI Optimization)
La puntuación compuesta que combina tus señales de schema, estructura, estadísticas y actualidad en una única medida general de preparación para la IA.
Citas y Fuentes (Citations & Sources)
Si tu página cita fuentes externas y con autoridad para respaldar sus afirmaciones — una señal de confianza que los motores de IA usan a la hora de decidir qué citar ellos mismos.
Knowledge Graph
Una base de datos estructurada de entidades y cómo se relacionan entre sí, como el Knowledge Graph de Google, que los sistemas de IA usan para verificar hechos y distinguir entre temas similares.
Términos técnicos y de schema.org
El marcado y los archivos que indican a las máquinas de qué trata tu página. Es la parte más técnica de GEO, y también la más fácil de corregir.
Datos Estructurados (Structured Data)
Los datos estructurados son marcado que añades a una página para etiquetar su contenido de cara a las máquinas. Indican cosas como «esto es un precio», «esto es un autor», «esta es la respuesta de una FAQ». Eso elimina la ambigüedad que, de otro modo, un rastreador o un modelo de IA tendría que adivinar.
JSON-LD
JSON-LD son las siglas de JavaScript Object Notation for Linked Data. Es la forma estándar, recomendada por Google, de incluir datos estructurados de schema.org en una página, dentro de una etiqueta <script type="application/ld+json">. Ha sustituido a los formatos más antiguos, microdata y RDFa, en la mayoría de los sitios.
DefinedTerm (schema.org)
DefinedTerm es un tipo de schema.org para «una palabra, nombre, acrónimo, frase, etc. con una definición formal». Es el marcado correcto para una entrada de glosario o diccionario. Todas las entradas de esta página están marcadas como tal.
DefinedTermSet (schema.org)
DefinedTermSet es un tipo de schema.org para un conjunto de entradas DefinedTerm relacionadas que comparten un contexto. Es el contenedor que envuelve todo un glosario, con cada definición dentro de él como término hijo.
FAQPage (schema.org)
FAQPage es un tipo de schema.org para una página que contiene una lista de preguntas y respuestas. Marcar tus preguntas y respuestas con él puede hacer que cada una sea apta para rich results, y más fácil de extraer en una respuesta de IA.
robots.txt
robots.txt es un archivo de texto plano en la raíz de tu sitio que indica a los rastreadores qué partes pueden y no pueden visitar. A los rastreadores de IA se les habla mediante sus propios nombres de user-agent. Es una solicitud, no un candado: no bloquea el acceso por sí mismo, y no todos los rastreadores de IA lo respetan.
llms.txt
llms.txt es una convención propuesta: un archivo Markdown seleccionado en la raíz de tu sitio (/llms.txt) que ofrece a los modelos de lenguaje una visión general, legible por máquinas, de tu contenido más importante. Fue propuesto por Jeremy Howard y Answer.AI en septiembre de 2024 y nunca ha sido ratificado formalmente. Su adopción es real pero parcial, y ni OpenAI, ni Anthropic, ni Google, ni Perplexity han confirmado oficialmente que sus rastreadores lo usen.
URL canónica y hreflang
Una URL canónica indica a los rastreadores de búsqueda y de IA qué versión de una página es la copia maestra cuando el mismo contenido existe en más de una dirección. hreflang les indica qué versión de idioma o región servir a qué audiencia. Ambas cosas importan en cuanto tu sitio tiene varios idiomas o páginas casi duplicadas.
Rastreadores y bots de IA
Estos son los programas que recuperan tus páginas para las empresas de IA. Los nombres y las reglas cambian a menudo, así que consulta la documentación oficial de cada proveedor antes de actuar sobre cualquiera de estos datos. Un patrón se repite en toda la lista. La mayoría de las empresas de IA operan al menos dos tipos de recuperador: un rastreador de entrenamiento o de índice que visita según su propio calendario, y un recuperador bajo demanda que solo visita cuando un usuario le pregunta al asistente sobre tu página. Bloquear uno no bloquea el otro, y tienen efectos muy distintos sobre tu visibilidad.
GPTBot
GPTBot es el rastreador de OpenAI para recopilar contenido con el que entrenar sus modelos de IA. Bloquearlo en robots.txt indica que tu contenido debe quedar fuera de los datos de entrenamiento de OpenAI. No afecta a la navegación en directo ni a la búsqueda de ChatGPT, que usan otros bots distintos.
OAI-SearchBot
OAI-SearchBot es el rastreador de OpenAI para mostrar sitios web en las funciones de búsqueda de ChatGPT. Si te excluyes de él, tu sitio no aparecerá en las respuestas de búsqueda de ChatGPT. Es independiente de GPTBot (entrenamiento) y de ChatGPT-User (navegación en directo).
ChatGPT-User
ChatGPT-User es el user-agent que envía OpenAI cuando un usuario real de ChatGPT activa una acción que visita una página, como pedirle que navegue a una URL. No es un rastreo automático y programado. Alguien pidió específicamente esa página.
ClaudeBot
ClaudeBot es el rastreador de Anthropic que recopila contenido web que puede usarse para entrenar los modelos Claude. Bloquearlo indica que tu contenido futuro debe quedar excluido de los conjuntos de datos de entrenamiento de Anthropic. Anteriormente, Anthropic usaba otros dos user agents para esto, Claude-Web y anthropic-ai, que ahora están obsoletos.
Claude-User
Claude-User es el user-agent de Anthropic para recuperar una página en directo cuando alguien le hace a Claude una pregunta que la necesita. Bloquearlo puede reducir la frecuencia con la que tu sitio aparece en las respuestas de Claude a los usuarios.
Claude-SearchBot
Claude-SearchBot es el rastreador de Anthropic para indexar contenido y mejorar la relevancia y precisión de los resultados de búsqueda de Claude. Es independiente de ClaudeBot (entrenamiento) y de Claude-User (una recuperación en directo de una sola página).
PerplexityBot y Perplexity-User
Perplexity opera dos rastreadores. PerplexityBot es un rastreador de índice tradicional que, según afirma Perplexity, respeta robots.txt. Perplexity-User es un recuperador bajo demanda, y Perplexity ha adoptado públicamente la postura de que se trata de un agente y no de un bot, por lo que no está obligado a respetar robots.txt.
Esa postura ha provocado disputas públicas con editores y con Cloudflare, que informó por separado de que Perplexity usaba rastreadores no declarados que rotaban user agents y direcciones IP para eludir los bloqueos. Trata esto como una disputa reportada, no como un hecho establecido.
Google-Extended
Google-Extended no es un rastreador con su propia cadena de user-agent, aunque a menudo se le liste como tal. Es un token de control de robots.txt que decide si el contenido que Google ya ha rastreado puede usarse también para entrenar los modelos Gemini y fundamentar las funciones de Gemini y Vertex AI. Bloquearlo no afecta a tu visibilidad normal en Google Search.
CCBot
CCBot es el rastreador de Common Crawl, una organización sin ánimo de lucro que mantiene un archivo abierto de la web. No pertenece a ninguna empresa de IA. Su conjunto de datos es un componente ampliamente usado en los datos de entrenamiento de muchos modelos de lenguaje grande, por lo que importa para GEO aunque bloquearlo no apunte a un producto de IA específico.
¿Es GEO lo mismo que SEO?
▼
¿Tengo que hacer todo esto?
▼
¿Qué pasa si bloqueo los rastreadores de IA?
▼
Descubre cómo puntúa tu página
Este glosario explica las señales. Un informe te dice dónde te encuentras en cada una. Analiza cualquier página con GEO-Score y obtén una puntuación en las 22 métricas, con el motivo detrás de cada una.
Analizar una página →