
Medir GEO es medir varias cosas distintas sobre las respuestas de ChatGPT, Gemini y Claude: con qué frecuencia te nombran (tasa de mención), qué parte de la conversación ocupas frente a tus competidores (cuota de voz), en qué puesto apareces cuando apareces, si alguna respuesta cita tu dominio, y si tu web es legible para un motor. Casi todo lo demás es una de esas con otro nombre — o una de las tres trampas de más abajo: la captura suelta, la "posición media" que promedia las veces que no sales, y cualquier cifra calculada sobre un puñado de respuestas.
Casi todos los errores de medición en GEO vienen del denominador, así que conviene fijarlo antes que nada: la unidad de observación es la respuesta, no el prompt.
Veinte prompts lanzados a tres motores no son veinte observaciones: son sesenta. La misma pregunta contestada por Gemini y por Claude son dos respuestas distintas, que pueden nombrar a marcas distintas, y mezclarlas en un único "20 prompts" tira por la borda dos tercios de la información. Cuando leas cualquier porcentaje de este artículo —tuyo o de una herramienta—, la primera pregunta es siempre la misma: ¿sobre cuántas respuestas?
| Métrica | Responde a | Se calcula sobre | El error habitual |
|---|---|---|---|
| Tasa de mención | ¿Me nombra la IA? | Todas las respuestas del escaneo | Contarla sobre prompts en vez de sobre respuestas |
| Cuota de voz | De todas las marcas que nombra, ¿cuántas veces yo? | Menciones tuyas + de los competidores que sigues | Compararla entre proyectos con competidores distintos |
| Posición cuando apareces | Cuando salgo, ¿salgo el primero? | Solo las respuestas donde apareces | Promediar también las respuestas donde no sales |
| Tasa de citación | ¿Enlaza el motor mi web como fuente? | Solo respuestas de motores que buscan en la web | Contar cualquier cita, sea de quien sea |
| Preparación técnica | ¿Puede un motor leerme y extraerme? | Tu propio HTML, sin preguntar a ningún modelo | Confundirla con estar apareciendo |
El porcentaje de respuestas en las que aparece tu marca. Es la primera porque sin ella ninguna otra tiene sentido: una cuota de voz del 100 % sobre una única mención no es liderazgo, es una anécdota.
Un matiz que cambia el número más de lo que parece: una mención tiene que estar verificada contra el texto de la respuesta, no dada por buena porque un modelo diga que mencionó tu marca. Y tiene que reconocer cómo te llama la gente de verdad — si sigues "Mozilla" y el motor recomienda "Firefox", una medición ingenua cuenta cero.
Tus menciones divididas entre tus menciones más las de los competidores que estás siguiendo. Responde a la pregunta que de verdad importa en una categoría: de todas las veces que la IA recomienda a alguien, ¿cuántas me recomienda a mí?
De ahí se sigue la trampa: la cuota de voz depende de a quién sigas. Añade dos competidores grandes y tu cuota baja sin que tú hayas empeorado. Compararla con la de otra empresa, que sigue a otras marcas, no significa nada. Por eso elegir bien el conjunto no es un trámite de configuración, sino parte de la medición: lo tratamos aparte en cómo seleccionar los competidores de un análisis GEO.
Aquí está el error más caro, y es tan común que merece verse en números.
La tentación es calcular una "posición media" como en SEO. Pero en una respuesta generativa, en la mayoría de las respuestas tu marca sencillamente no está. ¿Qué puesto le pones a una ausencia? Si se le asigna el último —lo que parece razonable y es lo que hacían nuestras primeras versiones—, ocurre esto:
| Entidad | Aparece en | Puesto real cuando aparece | «Posición media» |
|---|---|---|---|
| Entidad A | 10 de 20 | 2.º | 5,50 |
| Entidad B | 5 de 20 | 2.º | 7,25 |
| Entidad C | 4 de 20 | 2.º | 7,60 |
| Entidad D | 2 de 20 | 2.º | 8,30 |
| Entidad E | 1 de 20 | 2.º | 8,65 |
Dos consecuencias, y la segunda es la que descoloca a cualquiera que mire el panel:
Lo correcto es medir el puesto solo sobre las respuestas donde apareces, y publicarlo siempre al lado de la tasa de mención, que lleva la otra mitad de la historia. Un 1,0 quiere decir "siempre el primero de la lista, las veces que salgo". Cuántas veces salgo es la otra columna.
Una mención y una cita no son lo mismo. Que el modelo te nombre significa que te tiene en su cabeza; que enlace tu web como fuente significa que la respuesta se apoya en algo tuyo y el lector puede llegar hasta ti. Lo desarrollamos en la entrada de glosario sobre citación en IA.
Dos reglas que casi ninguna herramienta explicita:
Las cuatro anteriores miden lo que hacen los motores. Esta mide lo que haces tú: si tu página es legible, extraíble y atribuible. Es la única determinista del grupo —se calcula con comprobaciones sobre tu HTML, sin preguntarle nada a ningún modelo, así que la misma web da siempre el mismo número— y por eso es la única que puedes mover con seguridad antes de ver moverse a las demás. Tienes las seis dimensiones que la componen, con sus umbrales, en qué es una auditoría GEO.
No es una precaución teórica. Con tres respuestas en total, que una sola pase de no nombrarte a nombrarte mueve la métrica un tercio de golpe, sin que haya cambiado nada en el mercado ni en tu web. Quien mire esa subida y la celebre está leyendo ruido; quien mire la bajada equivalente y reaccione, peor todavía.
El otro motivo para no leer números pequeños es más sutil. Tres de tres menciones es un 100 %, y el intervalo de confianza de manual sobre esa cifra tiene anchura cero: "100 %, sin margen de error", a partir de tres tiradas de moneda. Cualquier medición honesta necesita un intervalo que no colapse en los extremos, y necesita decir cuántas observaciones lo sostienen.
Aunque midas con muestra suficiente, queda una fuente de variación que ninguna fórmula elimina: los motores buscan en vivo. Dos escaneos idénticos ven internets distintos, porque lo que devuelve una búsqueda cambia entre una llamada y la siguiente.
Contra eso, la respuesta no es una fórmula mejor: es dejar de tratar una observación como la respuesta. Lo que se lee es la tendencia sobre varias mediciones seguidas, no la última foto — y con la mediana, no con la media, porque una medición anómala —un proveedor teniendo una mala hora— arrastra una media y apenas mueve una mediana.
Con una condición estricta, que es donde se cae la mayoría: solo se comparan entre sí mediciones que midan lo mismo. Cambiar el conjunto de prompts, los motores o la forma de puntuar rompe la serie, y encadenar números que ya no son comparables es peor que no tener serie.
Tiene un coste, y hay que decirlo: una mejora real tarda un par de mediciones en reflejarse del todo. A cambio, lo que ves moverse se mueve de verdad.
Es útil, pero no como titular. El sentimiento es una métrica de segundo orden: solo existe donde ya hay una mención, así que una marca invisible luce un sentimiento inmejorable —no hay ninguna respuesta hablando mal de ella—. Presentado como cifra principal engaña; como filtro para ir a leer las respuestas negativas concretas, es excelente. Ese es el sitio que le corresponde.
Sí, y es lo que hace un índice como el GEO Score: resumirlas para poder seguir la evolución de un vistazo. Pero un índice no sustituye a las métricas de debajo, las ordena — sube porque han subido ellas, nunca al revés.
Lo que sí conviene exigirle a cualquier índice, sea el nuestro o el de otra herramienta: que cuando una de sus señales no se pueda medir, lo diga en vez de rellenarla con un cero.
Un dato que no se ha podido medir se excluye y se dice; nunca se sustituye por cero. Un cero es una afirmación —"lo medimos y salió lo peor posible"— y usarlo para decir "no lo sabemos" es la forma más fácil de mentir con una métrica sin haber falseado ni un solo dato.
Mira la tasa de mención junto al número de respuestas que la sostienen. Es la única pareja que no se puede malinterpretar: dice si estás en la conversación y con cuánta evidencia lo estás diciendo. Cuando esa pareja sea sólida —una decena de respuestas como mínimo, mejor varias decenas—, pasa a la cuota de voz y a la posición. Antes de eso, cualquier lectura más fina es ruido bien presentado.
Y si estás montando la medición desde cero, el orden es el inverso al de la curiosidad: primero el conjunto de preguntas, porque ninguna métrica es mejor que los prompts sobre los que se calcula. Eso lo cubrimos en cómo elegir los prompts para monitorizar tu marca, y el resto de la metodología vive en el pilar de medición.
GenScore lanza tu conjunto de prompts en ChatGPT, Gemini y Claude, y te devuelve estas métricas con el número de respuestas que las sostienen detrás. Escaneo gratuito, sin tarjeta.
Analiza tu dominioEscribimos sobre visibilidad de marca en motores de IA a partir de los escaneos reales que ejecuta nuestra propia herramienta. Cuando no tenemos evidencia de algo, lo decimos.