RecoSignal

Cómo medimos la visibilidad en IA: la metodología completa

Actualizado 17 de julio de 2026 · equipo de RecoSignal

Puntos clave

  • Medimos frecuencia, no posición: en 30 consultas al estilo de un cliente por motor, ¿con qué frecuencia un asistente nombra tu negocio? La posición dentro de una respuesta se registra, pero pesa cero en la puntuación, porque el orden de los nombres en las respuestas de la IA es inestable.
  • Una auditoría son 138 mediciones: 30 consultas en cada uno de ChatGPT, Gemini y Perplexity, y las 8 consultas de mayor intención se hacen tres veces cada una — 46 mediciones por motor.
  • Los pesos de los motores (ChatGPT 0.45, Gemini 0.30, Perplexity 0.25) y los umbrales del veredicto (≥40 visible, 10–39 débil, <10 invisible) son juicios, no mediciones. Los publicamos para que puedas discrepar de ellos y recalcular.
  • Lo que la puntuación no puede hacer: predecir, garantizar ni demostrar causalidad. Es una foto de cómo respondieron tres motores un día concreto, y repetirla otro día moverá el número.
  • Cada respuesta en bruto se guarda. Cualquier cifra de un informe de RecoSignal puede rastrearse hasta el texto de una respuesta real de IA, que es la única razón para creer algo de todo esto.

Por qué existe esta página

Una categoría que vende «puntuaciones de visibilidad en IA» sin publicar cómo se calculan merece la sospecha que recibe. Una puntuación cuyo método es secreto no se puede comprobar, ni discutir, ni reproducir — lo que la hace indistinguible de un número inventado para vender una suscripción.

Así que este es el método, completo: las consultas, los motores, la aritmética, los umbrales y las cosas concretas que el número no demuestra. Donde una decisión es un juicio y no una medición, así queda etiquetada. Donde el método tiene una limitación que juega en nuestra contra, se dice aquí en lugar de dejarla para que la encuentre un competidor.

Esta página sigue al código. Si cambia la medición, cambian con ella esta página y la versión de la metodología.

Qué medimos: frecuencia, no posición

La pregunta central es simple: en muchas preguntas realistas, al estilo de un cliente, ¿con qué frecuencia un asistente nombra tu negocio? Cada medición es binaria. Si te nombra en la respuesta, puntúa 1. Si no apareces, puntúa 0. Nada más entra en la puntuación.

Sí registramos en qué lugar de la respuesta apareció tu nombre, pero esa posición se guarda como diagnóstico y pesa cero. La razón es que el orden de los nombres dentro de una respuesta de IA no es lo bastante estable como para construir una métrica sobre él: haz la misma pregunta dos veces y los mismos negocios pueden volver en otro orden. Un proveedor que informa de tu «posición en ChatGPT» está informando de ruido con un decimal detrás. No hay ninguna lista ordenada dentro de estos sistemas en la que ocupar un puesto.

La puntuación de un motor es, por tanto, un porcentaje: 100 × (mediciones que te nombran ÷ mediciones exitosas en ese motor). Si te nombraron en 12 de 46 mediciones exitosas en ChatGPT, tu puntuación de ChatGPT es 26.1.

Las preguntas: 30 consultas por motor, cinco intenciones

Las consultas se generan para tu negocio y tu ciudad, y están escritas como escriben los clientes, no como escriben los publicistas. Treinta por motor, repartidas entre cinco intenciones, y cada intención aparece en dos variantes: una que nombra tu ciudad de forma explícita y otra formulada como «cerca de mí», con la ubicación enviada como parámetro de la API en lugar de escrita dentro de la pregunta.

  • best_of — «¿Quién es el mejor dentista de implantes en [city]?»
  • near_me — «Buen centro de medicina estética cerca de mí», con la ubicación enviada al motor como parámetro estructurado cuando el motor lo admite, en lugar de escrita dentro de la pregunta.
  • attribute — la pregunta que filtra por un hecho concreto: un seguro aceptado, un aparato utilizado, un servicio ofrecido, un precio.
  • comparison — «X o Y en [city]: ¿quién hace las dos cosas y cuánto cobran?»
  • urgency — la pregunta del mismo día: un diente astillado esta noche, una tubería reventada, una cita de urgencia.

138 mediciones por auditoría, y por qué la misma pregunta se hace tres veces

Las ocho consultas de mayor intención — aquellas en las que el cliente está más cerca de reservar — se hacen tres veces cada una en lugar de una. Eso convierte 30 consultas en 46 mediciones por motor, y a través de tres motores una auditoría son 138 llamadas en vivo a ChatGPT, Gemini y Perplexity.

La repetición no es relleno; es toda la razón por la que el resultado significa algo. Estos sistemas no son deterministas: la misma pregunta hecha dos veces puede producir nombres de negocios distintos. Una sola respuesta es una anécdota. Hacer tres veces las preguntas que más importan es la forma de distinguir una mención puntual de un negocio que el motor nombra de manera fiable.

También fija el techo honesto de la precisión. Con 46 mediciones por motor, una sola mención mueve la puntuación de ese motor unos 2.2 puntos. Una diferencia de un punto entre dos negocios no es un hallazgo, y no la presentamos como tal.

Los motores a los que preguntamos — y la limitación que no vamos a enterrar

Medimos tres motores: ChatGPT, Google Gemini y Perplexity. A cada uno se le consulta a través de su API oficial con la búsqueda web activada, en la configuración publicada en nuestro código.

Aquí está la limitación, dicha sin rodeos: consultamos los modelos por API, no las aplicaciones de consumo. La respuesta que un paciente obtiene en la aplicación de ChatGPT de su teléfono — con su historial de chats, su memoria, su cuenta, su nivel de suscripción y la versión que OpenAI lanzara esa mañana — no está garantizado que sea la respuesta que recibió nuestra medición. Ningún proveedor de esta categoría puede medir la aplicación de consumo a escala, porque no existe una interfaz para hacerlo; quien insinúe lo contrario te está vendiendo una captura de pantalla.

Lo que nuestra medición es, con precisión: una muestra amplia, repetida y reproducible de cómo los modelos subyacentes responden a preguntas de recomendación local con búsqueda web en vivo, en tu ciudad. Lo que no es: una escucha de los teléfonos de tus clientes. Creemos que lo primero merece pagarse y que lo segundo no existe. Deberías saber cuál de las dos cosas estás comprando.

Geografía: cómo se les dice a los motores dónde está el cliente

Una recomendación local depende por completo de dónde está parado el cliente, y los tres motores se toman ese hecho de forma distinta.

ChatGPT y Perplexity aceptan una ubicación estructurada — ciudad, región, país — enviada junto a la pregunta, y por eso nuestras consultas de «cerca de mí» pueden formularse exactamente como las formula un cliente, sin una ciudad escrita en el texto.

Gemini, en nuestras pruebas, no actuó sobre una ubicación entregada de esa manera. Así que para Gemini volvemos a nombrar la ciudad dentro del propio texto de la pregunta. Esto es una asimetría real entre los motores, la fija una bandera en nuestro código en lugar de esconderse en una caja negra, y significa que los resultados de «cerca de mí» de Gemini responden a una pregunta ligeramente distinta que los de ChatGPT. Preferimos decírtelo antes que fingir que a los tres motores se les preguntó de forma idéntica.

Cómo las tres puntuaciones de los motores se convierten en un número

El AI Visibility Score final es una media ponderada de las tres puntuaciones de los motores: ChatGPT 0.45, Gemini 0.30, Perplexity 0.25.

Esos pesos son un juicio, no una medición. Son nuestra estimación de qué parte del público que usa asistentes alcanza realmente cada motor, y no nos aferramos a ellos. Los publicamos exactamente por esta razón: puedes tomar las puntuaciones por motor de tu informe, aplicar tus propios pesos y obtener tu propio número. No hay nada escondido dentro de la media.

Una regla mecánica protege la media de la basura. Si un motor devuelve respuestas utilizables en menos de la mitad de sus mediciones — una caída del servicio, un límite de peticiones, un modelo que se niega a responder — ese motor se descarta por completo de la puntuación y los pesos restantes se renormalizan, en lugar de dejar que un motor averiado arrastre el número hacia abajo y hacerlo pasar por invisibilidad. Si ningún motor supera esa barra, la auditoría informa de que no hay puntuación en vez de inventarla.

Los umbrales del veredicto, y el hecho de que son un juicio

Una puntuación de 40 o más se lee como visible. Entre 10 y 39 se lee como débil. Por debajo de 10 — incluido un negocio al que no se nombró ni una sola vez — se lee como invisible.

No hay ninguna ciencia detrás de esos dos puntos de corte. Son las fronteras que elegimos para hacer el número legible para el dueño de un negocio, y son la parte de esta metodología más abierta a un desacuerdo razonable. Lo que no son es una palanca oculta: tus porcentajes en bruto por motor están en el informe, y si crees que la línea entre débil y visible corresponde al 35 o al 50, puedes trazarla ahí tú mismo.

Para dar escala, desde un mercado real: en nuestro benchmark dental de Dallas de julio de 2026, la clínica con mejor puntuación de toda el área metropolitana obtuvo 27.0 sobre 100 (el benchmark). Nadie en ese mercado superó la barra de la visibilidad. Una puntuación de 40 es una barra alta, y así está pensada.

Contar menciones: cómo un nombre en una frase se convierte en un número

Cada mención se extrae del texto de una respuesta real. Los nombres de los negocios se normalizan (mayúsculas, puntuación, sufijos como «LLC» o «DDS»). Dos grafías distintas se cuentan como un mismo negocio únicamente cuando algo en los datos demuestra que lo son: la grafía idéntica una vez quitados los acentos y la puntuación, el mismo nombre escrito en otro alfabeto, o ambas grafías apareciendo junto a citas del mismo sitio web corporativo. Las grafías que aparecen en una misma respuesta como dos elementos separados no se combinan nunca — un asistente que enumera opciones no nombra un mismo negocio dos veces, así que eso es prueba de dos negocios, no de uno. La misma regla rige para tu propio negocio y para cada competidor, y una grafía que no podemos vincular a nada se queda en su propia línea en lugar de fusionarse con otra por una suposición. Es deliberado: una tabla de clasificación que parte un negocio en dos es ruidosa, pero una que fusiona dos negocios en uno es sencillamente falsa.

Para la tabla de clasificación de competidores, un negocio necesita al menos dos menciones independientes para aparecer. Una sola mención de pasada está dentro del suelo de ruido de un sistema no determinista, y una tabla llena de negocios con una única mención sería una tabla de casualidades. Dos excepciones son deliberadas: tu propio negocio aparece siempre, incluso cuando la respuesta honesta es un cero — un cero que pediste es un hallazgo, y descartarlo en silencio sería mentir por omisión. Los competidores que nombraste tú mismo se saltan el umbral de dos menciones con una sola mención. Un competidor que nombraste y al que ningún motor mencionó ni una vez no aparece por ahora como fila de cero en la tabla de clasificación; eso es una limitación de la versión actual, no un juicio de que el hecho no importe, y está en la lista de cosas por arreglar.

El Share of Voice usa un denominador más amplio que la tabla de clasificación. Cuenta cada mención canónica distinta de un negocio en cada respuesta exitosa, incluidos los negocios mencionados una sola vez. El mismo negocio puede contar como máximo una vez por respuesta, aunque el modelo repita su nombre o use varios alias. Tu Share of Voice es 100 × (pares respuesta–negocio que te pertenecen ÷ todos los pares respuesta–negocio). Es una cuota de las menciones observadas en esta auditoría, no una cuota de mercado ni tráfico de búsqueda.

También registramos cada dominio de origen que citaron los motores. Eso es lo que produjo el hallazgo más incómodo que hemos publicado: en los tres mercados de Dallas que medimos en julio de 2026, entre el 73% y el 79% de las fuentes detrás de las recomendaciones de la IA eran los propios sitios web de los negocios, no los directorios — un resultado que va en contra de buena parte de lo que vende esta industria, y de buena parte de lo que nosotros mismos escribíamos antes. Los desgloses por mercado están publicados en las páginas de benchmark.

Lo que esta puntuación no puede hacer

No puede predecir. La puntuación describe cómo respondieron los motores durante la ventana de medición. No es un pronóstico del mes que viene, y una actualización del modelo puede moverla sin que nada de tu negocio haya cambiado.

No puede garantizar. Nadie puede prometer que ChatGPT te vaya a recomendar, porque no hay una posición que comprar ni una lista ordenada a la que entrar. Quien venda un #1 garantizado en una respuesta de IA está vendiendo un puesto que no existe.

No puede demostrar causalidad. Podemos mostrar que los negocios a los que un motor nombra suelen ser aquellos cuyos datos están expresados en texto legible y repetidos de forma coherente en todos los sitios que el motor consulta. No hemos hecho un experimento controlado que demuestre que cerrar una brecha concreta sube tu puntuación — nadie lo ha hecho, y un proveedor que declare aquí un número causal está adivinando. Lo que sí podemos hacer es medirte antes, medirte de nuevo después y decirte con honestidad qué se movió.

Es un solo día. El benchmark de Dallas es una foto del 7 de julio de 2026. Haz las mismas preguntas en octubre y los nombres habrán cambiado. Ese es un argumento para volver a medir, no para tratar una única medición como palabra sagrada — incluida la nuestra.

Reproducibilidad

Cada respuesta en bruto de la IA recogida durante una auditoría se guarda, junto con la consulta que la produjo, el motor que respondió, la marca de tiempo y los dominios de origen citados. Cada número de un informe de RecoSignal se remonta a ese texto.

Esta es la parte que separa una medición de una afirmación de marketing, y es el estándar al que nos gustaría que se sometiera al resto de esta categoría — también por parte de quien lea esta página con el informe de un competidor abierto en otra pestaña. Si un número de tu informe parece equivocado, pídenos las respuestas que hay detrás. Existen.

Esta página describe la versión 1.2 de la metodología. Cuando el método cambia, cambia la versión, y los informes indican qué versión los produjo.

Míralo funcionar en tu propio negocio

La forma más rápida de juzgar una metodología es verla producir un resultado que puedes comprobar. El AI Visibility Snapshot gratuito ejecuta sobre tu negocio la medición descrita arriba e informa de tu puntuación, de tu cuota de recomendaciones frente a tus competidores y de tu mayor brecha — con las respuestas en bruto que hay detrás. Si el número te sorprende, ahí están las respuestas con las que discutir.

Preguntas frecuentes

¿Por qué medir la frecuencia en lugar de mi posición en ChatGPT?
Porque no hay posición. Los asistentes de IA no mantienen una lista ordenada de negocios; generan una respuesta, y el orden de los nombres dentro de ella se desplaza entre ejecuciones de la misma pregunta. Registramos la posición como diagnóstico y le damos peso cero en la puntuación. Un proveedor que te vende una «posición en ChatGPT» le está poniendo un decimal al ruido.
¿Miden la aplicación de ChatGPT que usan de verdad mis clientes?
No, y nadie más lo hace tampoco. Consultamos los modelos a través de sus API oficiales con la búsqueda web activada. La aplicación de consumo añade historial de chats, memoria de la cuenta, nivel de suscripción y cambios del lado de la aplicación que no podemos ver ni reproducir, así que la respuesta en el teléfono de un cliente puede diferir de la nuestra. Lo que producimos es una muestra amplia, repetible y comprobable de cómo los modelos subyacentes responden a preguntas de recomendación local en tu ciudad — no una grabación de las pantallas de tus clientes.
¿De dónde salen los pesos de los motores?
De nuestro juicio sobre qué parte del público que usa asistentes alcanza cada motor: ChatGPT 0.45, Gemini 0.30, Perplexity 0.25. No son una medición, y los publicamos precisamente para que puedas rechazarlos. Tu informe contiene las puntuaciones en bruto por motor; aplica tus propios pesos y calcula tu propio número si los nuestros no encajan con tu mercado.
¿Por qué 40 es la línea de lo «visible»?
Porque la trazamos ahí. Los umbrales (≥40 visible, 10–39 débil, <10 invisible) existen para hacer el número legible para un dueño, no porque un estudio haya establecido esos puntos de corte. Para dar contexto, la clínica dental con mejor rendimiento de todo nuestro benchmark del área metropolitana de Dallas obtuvo 27.0 sobre 100 — en ese mercado, nadie superó la barra.
¿Cuántas mediciones son una sola auditoría?
138 llamadas en vivo: 30 consultas al estilo de un cliente por motor en ChatGPT, Gemini y Perplexity, y las 8 consultas de mayor intención se hacen tres veces cada una — 46 mediciones por motor. Las repeticiones existen porque estos sistemas no son deterministas, y una sola respuesta es una anécdota, no una medición.
Si arreglo las brechas de mi informe, ¿subirá mi puntuación?
Debería elevar la probabilidad de que te nombren, y no vamos a fingir que sabemos más que eso. Ningún estudio controlado ha demostrado que un arreglo concreto cause un aumento concreto de la puntuación — ni el nuestro, ni el de ningún competidor. Lo que sí podemos hacer es medir de nuevo después de los cambios y decirte qué se movió realmente, que es la razón por la que volver a medir importa más que cualquier número aislado.

Descubre si la IA recomienda tu negocio

El Snapshot gratuito muestra tu AI Visibility Score y a quién recomiendan ChatGPT, Gemini y Perplexity en tu lugar.

Ejecutar un AI Visibility Snapshot gratuito