Como medimos a visibilidade em IA: a metodologia completa
Atualizado 17 de julho de 2026 · equipa RecoSignal
Pontos-chave
- Medimos frequência, não posição: ao longo de 30 perguntas no estilo do cliente por motor, com que frequência um assistente cita o seu negócio? A posição dentro de uma resposta é registrada, mas entra na pontuação com peso zero, porque a ordem dos nomes nas respostas de IA é instável.
- Uma auditoria são 138 medições: 30 perguntas em cada um dos motores ChatGPT, Gemini e Perplexity, sendo que as 8 perguntas de maior intenção são feitas três vezes cada — 46 medições por motor.
- Os pesos dos motores (ChatGPT 0.45, Gemini 0.30, Perplexity 0.25) e as faixas de veredito (≥40 visível, 10–39 fraco, <10 invisível) são julgamentos, não medições. Nós os publicamos para que você possa discordar deles e recalcular.
- O que a pontuação não consegue fazer: prever, garantir ou provar causalidade. Ela é um retrato de como três motores responderam em um único dia, e refazer a medição em outro dia vai mexer no número.
- Toda resposta bruta fica armazenada. Qualquer cifra de um relatório da RecoSignal pode ser rastreada até o texto de uma resposta real de IA, e essa é a única razão para acreditar em qualquer coisa disso.
Por que esta página existe
Uma categoria que vende “pontuações de visibilidade em IA” sem publicar como elas são calculadas merece a desconfiança que recebe. Uma pontuação cujo método é secreto não pode ser verificada, contestada nem reproduzida — o que a torna indistinguível de um número inventado para vender uma assinatura.
Então aqui está o método, na íntegra: as perguntas, os motores, a aritmética, os limiares e as coisas específicas que o número não prova. Onde uma escolha é um julgamento, e não uma medição, ela está rotulada como tal. Onde o método tem uma limitação que joga contra nós, ela está declarada aqui, em vez de deixada para um concorrente descobrir.
Esta página acompanha o código. Se a medição mudar, esta página e a versão da metodologia mudam junto com ela.
O que medimos: frequência, não posição
A pergunta central é simples: ao longo de muitas perguntas realistas, no estilo de um cliente, com que frequência um assistente cita o seu negócio? Cada medição é binária. Citado na resposta vale 1. Ausente vale 0. Nada além disso entra na pontuação.
Nós de fato registramos em que ponto da resposta o seu nome apareceu, mas essa posição fica guardada como diagnóstico e tem peso zero. A razão é que a ordem dos nomes dentro de uma resposta de IA não é estável o bastante para sustentar uma métrica: faça a mesma pergunta duas vezes e os mesmos negócios podem voltar em outra ordem. O fornecedor que informa a sua “posição no ChatGPT” está informando ruído com casa decimal. Não existe, dentro desses sistemas, nenhuma lista ordenada em que se possa ocupar um lugar.
A pontuação de um motor é, portanto, uma porcentagem: 100 × (medições que citam você ÷ medições bem-sucedidas naquele motor). Se você foi citado em 12 de 46 medições bem-sucedidas no ChatGPT, a sua pontuação no ChatGPT é 26.1.
As perguntas: 30 por motor, cinco intenções
As perguntas são geradas para o seu negócio e a sua cidade, e são escritas do jeito que os clientes escrevem, não do jeito que o pessoal de marketing escreve. Trinta por motor, distribuídas em cinco intenções, cada intenção aparecendo em duas variações: uma que nomeia a sua cidade explicitamente e outra formulada como “perto de mim”, com a localização passada como parâmetro da API em vez de digitada dentro da pergunta.
- best_of — “Quem é o melhor dentista de implantes em [cidade]?”
- near_me — “Bom med spa perto de mim”, com a localização entregue ao motor como parâmetro estruturado, nos motores que aceitam um, em vez de digitada dentro da pergunta.
- attribute — a pergunta que filtra por um fato específico: um convênio aceito, um equipamento usado, um serviço oferecido, um preço.
- comparison — “X ou Y em [cidade]: quem faz os dois e quanto cobra?”
- urgency — a pergunta para o mesmo dia: um dente lascado hoje à noite, um cano estourado, uma consulta de emergência.
138 medições por auditoria, e por que a mesma pergunta é feita três vezes
As oito perguntas de maior intenção — aquelas em que o cliente está mais perto de agendar — são feitas três vezes cada, em vez de uma. Isso transforma 30 perguntas em 46 medições por motor e, somados os três motores, uma auditoria são 138 chamadas ao vivo para ChatGPT, Gemini e Perplexity.
A repetição não é enchimento; é toda a razão de o resultado significar alguma coisa. Esses sistemas não são determinísticos: a mesma pergunta feita duas vezes pode devolver nomes de negócios diferentes. Uma resposta isolada é um caso anedótico. Fazer três vezes as perguntas que mais importam é o que permite separar uma menção pontual de um negócio que o motor cita de forma confiável.
Isso também define o teto honesto da precisão. Com 46 medições por motor, uma única menção move a pontuação daquele motor em cerca de 2.2 pontos. Uma diferença de um ponto entre dois negócios não é um achado, e nós não a relatamos como se fosse.
Os motores que consultamos — e a limitação que não vamos esconder
Medimos três motores: ChatGPT, Google Gemini e Perplexity. Cada um é consultado pela sua API oficial com busca na web ativada, na configuração publicada em nosso código.
Aqui vai a limitação, dita sem rodeios: consultamos os modelos via API, não os aplicativos de consumo. A resposta que um paciente recebe no aplicativo do ChatGPT no celular dele — com o histórico de conversas, a memória, a conta, o nível de assinatura e qualquer versão que a OpenAI tenha lançado naquela manhã — não é necessariamente a resposta que a nossa medição recebeu. Nenhum fornecedor desta categoria consegue medir o aplicativo de consumo em escala, porque não existe interface para isso; quem insinua o contrário está vendendo uma captura de tela.
O que a nossa medição é, com precisão: uma amostra ampla, repetida e reproduzível de como os modelos subjacentes respondem a perguntas de recomendação local com busca na web ao vivo, na sua cidade. O que ela não é: uma escuta no celular dos seus clientes. Achamos que a primeira coisa vale o que se paga por ela e que a segunda não existe. Você merece saber qual das duas está comprando.
Geografia: como os motores ficam sabendo onde o cliente está
Uma recomendação local depende inteiramente de onde o cliente está, e os três motores tratam esse fato de maneiras diferentes.
ChatGPT e Perplexity aceitam uma localização estruturada — cidade, região, país — enviada junto com a pergunta, e é por isso que as nossas perguntas de “perto de mim” podem ser formuladas exatamente como um cliente as formula, sem a cidade digitada no texto.
O Gemini, nos nossos testes, não reagiu a uma localização fornecida dessa forma. Então, para o Gemini, recorremos a nomear a cidade dentro do próprio texto da pergunta. Essa é uma assimetria real entre os motores, definida por uma chave no nosso código em vez de escondida numa caixa-preta, e significa que os resultados de “perto de mim” do Gemini respondem a uma pergunta um pouco diferente da do ChatGPT. Preferimos contar isso a fingir que os três motores foram consultados de forma idêntica.
Como as três pontuações dos motores viram um número só
O AI Visibility Score final é uma média ponderada das três pontuações de motor: ChatGPT 0.45, Gemini 0.30, Perplexity 0.25.
Esses pesos são um julgamento, não uma medição. São a nossa estimativa de quanto do público que usa assistentes cada motor realmente alcança, e não nos apegamos a eles. Nós os publicamos exatamente por isso: você pode pegar as pontuações por motor do seu relatório, aplicar os seus próprios pesos e chegar ao seu próprio número. Nada fica escondido dentro da média.
Uma regra mecânica protege a média do lixo. Se um motor devolve respostas utilizáveis em menos da metade das suas medições — uma queda do serviço, limitação de taxa, um modelo se recusando a responder —, esse motor sai da pontuação por completo e os pesos restantes são renormalizados, em vez de deixar um motor quebrado puxar o número para baixo e apresentar isso como invisibilidade. Se nenhum motor passa dessa barra, a auditoria informa que não há pontuação em vez de inventar uma.
As faixas de veredito, e o fato de que são um julgamento
Uma pontuação de 40 ou mais é lida como visível. Entre 10 e 39 é lida como fraca. Abaixo de 10 — incluindo um negócio que nunca foi citado — é lida como invisível.
Não há ciência por trás desses dois pontos de corte. São as fronteiras que escolhemos para tornar o número legível para o dono de um negócio, e são a parte desta metodologia mais aberta a discordância razoável. O que elas não são é uma alavanca oculta: as suas porcentagens brutas por motor estão no relatório e, se você acha que a linha entre fraco e visível fica em 35 ou em 50, pode traçá-la você mesmo.
Para dar escala, a partir de um mercado real: no nosso benchmark odontológico de Dallas de julho de 2026, a clínica de melhor desempenho em toda a região metropolitana marcou 27.0 de 100 (o benchmark). Ninguém naquele mercado passou da barra da visibilidade. Uma pontuação de 40 é uma barra alta, e é para ser assim mesmo.
Contando menções: como um nome numa frase vira um número
Toda menção é extraída do texto de uma resposta real. Os nomes dos negócios são normalizados (maiúsculas, pontuação, sufixos como “LLC” ou “DDS”). Duas grafias diferentes são contadas como um único negócio apenas quando algo nos dados mostra que são o mesmo: a grafia idêntica depois de removidos acentos e pontuação, o mesmo nome escrito em outro alfabeto, ou ambas as grafias aparecendo ao lado de citações do mesmo site da empresa. Grafias que surgem numa mesma resposta como dois itens separados nunca são combinadas — um assistente que lista opções não cita o mesmo negócio duas vezes, então isso é evidência de dois negócios, e não de um. A mesma regra vale para o seu próprio negócio e para cada concorrente, e uma grafia que não conseguimos ligar a nada permanece na sua própria linha em vez de ser agregada num palpite. Isso é deliberado: uma tabela de concorrentes que divide um negócio em dois é ruidosa, mas uma que funde dois negócios em um está simplesmente errada.
Para a tabela de concorrentes, um negócio precisa de pelo menos duas menções independentes para aparecer. Uma única menção de passagem está dentro do piso de ruído de um sistema não determinístico, e uma tabela cheia de negócios com uma menção só seria uma tabela de coincidências. Duas exceções são deliberadas: o seu próprio negócio sempre aparece, inclusive quando a resposta honesta é um zero — um zero que você pediu é um achado, e omiti-lo em silêncio seria mentir por omissão. Os concorrentes que você mesmo indicou dispensam o limite de duas menções e entram com uma. Um concorrente indicado por você que nenhum motor mencionou sequer uma vez não aparece hoje como linha zerada na tabela; isso é uma limitação da versão atual, não um julgamento de que o fato seja irrelevante, e está na lista para corrigir.
O Share of Voice usa um denominador mais amplo que o da tabela de concorrentes. Ele conta cada menção canônica distinta a um negócio em cada resposta bem-sucedida, incluindo negócios mencionados uma única vez. O mesmo negócio pode contar no máximo uma vez por resposta, mesmo que o modelo repita o nome dele ou use vários apelidos. O seu Share of Voice é 100 × (pares resposta-e-negócio que pertencem a você ÷ todos os pares resposta-e-negócio). É uma parcela das menções observadas nesta auditoria, não participação de mercado nem tráfego de busca.
Também registramos cada domínio de origem que os motores citaram. Foi isso que produziu o achado mais incômodo que já publicamos: nos três mercados de Dallas que medimos em julho de 2026, de 73% a 79% das fontes por trás das recomendações da IA eram os sites dos próprios negócios, não diretórios — um resultado que contraria boa parte do que este setor vende e boa parte do que nós mesmos escrevíamos. Os detalhamentos por mercado estão publicados nas páginas de benchmark.
O que esta pontuação não consegue fazer
Ela não consegue prever. A pontuação descreve como os motores responderam durante a janela de medição. Não é uma previsão do mês que vem, e uma atualização de modelo pode mexer nela sem que nada no seu negócio tenha mudado.
Ela não consegue garantir. Ninguém pode prometer que o ChatGPT vai recomendar você, porque não há posição à venda nem lista ordenada em que entrar. Quem vende um #1 garantido numa resposta de IA está vendendo um lugar que não existe.
Ela não consegue provar causalidade. Podemos mostrar que os negócios citados por um motor tendem a ser aqueles cujos fatos estão declarados em texto legível e repetidos de forma consistente em todos os lugares que o motor consulta. Não realizamos um experimento controlado provando que corrigir uma lacuna específica eleva a sua pontuação — ninguém realizou, e o fornecedor que apresenta um número causal aqui está chutando. O que podemos fazer é medir você antes, medir de novo depois e dizer com honestidade o que se moveu.
É um único dia. O benchmark de Dallas é um retrato de 7 de julho de 2026. Faça as mesmas perguntas em outubro e os nomes terão mudado. Isso é um argumento para remedir, não para tratar uma medição isolada como verdade revelada — inclusive a nossa.
Reprodutibilidade
Cada resposta bruta de IA coletada durante uma auditoria fica armazenada, junto com a pergunta que a produziu, o motor que respondeu, o horário e os domínios de origem citados. Cada número de um relatório da RecoSignal remonta a esse texto.
Essa é a parte que separa uma medição de uma alegação de marketing, e é o padrão pelo qual gostaríamos que o resto desta categoria fosse cobrado — inclusive por quem estiver lendo esta página com o relatório de um concorrente aberto em outra aba. Se um número do seu relatório parecer errado, peça-nos as respostas que estão por trás dele. Elas existem.
Esta página descreve a versão 1.2 da metodologia. Quando o método muda, a versão muda, e os relatórios informam qual versão os produziu.
Veja o método rodando no seu próprio negócio
O jeito mais rápido de julgar uma metodologia é vê-la produzir um resultado que você consegue conferir. O AI Visibility Snapshot gratuito roda a medição descrita acima no seu negócio e informa a sua pontuação, a sua parcela de recomendações diante dos concorrentes e a sua maior lacuna — com as respostas brutas por trás disso. Se o número surpreender você, as respostas estão lá para serem contestadas.
Perguntas frequentes
- Por que medir frequência em vez da minha posição no ChatGPT?
- Porque não existe posição. Assistentes de IA não mantêm uma lista ordenada de negócios; eles geram uma resposta, e a ordem dos nomes dentro dela muda entre execuções da mesma pergunta. Registramos a posição como diagnóstico e damos a ela peso zero na pontuação. O fornecedor que vende a você uma “posição no ChatGPT” está colocando casa decimal em ruído.
- Vocês medem o aplicativo do ChatGPT que os meus clientes usam de verdade?
- Não, e ninguém mais mede. Consultamos os modelos pelas APIs oficiais deles com busca na web ativada. O aplicativo de consumo acrescenta histórico de conversas, memória da conta, nível de assinatura e mudanças do lado do app que não conseguimos ver nem reproduzir, de modo que a resposta no celular de um cliente pode diferir da nossa. O que produzimos é uma amostra ampla, repetível e verificável de como os modelos subjacentes respondem a perguntas de recomendação local na sua cidade — não uma gravação das telas dos seus clientes.
- De onde vêm os pesos dos motores?
- Do nosso julgamento sobre quanto do público que usa assistentes cada motor alcança: ChatGPT 0.45, Gemini 0.30, Perplexity 0.25. Não são uma medição, e nós os publicamos justamente para que você possa rejeitá-los. O seu relatório traz as pontuações brutas por motor; aplique os seus próprios pesos e calcule o seu próprio número se os nossos não corresponderem ao seu mercado.
- Por que 40 é a linha do “visível”?
- Porque fomos nós que a traçamos ali. As faixas (≥40 visível, 10–39 fraco, <10 invisível) existem para tornar o número legível para um dono de negócio, não porque um estudo tenha estabelecido esses pontos de corte. Para dar contexto, a clínica odontológica de melhor desempenho em todo o nosso benchmark da região metropolitana de Dallas marcou 27.0 de 100 — naquele mercado, ninguém passou da barra.
- Quantas medições tem uma única auditoria?
- 138 chamadas ao vivo: 30 perguntas no estilo do cliente por motor, entre ChatGPT, Gemini e Perplexity, com as 8 perguntas de maior intenção feitas três vezes cada — 46 medições por motor. As repetições existem porque esses sistemas não são determinísticos, e uma resposta isolada é um caso anedótico, não uma medição.
- Se eu corrigir as lacunas do meu relatório, a minha pontuação vai subir?
- Isso deve aumentar a probabilidade de você ser citado, e não vamos fingir saber mais do que isso. Nenhum estudo controlado provou que uma correção específica cause um aumento específico de pontuação — nem o nosso, nem o de qualquer concorrente. O que podemos fazer é medir de novo depois das mudanças e dizer o que de fato se moveu, e é por isso que remedir importa mais do que qualquer número isolado.
Descubra se a IA recomenda o seu negócio
O Snapshot gratuito mostra o seu AI Visibility Score e quem o ChatGPT, o Gemini e o Perplexity recomendam em vez de si.
Rodar um AI Visibility Snapshot gratuito