RecoSignal

Wie wir KI-Sichtbarkeit messen: die vollständige Methodik

Aktualisiert 17. Juli 2026 · RecoSignal-Team

Das Wichtigste in Kürze

  • Wir messen Häufigkeit, nicht Rang: Wie oft nennt ein Assistent Ihr Unternehmen über 30 kundennah formulierte Anfragen pro Engine hinweg? Die Position innerhalb einer Antwort halten wir fest, im Score wird sie mit null gewichtet, denn die Reihenfolge der Namen in KI-Antworten ist instabil.
  • Ein Audit sind 138 Messungen: 30 Anfragen an jede der Engines ChatGPT, Gemini und Perplexity, wobei die 8 Anfragen mit der höchsten Kaufabsicht je dreimal gestellt werden — 46 Messungen pro Engine.
  • Die Engine-Gewichte (ChatGPT 0.45, Gemini 0.30, Perplexity 0.25) und die Verdikt-Bänder (≥40 sichtbar, 10–39 schwach, <10 unsichtbar) sind Urteile, keine Messungen. Wir veröffentlichen sie, damit Sie ihnen widersprechen und neu rechnen können.
  • Was der Score nicht kann: vorhersagen, garantieren oder Kausalität beweisen. Er ist eine Momentaufnahme davon, wie drei Engines an einem Tag geantwortet haben; ein erneuter Lauf an einem anderen Tag verschiebt die Zahl.
  • Jede Rohantwort wird gespeichert. Jede Zahl in einem RecoSignal-Bericht lässt sich bis zum Text einer echten KI-Antwort zurückverfolgen — und das ist der einzige Grund, davon überhaupt etwas zu glauben.

Warum es diese Seite gibt

Eine Branche, die „KI-Sichtbarkeitswerte“ verkauft, ohne offenzulegen, wie sie berechnet werden, verdient das Misstrauen, das sie erntet. Ein Wert, dessen Methode geheim ist, lässt sich weder prüfen noch bestreiten noch reproduzieren — und damit ist er nicht zu unterscheiden von einer Zahl, die erfunden wurde, um ein Abo zu verkaufen.

Hier also die Methode vollständig: die Anfragen, die Engines, die Rechnung, die Schwellen und die konkreten Dinge, die diese Zahl nicht beweist. Wo eine Entscheidung ein Urteil und keine Messung ist, steht das ausdrücklich dabei. Wo die Methode eine Grenze hat, die gegen uns spricht, wird sie hier genannt, statt sie einem Wettbewerber zum Finden zu überlassen.

Diese Seite folgt dem Code. Ändert sich die Messung, ändern sich diese Seite und die Version der Methodik mit ihr.

Was wir messen: Häufigkeit, nicht Rang

Die Kernfrage ist einfach: Wie oft nennt ein Assistent Ihr Unternehmen über viele realistische, kundennah formulierte Fragen hinweg? Jede Messung ist binär. In der Antwort genannt zählt 1. Nicht genannt zählt 0. Mehr geht in den Score nicht ein.

Wir halten zwar fest, an welcher Stelle der Antwort Ihr Name auftauchte, doch dieser Rang wird als Diagnostik gespeichert und mit dem Gewicht null gewertet. Der Grund: Die Reihenfolge der Namen innerhalb einer KI-Antwort ist nicht stabil genug, um darauf eine Kennzahl zu bauen — stellen Sie dieselbe Frage zweimal, und dieselben Unternehmen können in anderer Reihenfolge zurückkommen. Ein Anbieter, der Ihren „Rang in ChatGPT“ meldet, meldet Rauschen mit einem Komma darin. In diesen Systemen gibt es keine sortierte Liste, in der man einen Platz einnehmen könnte.

Ein Engine-Score ist deshalb ein Prozentwert: 100 × (Messungen, die Sie nennen ÷ erfolgreiche Messungen auf dieser Engine). Wurden Sie in 12 von 46 erfolgreichen Messungen auf ChatGPT genannt, liegt Ihr ChatGPT-Score bei 26.1.

Die Fragen: 30 Anfragen pro Engine, fünf Absichten

Die Anfragen werden für Ihr Unternehmen und Ihre Stadt erzeugt, und sie sind so geschrieben, wie Kunden schreiben, nicht wie Marketingleute schreiben. Dreißig pro Engine, verteilt auf fünf Absichten, wobei jede Absicht in zwei Varianten vorkommt: eine, die Ihre Stadt ausdrücklich nennt, und eine als „in meiner Nähe“ formulierte, bei der der Standort als API-Parameter übergeben statt in die Frage getippt wird.

  • best_of — „Wer ist der beste Implantologe in [city]?“
  • near_me — „Gutes Med-Spa in meiner Nähe“, wobei der Standort der Engine als strukturierter Parameter übergeben wird, sofern sie einen unterstützt, statt in die Frage getippt zu werden.
  • attribute — die Frage, die auf eine konkrete Tatsache filtert: eine akzeptierte Versicherung, ein eingesetztes Gerät, eine angebotene Leistung, ein Preis.
  • comparison — „X oder Y in [city]: Wer macht beides, und was kostet es?“
  • urgency — die Frage für denselben Tag: ein abgebrochener Zahn heute Abend, ein Rohrbruch, ein Notfalltermin.

138 Messungen pro Audit — und warum dieselbe Frage dreimal gestellt wird

Die acht Anfragen mit der höchsten Kaufabsicht — jene, bei denen ein Kunde einer Buchung am nächsten ist — werden je dreimal statt einmal gestellt. Damit werden aus 30 Anfragen 46 Messungen pro Engine, und über drei Engines hinweg ist ein Audit 138 echte Aufrufe an ChatGPT, Gemini und Perplexity.

Die Wiederholung ist kein Füllmaterial; sie ist der ganze Grund, warum das Ergebnis überhaupt etwas bedeutet. Diese Systeme sind nicht deterministisch: Dieselbe Frage, zweimal gestellt, kann verschiedene Firmennamen hervorbringen. Eine einzelne Antwort ist eine Anekdote. Die wichtigsten Fragen dreimal zu stellen, ist der Weg, eine zufällige Erwähnung von einem Unternehmen zu unterscheiden, das die Engine verlässlich nennt.

Das setzt zugleich die ehrliche Obergrenze der Genauigkeit. Bei 46 Messungen pro Engine verschiebt eine einzelne Erwähnung den Score dieser Engine um rund 2.2 Punkte. Ein Unterschied von einem Punkt zwischen zwei Unternehmen ist kein Befund, und wir berichten ihn auch nicht als solchen.

Die Engines, die wir fragen — und die Grenze, die wir nicht verschweigen

Wir messen drei Engines: ChatGPT, Google Gemini und Perplexity. Jede wird über ihre offizielle API mit aktivierter Websuche abgefragt, in der Konfiguration, die in unserem Code veröffentlicht ist.

Hier die Grenze, klar gesagt: Wir fragen die API-Modelle ab, nicht die Consumer-Apps. Die Antwort, die eine Patientin in der ChatGPT-App auf ihrem Telefon bekommt — mit ihrem Chatverlauf, ihrem Gedächtnis, ihrem Konto, ihrer Abostufe und der Version, die OpenAI an jenem Morgen ausgeliefert hat —, ist nicht garantiert dieselbe Antwort, die unsere Messung erhalten hat. Kein Anbieter dieser Branche kann die Consumer-App in großem Maßstab messen, weil es dafür schlicht keine Schnittstelle gibt; wer anderes andeutet, verkauft Ihnen einen Screenshot.

Was unsere Messung genau ist: eine große, wiederholte, reproduzierbare Stichprobe davon, wie die zugrunde liegenden Modelle lokale Empfehlungsfragen mit aktiver Websuche in Ihrer Stadt beantworten. Was sie nicht ist: eine Wanze an den Telefonen Ihrer Kunden. Wir halten das Erste für sein Geld wert und das Zweite für schlicht nicht existent. Sie sollten wissen, was von beidem Sie kaufen.

Geografie: wie den Engines mitgeteilt wird, wo der Kunde ist

Eine lokale Empfehlung hängt vollständig davon ab, wo der Kunde gerade steht, und die drei Engines gehen mit dieser Tatsache unterschiedlich um.

ChatGPT und Perplexity nehmen einen strukturierten Standort — Stadt, Region, Land — entgegen, der neben der Frage übergeben wird; deshalb können unsere „in meiner Nähe“-Anfragen genau so formuliert sein, wie ein Kunde sie formuliert, ohne dass eine Stadt im Text steht.

Gemini hat in unseren Tests auf einen so übergebenen Standort nicht reagiert. Für Gemini fallen wir deshalb darauf zurück, die Stadt im Fragetext selbst zu nennen. Das ist eine echte Asymmetrie zwischen den Engines, sie ist durch ein Flag in unserem Code gesetzt und nicht in einer Blackbox versteckt, und sie bedeutet, dass Geminis „in meiner Nähe“-Ergebnisse eine leicht andere Frage beantworten als die von ChatGPT. Wir sagen Ihnen das lieber, als so zu tun, als wären alle drei Engines identisch befragt worden.

Wie aus drei Engine-Scores eine Zahl wird

Der endgültige AI Visibility Score ist ein gewichteter Mittelwert der drei Engine-Scores: ChatGPT 0.45, Gemini 0.30, Perplexity 0.25.

Diese Gewichte sind ein Urteil, keine Messung. Sie sind unsere Schätzung, welchen Anteil des assistenznutzenden Publikums jede Engine tatsächlich erreicht, und wir halten daran nicht verbissen fest. Genau deshalb veröffentlichen wir sie: Sie können die Werte je Engine aus Ihrem Bericht nehmen, Ihre eigenen Gewichte anwenden und Ihre eigene Zahl erhalten. Im Mittelwert ist nichts versteckt.

Eine mechanische Regel schützt den Mittelwert vor Müll. Liefert eine Engine für weniger als die Hälfte ihrer Messungen brauchbare Antworten — Ausfall, Rate-Limit, ein Modell, das die Antwort verweigert —, fällt diese Engine ganz aus dem Score, und die verbleibenden Gewichte werden neu normiert, statt eine kaputte Engine die Zahl nach unten ziehen und das als Unsichtbarkeit durchgehen zu lassen. Schafft keine Engine diese Hürde, meldet das Audit keinen Score, statt einen zu erfinden.

Die Verdikt-Bänder — und die Tatsache, dass sie ein Urteil sind

Ein Wert von 40 oder darüber gilt als sichtbar. Zwischen 10 und 39 gilt als schwach. Unter 10 — einschließlich eines Unternehmens, das kein einziges Mal genannt wurde — gilt als unsichtbar.

Hinter diesen beiden Schwellenwerten steckt keine Wissenschaft. Es sind die Grenzen, die wir gezogen haben, um eine Zahl für Inhaberinnen und Inhaber lesbar zu machen, und sie sind der Teil dieser Methodik, der begründetem Widerspruch am offensten steht. Was sie nicht sind: ein versteckter Hebel. Ihre rohen Prozentwerte je Engine stehen im Bericht, und wenn Sie finden, die Linie zwischen schwach und sichtbar gehöre auf 35 oder auf 50, können Sie sie dort selbst ziehen.

Zur Einordnung, aus einem echten Markt: In unserem Dallas-Zahnarzt-Benchmark vom Juli 2026 kam die Praxis mit dem höchsten Wert in der gesamten Metropolregion auf 27.0 von 100 (der Benchmark). Niemand in diesem Markt hat die Sichtbarkeitsschwelle überschritten. Ein Wert von 40 ist eine hohe Hürde, und das ist so gewollt.

Erwähnungen zählen: wie aus einem Namen im Satz eine Zahl wird

Jede Erwähnung wird aus dem Text einer echten Antwort geparst. Firmennamen werden normalisiert (Groß- und Kleinschreibung, Interpunktion, Zusätze wie „LLC“ oder „DDS“). Zwei verschiedene Schreibweisen zählen nur dann als ein Unternehmen, wenn etwas in den Daten zeigt, dass es dasselbe ist: identische Schreibweise, sobald Akzente und Interpunktion entfernt sind, derselbe Name in einem anderen Alphabet, oder beide Schreibweisen erscheinen neben Zitaten derselben Firmenwebsite. Schreibweisen, die in derselben Antwort als zwei getrennte Einträge auftauchen, werden nie zusammengeführt — ein Assistent, der Optionen auflistet, nennt dasselbe Unternehmen nicht zweimal, also ist das ein Beleg für zwei Unternehmen, nicht für eines. Dieselbe Regel gilt für Ihr eigenes Unternehmen und für jeden Wettbewerber, und eine Schreibweise, die wir mit nichts verknüpfen können, bleibt in ihrer eigenen Zeile, statt auf Verdacht eingegliedert zu werden. Das ist Absicht: Eine Bestenliste, die ein Unternehmen in zwei teilt, ist verrauscht, aber eine, die zwei Unternehmen zu einem verschmilzt, ist schlicht falsch.

Für die Wettbewerber-Bestenliste braucht ein Unternehmen mindestens zwei unabhängige Erwähnungen, um dort aufzutauchen. Eine einzelne beiläufige Erwähnung liegt im Grundrauschen eines nicht deterministischen Systems, und eine Bestenliste voller Unternehmen mit je einer Erwähnung wäre eine Bestenliste der Zufälle. Zwei Ausnahmen sind Absicht: Ihr eigenes Unternehmen erscheint immer, auch wenn die ehrliche Antwort eine Null ist — eine Null, um die Sie gebeten haben, ist ein Befund, und sie stillschweigend wegzulassen wäre eine Lüge durch Unterlassen. Wettbewerber, die Sie selbst genannt haben, umgehen die Schwelle von zwei Erwähnungen bereits mit einer Erwähnung. Ein von Ihnen genannter Wettbewerber, den keine Engine auch nur einmal erwähnt hat, erscheint derzeit nicht als Null-Zeile in der Bestenliste; das ist eine Grenze des aktuellen Stands, kein Urteil darüber, dass diese Tatsache unwichtig wäre, und sie steht auf der Liste der zu behebenden Punkte.

Share of Voice nutzt einen breiteren Nenner als die Bestenliste. Er zählt jede eigenständige kanonische Unternehmenserwähnung in jeder erfolgreichen Antwort, auch Unternehmen, die nur einmal erwähnt wurden. Dasselbe Unternehmen zählt höchstens einmal pro Antwort, selbst wenn das Modell seinen Namen wiederholt oder mehrere Schreibvarianten verwendet. Ihr Share of Voice ist 100 × (Antwort-Unternehmen-Paare, die Ihnen gehören ÷ alle Antwort-Unternehmen-Paare). Das ist ein Anteil an den beobachteten Erwähnungen in diesem Audit, kein Marktanteil und kein Suchtraffic.

Wir erfassen außerdem jede Quell-Domain, die die Engines zitiert haben. Daraus entstand der unbequemste Befund, den wir veröffentlicht haben: Über die drei Dallas-Märkte hinweg, die wir im Juli 2026 gemessen haben, waren 73% bis 79% der Quellen hinter den KI-Empfehlungen die eigenen Websites der Unternehmen und nicht Verzeichnisse — ein Ergebnis, das gegen einen großen Teil dessen spricht, was diese Branche verkauft, und gegen einen großen Teil dessen, was wir selbst früher geschrieben haben. Die Aufschlüsselungen je Markt sind auf den Benchmark-Seiten veröffentlicht.

Was dieser Score nicht kann

Er kann nicht vorhersagen. Der Score beschreibt, wie die Engines während des Messfensters geantwortet haben. Er ist keine Prognose für den nächsten Monat, und ein Modell-Update kann ihn verschieben, ohne dass sich an Ihrem Unternehmen irgendetwas ändert.

Er kann nichts garantieren. Niemand kann versprechen, dass ChatGPT Sie empfiehlt, denn es gibt keine Position zu kaufen und keine sortierte Liste zu betreten. Wer einen garantierten Platz 1 in einer KI-Antwort verkauft, verkauft einen Platz, den es nicht gibt.

Er kann keine Kausalität beweisen. Wir können zeigen, dass die Unternehmen, die eine Engine nennt, meist jene sind, deren Fakten in lesbarem Text stehen und überall dort einheitlich wiederholt werden, wo die Engine nachschaut. Wir haben kein kontrolliertes Experiment durchgeführt, das beweisen würde, dass das Schließen einer bestimmten Lücke Ihren Wert hebt — niemand hat das, und ein Anbieter, der hier eine kausale Zahl nennt, rät. Was wir tun können: Sie vorher messen, nach den Änderungen erneut messen und Ihnen ehrlich sagen, was sich bewegt hat.

Es ist ein einziger Tag. Der Dallas-Benchmark ist eine Momentaufnahme vom 7. Juli 2026. Stellen Sie dieselben Fragen im Oktober, und die Namen werden sich verschoben haben. Das ist ein Argument für erneutes Messen, nicht dafür, eine einzelne Messung für die reine Wahrheit zu halten — auch nicht unsere.

Reproduzierbarkeit

Jede während eines Audits gesammelte KI-Rohantwort wird gespeichert, zusammen mit der Anfrage, die sie erzeugt hat, der Engine, die geantwortet hat, dem Zeitstempel und den zitierten Quell-Domains. Jede Zahl in einem RecoSignal-Bericht führt auf diesen Text zurück.

Das ist der Teil, der eine Messung von einer Marketingbehauptung trennt, und es ist der Maßstab, an dem der Rest dieser Branche gemessen werden sollte — auch von allen, die diese Seite mit dem Bericht eines Wettbewerbers im Nachbartab lesen. Wenn eine Zahl in Ihrem Bericht falsch aussieht, fragen Sie uns nach den Antworten dahinter. Es gibt sie.

Diese Seite beschreibt Methodik-Version 1.2. Ändert sich die Methode, ändert sich die Version, und Berichte nennen, welche Version sie erzeugt hat.

Sehen Sie es an Ihrem eigenen Unternehmen laufen

Der schnellste Weg, eine Methodik zu beurteilen, ist zuzusehen, wie sie ein Ergebnis erzeugt, das Sie überprüfen können. Der kostenlose AI Visibility Snapshot führt die oben beschriebene Messung an Ihrem Unternehmen durch und meldet Ihren Wert, Ihren Anteil an den Empfehlungen gegenüber Ihren Wettbewerbern und Ihre größte einzelne Lücke — mitsamt den Rohantworten dahinter. Wenn die Zahl Sie überrascht, sind die Antworten da, mit denen Sie streiten können.

Häufige Fragen

Warum Häufigkeit messen statt meinen Rang in ChatGPT?
Weil es keinen Rang gibt. KI-Assistenten führen keine sortierte Liste von Unternehmen; sie erzeugen eine Antwort, und die Reihenfolge der Namen darin verschiebt sich zwischen Läufen derselben Frage. Wir erfassen die Position als Diagnostik und geben ihr im Score das Gewicht null. Ein Anbieter, der Ihnen einen „Rang in ChatGPT“ verkauft, setzt ein Komma hinter Rauschen.
Messen Sie die tatsächliche ChatGPT-App, die meine Kunden nutzen?
Nein, und niemand sonst tut das. Wir fragen die Modelle über ihre offiziellen APIs mit aktivierter Websuche ab. Die Consumer-App fügt Chatverlauf, Kontogedächtnis, Abostufe und App-seitige Änderungen hinzu, die wir weder sehen noch reproduzieren können, deshalb kann die Antwort auf dem Telefon eines Kunden von unserer abweichen. Was wir erzeugen, ist eine große, wiederholbare, überprüfbare Stichprobe davon, wie die zugrunde liegenden Modelle lokale Empfehlungsfragen in Ihrer Stadt beantworten — und keine Aufzeichnung der Bildschirme Ihrer Kunden.
Woher kommen die Engine-Gewichte?
Aus unserem Urteil darüber, welchen Anteil des assistenznutzenden Publikums jede Engine erreicht: ChatGPT 0.45, Gemini 0.30, Perplexity 0.25. Sie sind keine Messung, und wir veröffentlichen sie genau deshalb, damit Sie sie verwerfen können. Ihr Bericht enthält die rohen Werte je Engine; wenden Sie Ihre eigenen Gewichte an und rechnen Sie Ihre eigene Zahl aus, wenn unsere nicht zu Ihrem Markt passen.
Warum ist 40 die Linie für „sichtbar“?
Weil wir sie dort gezogen haben. Die Bänder (≥40 sichtbar, 10–39 schwach, <10 unsichtbar) gibt es, damit die Zahl für Inhaberinnen und Inhaber lesbar wird, und nicht, weil eine Studie diese Schwellenwerte festgelegt hätte. Zum Kontext: Die stärkste Zahnarztpraxis in unserem gesamten Dallas-Metro-Benchmark kam auf 27.0 von 100 — in diesem Markt hat niemand die Schwelle überschritten.
Wie viele Messungen sind ein einzelnes Audit?
138 echte Aufrufe: 30 kundennah formulierte Anfragen pro Engine über ChatGPT, Gemini und Perplexity hinweg, wobei die 8 Anfragen mit der höchsten Kaufabsicht je dreimal gestellt werden — 46 Messungen pro Engine. Die Wiederholungen gibt es, weil diese Systeme nicht deterministisch sind und eine einzelne Antwort eher eine Anekdote als eine Messung ist.
Wenn ich die Lücken aus meinem Bericht schließe, steigt dann mein Wert?
Es sollte die Wahrscheinlichkeit erhöhen, dass Sie genannt werden, und mehr zu wissen geben wir nicht vor. Keine kontrollierte Studie hat bewiesen, dass eine bestimmte Korrektur einen bestimmten Anstieg des Werts verursacht — weder unsere noch die eines Wettbewerbers. Was wir tun können: nach den Änderungen erneut messen und Ihnen sagen, was sich tatsächlich bewegt hat, weshalb die Neumessung mehr zählt als jede einzelne Zahl.

Finden Sie heraus, ob KI Ihr Unternehmen empfiehlt

Der kostenlose Snapshot zeigt Ihren AI Visibility Score und wen ChatGPT, Gemini und Perplexity statt Ihnen empfehlen.

Kostenlosen AI Visibility Snapshot starten