Research

Markensichtbarkeit in KI-Suchergebnissen messen

Erwähnung, Aufnahme in die Antwort und Zitat laufen auseinander, sobald du einen Assistenten mehr als einmal fragst. Ein einziger Prompt kann die gesamte Präsenz einer Marke tragen, ein Parser kann ihre Zitierrate um das 2,5-Fache verschieben, und eine halluzinierte Lizenz zählt trotzdem als Erwähnung. Ein Workflow für technische Teams, gebaut auf 359 Antworten.

Am 28. September habe ich Beetroot, den Clipboard-Manager für Windows, den ich baue, durch zehn Prompts auf vier KI-Oberflächen geschickt. Je nachdem, welche Zahl du nimmst, lag seine Sichtbarkeit bei 0 Prozent (jedes Modell ohne Webzugriff), bei 9 oder 13 Prozent (die beiden Oberflächen mit Suche, gemittelt über das Panel) oder bei 100 Prozent (Sonar, bei dem einen Prompt zu KI-Funktionen). Alle vier stimmen. Das ist das Erste, was du verstehen musst, wenn du Markensichtbarkeit in KI-Suchergebnissen messen willst: Keine dieser Zahlen beantwortet die Frage „Wie sichtbar sind wir?“

Eine Sichtbarkeitszahl bedeutet nur etwas zusammen mit der Oberfläche, von der sie stammt, den Prompts, über die gemittelt wurde, der Zahl der Samples dahinter und der Regel, die entschieden hat, was zählt. Lass eines davon weg, und du schaust auf eine Zufallsvariable, die sich als KPI verkleidet hat.

Vier Begriffe werden in Berichten zur KI-Sichtbarkeit wie Synonyme benutzt: Sichtbarkeit, Erwähnung, Zitat und Aufnahme in die Antwort. Die Daten unten trennen sie voneinander, deshalb definiere ich jeden zuerst. Danach kommt ein Workflow, den ein technisches Team selbst fahren kann, samt der Fehler, bei denen mich mein eigener kleiner Lauf erwischt hat.

Was bedeuten Sichtbarkeit, Erwähnung, Zitat und Aufnahme in die Antwort eigentlich?

Drei davon sind Ergebnisse, die du pro Antwort erfasst, der vierte ist die Zusammenfassung, die du daraus baust. Wirfst du sie in eine Zahl, kannst du nicht mehr unterscheiden, ob die Marke genannt, empfohlen oder als Quelle angegeben wurde.

Erwähnung (mention). Der Name der Marke steht im generierten Antworttext. Das ist ein String-Match (exakter Name plus eine geprüfte Alias-Liste), gezählt pro Antwort. Über den Kontext sagt er nichts: „Beetroot and similar indie apps“ ist eine Erwähnung, „avoid Beetroot“ ist eine Erwähnung, und ebenso jede Antwort auf einen Prompt, in dem der Markenname schon stand.

Aufnahme in die Antwort (answer inclusion). Die Marke gehört zu dem, was die Antwort für das Anliegen des Nutzers tatsächlich empfiehlt: ein eigener Listenpunkt, ein eigener Absatz, ein namentlicher Tipp. Das ist ein Urteil, kein String-Match, und es braucht meist einen Bewerter (eine Person oder ein zweites Modell, das du auditierst). Halte auch die Position fest. Platz eins von fünf und „auch einen Blick wert“ ganz unten sind verschiedene Ergebnisse.

Zitat (citation). Eine URL, die dir gehört, hängt als Quelle an der Antwort: eine Annotation, eine Fußnote, ein Inline-Link in einer Antwort, die auf Retrieval aufbaut. Ein Link, den ein Modell aus dem Gedächtnis schreibt, ohne Retrieval dahinter, gehört in ein anderes Feld (dazu unten mehr). Das Zitat ist von der Erwähnung unabhängig. Ein Modell kann dich aus dem Gedächtnis nennen, ohne Quelle, und es kann deine Vergleichsseite zitieren, während es einen Wettbewerber empfiehlt.

Sichtbarkeit (visibility). Die übergreifende Zusammenfassung: die Rate, mit der eine Marke in einer festgelegten Menge von Antworten auftaucht, also in einem fixen Prompt-Panel auf einer fixen Oberfläche über einen fixen Zeitraum. Sie ist immer ein Vektor (Erwähnungsrate, Aufnahmerate, Zitierrate, jeweils mit ihrer Stichprobengröße), nie ein einzelner Score, und sie existiert nie ohne das Panel, über das sie berechnet wurde.

Allen vier vorgelagert gibt es noch ein fünftes Objekt, das kaum jemand misst, weil die meisten Tools es verstecken: Retrieval, also die Seiten, die das System abgerufen hat, bevor es geschrieben hat. Abgerufen heißt nicht zitiert, und die Lücke dazwischen war am Ende groß.

Was hat ein einziges kleines Panel gezeigt?

Ich habe am 28. September 2026 zehn Prompts über ein API-Gateway durch vier Oberflächen geschickt. Acht Prompts waren nicht markenbezogen, von der Art, wie Käufer fragen („What is the best clipboard manager for Windows?“, „What are good alternatives to Ditto clipboard manager?“, „Recommend a clipboard manager for Windows that has built-in AI features, like rewriting or translating copied text“). Zwei waren Entitäts-Prompts, die das Produkt beim Namen nennen („Is the Beetroot clipboard manager free and open source? What license does it use?“). Jeder nicht markenbezogene Prompt lief 10-mal pro Oberfläche, jeder Entitäts-Prompt 5-mal. Zurück kamen 359 Antworten (ein Request lief in ein Rate Limit), und der ganze Lauf hat weniger als drei Dollar an Gateway-Guthaben gekostet.

Hier die Ergebnisse ohne Markenbezug, 80 Antworten pro Oberfläche (79 bei Sonar). Ein Vorbehalt zur Zeile mit Websuche: In 9 ihrer 80 Antworten hat das Modell entschieden, gar nicht zu suchen. „Suche verfügbar“ und „Suche benutzt“ sind also nicht dieselbe Bedingung.

OberflächeErwähnungsrate95%-IntervallZitat eigener URL
gpt-5-mini, ohne Tools0 / 800–5%0
Gemini 2.5 Flash, ohne Tools0 / 800–5%0
gpt-5-mini, Websuche7 / 804–17%5 Antworten (2 nur über Annotationen)
Perplexity Sonar10 / 797–22%nicht beobachtbar (siehe unten)

Die Zeilen ohne Tools überraschen nicht, wenn du auf die Daten schaust. Beetroot ist im Februar 2026 öffentlich erschienen. OpenAI gibt den Wissensstand von gpt-5-mini mit 31. Mai 2024 an, und in einem Lauf hat das Modell das selbst gesagt: kein solches Produkt „in my training up through mid-2024“. Ein Produkt, das jünger ist als die Trainingsdaten eines Modells, kann trotzdem aus dem Gedächtnis erwähnt werden (der Abschnitt zu Entitäten unten zeigt, wie), aber das Modell kann es nicht kennen. Für Beetroot waren auf diesen beiden Modellen Oberflächen mit Retrieval der einzige Ort, an dem es überhaupt auftauchte. Deshalb würde ich bei jeder jungen Marke diese zuerst messen.

Warum hat ein einziger Prompt die ganze Sichtbarkeit getragen?

Weil jede Erwähnung von dem einen Prompt kam, der zu dem passte, worin sich das Produkt tatsächlich unterscheidet. Der Prompt zu KI-Funktionen brachte mit Websuche 7 von 10 Erwähnungen und auf Sonar 10 von 10. Die anderen sieben nicht markenbezogenen Prompts brachten mit Websuche 0 von 70 und auf Sonar 0 von 69.

Die „9 Prozent“ und „13 Prozent“ auf Panel-Ebene verstecken also die einzige Struktur in den Daten. Ein Mittelwert über ein Panel ist nur unter dem Fragen-Mix dieses Panels eine Wahrscheinlichkeit, und nichts sagt, dass echte Nutzer in diesem Mix fragen. Die Antworten zeigen einen Intent, bei dem Beetroot in 17 von 20 Läufen auftauchte, und sieben, bei denen es in keinem von 139 auftauchte. Der Mittelwert vermengt beides zu einer Zahl, der keine der beiden Gruppen ähnlich sieht.

Für die Messung folgt daraus zweierlei. Erstens: Berichte pro Prompt (oder pro Intent-Cluster), bevor du irgendeinen Panel-Mittelwert berichtest. Zweitens: Die Zusammensetzung des Panels ist die Metrik. Nimm einen weiteren Prompt zu KI-Funktionen auf, der sich wie dieser verhält, und die Headline-Rate verdoppelt sich fast. Nimm drei auf, und sie verdreifacht sich fast, ohne dass sich in der Welt irgendetwas geändert hat. Deshalb muss das Panel versioniert und eingefroren werden wie Code. Denselben Blick verdient jeder kommerzielle Tracker, den du nutzt: Sein Panel ist die Zusammensetzungsentscheidung von jemand anderem.

Die Sicht auf die Wettbewerber zeigt dasselbe von der anderen Seite. Beim Prompt zu KI-Funktionen hat Sonar in allen 10 Antworten Microsofts PowerToys Advanced Paste genannt, und Beetroot kam in jeder davon auf Platz zwei. Ditto und CopyQ, die jeden anderen Prompt dominieren, tauchten dort auf Sonar überhaupt nicht auf. Ein Share of Voice über die ganze Kategorie würde das wegmitteln. Pro Intent berechnet zeigt er, wem welche Frage gehört.

Warum ist eine Erwähnung nicht dasselbe wie die Aufnahme in die Antwort?

Weil der String-Match Antworten mitzählt, die die Marke nicht wirklich gewonnen hat. Von den sieben Antworten mit Websuche, die Beetroot erwähnten, gaben sechs ihm einen eigenen Empfehlungsplatz (auf den Positionen eins bis vier), und eine packte es in eine Sammelzeile: „PastePaw (and similar indie apps: Beetroot, Klip, Clipboard Genie, PastePaw)“. Eine Regex wertet das als Erwähnung. Ein Leser würde es nicht Empfehlung nennen.

Sonar war der umgekehrte Fall: 10 von 10 Aufnahmen, immer als namentlicher Tipp, nie auf Platz eins. Die Formulierung hat sich zwischen den Läufen kaum bewegt („a good alternative“, „a strong alternative“, „a solid second choice“). Ein beständiger zweiter Platz ist ein anderer Befund als ein wackeliger erster, und eine nackte Erwähnungsrate kann die beiden nicht auseinanderhalten. Erfasse Aufnahme und Position getrennt von der Erwähnung.

Wie viel von der Zitierrate entscheidet dein Parser?

Genug, um die Rate bei denselben Antworten um das 2,5-Fache zu verschieben. Drei Befunde, alle aus der Technik rund um die Modelle und nicht aus den Modellen selbst.

Annotationen gegen Inline-Links. Mit Websuche liefert die API Zitate als strukturierte Annotationen, aber manche Antworten tragen Quellen zusätzlich als einfache Markdown-Links im Text. Zählst du nur Annotationen, haben 2 der 7 erwähnenden Antworten eine Beetroot-URL zitiert. Zählst du die Inline-Links mit, waren es 5. Dieselben Antworten, derselbe Tag, ein Unterschied um das 2,5-Fache, entschieden von einer Zeile Parsing-Code. Leg dich auf eine Definition fest, schreib sie auf und bewahr den Rohtext auf, damit du alte Antworten neu bewerten kannst, wenn du sie änderst.

Zitate, die deine Pipeline still verwirft. Die Antworten von Sonar enthielten neben jeder Beetroot-Empfehlung Fußnotenmarker wie [2][6], und mein Collector hat für keine davon eine Quell-URL erfasst. Die Roh-Responses hatte ich nicht aufbewahrt, also habe ich hinterher noch einen Request über dieselbe Gateway-Route geschickt und den kompletten Body gespeichert: Fußnotenmarker im Text, keine einzige URL irgendwo in der Response. Perplexitys eigene API liefert Zitate mit, diese Route hat sie nicht durchgereicht. Die Antwort ist sichtbar mit Quellen versehen, aber die Zitierrate für diese Oberfläche ist in meinen Daten nicht beobachtbar. Ein Collector kann eine komplette Metrik verlieren, ohne einen einzigen Fehler zu werfen. Speichere deshalb pro Oberfläche ein paar vollständige Roh-Responses und prüf sie auf die Felder, die du zu speichern glaubst.

Abgerufen heißt nicht zitiert. Einmal pro Antwort gezählt, haben die Läufe mit Websuche über 80 nicht markenbezogene Antworten 2.086 URLs abgerufen und 385 davon zitiert (Annotationen plus Inline-Links), rund 18 Prozent. Reddit-Threads wurden in 36 dieser 80 Antworten abgerufen und in 12 zitiert. „Das Modell hat deine Seite gelesen“ und „das Modell hat deine Seite als Quelle angegeben“ sind also getrennte Ereignisse. In einer Antwort wurde Beetroots eigene Seite abgerufen, und die Marke landete trotzdem in der Sammelzeile. In einer anderen wurde Beetroot empfohlen, ohne dass überhaupt eine Beetroot-URL abgerufen wurde, getragen von einem Forenthread darüber auf community.openai.com. Wenn du nur Zitate loggst, siehst du keinen der beiden Fälle.

Noch eine Falle: Auch die Modelle ohne Tools haben URLs produziert, in etwa 3 von 10 Antworten und oft mehrere auf einmal, aus dem Gedächtnis abgerufen statt per Retrieval. Eine zeigte auf clipjump.codeplex.com, einen Host auf einem Dienst, den Microsoft vor Jahren abgeschaltet hat. Eine URL in einer Antwort aus dem Gedächtnis ist eine Behauptung über einen Link, kein Zitat, und sie gehört in eine andere Spalte.

Was ändert sich, wenn der Prompt die Marke schon nennt?

Die Erwähnungsrate wird bedeutungslos (der Name steht im Prompt), und es zählt nur noch, ob die Antwort stimmt, falsch ist oder die Antwort verweigert. Hier gehen die vier Oberflächen am deutlichsten auseinander.

Nach Beetroots Lizenz gefragt, antworteten beide Web-Oberflächen in 5 von 5 Läufen mit Apache 2.0, was stimmt, und nach dem Hersteller gefragt, nannten beide in 5 von 5 den richtigen. gpt-5-mini ohne Tools hat jedes Mal abgelehnt: Beim Lizenz-Prompt fragte es, welches Beetroot ich meine, beim Hersteller-Prompt sagte es, es kenne das Produkt nicht. Das ist keine richtige Antwort, aber der sicherere Fehler. Gemini 2.5 Flash ohne Tools sagte in 4 von 5 Lizenz-Läufen MIT und verlinkte in 3 davon auf GitHub-Repositories unter Accounts, die mit dem Produkt nichts zu tun haben, jedes Mal ein anderes. Nach dem Hersteller gefragt, sagte es in 3 von 5 Läufen, ein solches Produkt gebe es nicht, und nannte in den anderen 2 einen falschen Entwickler.

Ein Dashboard, das „Marke erwähnt“ zählt, wertet diese Gemini-Zeile als volle Sichtbarkeit. Tatsächlich ist es eine selbstsichere Falschaussage mit falscher Quelle dran, und genau diese Antwort würde ein Käufer lesen, der deine Lizenz prüft. Bewerte bei Entitäts-Prompts, was die Antwort behauptet, gegen ein kurzes Faktenblatt (Lizenz, Hersteller, Preis, Plattform) und berichte richtig, falsch und verweigert als drei getrennte Zahlen. Ein Modell, das „weiß ich nicht“ sagt, schlägt sich besser als eines, das das falsche Repository verteilt.

Wie führst du diese Messung selbst durch?

Behandle sie als kleine Datenpipeline mit versioniertem Input, Rohdatenspeicher und einer Bewertungsschicht, die du erneut laufen lassen kannst. So würde ich es einem technischen Team übergeben.

  1. Schreib das Faktenblatt und die Alias-Liste. Kanonischer Name, bekannte Schreibfehler, eigene Domains (Website, Repository, Store-Einträge) und fünf bis zehn Fakten, die eine Antwort falsch wiedergeben kann. Versioniere beide Dateien.

  2. Bau das Prompt-Panel nach Intent auf. Nicht markenbezogene Kategorie-Prompts aus echter Nachfrage (Suchanfragen, als Fragen umformuliert), Vergleichs-Prompts, die Wettbewerber nennen, mindestens ein Prompt pro Alleinstellungsmerkmal des Produkts und ein getrenntes Set von Entitäts-Prompts. Versieh jeden Prompt mit seinem Intent und misch Entitäts-Prompts nie in die Erwähnungsrate.

  3. Wähl die Oberflächen ausdrücklich. Mindestens ein Modell nur mit Gedächtnis und eine Oberfläche mit Retrieval, geloggt mit exakter Modell-ID. API-Modelle sind nicht die Consumer-Apps (keine Personalisierung, kein Chatverlauf, oft ein anderer Modell-Build), also benenne, was du gemessen hast.

  4. Sample wiederholt und verteil die Samples. 10 Läufe pro Prompt und Oberfläche sind die Untergrenze. Meine wurden alle innerhalb von 49 Minuten gesammelt, und so dicht beieinanderliegende Wiederholungen sind korreliert. Behandle die Intervalle oben also als optimistisch und verteil echte Läufe über mehrere Tage.

  5. Speicher alles roh. Ein Datensatz pro Antwort:

    text
    run_id, panel_version, prompt_id, intent, surface, model_id, settings,
    timestamp, sample, status, search_fired, answer_text, cited_urls[],
    retrieved_urls[], search_queries[], raw_response

    Rohtext und Roh-Response sind die Felder, über die nicht verhandelt wird, und status und search_fired halten „keine Daten“ getrennt von „kein Retrieval“ oder „fehlgeschlagener Request“. Zwei meiner eigenen Definitionen haben sich geändert, während ich diese Daten analysiert habe (die Zitierregel und der Lizenz-Matcher), und jede Änderung war eine Neubewertung, kein neuer Lauf.

  6. Bewerte vier Dinge getrennt und auditiere den Matcher. Erwähnung (Regex plus Aliase, geprüft, indem du eine Stichprobe von Treffern und Nicht-Treffern liest: In diesem Lauf meinte „Ditto“ in mehreren Antworten zu KI-Funktionen ein ganz anderes Produkt namens Ditto, nicht den Clipboard-Manager), Aufnahme und Position (bewertet, mit einer von Hand geprüften Stichprobe, wenn ein Modell bewertet), Zitat (eine schriftliche Regel für Annotationen gegen Inline-Links gegen URLs aus dem Gedächtnis) und Faktentreue bei Entitäten gegen das Faktenblatt. Ergänz das Verhältnis von Retrieval zu Zitat, wo die Oberfläche Retrieval offenlegt.

  7. Berichte einen Vektor pro Intent, mit Intervallen. Für jeden Prompt oder jedes Intent-Cluster: Erwähnungsrate, Aufnahmerate und Zitierrate, jeweils mit n und einem Wilson-Intervall (das sind Ja/Nein-Ergebnisse pro Antwort). Der Anteil der Wettbewerber ist kein Ja/Nein-Ergebnis, weil eine Antwort mehrere Marken nennt. Berichte ihn deshalb als Zählung pro Antwort, statt ihn ins selbe Intervall zu pressen. Der Panel-Mittelwert kommt zuletzt, beschriftet mit der Panel-Version.

  8. Lass es nach Zeitplan erneut laufen und annotiere. Dasselbe Panel, dieselben Oberflächen, dieselbe Tageszeit. Markier Modell-Releases, Versionssprünge des Panels und deine eigenen Änderungen an der Website in der Zeitreihe, denn ein Modell-Update und eine Inhaltsänderung sehen in den Zahlen genau gleich aus.

Das Intervall aus Schritt 7 sind zehn Zeilen Code, also keine Ausrede, es wegzulassen:

python
from math import sqrt
 
def wilson(k, n, z=1.96):
    if n == 0:
        raise ValueError("no answers, no estimate")
    p = k / n
    d = 1 + z * z / n
    c = p + z * z / (2 * n)
    m = z * sqrt(p * (1 - p) / n + z * z / (4 * n * n))
    return ((c - m) / d, (c + m) / d)

wilson(0, 80) liefert ein Intervall von 0 bis etwa 4,6 Prozent. Das ist die ehrliche Fassung von „wir sind nicht sichtbar“: keine Erwähnung in 80 Antworten, und eine Rate über rund 5 Prozent hätte das kaum ergeben.

Was kann dir ein so kleines Panel nicht sagen?

Es kann dir nicht sagen, was echte Nutzer sehen. Die Läufe gingen über APIs, nicht über die Consumer-Apps von ChatGPT, Gemini oder Perplexity, die Personalisierung, Standort, Chatverlauf und manchmal ein anderes Modell dazunehmen. Es sind die Daten eines einzigen Tages, über Drift sagen sie also nichts. Sie decken ein Produkt in einer Nische ab, und das Produkt ist meins. Genau deshalb kann ich die Fakten prüfen, aber genau deshalb solltest du auch meine Bewertung der „Aufnahme“ mit diesem Wissen lesen.

Was es zeigt, ist, wie viel von einer KI-Sichtbarkeitszahl aus Messentscheidungen kommt statt von der Marke: welche Prompts im Panel sind, ob Entitäts-Prompts getrennt werden, welche Oberflächen zählen, wie Zitate geparst werden und ob halluzinierte Erwähnungen als Erfolg zählen. Keine dieser Entscheidungen ist an sich falsch. Falsch ist, sie nicht offenzulegen.

Das ist dasselbe Muster, das ich gefunden habe, als ich mir angesehen habe, was KI-Antworten mit dem Traffic von Verlagen gemacht haben: Die sichtbare Metrik ging in die eine Richtung, das, wofür sie stehen sollte, in die andere. Es hängt auch mit einem Punkt zusammen, den ich zu Agenten-Pipelines gemacht habe, dass ein Modell eine Abhängigkeit ist, die nicht stillhält. Logg die Modell-ID mit jeder Antwort, sonst sieht das nächste Modell-Release aus, als würde deine Content-Strategie aufgehen oder scheitern.

Das Panel ist mit Absicht klein: Es ist das kleinste Instrument, das die Idee eines einzelnen Sichtbarkeits-Scores schon zerlegt. Die größeren Studien, mit Methoden und Grenzen direkt neben den Befunden, findest du unter Research.

Diskussion

Hier gibt es keine Kommentarspalte. Diskussionen laufen auf X.

Max Nardit

Max Nardit

@mnardit

Weitere Artikel

Die Pizza-Day-Bitcoins verfolgen

Jedes Jahr dieselben Artikel. Kontrafaktische Bewertungen, das Roadtrip-Gerücht, die Mann-beißt-Pizza-Schlagzeile. Niemand verfolgt die echten Coins. Also habe ich es gemacht. Hier ist, was die Chain zeigt und was 'jene spezifischen Bitcoins' überhaupt bedeutet.