# Was misst ein Score für KI-Sichtbarkeit?

> Haben alle Prompts in einem Score für KI-Sichtbarkeit dieselbe Bedeutung? Erwähnungen, Empfehlungen, Prompt-Häufigkeit und Kaufabsicht beschreiben unterschiedliche Ergebnisse.

> 💡 **Kurzfassung (TL;DR):**
>
> - Eine Markenerwähnung, ein Quellenverweis und eine Kaufempfehlung sind unterschiedliche Ereignisse. Ein Score muss deutlich machen, welche davon er zählt.
> - Gleichgewichtung ist für sich genommen kein Rechenfehler. Sie kann nicht ohne Weiteres als gleich gute Abbildung von Prompt-Häufigkeit, Kaufabsicht und Umsatzpotenzial gelten.
> - Dieselben Antworten können bei veränderten Gewichtungen unterschiedliche Scores ergeben. Ein Anstieg muss zusammen mit dem Zweck und den Regeln der Berechnung ausgelegt werden.

„Wie funktioniert eine Spülmaschine?“ und „Welche leise Spülmaschine kann ich diese Woche innerhalb meines Budgets kaufen?“ drücken nicht dasselbe Bedürfnis aus. Die zweite Frage liegt näher an einer Kaufentscheidung. Bei der ersten kann es um reine Information gehen.

Ein Test zur KI-Sichtbarkeit kann die Antworten auf beide Fragen gleich gewichten. Diese Berechnung kann beschreiben, wie häufig eine Marke in Antworten auf eine ausgewählte Menge von Fragen erscheint. Sie sagt weniger klar aus, wie häufig die Marke in kaufnahen Gesprächen empfohlen wird.

Ein früherer Beitrag untersuchte, [wie gut Tests zur KI-Sichtbarkeit echte Kunden abbilden](/de/ki-sichtbarkeit-scores-messgueltigkeit). Hier geht es um eine andere Frage: Selbst wenn die richtigen Fragen ausgewählt wurden – was misst der Score, der aus ihren Antworten entsteht?

## Erwähnung, Quellenverweis und Empfehlung sind nicht dasselbe

Eine Marke kann in einer Antwort erscheinen, die erklärt, warum sie nicht gewählt werden sollte. Auf die Dokumentation eines Produkts kann verwiesen werden, während ein Wettbewerber empfohlen wird. Software kann die Marke in beiden Fällen korrekt identifizieren. Keiner der beiden Fälle zeigt für sich genommen, dass die Marke empfohlen wurde.

Als mögliche Kaufoption zu erscheinen, ist etwas anderes, als gegenüber Alternativen als passender zu gelten. Manche Empfehlungen gelten nur unter bestimmten Bedingungen. Eine Empfehlung am Ende eines Gesprächs spiegelt die bis dahin geklärten Bedürfnisse wider. Diese Ereignisse unter einem einzigen Etikett wie „Sichtbarkeit“ zusammenzufassen, macht sie wirtschaftlich nicht gleichwertig.

Mehrere Ereignisse in einem Index zusammenzuführen kann nützlich sein. Dann müssen die gezählten Ereignisse, die Bezugsgröße und die Art, wie jedes Ereignis den Score beeinflusst, offengelegt werden. Ein Score von null bis hundert ist nicht zwangsläufig ein Prozentsatz. Auch die Bezeichnung „Share of Voice“ erklärt nicht von selbst, gegen welche Gesamtheit der Anteil berechnet wird.

## Gleichgewichtung ist eine Entscheidung

Angenommen, die Hälfte der Fragen in einem Test betrifft den Preis. Erhält jede Frage dasselbe Gewicht und wird gleich häufig ausgeführt, machen preisbezogene Fragen die Hälfte des Gesamtgewichts aus. Das folgt aus dem Testdesign. Es zeigt nicht, dass die Hälfte realer Kundengespräche den Preis betrifft.

Gleichgewichtung ist nicht automatisch ein Rechenfehler. Sie kann angemessen sein, wenn Veränderungen in einer festen Prompt-Liste verfolgt werden sollen. Sie kann auch sinnvoll sein, wenn eine Stichprobe von Fragen die Verteilung tatsächlicher Nutzung abbildet.

Das Problem beginnt, wenn gleich gezählte Fragen als für Kunden gleich wichtig gelten. Jede zusätzliche Frage, die ein Berater hinzufügt, kann das Gesamtergebnis verändern, unabhängig davon, wie häufig Kunden sie tatsächlich stellen. Eine mathematisch korrekte Berechnung garantiert daher keine korrekte Deutung.

Produkte können unterschiedliche Entscheidungen treffen. [Ahrefs erklärt beispielsweise, dass seine Kennzahl „Estimated Impressions“ Erwähnungen mit dem Google-Suchvolumen gewichtet](https://ahrefs.com/blog/brand-radar-methodology/). Dasselbe Dokument sagt, Ahrefs behaupte keine validierte Beziehung zwischen Suchvolumen und der Häufigkeit, mit der Prompts in KI-Tools gestellt werden. Das ist die eigene Methodenbeschreibung des Anbieters. Sie zeigt nicht, dass eine Methode überlegen ist; sie zeigt, warum es darauf ankommt, was ein Gewicht repräsentiert.

## Prompt-Häufigkeit und Kaufabsicht sind getrennte Bewertungen

Ein Prompt muss nicht für jeden Zweck ein einziges richtiges Gewicht haben. Zuerst muss die Geschäftsfrage klar sein.

Geht es darum, Sichtbarkeit in Antworten auf häufig gestellte Fragen zu verstehen, ist relevant, wie oft Prompts gestellt werden. Dann kann eine oft gestellte Informationsfrage ein erhebliches Gewicht haben. Ihre beobachtete Häufigkeit braucht dennoch eine definierte Zielgruppe, einen Markt und einen Kontext der KI-Nutzung. Suchnachfrage misst nicht unmittelbar, wie häufig Fragen in KI-Gesprächen gestellt werden.

Geht es darum, Empfehlungen in kaufnahen Gesprächen zu verstehen, können dieselben Fragen unterschiedlich wichtig sein. Eine selten gestellte Frage zur Auswahl eines bestimmten Produkts kann relevanter sein als eine häufige Frage zur allgemeinen Information. Einen Prompt als „hohe Kaufabsicht“ zu bezeichnen, beweist allerdings nicht, dass die Person zum Kauf bereit ist.

![Eine Person studiert eine Spülmaschinenanleitung, während eine andere den Platz in einer Küche ausmisst und Modelle vergleicht.](/images/ai-visibility-series/research-versus-purchase-intent.avif)

*Sich über die Funktionsweise eines Produkts zu informieren und ein Modell zum Kauf auszuwählen, sind Tätigkeiten, hinter denen unterschiedliche Absichten stehen können. Keine der beiden belegt, dass anschließend ein Kauf erfolgt.*

Wer Häufigkeit und Kaufabsicht zusammen betrachtet, stößt auf eine dritte Frage: Welche Gespräche können ein größeres Umsatzpotenzial haben?

Das ist weder dasselbe wie die erste noch wie die zweite Frage. Ein Gespräch, das häufig und kaufnah wirkt, beweist nicht, dass ein Verkauf zustande kommt. Jede Behauptung über Umsatzpotenzial braucht eine eigene Verbindung zu beobachteten Geschäftsergebnissen.

Derselbe Prompt kann für alle drei Zwecke unterschiedlich wichtig sein. Ein Score, der die Häufigkeit bestimmter Kundenfragen abbildet, und ein Score, der kaufnahe Chancen priorisiert, müssen nicht übereinstimmen. Sie beantworten unterschiedliche Fragen. Beide „Score für KI-Sichtbarkeit“ zu nennen, kann diese Unterscheidung verdecken.

## Dieselben Antworten können unterschiedliche Scores ergeben

Veränderte Gewichtungen können den Gesamtscore verändern, obwohl sich die Antworten der KI überhaupt nicht geändert haben. Fragen, bei denen eine Marke bereits gut abschneidet, stärker zu gewichten, kann den Score erhöhen.

Das ist nicht zwangsläufig falsch. Die geschäftliche Priorität kann sich geändert haben. Ein Anstieg eines für die neue Priorität neu berechneten Scores sollte jedoch nicht als Beleg dafür dargestellt werden, dass KI die Marke häufiger empfiehlt. Eine Änderung der Berechnung muss von einer Änderung der Antworten getrennt werden.

Auch Modellupdates, andere Suchergebnisse und Veränderungen der getesteten Fragen können Ergebnisse beeinflussen. Vergleiche über die Zeit müssen benennen, welche Bedingungen gleich geblieben sind. Selbst ein nach denselben Regeln berechneter Anstieg beweist für sich genommen weder die Wirkung der Arbeit eines Beraters noch steigende Umsätze.

Dass eine Marke in einer Antwort erscheint, von einem Kunden in Betracht gezogen und gekauft wird, sind getrennte Ereignisse. In einem Zeitraum, in dem Score und Umsatz steigen, können andere Veränderungen eingetreten sein. Ihr Zusammenhang lässt sich untersuchen; dass beide sich gemeinsam bewegen, reicht nicht aus, um Ursache und Wirkung zu belegen.

## Den Score für die Entscheidung auslegen, die er stützen soll

Ein kontrollierter Sichtbarkeits-Score kann wertvoll sein, um Veränderungen bei ausgewählten Fragen oder Unterschiede zu Wettbewerbern zu verfolgen. Er muss nicht Umsatz messen, um nützlich zu sein.

Doch in häufig gestellten Fragen aufzutauchen, in kaufnahen Gesprächen empfohlen zu werden und Umsatzpotenzial zu tragen, sind nicht dasselbe Ergebnis. Gewichtung macht diese Ergebnisse nicht gleichwertig. Sie kann den beabsichtigten Zweck klarer machen – oder die Unsicherheit vergrößern, wenn sie schlecht gewählt ist.

Wenn ein Score steigt, muss zuerst geklärt werden, was gestiegen ist. Erst dann lässt sich seine Rolle in einer Geschäftsentscheidung beurteilen.

*Dieser Beitrag untersucht den Zweck einer Messung. Er schlägt weder eine Formel für den Score noch eine Umsetzungsmethode vor.*

---

Language: German
License: CC BY 4.0
License URL: https://creativecommons.org/licenses/by/4.0/
Scope: Evren Bal-authored text, unless this article expressly states otherwise.
Excluded: Third-party material, quoted excerpts, logos, and separately marked images retain their own rights.
Attribution: Credit Evren Bal, link to the canonical source and license, and indicate changes.
Source: https://evrenbal.com/de/was-misst-ein-ki-sichtbarkeitsscore
