Die Illusion der KI-Sichtbarkeit: Was Bings Citation-Share-Daten wirklich zeigen
Von Evren BalVeröffentlicht · 8 Min. Lesezeit

Seite kopieren
💡 Kurzfassung:
- Die Branche: Beratungen für „KI-Sichtbarkeit“ und GEO-SaaS-Tools versprechen, die Präsenz in KI-generierten Antworten zu optimieren.
- Das Problem: Die meisten beobachten eine ausgewählte Stichprobe von Prompts statt der Gesamtheit realer Nutzernachfrage. Die Stichprobe kann bestimmen, welche Geschichte das Dashboard erzählt.
- Die Daten: Bing ergänzte seinen eigenen Bericht AI Performance um Citation Share. Die Kennzahl zeigt den Anteil einer Website an den Zitaten zu bestimmten Grounding Queries auf unterstützten KI-Oberflächen von Microsoft.
- Der Befund: Bei den von mir betreuten Websites folgten die KI-Zitate von Bing sehr eng der Stärke in der Bing-Suche. Gut platzierte Seiten wurden tendenziell zitiert; schlecht platzierte meist nicht.
- Das Fazit: Bei den von mir betreuten Websites fand ich keinen Hinweis darauf, dass eine separate „KI-Optimierung“ etablierte Autorität umgehen kann. Das Dashboard mag neu sein. Die Arbeit darunter ist es nicht.
Wenn eine Grafik zur „KI-Sichtbarkeit“ steigt: Was genau nimmt dann zu? Die Wahrscheinlichkeit, dass eine Marke vor Nutzern erscheint, oder ihre Sichtbarkeit in den vom Anbieter ausgewählten Prompts?
Aus diesem Grund war ich der KI-Sichtbarkeitsbranche von Anfang an skeptisch gegenüber. Die Angebote wirkten zu glatt, die Kennzahlen zu geschlossen, um sie außerhalb des Anbieters überprüfen zu können.
Dann veröffentlichte Bing Citation Share in den Webmaster Tools. Damit konnte ich diese Skepsis erstmals mit Daten aus erster Hand abgleichen.
Eine neue Branche braucht neue Kennzahlen – auch wenn sie keine reale Nachfrage messen
Als ChatGPT begann, die Informationssuche zu verändern, geschah etwas Vorhersehbares: Fast über Nacht entstand eine neue Beratungskategorie. „Generative Engine Optimization.“ „KI-Sichtbarkeit.“ Ein ganzes Vokabular, das wie SEO klingen sollte, nur für große Sprachmodelle.
Das Versprechen wirkt zunächst schlüssig. Wenn Menschen ihre Fragen KI-Assistenten statt Google stellen und die KI bestimmte Quellen häufiger zitiert als andere, muss es doch etwas zu optimieren geben. Unternehmen mit vielen KI-Zitaten müssen etwas richtig machen – und andere könnten jemanden beauftragen, dasselbe zu erreichen.
Viele der dafür entstandenen SaaS-Tools arbeiten nach einem ähnlichen Muster: Sie pflegen eine Liste branchenrelevanter Fragen, stellen diese regelmäßig ChatGPT, Perplexity, Claude und anderen Modellen und prüfen, ob Ihre Marke oder Domain in der Antwort erscheint. Anschließend zeigen sie im Zeitverlauf einen „AI Visibility Score“ und ob er steigt oder fällt.
Beratungen setzen darauf auf und erklären, welche Änderungen die Verbesserung bewirkt hätten und was als Nächstes zu tun sei.
Das kann wie eine direkte Messung wirken. Häufig werden jedoch Modellausgaben innerhalb einer ausgewählten Prompt-Stichprobe gemessen.
Das Grundproblem: Ein Modell ist keine Messung
Diese Dashboards messen gewöhnlich eine konstruierte Stichprobe, nicht die Gesamtheit der Prompts realer Nutzer. Die Fragen können vom Anbieter, vom Kunden oder von beiden ausgewählt werden. Die Stichprobe ist begrenzt, und große Sprachmodelle sind nicht deterministisch: Stellen Sie dieselbe Frage zweimal, können sich die zitierten Quellen ändern.
Das macht die Stichprobe nicht nutzlos. Es macht sie zu einem Modell, dessen Wert von der Auswahl der Prompts, der untersuchten KI-Oberfläche, der Zahl der Wiederholungen und der offengelegten Unsicherheit abhängt. Verschweigt ein Dashboard diese Entscheidungen, wirkt es präziser, als die zugrunde liegende Messung tatsächlich ist.
Hinzu kommt ein subtileres Risiko. Eine Beratung, die ihren Wert belegen muss, kann Fragen betonen, bei denen Sie bereits erscheinen. „Sehen Sie, bei Fragen zu einem Thema, bei dem Sie bereits Autorität besitzen nennt ChatGPT Ihr Unternehmen.“ Das kann technisch stimmen und zugleich sehr wenig über die Fragen aussagen, die Ihr Markt tatsächlich stellt.
Das Problem ist nicht, dass jede Drittanbieterkennzahl erfunden wäre. Das Problem ist, dass der Anbieter die Stichprobe kontrolliert – und die Stichprobe das Ergebnis kontrollieren kann.
Bing Citation Share als Realitätscheck aus erster Hand
Microsoft führte AI Performance in den Bing Webmaster Tools im Februar 2026 ein. Am 16. Juni wurde der Bericht um Citation Share, Intents, Topics und Compare erweitert.
Laut Bings Dokumentation ist Citation Share der prozentuale Anteil der Zitate, die einer Website bei einer bestimmten Grounding Query zugerechnet werden. Der Bericht bündelt Aktivitäten aus Microsoft Copilot, KI-generierten Zusammenfassungen in Bing und ausgewählten Partnerintegrationen. Die Grounding Queries sind gruppierte Suchphrasen, nicht die vollständigen Fragen, die Nutzer eingegeben haben.
Diese Unterscheidung ist wichtig. Es handelt sich weder um ein Rohprotokoll aller Nutzergespräche noch beansprucht Citation Share, Rankings, Autorität, Traffic oder Qualität zu messen. Es sind aber Daten aus erster Hand über Zitataktivitäten innerhalb der unterstützten KI-Oberflächen von Microsoft – keine von einem externen Anbieter ausgewählte Prompt-Stichprobe.
Ich untersuchte diese Daten für die von mir betreuten Websites. Das Muster zeigte sich sofort und war ungewöhnlich konsistent.
Was die Daten tatsächlich zeigen
Bei den von mir betreuten Websites ging eine starke klassische Suchpräsenz in einer Themenkategorie mit einem hohen Anteil an KI-Zitaten in derselben Kategorie einher. Bei den verglichenen Suchanfragen wurden Seiten, die bereits in der Bing-Suche gut platziert waren, auch in KI-Antworten zitiert; Seiten mit schwacher organischer Leistung erhielten weniger Zitate.
Ich fand keine Seite, die in der Suche schlecht platziert war und zugleich häufig in KI-Zitaten erschien. Auch Seiten, die Drittanbieter-Tools als stark in ChatGPT oder Perplexity beschrieben, tauchten in Bings Daten aus erster Hand nicht ungewöhnlich häufig auf. Das beweist nicht, dass beide Systeme dieselben Signale nutzen. Es zeigt nur, dass sich die Ergebnisse bei diesen Websites und Suchanfragen gemeinsam bewegten.
Warum das plausibel ist
Eine plausible Interpretation lautet, dass klassische Suchautorität und der Anteil an KI-Zitaten auf überlappenden Grundlagen beruhen.
Auch KI-Suchsysteme müssen Quellen im Web entdecken, abrufen und bewerten. Inhaltliche Tiefe, Relevanz, Links, Konsistenz und Vertrauen verlieren nicht ihre Bedeutung, nur weil die Oberfläche eine generierte Antwort statt einer Liste blauer Links zeigt.
Das bedeutet nicht, dass Citation Share selbst Autorität misst; Bing erklärt ausdrücklich, dass dies nicht der Fall ist. Ebenso beweist es nicht, dass KI-Suche und klassische Suche identische Signale verwenden. Der engere Punkt ist: Bei den von mir untersuchten Websites und Suchanfragen bewegten sich beide Ergebnisse so nah zusammen, dass ich keinen Hinweis auf eine unabhängige Abkürzung um etablierte Autorität fand.
KI-Systeme können Klarheit, Struktur, Aktualität und andere Inhaltsqualitäten im Detail anders gewichten. Zitationsmuster werden sich verändern. In dieser Untersuchung schien die grundlegende Autorität jedoch die dominante Variable zu sein. Sie entsteht über Jahre und lässt sich nicht in einem Beratungs-Sprint herstellen.
Ein zweites Signal: KI entfernte gelöschte Seiten schneller als die Suche
In den Daten zeigte sich ein zweites, unerwartetes Muster. Es hing mit einer Änderung an der Website selbst zusammen.
Wir hatten bewusst viele ältere Inhalte entfernt – nicht, weil sie keinen Traffic hatten, sondern weil wir zu dem Schluss kamen, dass sie unsere thematische Autorität verwässerten. Das Ziel war das Gegenteil von Reichweite um jeden Preis: Wir wollten für die Themen gefunden und empfohlen werden, hinter denen wir tatsächlich stehen, nicht für einen langen Ausläufer aus überholtem Ballast.
Eine solche Bereinigung hat einen vorhersehbaren Preis: Für entfernte Seiten sinken die Impressionen, sowohl in der klassischen Suche als auch in KI-Zitaten. Das geschah. Als ich die Diagramme übereinanderlegte, setzte der Rückgang bei KI-Zitaten jedoch ungefähr zwei Wochen früher ein als in der Suche.
Meine erste Hypothese war, dass ein KI-Suchsystem mögliche Seiten im Index findet, ihren aktuellen Inhalt aber im Moment der Anfrage live abzurufen versucht. Danach könnte eine entfernte Seite noch im Index stehen und dennoch früh aus einer KI-Antwort verschwinden, weil der Live-Abruf einen 404-Fehler liefert. Bing hat diesen Mechanismus nicht dokumentiert; es war lediglich meine erste Erklärung für die Beobachtung. Selbst wenn sie zuträfe, würde sie nicht zeigen, dass neue Seiten schneller entdeckt werden.
Aktualisierung (28.06.2026): Nach Veröffentlichung dieses Beitrags verglich ich dasselbe Muster mit Daten aus Googles Bericht Generative AI, den Google am 3. Juni angekündigt hatte und für einen Teil der Websites ausrollte. Eine bereits im März entfernte Seite behielt ihre verlinkte Sichtbarkeit in der generativen Google-Suche bis Mitte Mai. Das widerspricht meiner Erklärung eines Live-Abrufs bei jeder Anfrage. Der schnellere Rückgang gegenüber der Suche blieb in beiden Datensätzen sichtbar, doch der Bericht kann den internen Mechanismus nicht beweisen. Die Korrektur erläutere ich in KI-Sichtbarkeit sank vor der Suche: Die Google-Daten, die meine Theorie änderten.
Die Einschränkung, die ernst genommen werden sollte
Bings Daten sind real, aber unvollständig.
Bing Copilot ist nicht ChatGPT.com. Nutzerbasis, Verteilung der Anfragen und KI-Modell unterscheiden sich von OpenAIs Verbraucherprodukt. Ich halte es für unwahrscheinlich, aber das Zitierverhalten von ChatGPT könnte deutlich von Bings Daten abweichen.
Auch die unterstützten Oberflächen und die Verteilung der Anfragen sind anders. Citation Share zeigt, was im KI-Ökosystem von Microsoft geschieht. ChatGPT und Googles KI-Funktionen werden nicht erfasst.
Google verfügt inzwischen über einen eigenen Bericht zu Impressionen in generativen KI-Funktionen, aber nicht über eine entsprechende Citation-Share-Kennzahl auf Ebene der Suchanfrage. Beide Berichte beleuchten unterschiedliche Teile des Bildes.
Das sind reale Einschränkungen. Eine Beobachtung aus erster Hand, die unvollständig ist, beantwortet eine andere Frage als ein vom Anbieter ausgewähltes Modell. Das Problem beginnt, wenn Letzteres so verkauft wird, als messe es direkt die Grundgesamtheit, aus der es nur eine Stichprobe zieht.
Was Sie daraus ableiten können
Wenn Sie für Beratung zur KI-Sichtbarkeit oder ein GEO-SaaS-Abonnement zahlen, sollten Sie eine einfache Frage stellen: Welche Suchanfragen werden gemessen, und stellen Ihre tatsächlichen Nutzer diese Fragen?
Kann der Anbieter keine Daten auf Ebene einzelner Suchanfragen aus realen Nutzerinteraktionen zeigen, sondern nur eigene API-Stichproben, kaufen Sie ein Modell Ihrer KI-Performance – keine direkte Messung realer Nachfrage.
In meinen Daten bewegten sich Suchleistung und KI-Zitate gemeinsam. Der Standardweg bleibt daher derselbe, der schon vor der GEO-Branche richtig war: Veröffentlichen Sie fundierte Inhalte zu den Themen, für die Sie stehen wollen, gewinnen Sie Links aus glaubwürdigen Quellen und arbeiten Sie über längere Zeit konsistent.
Bings Citation Share ist die nützlichste Kennzahl aus erster Hand, die mir innerhalb des Microsoft-Ökosystems zur Verfügung steht. Beobachten Sie sie zusammen mit organischen Impressionen als nachlaufenden Abgleich mit der Autorität, die Sie offenbar aufgebaut haben – nicht als Beweis dieser Autorität oder als Regler, den jemand für Sie hochdrehen kann.
Die Branche für KI-Sichtbarkeit wird wahrscheinlich bestehen bleiben. In einem unübersichtlichen Markt gibt es echte Nachfrage nach Beruhigung, und modellierte Kennzahlen eignen sich sehr gut dafür.
Mein Dashboard aus erster Hand sagte mir jedoch etwas Klares: Sie können sich keine KI-Autorität optimieren, die Sie nicht erarbeitet haben.
Wenn dieser Artikel hilfreich war
Ein Link von einer passenden Seite Ihrer Website oder das Teilen in sozialen Medien hilft diesem Artikel, mehr Menschen zu erreichen. Vielen Dank.
Hinweise zu Links und Marke →Über diesen Artikel
Dieser Beitrag wurde auf Grundlage der englischen Fassung redaktionell für die deutsche Ausgabe lokalisiert.
