Titelkarte: Sichtbarkeit in KI-Antworten messen – GEO & Brand Mentions, Linkship

GEO SEO messen: Sichtbarkeit in ChatGPT, Perplexity und AI Overviews prüfen

Die Frage kommt in fast jedem Marketing-Meeting, meistens von der Geschäftsführung und meistens ohne Vorwarnung: „Werden wir eigentlich in ChatGPT genannt?“ Jemand tippt die Frage in ein offenes Chatfenster, die Marke erscheint – Erleichterung. Zwei Wochen später stellt jemand anderes dieselbe Frage, die Marke erscheint nicht. Beide Beobachtungen sind korrekt. Beide sind wertlos.

Die ehrliche Antwort auf „Werden wir in ChatGPT genannt?“ lautet: „Kommt darauf an, wie oft man fragt.“ Generative Systeme antworten nicht deterministisch. Dieselbe Frage, zweimal gestellt, liefert unterschiedliche Anbieterlisten – ohne dass sich an Ihrer Website, Ihren Erwähnungen oder Ihrem Markt irgendetwas geändert hätte. Wer daraus schließt, KI-Sichtbarkeit sei nicht messbar, zieht den falschen Schluss. Messbar ist sie sehr wohl, nur nicht als Position, sondern als Anteil.

Dieser Artikel zeigt, wie Sie aus einem schwankenden Signal eine belastbare Kennzahl machen: mit einem festen Prompt-Set, wiederholten Abfragen, vier klar definierten Kennzahlen und einem Reporting, das eine Zahl nennt statt einen Screenshot. Die Abgrenzung zwischen Linkbuilding und GEO setzen wir dabei voraus – sie steht ausführlich in unserem Pillar zu GEO-Optimierung und Brand Mentions. Hier geht es ausschließlich ums Messen.

Kurz & knapp

  • Es gibt für KI-Antworten keine Search Console. Kein Anbieter meldet Ihnen, wie oft Ihre Marke in ChatGPT, Perplexity oder Google AI Overviews genannt wurde – KI-Sichtbarkeit messen heißt deshalb immer: selbst erheben.
  • Generative Antworten sind nicht deterministisch, teilweise personalisiert und ändern sich mit jedem Modell-Update. Einzelne Abfragen sind Anekdoten; belastbar wird die Messung erst durch Wiederholung unter festen Bedingungen.
  • Gemessen wird nicht eine Position, sondern ein Anteil: In wie viel Prozent der Antworten auf ein festes Prompt-Set kommt Ihre Marke vor – und welchen Anteil an allen genannten Marken haben Sie?
  • Vier Kennzahlen reichen: Nennungsrate, Share of Voice, Zitationsrate und Quellenprofil. Alles darüber hinaus erhöht den Aufwand, nicht die Aussagekraft.
  • Branchen-Benchmarks für GEO SEO existieren nicht. Vergleichen Sie deshalb ausschließlich gegen sich selbst über die Zeit und gegen drei fest definierte Wettbewerber im selben Prompt-Set.
  • Jedes Reporting braucht die Zeile „Modellstand“. Ein Sprung in der Zeitreihe ist häufiger ein Modellwechsel als ein Erfolg oder Misserfolg Ihrer Maßnahmen.

Warum KI-Sichtbarkeit anders gemessen wird als Rankings

Klassisches Rank-Tracking funktioniert, weil das gemessene Objekt stabil ist. Eine Suchanfrage liefert an einem Standort, zu einer Uhrzeit, auf einem Gerätetyp eine geordnete Liste von URLs. Wiederholen Sie die Abfrage eine Stunde später, sieht die Liste weitgehend gleich aus. Genau diese Stabilität fehlt bei generativen Antworten – und zwar aus vier Gründen, die sich nicht wegoptimieren lassen.

Nicht-Determinismus: dieselbe Frage, zwei Antworten

Sprachmodelle erzeugen Text, indem sie das jeweils nächste Wort aus einer Wahrscheinlichkeitsverteilung ziehen. Zwei identische Anfragen können deshalb zu unterschiedlichen Formulierungen und – wichtiger – zu unterschiedlichen Auswahlentscheidungen führen. Wenn ein System aus zwölf gefundenen Anbietern drei nennt, entscheidet ein Stück Zufall mit, welche drei das sind.

Dazu kommt bei retrieval-gestützten Systemen die zweite Streuquelle: Das System formuliert aus Ihrer Frage selbst eine oder mehrere Suchanfragen. Fällt diese Umformulierung anders aus, landen andere Dokumente im Kontext – und damit andere Marken in der Antwort. Für die Messung bedeutet das: Eine einzelne Abfrage misst nicht Ihre Sichtbarkeit, sondern eine Ziehung aus einer Verteilung.

Personalisierung und Kontext

Wenn Sie in Ihrem eigenen Account messen, messen Sie sich selbst mit. Gespeicherte Erinnerungen, frühere Chats im selben Thread, Ihr Standort, Ihre Spracheinstellung und bei einigen Systemen auch der Verlauf beeinflussen die Antwort. Der Klassiker: Ein Marketingleiter fragt aus dem Firmennetz nach den besten Anbietern seiner Kategorie, die eigene Marke erscheint an erster Stelle – und niemand merkt, dass das System aus dem bisherigen Gesprächskontext schlicht weiß, worum es geht.

Jede Erhebung braucht deshalb dieselben, dokumentierten Bedingungen: neue Sitzung ohne Verlauf, kein eingeloggtes Profil mit Erinnerungen, gleiche Sprache, gleiche Region, gleiche Systemauswahl. Bedingungen, die Sie nicht festhalten, können Sie im nächsten Monat nicht reproduzieren.

Kein offizielles Reporting

Für die klassische Suche gibt es die Google Search Console mit Impressionen, Klicks und Positionen aus erster Hand. Für KI-Antworten gibt es nichts Vergleichbares. OpenAI, Perplexity und Anthropic veröffentlichen keine markenbezogenen Nennungsdaten, und Google weist die Leistung von AI Overviews nicht als eigene Kategorie aus, sondern zählt sie in den Websuche-Daten mit.

Das ist kein Übergangszustand, den man aussitzen kann. Jede Zahl zur KI-Sichtbarkeit, die Sie heute im Meeting nennen, stammt entweder aus Ihrer eigenen Erhebung oder aus der Erhebung eines Tool-Anbieters, der genau dasselbe tut – Prompts absetzen, Antworten auswerten. Es gibt keine dritte Quelle.

Modellwechsel als Bruchstelle in der Zeitreihe

Der unangenehmste Effekt kommt zum Schluss. Wenn ein Anbieter das zugrundeliegende Modell wechselt oder das Retrieval-Verhalten ändert, verschiebt sich Ihre gemessene Nennungsrate, ohne dass sich in der Welt etwas geändert hat. Wir haben in Auswertungen Sprünge gesehen, die mit keiner Maßnahme im selben Zeitraum erklärbar waren – und mit dem Rollout einer neuen Modellversion zusammenfielen.

Deshalb gehört in jede Messreihe eine Spalte mit dem Modellstand: welches System, welche Modellversion, mit oder ohne aktivierte Websuche, an welchem Datum. Ohne diese Spalte interpretieren Sie irgendwann eine Infrastruktur-Änderung als Kampagnenerfolg.

Die Konsequenz aus allen vier Punkten ist dieselbe wie in der Marktforschung: Sie erheben eine Stichprobe statt einer Vollerhebung, Sie wiederholen jede Messung mehrfach, und Sie halten die Bedingungen konstant. Was dabei herauskommt, ist keine exakte Wahrheit, sondern ein reproduzierbarer Schätzwert mit erkennbarem Trend. Für eine Steuerungsentscheidung reicht das vollkommen.

Schritt 1: Das Prompt-Set aufbauen

Das Prompt-Set ist das Fundament. Es ersetzt die Keyword-Liste aus dem Rank-Tracking und entscheidet, was Sie überhaupt sehen können. Ein schlecht gebautes Set liefert monatelang stabile Zahlen, die niemanden interessieren.

Der wichtigste Unterschied zur Keyword-Liste: Prompts sind ganze Fragen in natürlicher Sprache, so wie ein Einkäufer sie tatsächlich tippt. „Zuführtechnik Anbieter“ ist ein Keyword. „Welche Anbieter für Zuführtechnik in Deutschland eignen sich für Serienfertigung in kleinen Losgrößen?“ ist ein Prompt. Nur der zweite erzeugt die Art von Antwort, um die es geht.

Die vier Prompt-Typen

Ein tragfähiges Set deckt vier Typen ab, die unterschiedliche Fragen beantworten. Verteilen Sie die Prompts ungefähr gleichmäßig – und widerstehen Sie der Versuchung, das Set mit Marken-Fragen zu füllen, nur weil Sie dort am besten aussehen.

  • Kategorie-Fragen zielen auf die Anbieterliste: „Welche Anbieter für X gibt es in Deutschland?“ Sie messen, ob Sie im Relevant Set der KI überhaupt vorkommen. Das ist der Prompt-Typ mit dem höchsten kommerziellen Wert und dem härtesten Wettbewerb.
  • Problem-Fragen beschreiben eine Situation statt einer Kategorie: „Unsere Rüstzeiten sind bei kleinen Losgrößen zu hoch – was hilft?“ Hier entscheidet, ob Ihre Inhalte das Problem in der Sprache des Kunden beschreiben. Marken tauchen in solchen Antworten seltener auf, dafür oft mit ausführlicher Begründung.
  • Vergleichsfragen stellen zwei Optionen gegenüber: „Anbieter A oder Anbieter B – was passt für einen Mittelständler?“ Sie zeigen, wie das System Ihre Marke einordnet, und decken schonungslos auf, mit welchen Attributen Sie verknüpft sind.
  • Marken-Fragen prüfen die Entität selbst: „Was ist Marke X?“, „Für wen ist Marke X geeignet?“ Sie messen weniger Sichtbarkeit als Korrektheit – und sind der schnellste Weg, veraltete Angaben, falsche Standorte oder eine falsche Kategoriezuordnung zu finden.

Beispiel-Set für einen B2B-Mittelständler

Nehmen wir den Hersteller von Zuführtechnik, der uns schon im GEO-Pillar begleitet hat. Ein Ausschnitt aus seinem Set, zwei Prompts je Typ:

  • Kategorie: „Welche Hersteller von Zuführtechnik gibt es in Deutschland?“ und „Wer liefert Vibrationswendelförderer für die Serienfertigung?“
  • Problem: „Wie reduziere ich Rüstzeiten bei häufigem Teilewechsel in der Montage?“ und „Welche Zuführlösung eignet sich für empfindliche Kunststoffteile?“
  • Vergleich: „Vibrationswendelförderer oder Schrittförderer – was ist bei kleinen Losgrößen sinnvoller?“ und „Marke X oder Marke Y für die Zuführung von Normteilen?“
  • Marke: „Was macht Marke X?“ und „Für welche Branchen arbeitet Marke X?“
Vier Prompt-Typen für Ihr Mess-Set Vergleichsfrage Ermöglicht die Bewertung von Optionen und die Auswahl der besten Wahl. Problem-Frage Bietet Lösungen für spezifische Probleme oder Herausforderungen. Kategorie-Frage Hilft bei der Identifizierung von Anbietern oder Lieferanten für bestimmte Produkte oder Dienstleistungen. Marken-Frage Bietet Informationen über Marken und ihre Zielgruppen.
Ein tragfähiges Prompt-Set deckt vier Fragetypen ab – wer nur Marken-Fragen misst, misst die eigene Bekanntheit statt die Sichtbarkeit im Markt.

Umfang, Wiederholungen, Rhythmus

Unsere Empfehlung: 20 bis 40 Prompts, je Prompt 3 bis 5 Wiederholungen, einmal im Monat. Diese drei Zahlen sind ein Kompromiss zwischen Aussagekraft und Aufwand, und sie haben jeweils einen Grund.

Unter 20 Prompts wird jede einzelne Antwort zu wichtig: Ein Prompt, bei dem Sie zufällig nicht genannt werden, verschiebt die Quote um mehrere Prozentpunkte. Über 40 Prompts steigt der Aufwand linear, der Erkenntnisgewinn aber kaum – die zusätzlichen Fragen sind meist Varianten bestehender.

Die Wiederholungen sind der eigentliche Kniff. Sie sind die Antwort auf den Nicht-Determinismus: Erst wenn Sie denselben Prompt drei- bis fünfmal in getrennten Sitzungen absetzen, wird aus „genannt / nicht genannt“ ein Anteil. Drei Wiederholungen sind das Minimum, fünf sind spürbar ruhiger in der Zeitreihe.

Der Monatsrhythmus passt zur Wirkungsgeschwindigkeit der Maßnahmen. Wöchentlich messen erzeugt Rauschen, das Sie fälschlich als Bewegung lesen; quartalsweise messen heißt, ein Modell-Update erst drei Monate später zu bemerken. Und: Das Set bleibt stabil. Neue Prompts kommen hinzu, alte fliegen nicht raus – sonst verlieren Sie die Vergleichbarkeit, die der ganze Aufwand erst erzeugt.

Schritt 2: Die vier Kennzahlen

Vier Kennzahlen genügen, um GEO SEO zu steuern. Jede beantwortet eine andere Frage, und jede führt bei schlechten Werten zu einer anderen Maßnahme. Genau deshalb sollten Sie alle vier erheben und nicht nur die schmeichelhafteste.

Nennungsrate: Kommen Sie überhaupt vor?

Die Nennungsrate ist der Anteil der ausgewerteten Antworten, in denen Ihr Marken- oder Firmenname vorkommt. Berechnung: Antworten mit Nennung geteilt durch die Gesamtzahl der ausgewerteten Antworten, mal 100. Wenn Ihre Marke in 31 von 96 Antworten auftaucht, liegt die Nennungsrate bei 32,3 Prozent.

Zählen Sie eine Antwort einmal, auch wenn die Marke dreimal darin vorkommt – sonst belohnen Sie geschwätzige Antworten. Und definieren Sie vorab, was als Nennung gilt: nur der exakte Firmenname, oder auch die Produktmarke und die geläufige Kurzform? Diese Definition schreiben Sie einmal auf und ändern sie nie wieder, sonst brechen Sie Ihre eigene Zeitreihe.

Share of Voice: Wie groß ist Ihr Anteil am Gespräch?

Share of Voice setzt Ihre Nennungen ins Verhältnis zu allen Markennennungen im selben Antwortsatz. Berechnung: Ihre Nennungen geteilt durch die Summe aller Markennennungen über alle ausgewerteten Antworten, mal 100. Diese Kennzahl ist die aussagekräftigste der vier, weil sie den Wettbewerb einbezieht.

Der Unterschied zur Nennungsrate zeigt sich in einem typischen Fall: Ihre Nennungsrate steigt von 30 auf 34 Prozent, Ihr Share of Voice fällt trotzdem – weil die Antworten insgesamt länger geworden sind und nun sieben statt vier Anbieter aufzählen. Die Sichtbarkeit ist gestiegen, die Position im Feld hat sich verschlechtert. Nur die zweite Kennzahl zeigt das.

Zitationsrate: Werden Sie als Quelle verlinkt?

Die Zitationsrate ist der Anteil der Antworten, in denen Ihre eigene Domain als Quelle verlinkt wird. Berechnung: Antworten mit Link auf Ihre Domain geteilt durch die Gesamtzahl der ausgewerteten Antworten, mal 100. Erheben Sie zusätzlich die Zitationsquote innerhalb der Nennungen – also den Anteil der Nennungen, bei denen auch ein Link mitkommt.

Nennung und Zitation sind zwei verschiedene Dinge, und die Lücke dazwischen ist diagnostisch wertvoll. Genannt zu werden bedeutet, dass das System Sie kennt. Zitiert zu werden bedeutet, dass Ihre eigenen Inhalte gut genug waren, um als Beleg zu dienen – und es ist der einzige der vier Werte, der überhaupt Klicks erzeugen kann.

Quellenprofil: Wer belegt die Antwort?

Das Quellenprofil ist keine einzelne Zahl, sondern eine Rangliste: Welche fremden Domains werden in den Antworten Ihres Prompt-Sets als Beleg zitiert, und wie oft? Zählen Sie über alle Antworten hinweg die Domains und sortieren Sie absteigend. Zehn bis fünfzehn Domains reichen für die Auswertung.

Diese Liste ist die operativ nützlichste Auswertung überhaupt, weil sie eine Zielliste ist. Wenn dieselben drei Fachportale in der Hälfte aller Antworten als Quelle auftauchen, wissen Sie exakt, wo eine Erwähnung wirkt und wo nicht – und können Ihre Digital-PR-Arbeit daran ausrichten, statt zu raten. Wie Sie diese Erwähnungen dann konkret gewinnen, steht in unserem Leitfaden zu Brand Mentions aufbauen.

Was ist ein guter Wert?

Hier müssen wir ehrlich sein: Es gibt keine belastbaren Branchen-Benchmarks für KI-Sichtbarkeit. Jede Zahl, die Ihnen jemand als „durchschnittliche Nennungsrate in Ihrer Branche“ verkauft, hängt vollständig an dessen Prompt-Set, dessen Systemauswahl und dessen Zählweise. Zwei Agenturen messen dieselbe Marke und kommen zu Werten, die um den Faktor zwei auseinanderliegen – beide korrekt gerechnet.

Nutzbar sind deshalb nur zwei Vergleiche. Der erste ist der Eigenvergleich über die Zeit: dasselbe Set, dieselbe Zählweise, Monat für Monat. Der zweite ist der Vergleich gegen drei fest definierte Wettbewerber, die Sie in derselben Erhebung mitzählen. Wählen Sie diese drei einmal aus – den Marktführer, den direktesten Konkurrenten und einen aggressiven Herausforderer – und behalten Sie sie bei. Ihr Share of Voice gegen genau diese drei ist die Zahl, die im Meeting trägt.

Schritt 3: Werkzeuge und ihre Grenzen

Fünf Werkzeuge decken das Feld ab. Keines davon liefert das vollständige Bild, und drei davon messen streng genommen etwas anderes als KI-Sichtbarkeit. Die Kombination ist trotzdem tragfähig – wenn Sie wissen, was jedes Werkzeug nicht kann.

Manuelle Stichprobe

Kostenlos, langsam und für den Einstieg unschlagbar – weil Sie dabei lernen, wie die Antworten in Ihrem Markt tatsächlich aussehen. Das Vorgehen ist banal, aber die Disziplin entscheidet über die Verwertbarkeit.

  • Eigenes Profil vermeiden. Messen Sie ausgeloggt oder in einem separaten Testkonto ohne gespeicherte Erinnerungen. Ein Account, in dem Sie täglich über Ihre eigene Marke sprechen, ist als Messinstrument unbrauchbar.
  • Verlauf aus, neue Sitzung je Prompt. Jeder Prompt beginnt in einem frischen Chat. Zwei Fragen im selben Thread beeinflussen sich gegenseitig – die zweite Antwort misst dann Ihre erste Frage mit.
  • Sprache und Region festlegen. Deutsch, Region Deutschland, dieselbe Einstellung in jedem Monat. Wenn Sie auch international messen, wird daraus eine zweite Messreihe, keine gemischte.
  • In einer Tabelle protokollieren. Eine Zeile je Antwort mit Datum, System, Modellstand, Prompt, Wiederholungsnummer, eigener Nennung (ja/nein), genannten Wettbewerbern und zitierten Domains. Aus dieser einen Tabelle fallen später alle vier Kennzahlen heraus.

Rankscale

Rankscale ist auf genau diese Aufgabe zugeschnitten: Prompt-Sets anlegen, automatisiert über mehrere KI-Systeme abfragen, Nennungen und Zitationsquellen auswerten und als Zeitreihe darstellen. Zusätzlich zeigt es, welche anderen Marken in denselben Antworten auftauchen – Ihre KI-Wettbewerber, die oft nicht mit Ihren SEO-Wettbewerbern identisch sind.

Der Wert liegt in der Wiederholung, die Sie sonst von Hand leisten müssten. Die Grenze liegt darin, dass auch Rankscale nur eine Stichprobe zieht – mit denselben Unschärfen wie Ihre manuelle Messung, nur häufiger und dokumentiert. Es ist ein Erhebungswerkzeug, keine offizielle Datenquelle.

Ahrefs Brand Radar

Brand Radar misst Erwähnungen und Zitationen im Umfeld von KI-Antworten und hat einen Vorteil, den ein reines GEO-Tool nicht hat: Es sitzt auf demselben Datenbestand wie die Backlink- und Sichtbarkeitsdaten. Sie können damit die Frage beantworten, ob die Domains, die Sie in KI-Antworten zitieren, dieselben sind, die auf Sie verlinken – oder eben nicht.

Diese Verbindung ist der eigentliche Nutzen. Sie legt offen, wo Linkbuilding und GEO auf dieselben Quellen zahlen und wo Ihre Linkinvestitionen in Domains fließen, die in keiner einzigen Antwort als Beleg auftauchen. Den laufenden Abgleich mit Ihrem Linkprofil beschreibt unser Artikel zum Backlink-Monitoring.

Google Search Console

Die Search Console misst KI-Sichtbarkeit nicht – das muss man so deutlich sagen. Google hat dokumentiert, dass Impressionen und Klicks aus AI Overviews in den Daten der Websuche enthalten sind und nicht als eigener Suchtyp ausgewiesen werden. Es gibt keinen Filter, mit dem Sie AI-Overviews-Traffic isolieren könnten.

Indirekt ist sie trotzdem nützlich. Zwei Muster sind auswertbar: erstens Seiten mit stabilen oder steigenden Impressionen bei fallender Klickrate – ein Hinweis darauf, dass die Antwort oberhalb der Ergebnisse die Frage bereits beantwortet. Zweitens die Entwicklung der Suchanfragen nach Ihrem Markennamen, die als Nachfrageindikator taugt: Wenn KI-Antworten Ihre Marke nennen, suchen Menschen danach.

Server-Logfiles

Die unterschätzte Quelle. Ihre Logfiles zeigen, ob die Crawler der KI-Anbieter Ihre Inhalte überhaupt abholen. Relevante User-Agents sind unter anderem GPTBot und OAI-SearchBot von OpenAI, PerplexityBot, ClaudeBot sowie – für die Google-Seite – Googlebot in Verbindung mit der Steuerung über Google-Extended. Filtern Sie die Zugriffe nach diesen Kennungen und schauen Sie sich an, welche Seiten wie oft geholt werden.

Das ist kein Sichtbarkeitswert, sondern ein Vorstufen-Indikator: Wenn ein Crawler Ihre wichtigsten Seiten nie anfragt, ist jede Diskussion über Nennungsraten verfrüht. Prüfen Sie in dem Fall zuerst robots.txt, Firewall-Regeln und Bot-Schutz – wir sehen regelmäßig, dass KI-Crawler von einer WAF blockiert werden, ohne dass es jemand entschieden hätte.

WerkzeugWas es misstAufwandGrenzen
Manuelle StichprobeNennung, Share of Voice, Zitation, Quellen – vollständig, aber händischhoch: mehrere Stunden pro MonatSkaliert nicht; anfällig für Nachlässigkeit bei Profil und Verlauf
RankscalePrompt-Tracking über mehrere KI-Systeme, Zitationsquellen, KI-Wettbewerbergering nach EinrichtungEbenfalls nur eine Stichprobe; Prompt-Set und Systemauswahl bestimmen das Ergebnis
Ahrefs Brand RadarErwähnungen und Zitationen im KI-Umfeld, verknüpft mit Backlink- und Sichtbarkeitsdatengering, an ein Ahrefs-Abo gebundenAbdeckung je nach System und Sprache unterschiedlich; keine freie Prompt-Definition wie bei einem reinen GEO-Tool
Google Search ConsoleImpressionen, Klicks, Positionen der Websuche inklusive AI Overviewsgering, ohnehin vorhandenWeist AI Overviews nicht separat aus – nur indirekte Interpretation über Klickrate und Branded Search
Server-LogfilesZugriffe von KI-Crawlern wie GPTBot, PerplexityBot, ClaudeBotmittel, einmalige Einrichtung der AuswertungZeigt nur das Abholen von Inhalten, keine Nennung und keine Zitation

Zu den Kosten: Rankscale und Brand Radar bewegen sich Stand September 2026 in einer Größenordnung von einem mittleren zweistelligen bis niedrigen dreistelligen Euro-Betrag pro Monat, je nach Umfang des Prompt-Sets und Anzahl der Systeme; Brand Radar setzt ein bestehendes Ahrefs-Abo voraus. Das sind Listenpreise der Anbieter, die sich schnell ändern – bitte vor der Entscheidung selbst prüfen.

Schritt 4: Das Reporting, das im Meeting funktioniert

Ein GEO-Reporting scheitert selten an den Daten und fast immer an der Darstellung. Wer 96 Antworten in eine Präsentation kippt, erntet Nachfragen zu Einzelfällen. Wer vier Zahlen zeigt, bekommt eine Entscheidung.

Vier Zeilen, ein Chart, eine Pflichtangabe

Das monatliche Reporting besteht aus einer Tabelle mit vier Zeilen – Nennungsrate, Share of Voice, Zitationsrate, Top-Quellen – jeweils mit dem Wert des Vormonats und der Veränderung. Dazu ein einziges Chart: die Nennungsrate im Zeitverlauf, mit den drei Wettbewerbern als Vergleichslinien. Mehr braucht niemand.

Darunter steht die Pflichtzeile Modellstand: welche Systeme abgefragt wurden, in welcher Modellversion, mit oder ohne Websuche, an welchen Tagen. Wenn im Berichtsmonat ein Modellwechsel stattgefunden hat, wird das dort vermerkt – und die Veränderung entsprechend vorsichtig interpretiert. Diese eine Zeile ist der Unterschied zwischen einem seriösen und einem gefälligen Report.

Ergänzen Sie zwei Sätze zur Interpretation. Nicht „Die Sichtbarkeit ist gestiegen“, sondern: „Die Nennungsrate stieg von 28 auf 32 Prozent, getragen von den Kategorie-Prompts; bei den Problem-Prompts liegt sie unverändert unter 10 Prozent.“ Das ist eine Aussage, aus der eine Maßnahme folgt.

Was Sie nicht berichten sollten

Keine Screenshots als Beweis. Ein Bildschirmfoto einer Antwort, in der Ihre Marke an erster Stelle steht, ist genau das, was Sie in der Einleitung dieses Artikels als wertlos erkannt haben – eine einzelne Ziehung aus einer Verteilung. Es beweist nichts, es lädt zum Gegenbeweis ein, und spätestens beim zweiten Meeting hält Ihnen jemand einen Screenshot entgegen, in dem der Wettbewerber vorne steht.

Ebenfalls nicht ins Reporting gehören: Kennzahlen ohne Vormonatswert, Prozentwerte ohne die absolute Basis dahinter, und die Zusammenfassung mehrerer KI-Systeme zu einem gemittelten „KI-Score“. Der Mittelwert aus ChatGPT, Perplexity und AI Overviews verschleiert genau die Unterschiede, die steuerungsrelevant sind – Perplexity reagiert auf neue Quellen innerhalb von Tagen, das Modellwissen von ChatGPT braucht Monate.

Monatsrhythmus-Zyklus Erneute Messung Bewerten Sie die Auswirkungen der Maßnahmen. Maßnahme Implementieren Sie Strategien, um die Ergebnisse zu verbessern. Auswertung Analysieren Sie die Daten, um Erkenntnisse zu gewinnen. Erhebung Sammeln Sie Daten, um die Ziele zu bewerten. Prompt-Set Definieren Sie die Ziele und Fragen für den Monat.
Der Mess-Kreislauf: Eine Messung ohne Maßnahme ist ein teures Hobby, eine Maßnahme ohne Nachmessung eine Vermutung.

Der Kreislauf schließt sich in der vierten Station. Eine Messung, die nicht zu einer Maßnahme führt, ist ein teures Hobby – und eine Maßnahme, deren Wirkung nicht in der nächsten Erhebung geprüft wird, ist eine Vermutung. Welche Maßnahmen an welcher Stelle greifen, beschreibt unser Umsetzungs-Leitfaden zur Generative Engine Optimization.

Ein Rechenbeispiel: Vom Prompt-Set zur Kennzahl

Das folgende Beispiel ist konstruiert, nicht aus einem realen Mandat übernommen. Die Rechenwege sind exakt so anwendbar, die Zahlen dienen der Veranschaulichung.

Aufbau: 24 Prompts, gleichmäßig auf die vier Typen verteilt, je Prompt 4 Wiederholungen in getrennten Sitzungen. Das ergibt 96 ausgewertete Antworten pro System. Gemessen wird in ChatGPT mit aktivierter Websuche, Sprache Deutsch, Region Deutschland, alles im September.

Ergebnis der Auszählung: Die eigene Marke wird in 31 der 96 Antworten genannt. In 12 Antworten wird zusätzlich die eigene Domain als Quelle verlinkt. Über alle 96 Antworten hinweg fallen insgesamt 214 Markennennungen – verteilt auf die eigene Marke, zwei feste Wettbewerber und 14 weitere Anbieter.

KennzahlRechnungErgebnis
Nennungsrate31 Antworten mit Nennung ÷ 96 Antworten × 10032,3 %
Zitationsrate (bezogen auf alle Antworten)12 Antworten mit Link ÷ 96 Antworten × 10012,5 %
Zitationsquote innerhalb der Nennungen12 Antworten mit Link ÷ 31 Antworten mit Nennung × 10038,7 %
Share of Voice eigene Marke31 Nennungen ÷ 214 Gesamtnennungen × 10014,5 %
Share of Voice Wettbewerber A48 Nennungen ÷ 214 × 10022,4 %
Share of Voice Wettbewerber B39 Nennungen ÷ 214 × 10018,2 %
Restfeld (14 weitere Anbieter)96 Nennungen ÷ 214 × 10044,9 %

Was diese Zahlen sagen: Die Marke ist im Relevant Set angekommen – ein Drittel der Antworten nennt sie. Sie liegt aber hinter beiden Hauptwettbewerbern, und der Abstand zu Wettbewerber A entspricht rund 17 zusätzlichen Nennungen. Das ist eine handhabbare Größe: Es geht nicht darum, „sichtbarer zu werden“, sondern darum, in etwa 17 weiteren Antworten vorzukommen.

Die interessantere Zahl ist die Zitationsquote von 38,7 Prozent. In knapp zwei Dritteln der Fälle, in denen die Marke genannt wird, wird sie über fremde Quellen belegt – Fachportale, Vergleichslisten, Foren. Das ist nicht schlimm, es ist sogar typisch, aber es zeigt, wo Potenzial liegt: Inhalte, die selbst zitierfähig genug sind, um als Beleg zu dienen.

Was die manuelle Erhebung kostet – und ab wann sich ein Tool rechnet

Rechnen Sie pro Antwort mit rund zweieinhalb Minuten: neue Sitzung öffnen, Prompt einfügen, Antwort lesen, eigene Marke und Wettbewerber erfassen, zitierte Domains in die Tabelle übertragen. Bei 96 Antworten sind das etwa vier Stunden – für ein System.

Wer wie empfohlen drei Systeme misst, landet bei rund zwölf Stunden pro Monat, plus etwa eine Stunde für Auswertung und Reporting. Bei einem internen Stundensatz von 80 Euro sind das etwa 1.040 Euro monatlich an gebundener Arbeitszeit – für eine Aufgabe, die vollständig aus stumpfem Abtippen besteht.

Unsere Empfehlung: Erheben Sie den ersten und zweiten Monat von Hand. Sie lernen dabei mehr über Ihren Markt als jedes Dashboard Ihnen zeigen kann, und Sie merken, ob Ihr Prompt-Set die richtigen Fragen stellt. Ab dem dritten Monat, spätestens ab zwei parallel gemessenen Systemen, rechnet sich ein Tool schon bei der Hälfte der oben gerechneten Zeit. Behalten Sie die manuelle Stichprobe aber als Ergänzung bei – fünf Kernfragen im Monat, gelesen statt gezählt. Ob Ihre Marke als erste Empfehlung oder als Fußnote erscheint und ob die Beschreibung stimmt, sieht kein Tool.

Was Sie aus den Zahlen ableiten

Messen ist nur die halbe Arbeit. Drei Muster tauchen in Auswertungen immer wieder auf, und jedes führt zu einer anderen Maßnahme. Die Zuordnung ist eindeutig genug, dass Sie sie als Entscheidungsregel verwenden können.

Muster 1: nie genannt

Die Nennungsrate liegt bei null oder im niedrigen einstelligen Bereich, auch bei den Kategorie-Prompts. Das ist kein Sichtbarkeitsproblem im engeren Sinn, sondern ein Entitäts- oder Quellenproblem: Über Ihre Marke steht außerhalb der eigenen Domain zu wenig Text, oder das Wenige ist so uneinheitlich, dass keine stabile Entität entsteht.

Maßnahme: Zuerst die kostenlose Hausaufgabe – identischer Firmenname, identische Kategorie, identische Kurzbeschreibung auf Website, LinkedIn, in Verzeichnissen und in jedem Presse-Boilerplate. Danach gezielt Erwähnungen in genau den Quellen aufbauen, die Ihr Quellenprofil als häufig zitiert ausweist. Den Weg dorthin beschreibt Brand Mentions aufbauen.

Muster 2: genannt, aber nicht zitiert

Die Nennungsrate ist ordentlich, die Zitationsrate bleibt niedrig. Das System kennt Sie, greift aber für die Belege auf andere Domains zurück. Fast immer liegt es an den Inhalten: Sie beantworten die Frage nicht direkt, die Aussagen stehen verstreut über mehrere Absätze, oder es fehlen belegte Zahlen, die zitierbar wären.

Maßnahme: Nehmen Sie die zehn Prompts mit der höchsten Nennungsrate und prüfen Sie, ob Sie zu jedem eine Seite haben, die diese Frage vollständig und eigenständig verständlich beantwortet. Definitionssätze, belegte Zahlen mit Erhebungszeitraum, FAQ-Abschnitte, sauberes Schema.org-Markup – die Umsetzung im Detail steht in der Generative Engine Optimization.

Muster 3: genannt mit falschen Angaben

Das unangenehmste Muster, und dasjenige, das reine Zahlen-Dashboards nicht anzeigen. Ihre Marke wird genannt, aber der falschen Kategorie zugeordnet, mit einem veralteten Standort versehen, mit einer eingestellten Produktlinie beschrieben oder mit einem Wettbewerber verwechselt. Das ist ein Konsistenzproblem und wird schlimmer, je länger es besteht – falsche Angaben verfestigen sich, weil sie weiterzitiert werden.

Maßnahme: Suchen Sie die Quelle des Fehlers. In den allermeisten Fällen ist es ein veraltetes Verzeichnisprofil, eine alte Pressemitteilung oder eine Unterseite Ihrer eigenen Website, die niemand aktualisiert hat. Korrigieren Sie zuerst die eigenen Quellen, dann die fremden – und nehmen Sie zwei Marken-Prompts fest ins Set auf, um die Korrektur über die Monate zu verfolgen. Bis eine falsche Angabe aus dem Modellwissen verschwindet, vergehen Monate; im Retrieval geht es schneller.

Häufige Fragen

Kann ich KI-Sichtbarkeit in der Google Search Console messen?

Nein, nicht direkt. Google zählt Impressionen und Klicks aus AI Overviews in den Daten der Websuche mit und weist sie nicht als eigenen Suchtyp aus – es gibt keinen Filter dafür. Indirekt lassen sich zwei Muster auswerten: Seiten mit stabilen Impressionen bei fallender Klickrate und die Entwicklung der Suchanfragen nach Ihrem Markennamen.

Wie viele Prompts brauche ich mindestens?

20 Prompts sind die Untergrenze für eine halbwegs ruhige Kennzahl, 20 bis 40 der praktikable Bereich. Wichtiger als die Anzahl sind die Wiederholungen: Drei bis fünf Abfragen je Prompt in getrennten Sitzungen fangen den Nicht-Determinismus ab. Ein Set aus 40 Prompts mit je einer Abfrage ist weniger aussagekräftig als 20 Prompts mit je vier.

Warum bekomme ich bei derselben Frage unterschiedliche Antworten?

Weil generative Systeme nicht deterministisch arbeiten: Sie ziehen das nächste Wort aus einer Wahrscheinlichkeitsverteilung, und bei retrieval-gestützten Systemen kommt hinzu, dass die intern formulierte Suchanfrage variiert. Beides führt dazu, dass unterschiedliche Quellen und damit unterschiedliche Marken in die Antwort geraten. Deshalb messen Sie Anteile über wiederholte Abfragen statt einzelner Positionen.

Was ist ein guter Share of Voice in KI-Antworten?

Dafür existiert kein belastbarer Branchen-Benchmark, weil jeder Wert vollständig vom Prompt-Set, der Systemauswahl und der Zählweise abhängt. Sinnvoll sind nur zwei Vergleiche: der eigene Wert über die Zeit bei unverändertem Set und der Vergleich gegen drei fest definierte Wettbewerber, die Sie in derselben Erhebung mitzählen.

Wie oft sollte ich messen?

Monatlich, immer im gleichen Zeitfenster. Wöchentliche Messungen erzeugen Rauschen, das leicht als echte Bewegung fehlinterpretiert wird; quartalsweise Messungen bemerken Modellwechsel und Wettbewerbsbewegungen zu spät. Halten Sie dabei Prompt-Set, Sprache, Region und Systemauswahl konstant, sonst messen Sie Ihre eigenen Einstellungsänderungen mit.

Zeigt ein Zugriff von GPTBot, dass meine Marke in ChatGPT erscheint?

Nein. Ein Crawler-Zugriff belegt nur, dass Ihre Inhalte abgeholt wurden – nicht, dass sie in einer Antwort verwendet oder Ihre Marke genannt wurde. Der Wert der Logfile-Auswertung liegt in der Gegenrichtung: Wenn GPTBot, PerplexityBot oder ClaudeBot Ihre wichtigsten Seiten nie anfragen, sollten Sie robots.txt, Firewall und Bot-Schutz prüfen, bevor Sie über Nennungsraten diskutieren.

Fazit

KI-Sichtbarkeit messen heißt: Stichprobe statt Vollerhebung, Anteil statt Position, Wiederholung statt Einzelbeobachtung. Es gibt keine Search Console für KI-Antworten und auf absehbare Zeit keine offizielle Datenquelle – jede Zahl, die Sie berichten, stammt aus einer selbst gebauten oder von einem Tool gebauten Erhebung. Das ist kein Mangel, solange Sie die Bedingungen dokumentieren und über die Zeit konstant halten.

Unsere Empfehlung: Bauen Sie ein Set aus 24 Prompts über die vier Typen, messen Sie mit vier Wiederholungen in zwei Systemen und werten Sie vier Kennzahlen aus – Nennungsrate, Share of Voice, Zitationsrate, Quellenprofil. Erheben Sie zwei Monate von Hand, um Ihren Markt zu verstehen, und automatisieren Sie danach. Berichten Sie eine Tabelle mit vier Zeilen, ein Chart und die Zeile „Modellstand“ – und niemals einen Screenshot. Nach dem dritten Monat haben Sie etwas, das die meisten Wettbewerber nicht haben: eine Zeitreihe, gegen die sich Maßnahmen prüfen lassen.

Weiterlesen: Worin sich GEO und Linkbuilding grundsätzlich unterscheiden und warum Erwähnungen die Währung der KI-Suche sind, klärt GEO-Optimierung und Brand Mentions. Wie Sie aus den Messergebnissen einen Umsetzungsplan machen, zeigt unser Leitfaden zur Generative Engine Optimization. Und welche Kanäle tatsächlich Erwähnungen liefern, steht in Brand Mentions aufbauen.

Ähnliche Beiträge