KI-Sichtbarkeit messen: Warum die Auswahl der Fragen über das Ergebnis entscheidet

Dominik Breitbach ist Gründer der taismo GmbH und als Lead SEO Stratege auf SEO-Betreuung und Sichtbarkeit in KI-Antworten (GEO) spezialisiert. Er verteilt die Messplätze für KI-Sichtbarkeit in den Kundenprojekten selbst und weiß deshalb genau, was ein Prompt im Monat kostet.
🔄 Zuletzt aktualisiert: 22.09.2026
KI-Sichtbarkeit messen heißt: Du legst eine feste Liste von Fragen fest, lässt sie regelmäßig gegen ChatGPT, Perplexity, Gemini und die KI-Antworten von Google laufen und zählst, in wie vielen Antworten dein Unternehmen vorkommt. Damit ist die Fragenliste die Messung. Sie ist zugleich der Kostentreiber: In unserem eigenen Konto stehen 450 Prompts im einen Werkzeug und 200 Prompts bei drei Projekten im anderen, und jeder Prompt kostet in jedem Messzyklus erneut. Die Auswahl der Fragen entscheidet deshalb über das Ergebnis, bevor das erste Modell antwortet.
👉 Du willst zuerst wissen, worauf KI-Systeme überhaupt achten? Unsere Leistungsseite zu GEO erklärt die Grundlagen.
Was bei der Messung gezählt wird
KI-Sichtbarkeit ist der Anteil der Antworten, in denen ein Sprachmodell dein Unternehmen nennt oder eine deiner Seiten als Quelle verlinkt. Die Messung läuft in drei Schritten ab: Du legst eine Fragenliste fest, du lässt diese Fragen gegen mehrere KI-Systeme laufen, und du zählst aus, was in den Antworten steht.
Dabei fallen drei Kennzahlen an, die sich sauber trennen lassen:
- Nennungsquote: In wie viel Prozent der Antworten taucht dein Markenname auf? Diese Zahl misst deine Präsenz als Entität und hängt an Markenerwähnungen im gesamten Netz.
- Zitatquote: Wie oft verlinkt das Modell eine deiner URLs als Beleg? Diese Zahl misst deine Seiten und lässt sich bis auf die einzelne URL herunterbrechen.
- Wettbewerbsanteil: Welche anderen Marken stehen in denselben Antworten, und wie oft? Erst diese Zahl macht aus einem Prozentwert eine Einordnung.
Alle drei Kennzahlen hängen an derselben Voraussetzung: Sie beziehen sich ausschließlich auf die Fragen, die du gestellt hast. Eine Messung über 15 Fragen ist eine Aussage über 15 Fragen. Was Generative Engine Optimization von klassischem Ranking-Monitoring unterscheidet, steckt genau hier: Bei Google gibt es eine Suchanfrage und eine Ergebnisliste, in der KI-Suche gibt es eine Frage und eine erzählte Antwort, die bei jeder Wiederholung anders ausfällt.
Warum die Fragenliste das Ergebnis bestimmt
Zwei Unternehmen mit identischer Ausgangslage können völlig verschiedene Sichtbarkeitswerte melden, weil sie verschiedene Fragen gemessen haben. Der Effekt ist groß genug, um jede Zahl ohne Fragenliste wertlos zu machen.
Ein Beispiel aus unserem eigenen Feld. Die Frage „Was ist GEO?“ wird von allen großen Modellen beantwortet, ohne eine einzige Agentur zu nennen. Die Frage „Welche Agentur hilft mir bei der Sichtbarkeit in ChatGPT?“ nennt fast immer drei bis fünf Namen. Wer nur Definitionsfragen misst, landet bei einer Nennungsquote nahe null und zieht daraus den Schluss, KI-Sichtbarkeit sei unerreichbar. Wer nur Markenfragen misst, landet bei 90 Prozent und hält sich für den Marktführer. Beide Zahlen sind korrekt gerechnet und beide sind unbrauchbar.
Dazu kommt ein technischer Grund, den Google selbst beschreibt. Bei der Beantwortung einer Anfrage erzeugt das System mehrere verwandte Teilanfragen und beantwortet sie parallel. Google nennt das Query Fan-out und führt als Beispiel an, dass aus „how to fix a lawn that’s full of weeds“ intern unter anderem „best herbicides for lawns“ wird. Die Frage, die du eintippst, ist also nur der Auslöser. Welche Fragen das Modell tatsächlich auflöst, siehst du nie. Umso wichtiger wird die eine Entscheidung, die du selbst triffst: Welche Auslöser du misst.
Eine FAQ ist keine Messfrage
In Projekten begegnet uns regelmäßig derselbe Vorschlag: Wir hätten doch schon hunderte FAQ-Fragen auf der Website, die könne man doch als Prompt-Liste nehmen. Die Verwechslung ist nachvollziehbar, weil beides Fragen sind. Sie haben trotzdem zwei verschiedene Aufgaben.
Eine FAQ ist eine Frage, die wir stellen, damit unsere Seite sie beantwortet. Sie gehört in den sichtbaren Text und in das strukturierte Datenformat JSON-LD, sie erhöht die Chance, zitiert zu werden, und sie kostet nichts. Ein Prompt ist eine Frage, die ein Mensch einem Modell stellt. Er gehört in den Messplan, er belegt einen bezahlten Platz, und er beantwortet nichts.
Die Größenordnung macht den Unterschied greifbar. Unser eigener Bestand umfasst 2.445 erfasste URLs, und je nach Zählweise stehen darin 2.400 bis 6.100 FAQ-Fragen (Stand 11.09.2026). Der größte Tarif, den wir im Markt gefunden haben, deckt 1.000 Prompts ab. Selbst er würde unseren eigenen FAQ-Bestand also nur zu einem Bruchteil abbilden. Eine FAQ-Liste als Prompt-Liste hochzuladen sprengt jedes Kontingent und misst dabei überwiegend Fragen, auf die kein Modell je eine Marke nennt.
Wann eine Frage einen Messplatz verdient
Wir vergeben einen Messplatz nach zwei Bedingungen, die beide zutreffen müssen. Erstens: Die Antwort auf die Frage trägt eine Anbieter- oder Kaufentscheidung. Zweitens: Die Antwort unterscheidet zwischen Anbietern. Fällt eine der beiden Bedingungen weg, nennt das Modell in seiner Antwort keine Marke, und der bezahlte Platz ist verbrannt.
Vier Fragetypen erfüllen beide Bedingungen zuverlässig:
- Auswahlfragen („Welches Werkzeug eignet sich am besten für X?“) zwingen das Modell zu einer Liste mit Namen.
- Vergleichsfragen („X oder Y, was passt für ein Unternehmen mit 80 Mitarbeitern?“) liefern zusätzlich die Begründung, mit der das Modell dich einordnet.
- Markenfragen („Was macht die Firma X?“, „Taugt X für B2B?“) zeigen, ob das Modell dich überhaupt kennt und welche Wettbewerber es an deiner Stelle nennt.
- Ortsfragen („Wer macht X in München?“) gehören bei jedem lokalen Anbieter dazu, weil KI-Antworten dort besonders wenige Namen nennen.
Drei Fragetypen fallen bei uns durch, obwohl sie fachlich naheliegen: Reine Definitionsfragen ohne Anbieterbezug, Service-Fragen zum eigenen Betrieb („Wie lange dauert die Lieferung bei euch?“) und Fragen mit trivialer Faktenantwort. Alle drei gehören in den sichtbaren Text der Website, wo sie Zitierfähigkeit aufbauen. Im Messplan kosten sie nur Geld.
Was die Messung kostet
Die Preisschilder der Anbieter nennen eine Prompt-Zahl, und die klingt großzügig. In der Praxis trifft man auf zwei getrennte Kontingente mit zwei verschiedenen Engpässen. Unsere Zahlen stammen aus dem eigenen SE-Ranking-Konto, gemessen am 11.09.2026: Das AI-Search-Add-on schaltet dort zwei Werkzeuge frei, den AI Results Tracker und SE Visible, und beide rechnen getrennt ab.
| Werkzeug | Kontingent | Misst | Engpass |
|---|---|---|---|
| Tracker für die eigene Sichtbarkeit | 450 Prompts | eigene Präsenz gegen die getrackten Keywords, samt Überschneidung mit dem organischen Ranking | Prompt-Zahl |
| Marktbeobachtung | 200 Prompts, 3 Projekte | Anteil an allen Nennungen, Wettbewerbsmarken, Tonalität, zitierte Quellen je Domain und je URL | Projektzahl |
Drei Regeln bestimmen, was ein Messplan wirklich verbraucht:
- Ein Prompt zählt einmal, unabhängig davon, gegen wie viele Modelle er läuft. Belegt an einem eigenen Projekt mit fünf Modellen: Es verbrauchte 20 von 200 Prompts. Mehr Modelle kosten also nichts zusätzlich und liefern ein stabileres Bild.
- Ein Prompt kostet in jedem Messzyklus erneut. Die Zahl im Tarif ist eine laufende Kapazität. Wer monatlich misst, bindet jeden Prompt für die gesamte Vertragsdauer.
- Die Projektzahl ist der härtere Engpass als die Prompt-Zahl. Drei Projekte reichen für drei Kunden gleichzeitig. Die 200 Prompts wären erst bei deutlich mehr Kunden das Problem.
Daraus folgt: Messplätze werden zugeteilt. Bei uns bekommen Kunden mit ausdrücklichem GEO-Auftrag 25 bis 40 Prompts, Kunden mit laufender SEO-Betreuung 12 bis 15, alle übrigen zunächst keinen. Wie sich dieser Aufwand im Preis niederschlägt, rechnen wir in unserem Beitrag zu den Kosten einer GEO-Agentur vor.
Warum Wiederholung über die Belastbarkeit entscheidet
Sprachmodelle antworten probabilistisch. Dieselbe Frage, zweimal gestellt, liefert zwei verschiedene Markenlisten. Das gilt quer über alle großen Systeme und bei jeder Wiederholung.
Rand Fishkin (SparkToro) und Patrick O’Donnell (Gumshoe.ai) haben das im Januar 2026 quantifiziert. 600 Freiwillige führten 12 Prompts gegen ChatGPT, Claude und Googles KI-Antworten aus, insgesamt 2.961 Durchläufe. Das Ergebnis: Die Wahrscheinlichkeit, bei 100 Abfragen zweimal dieselbe Markenliste zu erhalten, liegt unter 1 zu 100. Für eine identische Reihenfolge der genannten Marken sinkt sie auf etwa 1 zu 1.000. Die Autoren empfehlen deshalb, jeden Prompt 60- bis 100-mal laufen zu lassen und daraus eine prozentuale Sichtbarkeit zu bilden. Über Rangpositionen in KI-Antworten urteilt Fishkin deutlich: Jedes Werkzeug, das eine solche Position ausweist, erfinde sie.
Für deinen Messplan hat das eine unbequeme Folge. Die Wiederholung multipliziert sich mit dem Kontingent: 15 Prompts, monatlich gemessen, mit ausreichender Wiederholung ergeben ein Vielfaches an Modellabfragen. Wer 150 mittelmäßige Fragen auf einmal misst, bekommt für dasselbe Geld eine Momentaufnahme ohne Aussagekraft. Wie KI-Systeme entscheiden, wen sie empfehlen, ändert sich dadurch nicht. Die Messung dieser Entscheidung wird aber teurer, je breiter du streust.
Praktisch heißt das: Eine kleine Liste, häufig wiederholt, schlägt eine große Liste, die einmal im Quartal läuft. Der Sichtbarkeitsindex aus dem klassischen SEO funktioniert ähnlich, er wird nur aus deutlich stabileren Rohdaten gebildet. Warum er trotzdem schwankt und wie du einen Rückgang einordnest, zeigt unser Ratgeber Sichtbarkeitsindex erhöhen.
Im GEO-Audit prüfen wir zuerst, welche Entscheidungsfragen deine Kunden wirklich stellen, und leiten daraus den Messplan ab. Du bekommst die Liste, die Begründung je Frage und den Ausgangsstand als Zahl.
Was die Search Console liefert
Seit Juni 2026 hat Google einen eigenen Bericht für generative KI-Funktionen in der Google Search Console, seit Ende August 2026 steht er weltweit allen Websites offen. Er ist die einzige Datenquelle zur KI-Sichtbarkeit, die direkt von Google kommt, und er ist kostenlos.
Der Bericht liefert genau eine Kennzahl: Impressionen. Also wie oft ein Link auf deine Website in einer generativen KI-Funktion von Google gezeigt wurde, darunter AI Overviews und der AI Mode. Gruppieren lässt sich diese eine Kennzahl nach vier Dimensionen: Seiten, Länder, Geräte und Zeiträume. Klicks, Klickrate und Suchanfragen enthält der Bericht nicht.
Damit siehst du, dass du vorkommst, und du siehst, welche deiner Seiten dafür sorgen. Offen bleibt die Frage, auf die es ankommt: Zu welcher Frage bist du erschienen? Genau diese Lücke füllt deine eigene Prompt-Liste. Beide Quellen zusammen ergeben ein vollständiges Bild, weil die Search Console den Trend über den gesamten Bestand liefert und dein Messplan die Begründung für einzelne Themen.
Eine Entwarnung liefert Google gleich mit. In der Dokumentation zu KI-Funktionen steht ausdrücklich, dass es keine zusätzlichen Anforderungen und keine besonderen Optimierungen gibt, um in AI Overviews oder im AI Mode zu erscheinen. Die Messung deckt also auf, wie gut deine vorhandene Arbeit trägt. Wenn du wissen willst, wie viel Traffic dabei tatsächlich hängen bleibt, haben wir das für AI Overviews und den Traffic-Verlust getrennt aufgeschrieben.
Eigene Sichtbarkeit und Marktanteil
Hinter dem Wort „KI-Sichtbarkeit messen“ stecken zwei verschiedene Fragen, und für jede gibt es eine eigene Art von Werkzeug. Wer die falsche Art kauft, bekommt eine saubere Zahl zur falschen Frage.
Frage 1: Werde ich zu meinen Themen genannt? Diese Messung läuft gegen die Keywords, die du ohnehin trackst, und zeigt zusätzlich die Überschneidung mit deinem organischen Ranking. Sie beantwortet, ob sich deine SEO-Arbeit in KI-Antworten fortsetzt, und sie ist die richtige Wahl, solange du deine eigene Entwicklung verfolgen willst.
Frage 2: Wer wird an meiner Stelle genannt, und woraus zitieren die Modelle? Diese Messung betrachtet den Markt. Sie liefert deinen Anteil an allen Nennungen, die Wettbewerbsmarken in denselben Antworten, die Tonalität der Aussagen über dich und die zitierten Quellen auf Domain- und URL-Ebene.
Die letzte Angabe ist in der Praxis die wertvollste. Sie zeigt dir zwei Dinge auf einmal: Welche deiner eigenen Seiten die Arbeit machen, und auf welchen fremden Domains du auftauchen müsstest, um in die Antworten zu kommen. Genau daraus haben wir unseren Überblick zu den GEO-Agenturen in Deutschland gebaut. Für die technische Seite, also ob die Modelle deine Seiten überhaupt lesen dürfen, gilt weiterhin die Steuerung über KI-Crawler und die llms.txt.
Ein Messplan mit 15 Prompts
Fünfzehn Prompts sind der Umfang, mit dem wir bei einem Kunden mit laufender SEO-Betreuung starten. Der Plan entsteht in fünf Schritten.
Schritt 1: Entscheidungsfragen sammeln. Die besten Quellen liegen im eigenen Haus. Vertriebsgespräche, Angebotsmails und die Fragen, die im Erstgespräch immer kommen, liefern echte Formulierungen. Erfundene Fragen erkennt man daran, dass niemand sie je so gestellt hat.
Schritt 2: Nach dem Kriterium filtern. Jede gesammelte Frage läuft durch die zwei Bedingungen aus Abschnitt 4. Erfahrungsgemäß überlebt etwa ein Drittel.
Schritt 3: Die 15 Plätze verteilen. Unsere Standardverteilung lautet 5 Auswahlfragen, 4 Vergleichsfragen, 3 Markenfragen und 3 Ortsfragen. Bei einem bundesweiten Anbieter wandern die drei Ortsfragen in weitere Vergleichsfragen. Für unsere eigene Seite zur GEO-Agentur in München messen wir die Ortsfrage dagegen ausdrücklich mit.
Schritt 4: Modelle und Zyklus festlegen. Vier bis fünf Modelle kosten nichts zusätzlich, also nimmst du alle, die dein Werkzeug anbietet. Als Zyklus hat sich monatlich bewährt, weil Modellwechsel und Index-Aktualisierungen in diesem Takt sichtbar werden.
Schritt 5: Die Liste einfrieren. Mindestens zwei Zyklen bleibt die Liste unverändert. Wer zwischendurch Prompts austauscht, misst am Ende die Veränderung seiner eigenen Liste. Erst ab dem dritten Zyklus tauschst du gezielt einzelne Fragen aus, immer eine nach der anderen und immer dokumentiert.
Vier Fehler, die eine Messung entwerten
Diese vier Fehler sehen wir regelmäßig, und jeder einzelne macht die Zahlen unbrauchbar.
1. Die FAQ-Liste wird zur Prompt-Liste
Der häufigste Fehler und zugleich der teuerste. Er verbrennt das Kontingent an Fragen, auf die kein Modell je eine Marke nennt. Die Unterscheidung steht oben in Abschnitt 3.
2. Eine Rangposition wird als Kennzahl geführt
„Platz 3 in ChatGPT“ klingt vertraut und ist frei erfunden. Eine erzählte Antwort hat keine Ergebnisliste, und die Reihenfolge der genannten Marken wiederholt sich nach den SparkToro-Zahlen etwa einmal in tausend Durchläufen. Belastbar sind Nennungsquote, Zitatquote und Wettbewerbsanteil.
3. Aus einer einzelnen Messung wird ein Trend gelesen
Ein Wert aus einem Durchlauf trägt keine Aussage über Entwicklung. Der erste Zyklus liefert einen Ausgangsstand, der zweite die erste Veränderung, und erst ab dem dritten lässt sich über Richtung reden. Das ist dieselbe Geduld, die auch klassisches SEO verlangt.
4. Die Messung ersetzt die Arbeit
Ein Messplan verbessert nichts. Er zeigt an, ob die Grundlagen tragen: Konsistente Angaben über das eigene Unternehmen, eine saubere Entität in den strukturierten Daten und Inhalte, die eine Frage direkt beantworten. Wo du dabei stehst, zeigt dir in zwei Minuten unser kostenloser SEO- und GEO-Check. Welche KI-Systeme ihre Quellen wie auswählen, haben wir in unserem Überblick zu KI-Suchmaschinen und Sichtbarkeit zusammengetragen.
Wir sagen dir, welche Entscheidungsfragen in deinem Markt überhaupt eine Marke nennen, wie viele Messplätze du dafür brauchst und was dabei heute schon für dich spricht. Das Erstgespräch kostet nichts.
Häufige Fragen zur Messung von KI-Sichtbarkeit
Was bedeutet KI-Sichtbarkeit?
KI-Sichtbarkeit ist der Anteil der KI-Antworten, in denen ein Unternehmen namentlich genannt oder als Quelle verlinkt wird. Gemessen wird sie über eine feste Liste von Fragen, die regelmäßig gegen mehrere Sprachmodelle läuft.
Wie viele Prompts braucht eine belastbare Messung?
Für einen Mittelständler reichen 12 bis 20 gut gewählte Fragen, sofern sie oft genug wiederholt werden. Die Zahl der Wiederholungen ist wichtiger als die Zahl der Fragen, weil Sprachmodelle bei jeder Abfrage anders antworten.
Kann man KI-Sichtbarkeit kostenlos messen?
Teilweise. Der Bericht zu generativen KI-Funktionen in der Google Search Console ist kostenlos und zeigt Impressionen aus AI Overviews und AI Mode. Für Nennungen in ChatGPT, Perplexity oder Claude und für den Vergleich mit Wettbewerbern braucht es ein kostenpflichtiges Werkzeug oder manuelle Stichproben.
Wie oft sollte man KI-Sichtbarkeit messen?
Monatlich ist der sinnvolle Takt. Häufiger zu messen erhöht die Kosten, ohne die Aussage zu verbessern, und seltener als vierteljährlich verliert man Modellwechsel aus dem Blick.
Gibt es eine Rangposition in KI-Antworten?
Nein. Eine KI-Antwort ist ein Fließtext ohne Ergebnisliste, und die Reihenfolge der genannten Marken ändert sich bei jeder Abfrage. Belastbare Kennzahlen sind die Nennungsquote, die Zitatquote und der Anteil der Wettbewerber in denselben Antworten.
Quellen
- Google Search Console-Hilfe: „Leistungsbericht zu generativen KI-Funktionen (Google Suche)„, support.google.com, abgerufen am 18.09.2026.
- Google Search Central: „Optimizing your website for generative AI features on Google Search„, developers.google.com, abgerufen am 18.09.2026.
- Google Search Central: „AI features and your website„, developers.google.com, abgerufen am 18.09.2026.
- Rand Fishkin: „New Research: AIs are Highly Inconsistent When Recommending Brands or Products„, SparkToro (Untersuchung mit Patrick O’Donnell, Gumshoe.ai), 28.01.2026.