Messung
Wie wir messen
Wir messen von Hand, nicht über Schnittstellen.
Der Aufbau
Der Aufbau ist immer derselbe: zehn Käuferfragen, die euren Markennamen nicht enthalten, über vier Engines, also ChatGPT, Perplexity, Google AI Overviews und Claude, mit drei Läufen je Frage und Engine. Das sind 120 dokumentierte Datenpunkte je Domain und Messrunde. Jeder Lauf läuft in einer eigenen frischen Sitzung, als Referenzmessung ohne Personalisierung, feste Region Deutschland.
Die Bewertung
Bewertet wird jeder Lauf einzeln von 0 bis 3: nicht erwähnt, erwähnt, als Quelle zitiert, aktiv empfohlen. Das Scoring passiert live während der Messung, zu den Kernbefunden legen wir datierte Screenshots ab. Ab dem 16. September dokumentieren wir jeden einzelnen Lauf mit Screenshot.
Google spielt nicht auf jede Frage ein AI Overview aus. Wir halten ab dem 16. September getrennt fest, ob überhaupt eine Antwort erschienen ist, und weisen für Google zwei Zahlen aus: wie oft ein Overview kam und wie oft die Marke darin vorkam. Sonst sähe eine Frage ohne Overview genauso aus wie eine Frage, bei der die Marke gefehlt hat.
Zwei Messzeitpunkte
Gemessen wird zweimal mit identischem Fragensatz, einmal vor der Umsetzung und einmal danach. Rückgänge weisen wir aus, die stehen im Bericht.
Warum nicht automatisiert
Wir messen die Oberfläche, in der eure Käufer suchen, nicht die Schnittstelle dahinter. Bei ChatGPT und Perplexity antwortet die API anders als die Oberfläche: anderer Systemprompt, andere Abrufmechanik, andere Zahl. Für Google AI Overviews gibt es keine offizielle Schnittstelle, die verfügbaren Scraper lesen die Suchergebnisseite aus. Personalisierung schalten wir bewusst ab, sonst wären zwei Messrunden nicht vergleichbar.
Aufwand und Nachprüfbarkeit
Der Aufwand liegt bei rund fünf Stunden je Domain und Messrunde: zweieinhalb Stunden Messung, eine Stunde Auswertung, anderthalb bis zwei Stunden Bericht. Das ist teuer und langsam. Dafür bekommt ihr den vollständigen Fragensatz und könnt jede Frage selbst stellen. Einzelne Läufe schwanken, deshalb messen wir jede Frage dreimal. Wenn eure Stichprobe von unserem Ergebnis abweicht, zeigen wir euch die Belege dazu.