Datenerfassung
Wir erfassen Daten aus den live verfügbaren, öffentlichen Consumer-Interfaces jeder Plattform, darunter ChatGPT, Perplexity, Google AI Overviews, Google AI Mode, Gemini, Grok und Microsoft Copilot. Wir führen echte Browser-Sessions gegen dieselben Interfaces aus, die deine Kunden nutzen.
Wir verwenden nicht die APIs der Plattformen. API-Ausgaben sind bereinigt und greifen auf andere Quellen zurück als das Consumer-Produkt, deshalb spiegeln sie nicht wider, was ein echter Nutzer sieht. Die gerenderte Consumer-Erfahrung zu erfassen ist der einzige Weg, die Antworten zu messen, die deine Kunden tatsächlich erhalten.
Außerdem führen wir aus den Standorten aus, die für dich zählen. Die Plattformen lokalisieren ihre Antworten, also ist ein aus der richtigen Region erfasstes Ergebnis genau das Ergebnis, das ein echter Nutzer in diesem Markt bekommt. Bei jedem Durchlauf erfassen wir die vollständige gerenderte Antwort und jede Quell-URL, die sie zitiert. Diese Rohantwort ist die Grundlage, aus der jede Metrik berechnet wird.
Messung durch Sampling
Ein Temso-Score ist eine Rate, keine einzelne Antwort. Für ein bestimmtes Thema messen wir über wiederholte Durchläufe hinweg den Anteil der Antworten, in denen eine bestimmte Marke und Quelle auftaucht. Dieser Anteil ist die Metrik.
Zwei Arten von Fehlern wirken sich darauf aus: zufällige Varianz und systematische Verzerrung.
Zufällige Varianz bedeutet, dass die Plattform von einem Durchlauf zum nächsten unterschiedlich antwortet. Sie mittelt sich heraus, je größer die Stichprobe wird. Die Fehlermarge sinkt etwa mit der Quadratwurzel der Anzahl der Durchläufe, eine größere Stichprobe liefert also eine engere, stabilere Zahl.
Systematische Verzerrung ist etwas anderes. Sie mittelt sich nicht heraus, egal wie viele Durchläufe du hinzufügst. Wir beseitigen sie, indem wir die Testbedingungen konstant halten: feste Region, Sprache, Session-Status und Kadenz. Weil sich die Bedingungen nie ändern, spiegelt eine Veränderung in den Daten eine echte Veränderung in der KI oder in deinem Content wider, nie eine Veränderung in der Art, wie wir gemessen haben.
Die Stichprobengröße ist der wichtigste Hebel
Der mit Abstand größte Faktor für die Genauigkeit ist die Stichprobengröße. Mehr Durchläufe bedeuten ein engeres Konfidenzintervall, eine stabilere Messung und eine geringere Wahrscheinlichkeit für ein verzerrtes Ergebnis.
Die Stichprobengröße ist außerdem ein Hebel, den du steuerst. Enterprise-Pläne führen deine Prompt-Sets mit höherer täglicher Frequenz aus, skaliert auf die Präzision, die dein Use Case verlangt. Je sensibler die Entscheidung ist, die von den Daten abhängt, desto häufiger sampeln wir.
Modellieren, wie echte Nutzer fragen
KI-Plattformen beantworten nicht den rohen Prompt. Sie zerlegen jede Suchanfrage in mehrere Unterabfragen (Fan-out), rufen dazu passende Informationen ab und synthetisieren das Ergebnis. Semantisch gleichwertige Formulierungen erzeugen sich überschneidende Sets an Unterabfragen, also konvergieren sie auf dieselben abgerufenen Quellen und im Wesentlichen dieselbe Antwort. Jede mögliche Formulierung zu messen ist unnötig.
Die Variable, die die Antwort tatsächlich verändert, ist der Kontext der fragenden Person: das Angebot, die Persona und der Use Case hinter der Frage. Temso stellt ein Schema bereit, um diese Dimensionen in deine Prompt-Bibliothek zu codieren, sodass das Set deine tatsächliche Nachfrage abbildet statt generischer Fragen.
Wir validieren anhand unabhängiger Signale, dass das Set repräsentativ ist: Keyword-Suchvolumina, um Prompts nach Nachfrage zu gewichten, und deine eigenen First-Party-Daten über Integrationen wie die Google Search Console.
Die Daten verifizieren
Die Zahlen werden beobachtet, nicht geschätzt. Jede Metrik lässt sich auf eine bestimmte erfasste Antwort und die exakten Quell-URLs zurückführen, die sie ausgelöst haben. Wenn sich ein Score verändert, kannst du in die Antwort eintauchen, die das verursacht hat. Führ sie erneut aus und prüf es.
Darüber hinaus lassen dich zwei unabhängige Gegenprüfungen das Signal anhand deiner eigenen Daten bestätigen.
Temso korreliert diese Crawl-Aktivität mit Zitierungs-Trends, sodass du bestätigen kannst, dass steigende Zitierungen mit echtem Crawler-Verhalten auf deiner Website zusammenpassen. Das ist eingebaut und muss in deinem Account nur aktiviert werden.
Die Anfrage- und Impression-Muster in der Search Console mit den Zitierungs-Mustern in Temso zu vergleichen gibt dir eine zweite unabhängige Datenquelle. Wenn sich unabhängige Instrumente gemeinsam bewegen, spiegelt die Messung die Realität wider und nicht ein Artefakt davon, wie sie erfasst wurde.
Was die Daten sind und was nicht
Die Plattformen sind nicht stationär. Modelle werden aktualisiert, führen serverseitige Tests durch und ändern ihr Verhalten im Laufe der Zeit. Das messen wir ebenfalls. Eine Verschiebung, die alle Marken gleichzeitig trifft, signalisiert eine Plattformänderung. Eine Verschiebung, die nur deine Marke betrifft, signalisiert eine Veränderung in deinem Content oder deiner Sichtbarkeit.
Scores liest du am besten als Trends über die Zeit, nicht als exakte Tageswerte. Und die Daten messen Sichtbarkeit, nicht Reichweite: Sie zeigen, was in KI-Antworten erscheint, nicht wie viele Menschen es gesehen haben.
Wenn dein Team die Methodik anhand eurer eigenen Daten validieren möchte, geht unser Team sie gerne direkt mit euch durch.

