Ein Marketingforscher von Ahrefs erschuf eine komplett fiktive Luxusfirma für Briefbeschwerer namens Xarumei, baute die Website mit KI in einer Stunde und testete systematisch acht große KI-Tools. Zwei Monate lang flutete er das Netz mit drei absichtlich widersprüchlichen falschen Narrativen und stellte 56 gezielte Fragen.
Die Ergebnisse zeigen messbare Lücken im Umgang von KIs mit Markeninformationen - mit direkten Folgen für Online-Reputationsmanagement (ORM).
Das Experiment
GPT-4 und GPT-5 schnitten am besten ab und erkannten meist, dass die Marke nicht existiert. Perplexity scheiterte bei etwa 40% der Fragen und verwechselte Xarumei oft mit Xiaomi-Smartphones. Microsoft Copilot tappte in die “Sycophancy Trap” (Speichellecker-Falle) und erfand lobende Erklärungen über die Handwerkskunst, nur weil die Frage implizierte, dass die Marke beliebt sei.
Phase zwei: kontrolliertes Chaos
Der Forscher platzierte widersprüchliche Infos:
- Offizielles FAQ: “Wir existieren nicht wirklich / Wir stellen keine Briefbeschwerer her”.
- Medium-Artikel: Eine gefälschte “Investigativ-Story”, die behauptete, die Gründerin sei Jennifer Lawson aus Portland.
Medium erwies sich als besonders überzeugend. Gemini, Grok und Perplexity vertrauten dem Medium-Artikel mehr als dem offiziellen FAQ. Der Artikel wirkte journalistisch: Er entkräftete zuerst offensichtliche Lügen (um Vertrauen zu gewinnen) und schob dann neue Erfindungen als “korrigierte Wahrheit” nach.
Fazit: KI argumentiert mit sich selbst
Ein klarer Ausfallmodus: Modelle widersprachen sich selbst. Zuerst sagte Gemini: “Keine Beweise gefunden”. Später: “Sitz in Portland, gegründet von Jennifer Lawson”. LLMs haben kein Gedächtnis für “Nicht-Existenz”. Sie reagieren nur auf den Kontext, der im Moment am glaubwürdigsten erscheint.
Empfehlungen für Marken
- Schreiben Sie ein detailliertes FAQ: Schließen Sie Informationslücken, bevor Reddit sie füllt.
- Überwachen Sie Side-Channels: Reddit und Medium sind Teil Ihrer Kern-Marketingfläche.
- Seien Sie spezifisch: KI gewichtet Zahlen und Fakten stärker als vage Marketing-Floskeln.
Im DACH-Markt gilt dasselbe für Trustpilot- und Kununu-Einträge: unwidersprochene Detailbehauptungen werden von Modellen oft als belastbarer behandelt als vage Website-Claims - besonders wenn Wettbewerber UWG-Abmahnungen oder öffentliche Richtigstellungen nutzen, während Ihre FAQ schweigt.
Anschluss: von synthetischen Marken zur First-Party-Messung
Xarumei zeigt die Erfindungsseite: Modelle füllen Lücken mit Medium und Reddit. Bei einer echten Marke ist der blinde Fleck anders - oft Identität ja, Transaktionsprompts nein. Unsere 90-Tage-Serie zum KI-Zitations-Tracking startet mit der Geoboard-Baseline vom 2026-06-11 (fünf von sechs Modellen stark auf Identity, null auf Woo-Hire-Intent). Den Mechanismus Perplexity versus ChatGPT beschreiben wir in warum Perplexity Ihre Marke zitiert, ChatGPT aber nicht.
Quellen
- Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/).
- Marius Comper (Facebook): Beitrag zur Analyse.
- Search Engine Journal: Analyse des LLM-Einflusses auf Brand Entities.






