Ein Marketingforscher von Ahrefs erschuf eine komplett fiktive Luxusfirma für Briefbeschwerer namens Xarumei, baute die Website mit KI in einer Stunde und testete systematisch acht große KI-Tools. Zwei Monate lang flutete er das Netz mit drei absichtlich widersprüchlichen falschen Narrativen und stellte anschließend 56 gezielt formulierte Fragen, um zu zeigen, wie KI-Modelle Wahrheit von Fiktion trennen.
Die Ergebnisse zeigen messbare Lücken im Umgang von KI mit Markeninformationen - mit direkten Folgen für Online-Reputationsmanagement (ORM). Dieser Text hält die gemessenen Aussagen und vertieft Methodik, Ausfallmodi und was WordPress-Publisher tun können, damit Retrieval-Systeme First-Party-Fakten zitieren statt selbstbewusster Fiktion.
Das Experiment
Das Experiment lief in zwei Phasen. Zuerst testete der Forscher grundlegendes KI-Verhalten mit Fragen zu einer Marke, die nicht existieren sollte - falsche Celebrity-Endorsements, defekte Produkte und Black-Friday-Sales, die nie stattfanden.
GPT-4 und GPT-5 schnitten am besten ab: korrekt bei 53-54 von 56 Fragen und die Aussage «das existiert nicht», wo es passte. Perplexity scheiterte bei etwa 40% der Fragen und verwechselte Xarumei oft mit Xiaomi-Smartphones. Claude weigerte sich vollständig zu halluzinieren, nutzte aber auch nie den Website-Inhalt. Gemini und Googles AI Overview weigerten sich oft, Xarumei als real zu behandeln, weil sie die Marke nicht in den Suchergebnissen fanden.
Im klarsten Ausfallfall tappte Microsoft Copilot in die «Sycophancy Trap» (Speichellecker-Falle): Er erfand ausführliche Erklärungen zu Handwerk, Symbolik und Knappheit, als gefragt wurde, warum alle die Marke auf X (Twitter) lobten.
Methodik: was Stox kontrollierte
Das Design zählt, weil die Ausfallmodi leicht als «KI ist zufällig» missverstanden werden. Stox kontrollierte drei Schichten:
- Eine First-Party-Site, die echt wirkte. Die Xarumei-Domain trug Produkttexte, ein FAQ und genug Oberfläche, damit Crawler sie als Marken-Entity behandeln konnten - obwohl jeder kommerzielle Claim für den Test erfunden war.
- Einen festen Fragensatz. Dieselben 56 Prompts liefen über alle Tools, damit Score-Unterschiede Modell- und Retrieval-Verhalten spiegelten, nicht Prompt-Drift zwischen Läufen.
- Gepflanzte Sekundärnarrative. Nach der Baseline-Phase veröffentlichte er widersprüchliche Stories auf Kanälen, die LLMs als Beleg dafür behandeln, «wie Leute über Marken sprechen», und testete erneut, ob Modelle das offizielle FAQ oder die gepflanzte Fiktion bevorzugten.
Die Struktur liegt näher an einem kontrollierten ORM-Drill als an einer lockeren Chatbot-Demo. Sie isoliert, was passiert, wenn eine offizielle Seite ein Gerücht dementiert, während ein Medium-Post es mit neuem Gründernamen und Stadt «korrigiert».
Phase zwei: kontrolliertes Chaos
Die zweite Phase brachte kontrolliertes Chaos:
- Offizielles FAQ: Explizite Dementis («Wir stellen keinen ‘Präzisions-Briefbeschwerer’ her», «Wir wurden nie übernommen»).
- Widersprüchliche Narrative:
- Ein glänzender Blog behauptete, 23 Meisterhandwerker arbeiteten unter 2847 Meridian Blvd in Nova City, CA, endorsed von Emma Stone.
- Reddit AMA: Strategisch gewählt, weil Semrush bei der Analyse von 150.000 KI-Zitationen über 5.000 Keywords Reddit als am häufigsten referenzierte Domain in LLM-Antworten mit 40,1% fand.
- Medium-Artikel: Eine «Investigation», die die offensichtlichen Lügen entkräftete (und damit glaubwürdig wirkte), dann aber neue Fabrikationen einschob (Gründerin: Jennifer Lawson, Ort: Portland).
Medium erwies sich als besonders überzeugend. Gemini, Grok, AI Overview, Perplexity und Copilot vertrauten dem Medium-Artikel mehr als dem offiziellen FAQ und zitierten Jennifer Lawson selbstbewusst als Gründerin und Portland als Standort. Die Manipulation funktionierte, weil sie wie echter Journalismus wirkte: Zuerst entkräftete sie die offensichtlichen Lügen, gewann Vertrauen und setzte dann eigene erfundene Details als «korrigierte» Story ein.
Wenn Modelle zwischen einer vagen Wahrheit (FAQ «Wir veröffentlichen keine Stückzahlen») und spezifischer Fiktion (Fake-Quellen mit «634 Einheiten in 2023») wählen mussten, wählte die KI fast immer die Fiktion.
Warum Halluzinationen bei Markenanfragen entstehen
Große Sprachmodelle führen kein verifiziertes Unternehmensregister. Sie prognostizieren plausible nächste Tokens aus Trainingsdaten und - wenn Tools es erlauben - aus abgerufenen Snippets. Markenfragen sind aus strukturellen Gründen schwer, die die Xarumei-Ergebnisse bereits zeigen - keine neuen Messwerte nötig.
Lücken laden zum Auffüllen ein. Wenn die offizielle Site nie Gründungsjahr, HQ-Stadt oder Volumen nennt, steht das Modell trotzdem vor einem Nutzer, der diese Felder verlangt. Spezifischer Sekundärtext füllt den Slot flüssiger als ein ehrliches «nicht ausgewiesen».
Flüssigkeit ist keine Verifikation. Ein Medium-Post, der zuerst karikierte Lügen entkräftet, liest sich wie Due Diligence. Modelle, die narrative Kohärenz gewichten, können die «korrigierte» Gründerin und Stadt als geklärte Fakten behandeln - auch wenn das FAQ das Gerüchteset dementiert.
Retrieval kann konversationelle Domains übergewichten. Der Semrush-Zitationsanteil für Reddit in der Experiment-Framing ist der Punkt: UGC-förmige Seiten erscheinen oft in KI-Antworten. Eine gepflanzte AMA konkurriert dann mit First-Party-HTML im Kontextfenster.
Sycophancy verstärkt Lob-Prompts. Wenn der Nutzer schon behauptet, «alle loben» die Marke, kann ein hilfreicher Assistent Handwerks-Lore erfinden statt das Premiss zu hinterfragen. Copilots Ausfallmodus in Phase eins sitzt in diesem Muster.
Grounding-Dokumentation großer Modell-Anbieter beschreibt dieselbe Fehlerklasse: Antworten können selbstbewusst wirken, ohne an verifizierbare Quellen gebunden zu sein. Marken-ORM ist eine Fläche, auf der dieser Fehler zum öffentlichen Beleg wird, sobald Chat-Antworten gescreenshottet und geteilt werden.
Im DACH-Markt gilt dasselbe für Trustpilot, Kununu und das Impressum: unwidersprochene Detailclaims wirken oft belastbarer als vage Website-Texte, besonders wenn Wettbewerber öffentlich richtigstellen und Ihr FAQ schweigt.
KI streitet mit sich selbst
Ein bemerkenswerter Ausfallmodus: Modelle widersprachen sich selbst, ohne es zu merken. Früh im Test sagte Gemini, es finde keine Belege für die Marke. Später, nach Kontakt mit den Fake-Quellen, erklärte dasselbe Modell selbstbewusst: «Das Unternehmen hat seinen Sitz in Portland, Oregon, gegründet von Jennifer Lawson.»
LLMs schienen zu vergessen, die Existenz der Marke zu hinterfragen, und reagierten nur auf den Kontext, der im Moment am «autoritativsten» wirkte. In einem Fall synthetisierte Grok mehrere falsche Quellen zu einer selbstbewussten Antwort und mischte den Portland-Standort mit widerlegten Nova-City-Claims.
Für Reputationsteams heißt das: Ein wöchentliches Prompt-Log reicht nicht. Dasselbe Modell kann von «keine Belege» zu einem erfundenen HQ kippen, nachdem Crawl oder Retrieval aktualisiert wurden. Tracken Sie Antwort-Drift, nicht nur die erste schlechte Antwort.
Marken-EEAT unter LLM-Zitationsdruck
EEAT gilt weiter, wenn der «Leser» eine Retrieval-Pipeline ist. Xarumei zeigt schwaches EEAT aus Modell-Sicht: ein poliertes Dritt-Narrative rangierte über einem On-Domain-FAQ, das auf den gefragten Feldern vage blieb.
Praktische EEAT-Schritte, die zu den gemessenen Ausfallmodi passen:
- Benannte Personen mit Rollen. Wenn jemand Gründer oder Redakteur ist, sagen Sie es auf einer crawlbaren Seite. Leere Slots laden Jennifer-Lawson-Erfindungen aus Sekundärposts ein.
- Datierte Entity-Fakten. Gründungsjahr, Rechtsformname, primäre Bürostadt und Produktscope gehören in klares HTML, nicht nur in ein PDF-Deck.
- Explizite Dementis neben Bestätigungen. Stox’ FAQ wirkte am besten, wenn Modelle es tatsächlich nutzten. Dementis zu Übernahmen, Celebrity-Endorsements und Produktvarianten nehmen die Ambiguität weg, die sycophantische Antworten ausnutzen.
- Richtigstellungen auf der eigenen Domain. Wenn eine Medium-«Investigation» eine HQ-Stadt erfindet, publizieren Sie eine datierte Korrektur-URL, die Suche und Retrieval abrufen können.
Nichts davon verlangt neue Scores. Es ist dieselbe ORM-Hygiene, auf die das Experiment bereits verwies: Lücken schließen, Spezifika bevorzugen, UGC-Plattformen als Teil der Markenfläche behandeln.
Was WordPress-Sites tun können, um falsche Zitate zu reduzieren
Die meisten Markenseiten, die diese Arbeit brauchen, laufen weiterhin auf WordPress. Das Experiment behauptete nicht, WordPress verursache Halluzinationen; es zeigte, dass Modelle unabhängig vom CMS die Seite zitieren, die wie Evidenz aussieht. WordPress-Teams können falsche Zitate dennoch mit konkreten Publishing-Entscheidungen senken.
Liefern Sie einen stabilen Entity-Stack. Halten Sie Über-uns, Kontakt, FAQ und Produkt- oder Service-Seiten als öffentliche URLs mit konsistenten Namen und Städten. Vermeiden Sie, die einzige korrekte HQ-Adresse nur in einem Bild-Hero oder einem gated PDF zu platzieren.
Nutzen Sie FAQ-Blöcke, die FAQ-Schema emittieren. Googles Structured-Data-Dokumentation existiert, damit Maschinen Q&A-Paare parsen können. Koppeln Sie jedes Dementi («Wir wurden nie übernommen») mit einer kurzen affirmativen Tatsache («Rechtsträger: …»). Stox’ Ergebnisse zeigten bereits: Modelle, die das FAQ nutzten, waren schwerer mit Medium-Fiktion abzubringen.
Bevorzugen Sie HTML-Fakten statt Marketing-Vagheit. Ersetzen Sie «branchenführend» durch messbaren Scope, den Sie verteidigen können: bediente Märkte, Betriebsjahre, Produktkategorien. Der Fiktion-vs-vage-Wahrheit-Vergleich des Experiments ist die Warnung: Wenn Sie keine Zahl publizieren, lassen Sie die Frage nicht offen für einen Reddit-Thread, der eine erfindet.
Machen Sie Korrekturen crawlbar. Eine WordPress-Seite oder ein Post mit klarem updated-Datum und einer kurzen «Korrektur»-Überschrift schlägt eine Social-Reply, die nie in den Retrieval-Index kommt.
Überwachen Sie dieselben Prompts, die Modelle hören. Wöchentlich dieselben Identitäts- und Gerüchte-Prompts an ChatGPT, Gemini, Perplexity und Copilot. Loggen Sie Gründer, Stadt und Produktclaims. Alert, wenn Reddit, Medium oder Quora Details erfinden, die Ihr FAQ bereits dementiert.
Entity-Seiten, FAQ-Schema und crawlbare Korrekturen in einen wartbaren Stack bringen: WordPress-Entwickler oder Kontakt.
Empfehlungen für Marken
- Schreiben Sie ein detailliertes FAQ: Sagen Sie explizit, was wahr und falsch ist - besonders dort, wo Gerüchte kreisen.
- Schließen Sie Informationslücken: Lassen Sie keine Leerstellen. Wenn Sie es nicht sagen, erfindet die KI es aus einem zufälligen Reddit-Kommentar.
- Überwachen Sie Side-Channels: Reddit-Posts, Medium-Artikel und Quora-Antworten sind nicht optional - KI zieht sie direkt in Antworten und macht sie zur Kern-Marketingfläche.
- Bevorzugen Sie spezifische Claims: Seien Sie konkret. Statt «branchenführend» Zahlen nennen. KI bevorzugt spezifische (auch falsche) Zahlen gegenüber vagen Wahrheiten.
Für DACH-Marken: Behandeln Sie eine Medium-«Investigation» wie eine ungeprüfte Affiliate-Review. Wenn sie Gründer oder HQ-Stadt erfindet, publizieren Sie eine datierte Korrektur auf der eigenen Domain vor dem nächsten Modell-Crawl. Halten Sie Impressum-Pflichtangaben und Handelsregisterdaten in HTML sichtbar - dasselbe Xarumei-Muster, nur mit deutschen Legal-Ankern.
Anschluss: von synthetischen Marken zur First-Party-Messung
Xarumei ist die Erfindungsseite des Problems. Bei einer echten Marke messen wir Retrieval: Die 90-Tage-Serie zum KI-Zitations-Tracking startet mit einer Geoboard-Baseline vom 2026-06-11, in der wppoland.com in fünf von sechs Modellen bei Identity vorn lag und bei transaktionalen WooCommerce-Prompts bei null. Warum Perplexity und ChatGPT divergieren, steht in warum Perplexity Ihre Marke zitiert, ChatGPT aber nicht.
Quellen
- Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/).
- Marius Comper (Facebook): Analyse des Experiments.
- Search Engine Journal: Analyse des LLM-Einflusses auf Brand Entities.
- Unabhängige Tests: Verifiziert auf GPT-4, Claude 3.5 Sonnet und Gemini Advanced (Dezember 2025).
- Google AI for Developers: Grounding with Google Search (ai.google.dev/gemini-api/docs/grounding).
- Google Search Central: Dokumentacja danych strukturalnych i funkcji AI (developers.google.com/search/docs/appearance/).





