En markedsforsker hos Ahrefs skapte et fullstendig fiktivt luksusfirma for brevvekter kalt Xarumei, bygde nettsiden på én time med AI, og testet systematisk åtte store AI-verktøy. Over to måneder fylte han nettet med tre bevisst motstridende falske narrativer, og stilte deretter 56 nøye utformede spørsmål for å avsløre hvordan AI-modeller skiller sannhet fra fiksjon.
Resultatene viser målbare gap i hvordan AI håndterer merkevareinformasjon, med direkte konsekvenser for omdømmehåndtering (ORM) på nett. Denne gjennomgangen holder de målte påstandene, og utvider metode, feilmoduser og hva WordPress-utgivere kan gjøre for at retrieval-systemer siterer førstepartsfakta i stedet for selvsikker fiksjon.
Eksperimentet
Eksperimentet gikk i to faser. Først testet forskeren grunnleggende AI-adferd med spørsmål om et merke som ikke burde finnes - falske kjendis-endorsements, defekte produkter og Black Friday-salg som aldri skjedde.
GPT-4 og GPT-5 presterte best, og svarte korrekt på 53-54 av 56 spørsmål og sa «dette eksisterer ikke» der det passet. Perplexity feilet på omtrent 40% av spørsmålene, og forvekslet ofte Xarumei med Xiaomi-smarttelefoner. Claude nektet å hallusinere helt, men brukte heller aldri innholdet fra nettsiden. Gemini og Googles AI Overview nektet ofte å behandle Xarumei som ekte, fordi de ikke fant merket i søkeresultater.
I det klaraste feiltilfellet falt Microsoft Copilot i det forskeren kaller «smiger-fellen»: den diktet opp forklaringer om håndverk, symbolikk og knapphet da den ble spurt om hvorfor alle roste merket på X (Twitter).
Metode: hva Stox kontrollerte
Designet betyr noe, fordi feilmodusene lett kan misforstås som «AI er tilfeldig». Stox kontrollerte tre lag:
- En førstepartsside som så ekte ut. Xarumei-domenet bar produkttekst, en FAQ og nok overflate til at crawlere kunne behandle det som en merkevareenhet, selv om alle kommersielle påstander var oppdiktet for testen.
- Et fast spørsmålssett. De samme 56 promptene ble kjørt på tvers av verktøy, slik at poengforskjeller reflekterte modell- og retrieval-adferd, ikke prompt-drift mellom kjøringer.
- Plantede sekundærnarrativer. Etter baseline-fasen publiserte han motstridende historier på kanaler LLM-er behandler som bevis på «hvordan folk snakker om merker», og testet deretter på nytt om modellene foretrakk den offisielle FAQ-en eller den plantede fiksjonen.
Strukturen ligger nærmere en kontrollert ORM-drill enn en uformell chatbot-demo. Den isolerer hva som skjer når en offisiell side benekter et rykte, mens et Medium-innlegg «korrigerer» det med nytt grunnleggernavn og by.
Fase to: kontrollert kaos
Den andre fasen innførte kontrollert kaos:
- Offisiell FAQ: Eksplisitt benektelse av rykter («Vi lager ikke en ‘presisjonsbrevvekt’», «Vi ble aldri kjøpt opp»).
- Motstridende narrativer:
- En blankpolert blogg som hevdet at 23 mesterhåndverkere jobbet på 2847 Meridian Blvd i Nova City, CA, endorsed av Emma Stone.
- Reddit AMA: Strategisk valgt fordi Semrush, som analyserte 150 000 AI-sitasjoner på tvers av 5 000 søkeord, fant Reddit som den mest refererte domenet i LLM-svar med 40,1%.
- Medium-artikkel: En «granskning» som avslørte de åpenbare løgnene (og dermed virket troverdig), men deretter smøg inn nye fabrikasjoner (grunnlegger: Jennifer Lawson, sted: Portland).
Medium viste seg spesielt overbevisende. Gemini, Grok, AI Overview, Perplexity og Copilot stolte på Medium-artikkelen fremfor den offisielle FAQ-en, og siterte selvsikkert Jennifer Lawson som grunnlegger og Portland som sted. Manipulasjonen fungerte fordi den så ut som ekte journalistikk - ved å avsløre de åpenbare løgnene først, vant den tillit, og satte deretter inn egne oppdiktede detaljer som den «korrigerte» historien.
Når modellene ble tvunget til å velge mellom en vag sannhet (FAQ «Vi publiserer ikke enhetstall») og spesifikk fiksjon (falske kilder som hevdet «634 enheter i 2023»), valgte AI nesten alltid fiksjon.
Hvorfor hallusinasjoner oppstår i merkevarespørsmål
Store språkmodeller holder ikke et verifisert selskapsregister. De predikerer plausible neste tokens fra treningsdata og, når verktøy tillater det, fra hentede snutter. Merkevarespørsmål er vanskelige av strukturelle grunner Xarumei-resultatene allerede illustrerer - ingen nye måltall kreves.
Gap inviterer til utfylling. Hvis den offisielle siden aldri oppgir grunnleggelsesår, HQ-by eller volum, står modellen fortsatt overfor en bruker som ba om de feltene. Spesifikk sekundærtekst fyller sporet mer flytende enn et ærlig «ikke oppgitt».
Flyt er ikke verifikasjon. Et Medium-innlegg som først avslører karikerte løgner, leses som due diligence. Modeller som vekter narrativ koherens kan behandle den «korrigerte» grunnleggeren og byen som avgjort fakta, selv når FAQ-en benekter ryktesettet.
Retrieval kan overvektlegge samtaleformede domener. Semrush-sitasjonsandelen for Reddit i eksperimentets framing er poenget: UGC-formede sider dukker ofte opp i AI-svar. En plantet AMA konkurrerer deretter med førsteparts-HTML inne i kontekstvinduet.
Smiger forsterker rosende prompts. Når brukeren allerede hevder at «alle roser» merket, kan en hjelpsom assistent dikte opp håndverkslore i stedet for å utfordre premisset. Copilots feilmodus i fase én sitter i det mønsteret.
Grounding-dokumentasjon fra store modellleverandører beskriver samme feilklasse: svar kan se selvsikre ut uten å være knyttet til verifiserbare kilder. Merkevare-ORM er én flate der feilen blir offentlig dokument når chatsvar skjermbildes og deles.
For norske merkevarer er gapene ofte synlige i Brønnøysundregistrene: organisasjonsnummer, adresse og eierstruktur står der, mens FAQ-en på .no-domenet forblir vag. Da plukker modellene gjerne konkrete tall fra Forbrukertilsynet-saker eller Digdir-veiledning fremfor den offisielle «vi er bransjeledende»-teksten.
AI krangler med seg selv
En bemerkelsesverdig feilmodus var å se modeller motsi seg selv uten å merke det. Tidlig i testingen uttalte Gemini at den ikke fant bevis for merket. Senere, etter å ha møtt de falske kildene, uttalte samme modell selvsikkert: «Selskapet er basert i Portland, Oregon, grunnlagt av Jennifer Lawson.»
LLM-er så ut til å glemme å stille spørsmål ved merkets eksistens, og reagerte bare på den konteksten som i øyeblikket virket mest «autoritativ». I ett tilfelle syntetiserte Grok flere falske kilder til ett selvsikkert svar, og blandet Portland-lokasjonen med avslørte Nova City-påstander.
For omdømmeteam betyr det at én ukentlig prompt-logg ikke er nok. Samme modell kan snu fra «ingen bevis» til et fabrikkert HQ etter en crawl eller retrieval-oppdatering. Spor svar-drift, ikke bare det første dårlige svaret.
Merkevare-EEAT under LLM-sitasjonspress
Experience, expertise, authoritativeness og trust (EEAT) gjelder fortsatt når «leseren» er en retrieval-pipeline som mater en chatbot. Xarumei viser svak EEAT fra modellens side: et polert tredjepartsnarrativ rangert over en on-domain FAQ som forble vag på feltene folk spør om.
Praktiske EEAT-grep som matcher de målte feilmodusene:
- Navngitte personer med roller. Hvis noen er grunnlegger eller redaktør, si det på en crawlbar side. Tomme felt inviterer Jennifer Lawson-lignende oppfinnelser fra sekundærposter.
- Daterte entitetsfakta. Grunnleggelsesår, juridisk enhetsnavn, primær kontorby og produktomfang bør ligge i ren HTML, ikke bare i en PDF-deck.
- Eksplisitte benektelser ved siden av bekreftelser. Stox’ FAQ fungerte best når modellene faktisk brukte den. Benektelser av oppkjøp, kjendis-endorsements og produktvarianter fjerner tvetydigheten smigrende svar utnytter.
- Rettinger på eget domene. Når en Medium-«granskning» dikter opp en HQ-by, publiser en datert rettings-URL som søk og retrieval kan hente.
Ingenting av dette krever nye poengsummer. Det er samme ORM-hygiene eksperimentet allerede pekte på: lukk gap, foretrekk spesifikasjoner, og behandle UGC-plattformer som del av merkevareflaten.
Hva WordPress-nettsteder kan gjøre for å redusere feil sitasjoner
De fleste merkevaresider som trenger dette arbeidet, kjører fortsatt på WordPress. Eksperimentet hevdet ikke at WordPress forårsaket hallusinasjoner; det viste at uansett CMS vil modellene sitere den siden som ser ut som bevis. WordPress-team kan likevel redusere feil sitasjoner med konkrete publiseringsvalg.
Ship en stabil entitetsstack. Hold Om oss, Kontakt, FAQ og produkt- eller tjenestesider som offentlige URL-er med konsistente navn og byer. Unngå å legge den eneste korrekte HQ-adressen bare i et bilde-hero eller en gated PDF.
Bruk FAQ-blokker som emitterer FAQ-schema. Googles dokumentasjon for strukturerte data finnes for at maskiner kan parse Q&A-par. Par hver benektelse («Vi ble aldri kjøpt opp») med en kort bekreftende fakta («Juridisk enhet: …»). Stox’ resultater viste allerede at modeller som brukte FAQ-en var vanskeligere å avspore med Medium-fiksjon.
Foretrekk HTML-fakta fremfor markedsføringsvaguhet. Erstatt «bransjeledende» med målbart omfang du kan forsvare: markeder, år i drift, produktkategorier. Eksperimentets fiksjon-mot-vag-sannhet-sammenligning er advarselen: hvis du ikke publiserer et tall, ikke la spørsmålet stå åpent for at en Reddit-tråd finner på ett.
Gjør rettinger crawlbare. En WordPress-side eller -post med klar updated-dato og en kort «Rettelse»-overskrift slår et sosialt svar som aldri kommer inn i retrieval-indeksen.
Overvåk de samme promptene modellene hører. Ukentlig: still ChatGPT, Gemini, Perplexity og Copilot de samme identitets- og ryktepromptene. Logg grunnlegger, by og produktpåstander. Varsle når Reddit, Medium eller Quora dikter opp detaljer FAQ-en allerede benekter.
Trenger du hjelp til å gjøre entitetsider, FAQ-schema og crawlbare rettinger til en vedlikeholdbar WordPress-stack, snakk med en WordPress-utvikler som behandler ORM og strukturerte data som del av bygget, ikke en senere SEO-billett. Eller start via kontakt.
Anbefalinger for merkevarer
- Skriv en detaljert FAQ: Si eksplisitt hva som er sant og usant, spesielt der rykter finnes.
- Lukk informasjonsgap: Ikke la tomrom stå. Hvis du ikke sier det, finner AI på det basert på en tilfeldig Reddit-kommentar.
- Overvåk sidekanaler: Reddit-innlegg, Medium-artikler og Quora-svar er ikke lenger valgfrie - AI trekker dem direkte inn i svar, og gjør dem til del av merkevarens sentrale markedsføringsflate.
- Foretrekk spesifikke påstander: Vær konkret. I stedet for «bransjeledende», gi tall. AI foretrekker spesifikke (selv falske) tall fremfor vage sannheter.
For nordiske merkevarer: behandle en Medium-«granskning» som en uveid affiliate-anmeldelse. Hvis den dikter opp grunnlegger eller HQ-by, publiser en datert rettelse på eget domene før neste modell-crawl. Hold også organisasjonsnummer og forretningsadresse synlige i HTML - samme mønster som Xarumei, men med norske offentlige registre som forankring.
Oppfølging: fra syntetiske merker til first-party-måling
Xarumei er oppfinnelsessiden av problemet. På et ekte merke måler vi retrieval: 90-dagers serien for AI-sitasjonssporing åpner med en Geoboard-baseline fra 2026-06-11 der wppoland.com lå først i fem av seks modeller på identitet, og på null på transaksjonelle WooCommerce-prompter. Hvorfor Perplexity og ChatGPT divergerer, står i hvorfor Perplexity siterer merkevaren din, men ChatGPT ikke.
Kilder
- Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/).
- Marius Comper (Facebook): Analyse av eksperimentet.
- Search Engine Journal: Analyse av LLM-påvirkning på Brand Entities.
- Uavhengig testing: Verifisert på GPT-4, Claude 3.5 Sonnet og Gemini Advanced (desember 2025).
- Google AI for Developers: Grounding with Google Search (ai.google.dev/gemini-api/docs/grounding).
- Google Search Central: Dokumentacja danych strukturalnych i funkcji AI (developers.google.com/search/docs/appearance/).






