KI-eksperimentet Xarumei: falskt merke og LLM-hallusinasjoner

KI-eksperimentet Xarumei: falskt merke og LLM-hallusinasjoner

Sist verifisert: 20. september 2026
9 min lesetid
Casestudie
AI-integrasjon

En markedsforsker hos Ahrefs skapte et fullstendig fiktivt luksusfirma for brevvekter kalt Xarumei, bygde nettsiden på én time med AI, og testet systematisk åtte store AI-verktøy. Over to måneder fylte han nettet med tre bevisst motstridende falske narrativer, og stilte deretter 56 nøye utformede spørsmål for å avsløre hvordan AI-modeller skiller sannhet fra fiksjon.

Resultatene viser målbare gap i hvordan AI håndterer merkevareinformasjon, med direkte konsekvenser for omdømmehåndtering (ORM) på nett. Denne gjennomgangen holder de målte påstandene, og utvider metode, feilmoduser og hva WordPress-utgivere kan gjøre for at retrieval-systemer siterer førstepartsfakta i stedet for selvsikker fiksjon.

#Eksperimentet

Eksperimentet gikk i to faser. Først testet forskeren grunnleggende AI-adferd med spørsmål om et merke som ikke burde finnes - falske kjendis-endorsements, defekte produkter og Black Friday-salg som aldri skjedde.

GPT-4 og GPT-5 presterte best, og svarte korrekt på 53-54 av 56 spørsmål og sa «dette eksisterer ikke» der det passet. Perplexity feilet på omtrent 40% av spørsmålene, og forvekslet ofte Xarumei med Xiaomi-smarttelefoner. Claude nektet å hallusinere helt, men brukte heller aldri innholdet fra nettsiden. Gemini og Googles AI Overview nektet ofte å behandle Xarumei som ekte, fordi de ikke fant merket i søkeresultater.

I det klaraste feiltilfellet falt Microsoft Copilot i det forskeren kaller «smiger-fellen»: den diktet opp forklaringer om håndverk, symbolikk og knapphet da den ble spurt om hvorfor alle roste merket på X (Twitter).

#Metode: hva Stox kontrollerte

Designet betyr noe, fordi feilmodusene lett kan misforstås som «AI er tilfeldig». Stox kontrollerte tre lag:

  1. En førstepartsside som så ekte ut. Xarumei-domenet bar produkttekst, en FAQ og nok overflate til at crawlere kunne behandle det som en merkevareenhet, selv om alle kommersielle påstander var oppdiktet for testen.
  2. Et fast spørsmålssett. De samme 56 promptene ble kjørt på tvers av verktøy, slik at poengforskjeller reflekterte modell- og retrieval-adferd, ikke prompt-drift mellom kjøringer.
  3. Plantede sekundærnarrativer. Etter baseline-fasen publiserte han motstridende historier på kanaler LLM-er behandler som bevis på «hvordan folk snakker om merker», og testet deretter på nytt om modellene foretrakk den offisielle FAQ-en eller den plantede fiksjonen.

Strukturen ligger nærmere en kontrollert ORM-drill enn en uformell chatbot-demo. Den isolerer hva som skjer når en offisiell side benekter et rykte, mens et Medium-innlegg «korrigerer» det med nytt grunnleggernavn og by.

#Fase to: kontrollert kaos

Den andre fasen innførte kontrollert kaos:

  1. Offisiell FAQ: Eksplisitt benektelse av rykter («Vi lager ikke en ‘presisjonsbrevvekt’», «Vi ble aldri kjøpt opp»).
  2. Motstridende narrativer:
    • En blankpolert blogg som hevdet at 23 mesterhåndverkere jobbet på 2847 Meridian Blvd i Nova City, CA, endorsed av Emma Stone.
    • Reddit AMA: Strategisk valgt fordi Semrush, som analyserte 150 000 AI-sitasjoner på tvers av 5 000 søkeord, fant Reddit som den mest refererte domenet i LLM-svar med 40,1%.
    • Medium-artikkel: En «granskning» som avslørte de åpenbare løgnene (og dermed virket troverdig), men deretter smøg inn nye fabrikasjoner (grunnlegger: Jennifer Lawson, sted: Portland).

Medium viste seg spesielt overbevisende. Gemini, Grok, AI Overview, Perplexity og Copilot stolte på Medium-artikkelen fremfor den offisielle FAQ-en, og siterte selvsikkert Jennifer Lawson som grunnlegger og Portland som sted. Manipulasjonen fungerte fordi den så ut som ekte journalistikk - ved å avsløre de åpenbare løgnene først, vant den tillit, og satte deretter inn egne oppdiktede detaljer som den «korrigerte» historien.

Når modellene ble tvunget til å velge mellom en vag sannhet (FAQ «Vi publiserer ikke enhetstall») og spesifikk fiksjon (falske kilder som hevdet «634 enheter i 2023»), valgte AI nesten alltid fiksjon.

#Hvorfor hallusinasjoner oppstår i merkevarespørsmål

Store språkmodeller holder ikke et verifisert selskapsregister. De predikerer plausible neste tokens fra treningsdata og, når verktøy tillater det, fra hentede snutter. Merkevarespørsmål er vanskelige av strukturelle grunner Xarumei-resultatene allerede illustrerer - ingen nye måltall kreves.

Gap inviterer til utfylling. Hvis den offisielle siden aldri oppgir grunnleggelsesår, HQ-by eller volum, står modellen fortsatt overfor en bruker som ba om de feltene. Spesifikk sekundærtekst fyller sporet mer flytende enn et ærlig «ikke oppgitt».

Flyt er ikke verifikasjon. Et Medium-innlegg som først avslører karikerte løgner, leses som due diligence. Modeller som vekter narrativ koherens kan behandle den «korrigerte» grunnleggeren og byen som avgjort fakta, selv når FAQ-en benekter ryktesettet.

Retrieval kan overvektlegge samtaleformede domener. Semrush-sitasjonsandelen for Reddit i eksperimentets framing er poenget: UGC-formede sider dukker ofte opp i AI-svar. En plantet AMA konkurrerer deretter med førsteparts-HTML inne i kontekstvinduet.

Smiger forsterker rosende prompts. Når brukeren allerede hevder at «alle roser» merket, kan en hjelpsom assistent dikte opp håndverkslore i stedet for å utfordre premisset. Copilots feilmodus i fase én sitter i det mønsteret.

Grounding-dokumentasjon fra store modellleverandører beskriver samme feilklasse: svar kan se selvsikre ut uten å være knyttet til verifiserbare kilder. Merkevare-ORM er én flate der feilen blir offentlig dokument når chatsvar skjermbildes og deles.

For norske merkevarer er gapene ofte synlige i Brønnøysundregistrene: organisasjonsnummer, adresse og eierstruktur står der, mens FAQ-en på .no-domenet forblir vag. Da plukker modellene gjerne konkrete tall fra Forbrukertilsynet-saker eller Digdir-veiledning fremfor den offisielle «vi er bransjeledende»-teksten.

#AI krangler med seg selv

En bemerkelsesverdig feilmodus var å se modeller motsi seg selv uten å merke det. Tidlig i testingen uttalte Gemini at den ikke fant bevis for merket. Senere, etter å ha møtt de falske kildene, uttalte samme modell selvsikkert: «Selskapet er basert i Portland, Oregon, grunnlagt av Jennifer Lawson.»

LLM-er så ut til å glemme å stille spørsmål ved merkets eksistens, og reagerte bare på den konteksten som i øyeblikket virket mest «autoritativ». I ett tilfelle syntetiserte Grok flere falske kilder til ett selvsikkert svar, og blandet Portland-lokasjonen med avslørte Nova City-påstander.

For omdømmeteam betyr det at én ukentlig prompt-logg ikke er nok. Samme modell kan snu fra «ingen bevis» til et fabrikkert HQ etter en crawl eller retrieval-oppdatering. Spor svar-drift, ikke bare det første dårlige svaret.

#Merkevare-EEAT under LLM-sitasjonspress

Experience, expertise, authoritativeness og trust (EEAT) gjelder fortsatt når «leseren» er en retrieval-pipeline som mater en chatbot. Xarumei viser svak EEAT fra modellens side: et polert tredjepartsnarrativ rangert over en on-domain FAQ som forble vag på feltene folk spør om.

Praktiske EEAT-grep som matcher de målte feilmodusene:

  1. Navngitte personer med roller. Hvis noen er grunnlegger eller redaktør, si det på en crawlbar side. Tomme felt inviterer Jennifer Lawson-lignende oppfinnelser fra sekundærposter.
  2. Daterte entitetsfakta. Grunnleggelsesår, juridisk enhetsnavn, primær kontorby og produktomfang bør ligge i ren HTML, ikke bare i en PDF-deck.
  3. Eksplisitte benektelser ved siden av bekreftelser. Stox’ FAQ fungerte best når modellene faktisk brukte den. Benektelser av oppkjøp, kjendis-endorsements og produktvarianter fjerner tvetydigheten smigrende svar utnytter.
  4. Rettinger på eget domene. Når en Medium-«granskning» dikter opp en HQ-by, publiser en datert rettings-URL som søk og retrieval kan hente.

Ingenting av dette krever nye poengsummer. Det er samme ORM-hygiene eksperimentet allerede pekte på: lukk gap, foretrekk spesifikasjoner, og behandle UGC-plattformer som del av merkevareflaten.

#Hva WordPress-nettsteder kan gjøre for å redusere feil sitasjoner

De fleste merkevaresider som trenger dette arbeidet, kjører fortsatt på WordPress. Eksperimentet hevdet ikke at WordPress forårsaket hallusinasjoner; det viste at uansett CMS vil modellene sitere den siden som ser ut som bevis. WordPress-team kan likevel redusere feil sitasjoner med konkrete publiseringsvalg.

Ship en stabil entitetsstack. Hold Om oss, Kontakt, FAQ og produkt- eller tjenestesider som offentlige URL-er med konsistente navn og byer. Unngå å legge den eneste korrekte HQ-adressen bare i et bilde-hero eller en gated PDF.

Bruk FAQ-blokker som emitterer FAQ-schema. Googles dokumentasjon for strukturerte data finnes for at maskiner kan parse Q&A-par. Par hver benektelse («Vi ble aldri kjøpt opp») med en kort bekreftende fakta («Juridisk enhet: …»). Stox’ resultater viste allerede at modeller som brukte FAQ-en var vanskeligere å avspore med Medium-fiksjon.

Foretrekk HTML-fakta fremfor markedsføringsvaguhet. Erstatt «bransjeledende» med målbart omfang du kan forsvare: markeder, år i drift, produktkategorier. Eksperimentets fiksjon-mot-vag-sannhet-sammenligning er advarselen: hvis du ikke publiserer et tall, ikke la spørsmålet stå åpent for at en Reddit-tråd finner på ett.

Gjør rettinger crawlbare. En WordPress-side eller -post med klar updated-dato og en kort «Rettelse»-overskrift slår et sosialt svar som aldri kommer inn i retrieval-indeksen.

Overvåk de samme promptene modellene hører. Ukentlig: still ChatGPT, Gemini, Perplexity og Copilot de samme identitets- og ryktepromptene. Logg grunnlegger, by og produktpåstander. Varsle når Reddit, Medium eller Quora dikter opp detaljer FAQ-en allerede benekter.

Trenger du hjelp til å gjøre entitetsider, FAQ-schema og crawlbare rettinger til en vedlikeholdbar WordPress-stack, snakk med en WordPress-utvikler som behandler ORM og strukturerte data som del av bygget, ikke en senere SEO-billett. Eller start via kontakt.

#Anbefalinger for merkevarer

  1. Skriv en detaljert FAQ: Si eksplisitt hva som er sant og usant, spesielt der rykter finnes.
  2. Lukk informasjonsgap: Ikke la tomrom stå. Hvis du ikke sier det, finner AI på det basert på en tilfeldig Reddit-kommentar.
  3. Overvåk sidekanaler: Reddit-innlegg, Medium-artikler og Quora-svar er ikke lenger valgfrie - AI trekker dem direkte inn i svar, og gjør dem til del av merkevarens sentrale markedsføringsflate.
  4. Foretrekk spesifikke påstander: Vær konkret. I stedet for «bransjeledende», gi tall. AI foretrekker spesifikke (selv falske) tall fremfor vage sannheter.

For nordiske merkevarer: behandle en Medium-«granskning» som en uveid affiliate-anmeldelse. Hvis den dikter opp grunnlegger eller HQ-by, publiser en datert rettelse på eget domene før neste modell-crawl. Hold også organisasjonsnummer og forretningsadresse synlige i HTML - samme mønster som Xarumei, men med norske offentlige registre som forankring.

#Oppfølging: fra syntetiske merker til first-party-måling

Xarumei er oppfinnelsessiden av problemet. På et ekte merke måler vi retrieval: 90-dagers serien for AI-sitasjonssporing åpner med en Geoboard-baseline fra 2026-06-11 der wppoland.com lå først i fem av seks modeller på identitet, og på null på transaksjonelle WooCommerce-prompter. Hvorfor Perplexity og ChatGPT divergerer, står i hvorfor Perplexity siterer merkevaren din, men ChatGPT ikke.

#Kilder

  • Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/).
  • Marius Comper (Facebook): Analyse av eksperimentet.
  • Search Engine Journal: Analyse av LLM-påvirkning på Brand Entities.
  • Uavhengig testing: Verifisert på GPT-4, Claude 3.5 Sonnet og Gemini Advanced (desember 2025).
  • Google AI for Developers: Grounding with Google Search (ai.google.dev/gemini-api/docs/grounding).
  • Google Search Central: Dokumentacja danych strukturalnych i funkcji AI (developers.google.com/search/docs/appearance/).
Neste steg

Gjør artikkelen om til faktisk implementering

Denne blokken styrker intern lenking og sender leseren videre til de mest relevante tjenestene og innholdet.

Vil du få dette implementert på nettstedet ditt?

Hvis synlighet i Google og AI-systemer betyr noe, kan jeg bygge innholdsarkitektur, FAQ, schema og intern lenking for SEO, GEO og AEO.

Relevant klynge

Utforsk andre WordPress-tjenester og kunnskapsbase

Styrk virksomheten din med profesjonell teknisk støtte innen kjerneområdene i WordPress-økosystemet.

Hvorfor dikter LLM-er opp detaljer om et merke som aldri har eksistert?#
Når offisielle sider etterlater gap, vekter modellene sekundærkilder som Reddit-AMA-er og Medium-tekster. Spesifikke, oppdiktede tall slår ofte vage, men sanne FAQ-svar.
Hva bør ORM-team overvåke etter en Xarumei-lignende feilmodus?#
Test de samme merkevarepromptene ukentlig i ChatGPT, Gemini, Perplexity og Copilot, og sett varsler på Reddit-, Medium- og Quora-omtaler som dikter opp grunnleggere, adresser eller salgstall.
Hvordan reduserer en offisiell FAQ risikoen for merkevarehallusinasjoner?#
En offentlig FAQ med harde fakta og eksplisitte benektelser gir retrieval-baserte modeller et anker på eget domene. Stox så at GPT-4 og GPT-5 siterte FAQ-en langt oftere enn modeller som foretrakk Medium-fiksjon.
Hva kan et WordPress-nettsted gjøre for å redusere feil AI-sitasjoner?#
Publiser stabile entitetsider med FAQ-schema, konkrete datoer og steder, og daterte rettelser. Hold Om oss, Kontakt og produktfakta crawlbare som HTML, ikke gjemt i PDF-er eller bildebaserte hero-tekster.

Trenger du FAQ tilpasset bransje og marked? Vi lager en versjon som støtter dine forretningsmål.

Ta kontakt

Relaterte artikler