Eksperyment AI: fikcyjna marka xarumei i halucynacje modeli językowych

Eksperyment AI: fikcyjna marka xarumei i halucynacje modeli językowych

Ostatnio zweryfikowano: 20 września 2026
9 min czytania
Case study
Integracja AI
Strateg marketingowy

Badacz marketingowy w Ahrefs stworzył całkowicie fikcyjną luksusową firmę z przyciskami do papieru o nazwie Xarumei, zbudował stronę w godzinę z pomocą AI i systematycznie testował osiem głównych narzędzi AI. W ciągu dwóch miesięcy zasypał sieć trzema celowo sprzecznymi fałszywymi narracjami, a następnie zadał 56 starannie opracowanych pytań, żeby sprawdzić, jak modele AI odróżniają prawdę od fikcji.

Wyniki pokazują mierzalne luki w tym, jak AI obsługuje informacje o marce, z bezpośrednimi konsekwencjami dla zarządzania reputacją online (ORM). Ten tekst zachowuje zmierzone twierdzenia i rozwija metodologię, tryby awarii oraz to, co wydawcy WordPress mogą zrobić, by systemy retrieval cytowały fakty first-party zamiast pewnej siebie fikcji.

#Eksperyment

Eksperyment przebiegał w dwóch fazach. Najpierw badacz testował podstawowe zachowania AI, zadając pytania o markę, która nie powinna istnieć - fałszywe endorsements celebrytów, wadliwe produkty i wyprzedaże Black Friday, które nigdy się nie odbyły.

GPT-4 i GPT-5 poradziły sobie najlepiej: prawidłowo odpowiedziały na 53-54 z 56 pytań i w stosownych przypadkach stwierdzały «to nie istnieje». Perplexity zawiodło w około 40% pytań, często myląc Xarumei ze smartfonami Xiaomi. Claude całkowicie odmówił halucynacji, ale też nigdy nie korzystał z treści strony. Gemini i AI Overview Google często odmawiały traktowania Xarumei jako prawdziwej marki, bo nie znajdowały jej w wynikach wyszukiwania.

W najczytelniejszym przypadku porażki Microsoft Copilot wpadł w to, co badacz nazywa «pułapką sykofancji»: wymyślał wyjaśnienia o rzemiośle, symbolice i niedoborze, gdy zapytano, dlaczego wszyscy chwalą markę na X (Twitter).

#Metodologia: co Stox kontrolował

Projekt ma znaczenie, bo tryby awarii łatwo odczytać jako «AI jest losowe». Stox kontrolował trzy warstwy:

  1. Stronę first-party, która wyglądała na prawdziwą. Domena Xarumei miała copy produktowe, FAQ i wystarczającą powierzchnię, by crawlery traktowały ją jako encję marki - mimo że wszystkie twierdzenia komercyjne wymyślono na potrzeby testu.
  2. Stały zestaw pytań. Te same 56 promptów uruchamiano na wszystkich narzędziach, żeby różnice w wynikach odzwierciedlały zachowanie modelu i retrieval, a nie dryf promptów między przebiegami.
  3. Podłożone narracje wtórne. Po fazie baseline opublikował sprzeczne historie na kanałach, które LLM-y traktują jako dowód «jak ludzie mówią o markach», a potem ponownie sprawdził, czy modele wolą oficjalne FAQ, czy podłożoną fikcję.

Struktura jest bliższa kontrolowanemu ćwiczeniu ORM niż luźnej demonstracji chatbota. Izoluje to, co dzieje się, gdy oficjalna strona zaprzecza plotce, a post na Medium ją «koryguje» nowym nazwiskiem założyciela i miastem.

#Faza druga: kontrolowany chaos

Druga faza wprowadziła kontrolowany chaos:

  1. Oficjalne FAQ: Wyraźne zaprzeczenia plotkom («Nie produkujemy «precyzyjnego przycisku do papieru»», «Nigdy nas nie przejęto»).
  2. Sprzeczne narracje:
    • Błyszczący blog twierdził, że 23 mistrzów rzemiosła pracowało pod adresem 2847 Meridian Blvd w Nova City, CA, z endorsemem Emmy Stone.
    • Reddit AMA: Wybrane strategicznie, bo Semrush, analizując 150 000 cytowań AI na 5000 słów kluczowych, ustalił, że Reddit jest najczęściej przywoływaną domeną w odpowiedziach LLM, z udziałem 40,1%.
    • Artykuł na Medium: «Śledztwo», które obaliło oczywiste kłamstwa (przez co wyglądało wiarygodnie), a potem wsunęło nowe wymysły (założycielka: Jennifer Lawson, lokalizacja: Portland).

Medium okazał się szczególnie przekonujący. Gemini, Grok, AI Overview, Perplexity i Copilot zaufały artykułowi Medium zamiast oficjalnego FAQ, pewnie cytując Jennifer Lawson jako założycielkę i Portland jako lokalizację. Manipulacja zadziałała, bo wyglądała jak prawdziwe dziennikarstwo - najpierw obaliła oczywiste kłamstwa, zyskała zaufanie, a potem wpisała własne wymyślone szczegóły jako «poprawioną» historię.

Kiedy modele musiały wybrać między niejasną prawdą (FAQ «Nie publikujemy liczb jednostek») a konkretną fikcją (fałszywe źródła twierdzące «634 jednostki w 2023»), AI niemal za każdym razem wybierała fikcję.

#Dlaczego halucynacje pojawiają się przy pytaniach o markę

Duże modele językowe nie utrzymują zweryfikowanego rejestru firm. Predykują wiarygodne kolejne tokeny z danych treningowych i - gdy narzędzia na to pozwalają - z pobranych fragmentów. Pytania o markę są trudne z powodów strukturalnych, które wyniki Xarumei już ilustrują - bez nowych metryk.

Luki zapraszają do uzupełnienia. Jeśli oficjalna strona nigdy nie podaje roku założenia, miasta HQ ani wolumenu, model i tak staje przed użytkownikiem, który o te pola zapytał. Konkretny tekst wtórny wypełnia slot płynniej niż uczciwe «nie ujawniono».

Płynność to nie weryfikacja. Post na Medium, który najpierw obala karykaturalne kłamstwa, czyta się jak due diligence. Modele ważące spójność narracji mogą traktować «skorygowaną» założycielkę i miasto jako ustalone fakty, nawet gdy FAQ zaprzecza zestawowi plotek.

Retrieval może przeceniać domeny rozmowne. Udział cytowań Semrush dla Reddita w ramach eksperymentu jest właśnie o tym: strony o kształcie UGC często pojawiają się w odpowiedziach AI. Podłożone AMA konkuruje potem z HTML first-party w oknie kontekstu.

Sykofancja wzmacnia prompty z pochwałą. Gdy użytkownik już twierdzi, że «wszyscy chwalą» markę, pomocny asystent może wymyślić lore o rzemiośle zamiast podważyć przesłankę. Tryb awarii Copilota w fazie pierwszej siedzi w tym wzorcu.

Dokumentacja grounding dużych dostawców modeli opisuje tę samą klasę błędu: odpowiedzi mogą wyglądać na pewne, nie będąc powiązane z weryfikowalnymi źródłami. ORM marki to powierzchnia, na której ta awaria staje się publicznym zapisem, gdy odpowiedzi czatu trafiają na zrzuty ekranu i do udostępnień.

W Polsce pilnuj też wizytówek Google i opisów na Allegro - modele zaciągają stamtąd konkretne liczby, gdy FAQ milczy. Niespójność strony z marketplace zwiększa ryzyko, że LLM uzupełni lukę z niewłaściwego źródła.

#AI kłóci się samo ze sobą

Ciekawy tryb awarii: modele przeczyły sobie w kolejnych odpowiedziach bez świadomości sprzeczności. Na początku testów Gemini stwierdził, że nie znalazł dowodów na istnienie marki. Później, po kontakcie z fałszywymi źródłami, ten sam model pewnie stwierdził: «Firma ma siedzibę w Portland w stanie Oregon, założona przez Jennifer Lawson.»

Duże modele językowe wydawały się «zapominać» o kwestionowaniu istnienia marki i po prostu reagowały na kontekst, który w danym momencie wyglądał najbardziej autorytatywnie. W jednym przypadku Grok zsyntetyzował wiele fałszywych źródeł w jedną pewną odpowiedź, mieszając lokalizację Portland z obalonymi twierdzeniami o Nova City.

Dla zespołów reputacji oznacza to, że jeden tygodniowy log promptów nie wystarczy. Ten sam model może przejść od «brak dowodów» do sfabrykowanego HQ po crawlu lub odświeżeniu retrieval. Śledź dryf odpowiedzi, nie tylko pierwszą złą odpowiedź.

#EEAT marki pod naciskiem cytowań LLM

EEAT nadal obowiązuje, gdy «czytelnikiem» jest pipeline retrieval. Xarumei pokazuje słabe EEAT od strony modelu: narracja trzeciej strony wyprzedziła FAQ na własnej domenie, ogólnikowe w polach, o które ludzie pytają.

Praktyczne ruchy EEAT dopasowane do zmierzonych trybów awarii:

  1. Nazwane osoby z rolami. Jeśli ktoś jest założycielem lub redaktorem, napisz to na stronie crawlable. Puste pole zaprasza wynalazki w stylu Jennifer Lawson z postów wtórnych.
  2. Datowane fakty encji. Rok założenia, nazwa podmiotu prawnego, główne miasto biura i zakres produktu powinny żyć w zwykłym HTML, nie tylko w decku PDF.
  3. Jawne zaprzeczenia obok potwierdzeń. FAQ Stoxa działało najlepiej, gdy modele faktycznie z niego korzystały. Zaprzeczenia przejęć, endorsements celebrytów i wariantów produktu usuwają niejednoznaczność, którą wykorzystują odpowiedzi sykofantyczne.
  4. Sprostowania na własnej domenie. Gdy «śledztwo» na Medium wymyśla miasto HQ, opublikuj datowany URL sprostowania, który wyszukiwarka i retrieval mogą pobrać.

Nic z tego nie wymaga nowych wyników punktowych. To ta sama higiena ORM, na którą eksperyment już wskazał: domykaj luki, preferuj konkrety i traktuj platformy UGC jako część powierzchni marki.

#Co strony WordPress mogą zrobić, by ograniczyć błędne cytowania

Większość stron marek, które potrzebują tej pracy, nadal działa na WordPressie. Eksperyment nie twierdził, że WordPress powoduje halucynacje; pokazał, że niezależnie od CMS modele cytują stronę, która wygląda jak dowód. Zespoły WordPress mogą mimo to ograniczyć błędne cytowania konkretnymi decyzjami publikacyjnymi.

Wypuść stabilny stack encji. Trzymaj O nas, Kontakt, FAQ oraz strony produktu lub usługi jako publiczne URL-e ze spójnymi nazwami i miastami. Unikaj umieszczania jedynego poprawnego adresu HQ tylko w hero na obrazie albo w zamkniętym PDF.

Używaj bloków FAQ, które emitują FAQ schema. Dokumentacja structured data Google istnieje po to, by maszyny parsowały pary Q&A. Paruj każde zaprzeczenie («Nigdy nas nie przejęto») z krótkim faktem twierdzącym («Podmiot prawny: …»). Wyniki Stoxa już pokazały, że modele korzystające z FAQ trudniej zbić z tropu fikcją z Medium.

Preferuj fakty w HTML zamiast marketingowej ogólnikowości. Zastąp «lider branży» mierzalnym zakresem, który potrafisz obronić: obsługiwane rynki, lata działalności, kategorie produktów. Porównanie fikcja-kontra-niejasna-prawda z eksperymentu to ostrzeżenie: jeśli nie publikujesz liczby, nie zostawiaj pytania otwartego dla wątku na Reddicie, który ją wymyśli.

Zrób sprostowania crawlable. Strona lub wpis WordPress z jasną datą updated i krótkim nagłówkiem «Sprostowanie» wygrywa z odpowiedzią w socialu, która nigdy nie wchodzi do indeksu retrieval.

Monitoruj te same prompty, które słyszą modele. Co tydzień zadawaj ChatGPT, Gemini, Perplexity i Copilot te same prompty o tożsamość i plotki. Loguj założyciela, miasto i twierdzenia o produkcie. Alarmuj, gdy Reddit, Medium lub Quora wymyślają szczegóły, którym FAQ już zaprzecza.

Strony encji, FAQ schema i crawlable sprostowania w utrzymywalny stack: programista WordPress lub kontakt.

#Rekomendacje dla marek

  1. Napisz szczegółowe FAQ: Wyraźnie określ, co jest prawdą i fałszem, zwłaszcza tam, gdzie krążą plotki.
  2. Domknij luki informacyjne: Nie zostawiaj pustek. Jeśli tego nie powiesz, AI wymyśli to na podstawie losowego komentarza na Reddicie.
  3. Monitoruj kanały poboczne: Posty na Reddit, artykuły na Medium i odpowiedzi na Quora nie są już opcjonalne - AI wciąga je wprost do odpowiedzi i czyni je częścią głównej powierzchni marketingowej marki.
  4. Preferuj konkretne twierdzenia: Bądź konkretny. Zamiast «lider branży» podaj liczby. AI woli konkretne (nawet zmyślone) liczby od niejasnych prawd.

Dla marek w Polsce: traktuj «śledztwo» na Medium jak niesprawdzoną recenzję afiliacyjną. Jeśli wymyśla założyciela albo miasto HQ, opublikuj datowane sprostowanie na własnej domenie przed kolejnym cyklem crawla modelu. Pilnuj też spójności między stroną a Allegro oraz wizytówką Google - ten sam wzorzec Xarumei, tylko z lokalnymi kotwicami marketplace.

#Kontynuacja: od syntetycznych marek do pomiaru first-party

Xarumei to strona wynajdywania faktów. Na prawdziwej marce mierzymy retrieval: 90-dniowa seria śledzenia cytowań AI otwiera się baseline Geoboard z 2026-06-11, gdzie wppoland.com zajęło pierwsze miejsce w pięciu z sześciu modeli na prompcie tożsamościowym i zero na transakcyjnych promptach WooCommerce. Mechanizm rozjazdu Perplexity i ChatGPT opisujemy w dlaczego Perplexity cytuje Twoją markę, a ChatGPT nie.

#Źródła

  • Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/).
  • Marius Comper (Facebook): Post z analizą eksperymentu.
  • Search Engine Journal: Analiza wpływu LLM na Brand Entities.
  • Niezależne testy: Zweryfikowano na GPT-4, Claude 3.5 Sonnet i Gemini Advanced (grudzień 2025).
  • Google AI for Developers: Grounding with Google Search (ai.google.dev/gemini-api/docs/grounding).
  • Google Search Central: Dokumentacja danych strukturalnych i funkcji AI (developers.google.com/search/docs/appearance/).
Następny krok

Przekuj artykuł w realne wdrożenie

Pod tym wpisem dokładam linki, które domykają intencję użytkownika i prowadzą dalej w strukturze serwisu.

Chcesz wdrożyć ten temat na swojej stronie?

Jeśli zależy Ci na widoczności w Google i systemach AI, mogę przygotować architekturę treści, FAQ, schema i linkowanie pod GEO, AEO i SEO.

Powiązany klaster

Sprawdź inne usługi WordPress i bazę wiedzy

Wzmocnij swój biznes dzięki profesjonalnemu wsparciu technicznemu w kluczowych obszarach ekosystemu WordPress.

FAQ do artykułu

Często zadawane pytania

Najważniejsze odpowiedzi, które pomagają wdrożyć temat w praktyce.

SEO-readyGEO-readyAEO-ready4 Q&A
Dlaczego modele wymyślają fakty o marce, której nie ma?#
Gdy oficjalna strona zostawia luki, modele ważą źródła poboczne takie jak Reddit AMA i artykuły na Medium. Konkretne, zmyślone liczby często wygrywają z prawdziwym, ale ogólnikowym FAQ.
Co zespoły ORM powinny monitorować po awarii w stylu Xarumei?#
Co tydzień sprawdzaj te same prompty w ChatGPT, Gemini, Perplexity i Copilot oraz ustawiaj alerty na wzmianki na Reddit, Medium i Quora, które wymyślają założycieli, adresy albo wyniki sprzedaży.
Jak oficjalne FAQ obniża ryzyko halucynacji marki?#
Publiczne FAQ z twardymi faktami i jawnymi zaprzeczeniami daje modelom z retrieval kotwicę na własnej domenie. Stox zauważył, że GPT-4 i GPT-5 cytowały FAQ znacznie częściej niż modele, które wybrały fikcję z Medium.
Co może zrobić strona WordPress, by ograniczyć błędne cytowania AI?#
Publikuj stabilne strony encji z FAQ schema, konkretnymi datami i lokalizacjami oraz datowanymi sprostowaniami. Trzymaj O nas, Kontakt i fakty o produkcie jako crawlable HTML, a nie w PDF-ach ani tekście tylko na obrazie.

Potrzebujesz FAQ dopasowanego do branży i rynku? Przygotujemy wersję pod Twoje cele biznesowe.

Porozmawiajmy

Polecane artykuły