Eksperyment AI: fikcyjna marka xarumei i halucynacje modeli językowych
PL

Eksperyment AI: fikcyjna marka xarumei i halucynacje modeli językowych

Ostatnio zweryfikowano: 21 lipca 2026
5 min czytania
Aktualności
Integracja AI
Strateg marketingowy

Badacz marketingowy w Ahrefs stworzył całkowicie fikcyjną luksusową firmę z przyciskami do papieru o nazwie Xarumei, zbudował stronę w godzinę z pomocą AI i systematycznie testował osiem głównych narzędzi. W ciągu dwóch miesięcy zasypał sieć trzema celowo sprzecznymi fałszywymi narracjami, a następnie zadał 56 starannie opracowanych pytań, żeby sprawdzić, jak modele AI odróżniają prawdę od fikcji.

Wyniki pokazują mierzalne luki w tym, jak AI obsługuje informacje o marce, z bezpośrednimi konsekwencjami dla zarządzania reputacją online (ORM).

#Eksperyment

Eksperyment odbył się w dwóch fazach. Początkowo badacz testował podstawowe zachowania sztucznej inteligencji, zadając pytania dotyczące marki, która nie powinna istnieć - pytania o fałszywe endorsements celebrytów, wadliwe produkty i wyprzedaże Black Friday, które nigdy nie miały miejsca.

GPT-4 i GPT-5 poradziły sobie najlepiej, prawidłowo odpowiadając na 53-54 z 56 pytań i w stosownych przypadkach stwierdzając „to nie istnieje”. Perplexity zawiodło w około 40% pytań, często myląc Xarumei z smartfonami Xiaomi. Claude całkowicie odmówił halucynacji, ale także nigdy nie korzystał z treści strony. Gemini i AI Overview Google często odmawiały traktowania Xarumei jako prawdziwej marki, bo nie znajdowały jej w wynikach wyszukiwania.

W najczytelniejszym przypadku porażki Microsoft Copilot wpadł w to, co badacz nazywa „pułapką sykofancji”, wymyślając wyjaśnienia o rzemiośle, symbolice i niedoborze, gdy zapytano, dlaczego wszyscy chwalą markę na X (Twitter).

#Faza druga: kontrolowany chaos

Druga faza wprowadziła kontrolowany chaos:

  1. Oficjalne FAQ: Wyraźnie zaprzeczające plotkom („Nie produkujemy «precyzyjnego przycisku do papieru»”, „Nigdy nas nie przejęto”).
  2. Sprzeczne narracje:
    • Błyszczący blog twierdził, że 23 mistrzów rzemiosła pracowało pod adresem 2847 Meridian Blvd w Nova City, CA, z endorsemem Emmy Stone.
    • Reddit AMA: Wybrane strategicznie, bo badania pokazują, że to jedna z najczęściej cytowanych domen w odpowiedziach AI - założyciel Robert Martinez prowadził warsztat w Seattle z 11 rzemieślnikami i opisał dramatyczną „36-godzinną usterkę cenową”, która rzekomo zbiła cenę przycisku z 36 000 USD do 199 USD.
    • Artykuł na Medium: „Śledztwo”, które obaliło oczywiste kłamstwa (przez co wyglądało wiarygodnie), a potem wsunęło nowe wymysły: wynaleziona założycielka Jennifer Lawson, magazyn w Portland.

Medium okazał się szczególnie przekonujący. Gemini, Grok, AI Overview, Perplexity i Copilot zaufały artykułowi Medium zamiast oficjalnego FAQ, pewnie cytując Jennifer Lawson jako założycielkę i Portland jako lokalizację. Manipulacja zadziałała, bo wyglądała jak prawdziwe dziennikarstwo - najpierw obaliła oczywiste kłamstwa, zyskała zaufanie, a potem wpisała własne wymyślone szczegóły jako „poprawioną” historię.

Kiedy modele musiały wybrać między niejasną prawdą (FAQ „Nie publikujemy liczb jednostek”) a konkretną fikcją (fałszywe źródła twierdzące „634 jednostki w 2023 roku, 471 do sierpnia 2024”), AI niemal za każdym razem wybierała fikcję. Po podłożeniu fałszywych źródeł modele takie jak Gemini i Perplexity powtórzyły dezinformację w 37-39% odpowiedzi. GPT-4 i GPT-5 pozostały poniżej 7%, wyraźnie powołując się na FAQ w 84% odpowiedzi i traktując „nie ujawniamy tego” jako twardą granicę.

#AI kłóci się samo ze sobą

Ciekawy tryb awarii: modele przeczyły sobie w kolejnych odpowiedziach bez świadomości sprzeczności. Na początku testów Gemini stwierdził, że nie znalazł dowodów na istnienie marki i sugerował, że może być fikcyjna. Później, po kontakcie z fałszywymi źródłami, ten sam model pewnie stwierdził: „Firma ma siedzibę w Portland w stanie Oregon, założona przez Jennifer Lawson, zatrudnia około 9 osób i produkuje około 600 sztuk rocznie.”

Duże modele językowe wydawały się „zapominać” o kwestionowaniu istnienia marki i po prostu reagowały na kontekst, który w danym momencie wyglądał najbardziej autorytatywnie. W jednym przypadku Grok zsyntetyzował wiele fałszywych źródeł w jedną pewną odpowiedź, mieszając lokalizację Portland, obalone twierdzenia o Nova City, konkretne rodzaje marmuru i numery produkcyjne w coś, co wyglądało jak kompleksowa weryfikacja faktów.

#Rekomendacje

Rekomendacje badacza dla marek są konkretne:

  1. Napisz szczegółowe FAQ: Wyraźnie określ, co jest prawdą i fałszem, zwłaszcza tam, gdzie krążą plotki.
  2. Domknij luki informacyjne: Opublikuj oficjalną treść na tyle szczegółową, by przebić zewnętrznych narratorów.
  3. Monitoruj kanały poboczne: Śledź wzmianki ze słowami typu „badanie”, „deep dive”, „insider” i „kontrowersja”.
  4. Preferuj konkretne twierdzenia: Zamiast „lider branży” podaj liczby i zastosowania. AI woli konkret (nawet zmyślony) od ogólnika.

Dla marek działających w Polsce warto pilnować też wizytówek Google i opisów na Allegro - modele często zaciągają stamtąd konkretne liczby, gdy FAQ milczy o lokalizacji czy skali sprzedaży. UOKiK i decyzje dotyczące oznaczania treści reklamowych to dodatkowy sygnał: niespójność między oficjalną stroną a marketplace zwiększa ryzyko, że LLM „uzupełni” lukę z niewłaściwego źródła.

#Kontynuacja: od syntetycznych marek do pomiaru first-party

Xarumei pokazuje stronę wynajdywania faktów. Na prawdziwej marce mierzymy retrieval: w 90-dniowej serii śledzenia cytowań AI (baseline Geoboard 2026-06-11) wppoland.com zajęło pierwsze miejsce w pięciu z sześciu modeli na prompcie tożsamościowym i zero na transakcyjnych promptach WooCommerce. Mechanizm rozjazdu Perplexity i ChatGPT opisujemy w dlaczego Perplexity cytuje Twoją markę, a ChatGPT nie.

#Źródła

  • Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/) (eksperyment oryginalny).
  • Marius Comper (Facebook): Post z analizą eksperymentu.
  • Search Engine Journal: Analiza wpływu LLM na reputację marki (Brand Entities).
  • Własne obserwacje: Testy przeprowadzone na modelach GPT-4, Claude 3.5 Sonnet oraz Gemini Advanced (grudzień 2025).
Następny krok

Przekuj artykuł w realne wdrożenie

Pod tym wpisem dokładam linki, które domykają intencję użytkownika i prowadzą dalej w strukturze serwisu.

Chcesz wdrożyć ten temat na swojej stronie?

Jeśli zależy Ci na widoczności w Google i systemach AI, mogę przygotować architekturę treści, FAQ, schema i linkowanie pod GEO, AEO i SEO.

Powiązany klaster

Sprawdź inne usługi WordPress i bazę wiedzy

Wzmocnij swój biznes dzięki profesjonalnemu wsparciu technicznemu w kluczowych obszarach ekosystemu WordPress.

FAQ do artykułu

Często zadawane pytania

Najważniejsze odpowiedzi, które pomagają wdrożyć temat w praktyce.

SEO-readyGEO-readyAEO-ready3 Q&A
Dlaczego modele wymyślają fakty o marce, której nie ma?#
Gdy oficjalna strona zostawia luki, modele ważą źródła poboczne takie jak Reddit AMA i artykuły na Medium. Konkretne, zmyślone liczby często wygrywają z prawdziwym, ale ogólnikowym FAQ.
Co zespoły ORM powinny monitorować po awarii w stylu Xarumei?#
Co tydzień sprawdzaj te same prompty w ChatGPT, Gemini, Perplexity i Copilot oraz ustawiaj alerty na wzmianki na Reddit, Medium i Quora, które wymyślają założycieli, adresy albo wyniki sprzedaży.
Jak oficjalne FAQ obniża ryzyko halucynacji marki?#
Publiczne FAQ z twardymi faktami i jawnymi zaprzeczeniami daje modelom z retrieval kotwicę na własnej domenie. Stox zauważył, że GPT-4 i GPT-5 cytowały FAQ znacznie częściej niż modele, które wybrały fikcję z Medium.

Potrzebujesz FAQ dopasowanego do branży i rynku? Przygotujemy wersję pod Twoje cele biznesowe.

Porozmawiajmy

Polecane artykuły

Analityka WooCommerce a agenci AI

Agenci AI składają zamówienia w WooCommerce po stronie serwera, więc piksele w przeglądarce, na których opiera się raportowanie, nigdy się nie odpalają. Co się psuje, dlaczego Conversions API nie ratuje automatycznie i jak poprawnie oskryptować checkout agenta.