Badacz marketingowy w Ahrefs stworzył całkowicie fikcyjną luksusową firmę z przyciskami do papieru o nazwie Xarumei, zbudował stronę w godzinę z pomocą AI i systematycznie testował osiem głównych narzędzi. W ciągu dwóch miesięcy zasypał sieć trzema celowo sprzecznymi fałszywymi narracjami, a następnie zadał 56 starannie opracowanych pytań, żeby sprawdzić, jak modele AI odróżniają prawdę od fikcji.
Wyniki pokazują mierzalne luki w tym, jak AI obsługuje informacje o marce, z bezpośrednimi konsekwencjami dla zarządzania reputacją online (ORM).
Eksperyment
Eksperyment odbył się w dwóch fazach. Początkowo badacz testował podstawowe zachowania sztucznej inteligencji, zadając pytania dotyczące marki, która nie powinna istnieć - pytania o fałszywe endorsements celebrytów, wadliwe produkty i wyprzedaże Black Friday, które nigdy nie miały miejsca.
GPT-4 i GPT-5 poradziły sobie najlepiej, prawidłowo odpowiadając na 53-54 z 56 pytań i w stosownych przypadkach stwierdzając „to nie istnieje”. Perplexity zawiodło w około 40% pytań, często myląc Xarumei z smartfonami Xiaomi. Claude całkowicie odmówił halucynacji, ale także nigdy nie korzystał z treści strony. Gemini i AI Overview Google często odmawiały traktowania Xarumei jako prawdziwej marki, bo nie znajdowały jej w wynikach wyszukiwania.
W najczytelniejszym przypadku porażki Microsoft Copilot wpadł w to, co badacz nazywa „pułapką sykofancji”, wymyślając wyjaśnienia o rzemiośle, symbolice i niedoborze, gdy zapytano, dlaczego wszyscy chwalą markę na X (Twitter).
Faza druga: kontrolowany chaos
Druga faza wprowadziła kontrolowany chaos:
- Oficjalne FAQ: Wyraźnie zaprzeczające plotkom („Nie produkujemy «precyzyjnego przycisku do papieru»”, „Nigdy nas nie przejęto”).
- Sprzeczne narracje:
- Błyszczący blog twierdził, że 23 mistrzów rzemiosła pracowało pod adresem 2847 Meridian Blvd w Nova City, CA, z endorsemem Emmy Stone.
- Reddit AMA: Wybrane strategicznie, bo badania pokazują, że to jedna z najczęściej cytowanych domen w odpowiedziach AI - założyciel Robert Martinez prowadził warsztat w Seattle z 11 rzemieślnikami i opisał dramatyczną „36-godzinną usterkę cenową”, która rzekomo zbiła cenę przycisku z 36 000 USD do 199 USD.
- Artykuł na Medium: „Śledztwo”, które obaliło oczywiste kłamstwa (przez co wyglądało wiarygodnie), a potem wsunęło nowe wymysły: wynaleziona założycielka Jennifer Lawson, magazyn w Portland.
Medium okazał się szczególnie przekonujący. Gemini, Grok, AI Overview, Perplexity i Copilot zaufały artykułowi Medium zamiast oficjalnego FAQ, pewnie cytując Jennifer Lawson jako założycielkę i Portland jako lokalizację. Manipulacja zadziałała, bo wyglądała jak prawdziwe dziennikarstwo - najpierw obaliła oczywiste kłamstwa, zyskała zaufanie, a potem wpisała własne wymyślone szczegóły jako „poprawioną” historię.
Kiedy modele musiały wybrać między niejasną prawdą (FAQ „Nie publikujemy liczb jednostek”) a konkretną fikcją (fałszywe źródła twierdzące „634 jednostki w 2023 roku, 471 do sierpnia 2024”), AI niemal za każdym razem wybierała fikcję. Po podłożeniu fałszywych źródeł modele takie jak Gemini i Perplexity powtórzyły dezinformację w 37-39% odpowiedzi. GPT-4 i GPT-5 pozostały poniżej 7%, wyraźnie powołując się na FAQ w 84% odpowiedzi i traktując „nie ujawniamy tego” jako twardą granicę.
AI kłóci się samo ze sobą
Ciekawy tryb awarii: modele przeczyły sobie w kolejnych odpowiedziach bez świadomości sprzeczności. Na początku testów Gemini stwierdził, że nie znalazł dowodów na istnienie marki i sugerował, że może być fikcyjna. Później, po kontakcie z fałszywymi źródłami, ten sam model pewnie stwierdził: „Firma ma siedzibę w Portland w stanie Oregon, założona przez Jennifer Lawson, zatrudnia około 9 osób i produkuje około 600 sztuk rocznie.”
Duże modele językowe wydawały się „zapominać” o kwestionowaniu istnienia marki i po prostu reagowały na kontekst, który w danym momencie wyglądał najbardziej autorytatywnie. W jednym przypadku Grok zsyntetyzował wiele fałszywych źródeł w jedną pewną odpowiedź, mieszając lokalizację Portland, obalone twierdzenia o Nova City, konkretne rodzaje marmuru i numery produkcyjne w coś, co wyglądało jak kompleksowa weryfikacja faktów.
Rekomendacje
Rekomendacje badacza dla marek są konkretne:
- Napisz szczegółowe FAQ: Wyraźnie określ, co jest prawdą i fałszem, zwłaszcza tam, gdzie krążą plotki.
- Domknij luki informacyjne: Opublikuj oficjalną treść na tyle szczegółową, by przebić zewnętrznych narratorów.
- Monitoruj kanały poboczne: Śledź wzmianki ze słowami typu „badanie”, „deep dive”, „insider” i „kontrowersja”.
- Preferuj konkretne twierdzenia: Zamiast „lider branży” podaj liczby i zastosowania. AI woli konkret (nawet zmyślony) od ogólnika.
Dla marek działających w Polsce warto pilnować też wizytówek Google i opisów na Allegro - modele często zaciągają stamtąd konkretne liczby, gdy FAQ milczy o lokalizacji czy skali sprzedaży. UOKiK i decyzje dotyczące oznaczania treści reklamowych to dodatkowy sygnał: niespójność między oficjalną stroną a marketplace zwiększa ryzyko, że LLM „uzupełni” lukę z niewłaściwego źródła.
Kontynuacja: od syntetycznych marek do pomiaru first-party
Xarumei pokazuje stronę wynajdywania faktów. Na prawdziwej marce mierzymy retrieval: w 90-dniowej serii śledzenia cytowań AI (baseline Geoboard 2026-06-11) wppoland.com zajęło pierwsze miejsce w pięciu z sześciu modeli na prompcie tożsamościowym i zero na transakcyjnych promptach WooCommerce. Mechanizm rozjazdu Perplexity i ChatGPT opisujemy w dlaczego Perplexity cytuje Twoją markę, a ChatGPT nie.
Źródła
- Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/) (eksperyment oryginalny).
- Marius Comper (Facebook): Post z analizą eksperymentu.
- Search Engine Journal: Analiza wpływu LLM na reputację marki (Brand Entities).
- Własne obserwacje: Testy przeprowadzone na modelach GPT-4, Claude 3.5 Sonnet oraz Gemini Advanced (grudzień 2025).





