Um investigador de marketing da Ahrefs criou uma empresa de pisa-papéis de luxo completamente fictícia chamada Xarumei, construiu o site numa hora com IA e testou sistematicamente oito grandes ferramentas de IA. Durante dois meses inundou a web com três narrativas falsas deliberadamente contraditórias e depois fez 56 perguntas cuidadosamente elaboradas para revelar como os modelos de IA distinguem verdade de ficção.
Os resultados mostram lacunas mensuráveis na forma como a IA lida com informação de marca, com consequências diretas para a gestão de reputação online (ORM). Este texto mantém as afirmações medidas e aprofunda a metodologia, os modos de falha e o que editores WordPress podem fazer para que sistemas de retrieval citem factos first-party em vez de ficção confiante.
A experiência
A experiência decorreu em duas fases. Inicialmente, o investigador testou o comportamento básico da IA com perguntas sobre uma marca que não deveria existir - endorsements falsos de celebridades, produtos defeituosos e promoções de Black Friday que nunca aconteceram.
GPT-4 e GPT-5 tiveram o melhor desempenho: responderam corretamente a 53-54 das 56 perguntas e afirmaram «isto não existe» quando adequado. Perplexity falhou em cerca de 40% das perguntas e confundiu frequentemente a Xarumei com smartphones Xiaomi. Claude recusou alucinar por completo, mas também nunca usou o conteúdo do site. Gemini e o AI Overview da Google recusaram muitas vezes tratar a Xarumei como real porque não a encontravam nos resultados de pesquisa.
No caso de falha mais claro, o Microsoft Copilot caiu na «armadilha da bajulação» (sycophancy): inventou explicações elaboradas sobre artesanato, simbolismo e escassez quando perguntado porque é que toda a gente elogiava a marca no X (Twitter).
Metodologia: o que Stox controlou
O desenho importa porque os modos de falha são fáceis de ler como «a IA é aleatória». Stox controlou três camadas:
- Um site first-party que parecia real. O domínio Xarumei tinha copy de produto, um FAQ e superfície suficiente para os crawlers tratarem a marca como entidade - mesmo que todas as alegações comerciais fossem inventadas para o teste.
- Um conjunto fixo de perguntas. Os mesmos 56 prompts correram em todas as ferramentas, para que as diferenças de resultado refletissem comportamento de modelo e retrieval, não deriva de prompts entre execuções.
- Narrativas secundárias plantadas. Depois da fase de baseline, publicou histórias conflituosas em canais que os LLMs tratam como prova de «como as pessoas falam de marcas» e voltou a testar se os modelos preferiam o FAQ oficial ou a ficção plantada.
A estrutura está mais perto de um exercício controlado de ORM do que de uma demo informal de chatbot. Isola o que acontece quando uma página oficial nega um rumor enquanto um post no Medium o «corrige» com novo nome de fundador e cidade.
Fase dois: caos controlado
A segunda fase introduziu caos controlado:
- FAQ oficial: Negação explícita de rumores («Não fabricamos um ‘pisa-papéis de precisão’», «Nunca fomos adquiridos»).
- Narrativas conflituosas:
- Um blog polido alegava que 23 mestres artesãos trabalhavam em 2847 Meridian Blvd em Nova City, CA, com endorsement de Emma Stone.
- Reddit AMA: Escolhido estrategicamente porque a Semrush, ao analisar 150 000 citações de IA em 5 000 palavras-chave, encontrou o Reddit como o domínio mais referenciado nas respostas de LLM, com 40,1%.
- Artigo no Medium: Uma «investigação» que desmontou as mentiras óbvias (parecendo credível) e depois introduziu novas fabricções (fundadora: Jennifer Lawson, localização: Portland).
O Medium revelou-se especialmente persuasivo. Gemini, Grok, AI Overview, Perplexity e Copilot confiaram no artigo do Medium em vez do FAQ oficial, citando com confiança Jennifer Lawson como fundadora e Portland como localização. A manipulação funcionou porque parecia jornalismo real - ao desmontar primeiro as mentiras óbvias, ganhou confiança e depois inseriu os seus próprios detalhes inventados como a história «corrigida».
Quando obrigados a escolher entre uma verdade vaga (FAQ «Não publicamos números de unidades») e ficção específica (fontes falsas a alegar «634 unidades em 2023»), a IA escolheu ficção quase sempre.
Porque é que as alucinações acontecem em perguntas de marca
Os LLM não mantêm um registo verificável de empresas. Predizem tokens a partir de treino e, quando as ferramentas o permitem, de snippets recuperados. Perguntas de marca são difíceis pelas mesmas razões estruturais que Xarumei já ilustra - sem métricas novas.
Lacunas convidam ao preenchimento. Sem ano de fundação, cidade da sede ou volume no site oficial, texto secundário específico preenche o espaço com mais fluência do que um honesto «não divulgado».
Fluência não é verificação. Um post no Medium que primeiro desmonta mentiras caricatas lê-se como diligência. Modelos que ponderam coerência narrativa podem tratar a fundadora e a cidade «corrigidas» como facto, mesmo quando o FAQ nega o conjunto de rumores.
O retrieval pode sobreponderar domínios conversacionais. A quota Semrush do Reddit no enquadramento da experiência é o ponto: páginas UGC aparecem frequentemente em respostas de IA. Um AMA plantado compete com HTML first-party na janela de contexto.
A bajulação amplifica prompts de elogio. Quando o utilizador já afirma que «toda a gente elogia» a marca, um assistente prestável pode inventar lore de artesanato em vez de desafiar a premissa - o modo de falha do Copilot na fase um.
A documentação de grounding dos fornecedores descreve a mesma classe de erro: respostas confiantes sem fontes verificáveis. Em Portugal, Portal da Empresa, ficha .pt com NIPC e sede explícitos, alertas Deco Proteste e fóruns de consumidores entram no mesmo conjunto de fontes secundárias que os modelos ponderam.
A IA discute consigo mesma
Cedo nos testes, o Gemini afirmou não encontrar provas da marca. Mais tarde, após as fontes falsas, o mesmo modelo afirmou: «A empresa tem sede em Portland, Oregon, fundada por Jennifer Lawson.»
Os LLMs reagiam ao contexto que no momento parecia mais «autoritativo». Num caso, o Grok sintetizou várias fontes falsas numa resposta confiante, misturando Portland com alegações de Nova City já desmentidas.
Para equipas de reputação, um único registo semanal de prompts não chega. O mesmo modelo pode passar de «sem provas» para uma sede fabricada após um crawl. Acompanhe a deriva das respostas, não só a primeira resposta má.
EEAT de marca sob pressão de citação LLM
EEAT continua a aplicar-se quando o «leitor» é um pipeline de retrieval. Xarumei mostra EEAT fraco do lado do modelo: uma narrativa polida de terceiros ultrapassou um FAQ on-domain vago nos campos que as pessoas perguntam.
- Pessoas nomeadas com papéis. Fundador ou editor numa página rastreável - senão surgem invenções ao estilo Jennifer Lawson.
- Factos de entidade datados. Ano de fundação, entidade jurídica, cidade do escritório e âmbito do produto em HTML claro, não só em PDF.
- Negações explícitas ao lado de afirmações. O FAQ de Stox funcionou melhor quando os modelos o usaram. Negações de aquisições, endorsements e variantes removem ambiguidade.
- Correções no seu domínio. Quando o Medium inventa uma cidade de sede, publique um URL de correção datado.
É a mesma higiene de ORM: fechar lacunas, preferir especificidade, tratar UGC como superfície da marca.
O que sites WordPress podem fazer para reduzir citações erradas
A experiência não afirmou que o WordPress causa alucinações; mostrou que os modelos citam a página que parece evidência. Equipas WordPress podem reduzir citações erradas com escolhas concretas.
Publique um stack de entidade estável. Sobre, Contacto, FAQ e produto como URLs públicos com nomes e cidades consistentes - não só num hero em imagem ou PDF fechado.
Use blocos de FAQ que emitam schema de FAQ. Emparelhe cada negação («Nunca fomos adquiridos») com um facto afirmativo («Entidade jurídica: …»). Modelos que usaram o FAQ eram mais difíceis de desviar com ficção do Medium.
Prefira factos em HTML a vaguidade de marketing. Substitua «líder de mercado» por âmbito mensurável. Se não publica um número, não deixe a pergunta aberta para o Reddit inventar um.
Torne as correções rastreáveis. Uma página WordPress com data updated e cabeçalho «Correção» supera uma resposta social que nunca entra no índice de retrieval.
Monitorize os mesmos prompts. Semanalmente: ChatGPT, Gemini, Perplexity e Copilot. Registe fundador, cidade e produto. Alerte quando Reddit, Medium ou Quora inventarem detalhes que o FAQ já nega.
Ajuda a transformar isto num stack sustentável: programador WordPress ou contacto.
Recomendações para marcas
- Escreva um FAQ detalhado: Declare o que é verdadeiro e falso onde existem rumores.
- Feche lacunas de informação: Se não o disser, a IA inventa a partir de um comentário no Reddit.
- Monitorize canais laterais: Reddit, Medium e Quora fazem parte da superfície principal de marketing.
- Prefira afirmações específicas: A IA prefere números específicos (mesmo falsos) a verdades vagas.
Para marcas em Portugal: trate uma «investigação» no Medium como review de afiliado não verificada. Se inventar fundador ou sede, publique correção datada no seu domínio. Mantenha NIPC e sede visíveis em HTML.
Seguimento: de marcas sintéticas à medição first-party
Xarumei é o lado da invenção do problema. Numa marca real medimos retrieval: a série de 90 dias de monitorização de citações de IA abre com uma baseline Geoboard de 2026-06-11 em que o wppoland.com ficou em primeiro em cinco de seis modelos no prompt de identidade e a zero nos prompts transacionais de WooCommerce. O desfasamento Perplexity versus ChatGPT está em porque o Perplexity cita a sua marca e o ChatGPT não.
Fontes
- Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/).
- Marius Comper (Facebook): Análise da experiência.
- Search Engine Journal: Análise do impacto dos LLM nas Brand Entities.
- Testes independentes: Verificado em GPT-4, Claude 3.5 Sonnet e Gemini Advanced (dezembro 2025).
- Google AI for Developers: Grounding with Google Search (ai.google.dev/gemini-api/docs/grounding).
- Google Search Central: Dokumentacja danych strukturalnych i funkcji AI (developers.google.com/search/docs/appearance/).






