Experiência de IA: a marca falsa "xarumei" e as alucinações dos LLMs

Experiência de IA: a marca falsa "xarumei" e as alucinações dos LLMs

Última verificação: 20 de setembro de 2026
9 min de leitura
Caso de estudo
Integração IA
Estratega de marketing

Um investigador de marketing da Ahrefs criou uma empresa de pisa-papéis de luxo completamente fictícia chamada Xarumei, construiu o site numa hora com IA e testou sistematicamente oito grandes ferramentas de IA. Durante dois meses inundou a web com três narrativas falsas deliberadamente contraditórias e depois fez 56 perguntas cuidadosamente elaboradas para revelar como os modelos de IA distinguem verdade de ficção.

Os resultados mostram lacunas mensuráveis na forma como a IA lida com informação de marca, com consequências diretas para a gestão de reputação online (ORM). Este texto mantém as afirmações medidas e aprofunda a metodologia, os modos de falha e o que editores WordPress podem fazer para que sistemas de retrieval citem factos first-party em vez de ficção confiante.

#A experiência

A experiência decorreu em duas fases. Inicialmente, o investigador testou o comportamento básico da IA com perguntas sobre uma marca que não deveria existir - endorsements falsos de celebridades, produtos defeituosos e promoções de Black Friday que nunca aconteceram.

GPT-4 e GPT-5 tiveram o melhor desempenho: responderam corretamente a 53-54 das 56 perguntas e afirmaram «isto não existe» quando adequado. Perplexity falhou em cerca de 40% das perguntas e confundiu frequentemente a Xarumei com smartphones Xiaomi. Claude recusou alucinar por completo, mas também nunca usou o conteúdo do site. Gemini e o AI Overview da Google recusaram muitas vezes tratar a Xarumei como real porque não a encontravam nos resultados de pesquisa.

No caso de falha mais claro, o Microsoft Copilot caiu na «armadilha da bajulação» (sycophancy): inventou explicações elaboradas sobre artesanato, simbolismo e escassez quando perguntado porque é que toda a gente elogiava a marca no X (Twitter).

#Metodologia: o que Stox controlou

O desenho importa porque os modos de falha são fáceis de ler como «a IA é aleatória». Stox controlou três camadas:

  1. Um site first-party que parecia real. O domínio Xarumei tinha copy de produto, um FAQ e superfície suficiente para os crawlers tratarem a marca como entidade - mesmo que todas as alegações comerciais fossem inventadas para o teste.
  2. Um conjunto fixo de perguntas. Os mesmos 56 prompts correram em todas as ferramentas, para que as diferenças de resultado refletissem comportamento de modelo e retrieval, não deriva de prompts entre execuções.
  3. Narrativas secundárias plantadas. Depois da fase de baseline, publicou histórias conflituosas em canais que os LLMs tratam como prova de «como as pessoas falam de marcas» e voltou a testar se os modelos preferiam o FAQ oficial ou a ficção plantada.

A estrutura está mais perto de um exercício controlado de ORM do que de uma demo informal de chatbot. Isola o que acontece quando uma página oficial nega um rumor enquanto um post no Medium o «corrige» com novo nome de fundador e cidade.

#Fase dois: caos controlado

A segunda fase introduziu caos controlado:

  1. FAQ oficial: Negação explícita de rumores («Não fabricamos um ‘pisa-papéis de precisão’», «Nunca fomos adquiridos»).
  2. Narrativas conflituosas:
    • Um blog polido alegava que 23 mestres artesãos trabalhavam em 2847 Meridian Blvd em Nova City, CA, com endorsement de Emma Stone.
    • Reddit AMA: Escolhido estrategicamente porque a Semrush, ao analisar 150 000 citações de IA em 5 000 palavras-chave, encontrou o Reddit como o domínio mais referenciado nas respostas de LLM, com 40,1%.
    • Artigo no Medium: Uma «investigação» que desmontou as mentiras óbvias (parecendo credível) e depois introduziu novas fabricções (fundadora: Jennifer Lawson, localização: Portland).

O Medium revelou-se especialmente persuasivo. Gemini, Grok, AI Overview, Perplexity e Copilot confiaram no artigo do Medium em vez do FAQ oficial, citando com confiança Jennifer Lawson como fundadora e Portland como localização. A manipulação funcionou porque parecia jornalismo real - ao desmontar primeiro as mentiras óbvias, ganhou confiança e depois inseriu os seus próprios detalhes inventados como a história «corrigida».

Quando obrigados a escolher entre uma verdade vaga (FAQ «Não publicamos números de unidades») e ficção específica (fontes falsas a alegar «634 unidades em 2023»), a IA escolheu ficção quase sempre.

#Porque é que as alucinações acontecem em perguntas de marca

Os LLM não mantêm um registo verificável de empresas. Predizem tokens a partir de treino e, quando as ferramentas o permitem, de snippets recuperados. Perguntas de marca são difíceis pelas mesmas razões estruturais que Xarumei já ilustra - sem métricas novas.

Lacunas convidam ao preenchimento. Sem ano de fundação, cidade da sede ou volume no site oficial, texto secundário específico preenche o espaço com mais fluência do que um honesto «não divulgado».

Fluência não é verificação. Um post no Medium que primeiro desmonta mentiras caricatas lê-se como diligência. Modelos que ponderam coerência narrativa podem tratar a fundadora e a cidade «corrigidas» como facto, mesmo quando o FAQ nega o conjunto de rumores.

O retrieval pode sobreponderar domínios conversacionais. A quota Semrush do Reddit no enquadramento da experiência é o ponto: páginas UGC aparecem frequentemente em respostas de IA. Um AMA plantado compete com HTML first-party na janela de contexto.

A bajulação amplifica prompts de elogio. Quando o utilizador já afirma que «toda a gente elogia» a marca, um assistente prestável pode inventar lore de artesanato em vez de desafiar a premissa - o modo de falha do Copilot na fase um.

A documentação de grounding dos fornecedores descreve a mesma classe de erro: respostas confiantes sem fontes verificáveis. Em Portugal, Portal da Empresa, ficha .pt com NIPC e sede explícitos, alertas Deco Proteste e fóruns de consumidores entram no mesmo conjunto de fontes secundárias que os modelos ponderam.

#A IA discute consigo mesma

Cedo nos testes, o Gemini afirmou não encontrar provas da marca. Mais tarde, após as fontes falsas, o mesmo modelo afirmou: «A empresa tem sede em Portland, Oregon, fundada por Jennifer Lawson.»

Os LLMs reagiam ao contexto que no momento parecia mais «autoritativo». Num caso, o Grok sintetizou várias fontes falsas numa resposta confiante, misturando Portland com alegações de Nova City já desmentidas.

Para equipas de reputação, um único registo semanal de prompts não chega. O mesmo modelo pode passar de «sem provas» para uma sede fabricada após um crawl. Acompanhe a deriva das respostas, não só a primeira resposta má.

#EEAT de marca sob pressão de citação LLM

EEAT continua a aplicar-se quando o «leitor» é um pipeline de retrieval. Xarumei mostra EEAT fraco do lado do modelo: uma narrativa polida de terceiros ultrapassou um FAQ on-domain vago nos campos que as pessoas perguntam.

  1. Pessoas nomeadas com papéis. Fundador ou editor numa página rastreável - senão surgem invenções ao estilo Jennifer Lawson.
  2. Factos de entidade datados. Ano de fundação, entidade jurídica, cidade do escritório e âmbito do produto em HTML claro, não só em PDF.
  3. Negações explícitas ao lado de afirmações. O FAQ de Stox funcionou melhor quando os modelos o usaram. Negações de aquisições, endorsements e variantes removem ambiguidade.
  4. Correções no seu domínio. Quando o Medium inventa uma cidade de sede, publique um URL de correção datado.

É a mesma higiene de ORM: fechar lacunas, preferir especificidade, tratar UGC como superfície da marca.

#O que sites WordPress podem fazer para reduzir citações erradas

A experiência não afirmou que o WordPress causa alucinações; mostrou que os modelos citam a página que parece evidência. Equipas WordPress podem reduzir citações erradas com escolhas concretas.

Publique um stack de entidade estável. Sobre, Contacto, FAQ e produto como URLs públicos com nomes e cidades consistentes - não só num hero em imagem ou PDF fechado.

Use blocos de FAQ que emitam schema de FAQ. Emparelhe cada negação («Nunca fomos adquiridos») com um facto afirmativo («Entidade jurídica: …»). Modelos que usaram o FAQ eram mais difíceis de desviar com ficção do Medium.

Prefira factos em HTML a vaguidade de marketing. Substitua «líder de mercado» por âmbito mensurável. Se não publica um número, não deixe a pergunta aberta para o Reddit inventar um.

Torne as correções rastreáveis. Uma página WordPress com data updated e cabeçalho «Correção» supera uma resposta social que nunca entra no índice de retrieval.

Monitorize os mesmos prompts. Semanalmente: ChatGPT, Gemini, Perplexity e Copilot. Registe fundador, cidade e produto. Alerte quando Reddit, Medium ou Quora inventarem detalhes que o FAQ já nega.

Ajuda a transformar isto num stack sustentável: programador WordPress ou contacto.

#Recomendações para marcas

  1. Escreva um FAQ detalhado: Declare o que é verdadeiro e falso onde existem rumores.
  2. Feche lacunas de informação: Se não o disser, a IA inventa a partir de um comentário no Reddit.
  3. Monitorize canais laterais: Reddit, Medium e Quora fazem parte da superfície principal de marketing.
  4. Prefira afirmações específicas: A IA prefere números específicos (mesmo falsos) a verdades vagas.

Para marcas em Portugal: trate uma «investigação» no Medium como review de afiliado não verificada. Se inventar fundador ou sede, publique correção datada no seu domínio. Mantenha NIPC e sede visíveis em HTML.

#Seguimento: de marcas sintéticas à medição first-party

Xarumei é o lado da invenção do problema. Numa marca real medimos retrieval: a série de 90 dias de monitorização de citações de IA abre com uma baseline Geoboard de 2026-06-11 em que o wppoland.com ficou em primeiro em cinco de seis modelos no prompt de identidade e a zero nos prompts transacionais de WooCommerce. O desfasamento Perplexity versus ChatGPT está em porque o Perplexity cita a sua marca e o ChatGPT não.

#Fontes

  • Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/).
  • Marius Comper (Facebook): Análise da experiência.
  • Search Engine Journal: Análise do impacto dos LLM nas Brand Entities.
  • Testes independentes: Verificado em GPT-4, Claude 3.5 Sonnet e Gemini Advanced (dezembro 2025).
  • Google AI for Developers: Grounding with Google Search (ai.google.dev/gemini-api/docs/grounding).
  • Google Search Central: Dokumentacja danych strukturalnych i funkcji AI (developers.google.com/search/docs/appearance/).
Próximo passo

Transforme o artigo numa implementação real

Este bloco reforça a ligação interna e conduz o leitor para o passo seguinte mais útil dentro da arquitetura do site.

Quer implementar isto no seu site?

Se a visibilidade no Google e em sistemas de IA importa, posso estruturar conteúdo, FAQ, schema e linkagem interna para SEO, GEO e AEO.

Cluster relacionado

Explorar outros serviços WordPress e base de conhecimento

Reforce o seu negócio com suporte técnico profissional em áreas-chave do ecossistema WordPress.

Porque é que os LLM inventam detalhes sobre uma marca que nunca existiu?#
Quando as páginas oficiais deixam lacunas, os modelos ponderam fontes secundárias como AMA no Reddit e artigos no Medium. Números fabricados e específicos batem frequentemente respostas verdadeiras, mas vagas, do FAQ.
O que devem as equipas de ORM monitorizar após um modo de falha ao estilo Xarumei?#
Teste semanalmente os mesmos prompts de marca no ChatGPT, Gemini, Perplexity e Copilot, e configure alertas para menções no Reddit, Medium e Quora que inventem fundadores, moradas ou números de vendas.
Como é que um FAQ oficial reduz o risco de alucinação de marca?#
Um FAQ público com factos duros e negações explícitas dá aos modelos com retrieval uma âncora no domínio próprio. Stox viu o GPT-4 e o GPT-5 citarem o FAQ com muito mais frequência do que os modelos que preferiram a ficção do Medium.
O que pode um site WordPress fazer para reduzir citações de IA erradas?#
Publique páginas de entidade estáveis com schema de FAQ, datas e localizações concretas, e correções datadas. Mantenha Sobre, Contacto e factos de produto rastreáveis em HTML, não enterrados em PDF ou texto só em imagem.

Precisa de FAQ adaptado ao setor e mercado? Criamos uma versão alinhada com os seus objetivos de negócio.

Fale connosco

Artigos Relacionados