Experimento IA: la marca falsa "Xarumei" y las alucinaciones de LLM

Experimento IA: la marca falsa "Xarumei" y las alucinaciones de LLM

Última verificación: 22 de septiembre de 2026
7 min de lectura
Caso de estudio
Integración IA
Estratega de marketing

Un investigador de marketing de Ahrefs creó una empresa de pisapapeles de lujo completamente ficticia llamada Xarumei, construyó su sitio web en una hora usando IA, y probó sistemáticamente ocho herramientas de IA principales. Durante dos meses, inundó la web con tres narrativas falsas deliberadamente contradictorias, luego hizo 56 preguntas cuidadosamente elaboradas diseñadas para revelar cómo los modelos de IA distinguen la verdad de la ficción.

Los resultados muestran lagunas medibles en cómo la IA maneja la información de marca, con consecuencias directas para la gestión de reputación online (ORM). Este texto conserva esas mediciones y amplía metodología, modos de fallo y lo que pueden hacer los editores WordPress para que los sistemas de retrieval citen hechos first-party en lugar de ficción confiada.

#El experimento

El experimento se realizó en dos fases. Inicialmente, el investigador probó el comportamiento básico de la IA haciendo preguntas sobre una marca que no debería existir: preguntas que involucraban endorsements falsos de celebridades, productos defectuosos y ventas de Black Friday que nunca ocurrieron.

GPT-4 y GPT-5 tuvieron el mejor desempeño, respondiendo correctamente 53-54 de 56 preguntas y declarando “esto no existe” cuando era apropiado. Perplexity falló en aproximadamente el 40% de las preguntas, confundiendo a menudo Xarumei con smartphones Xiaomi. Claude se negó a alucinar completamente pero tampoco usó nunca el contenido del sitio web. Gemini y el AI Overview de Google a menudo se negaron a tratar a Xarumei como real porque no podían encontrarla en los resultados de búsqueda.

En el fallo más claro, Microsoft Copilot cayó en lo que el investigador llama la “trampa del servilismo”, inventando explicaciones elaboradas sobre artesanía, simbolismo y escasez cuando se le preguntó por qué todos estaban elogiando la marca en X (Twitter).

#Metodología: qué controló Stox

El diseño importa porque es fácil leer los fallos como “la IA es aleatoria”. Stox controló tres capas:

  1. Un sitio first-party que parecía real. El dominio Xarumei llevaba copy de producto, un FAQ y suficiente superficie para que los crawlers lo trataran como entidad de marca, aunque toda afirmación comercial era inventada para la prueba.
  2. Un set fijo de preguntas. Los mismos 56 prompts se ejecutaron en las herramientas para que las diferencias de puntuación reflejaran comportamiento de modelo y retrieval, no deriva de prompt entre corridas.
  3. Narrativas secundarias plantadas. Tras la fase base, publicó historias conflictivas en canales que los LLM tratan como evidencia de “cómo habla la gente de las marcas”, y volvió a probar si los modelos preferían el FAQ oficial o la ficción plantada.

Esa estructura se parece más a un ejercicio controlado de ORM que a una demo casual de chatbot. Aísla qué ocurre cuando una página oficial niega un rumor y un post de Medium lo “corrige” con un nuevo nombre de fundador y una ciudad.

#Fase dos: caos controlado

La segunda fase introdujo caos controlado:

  1. FAQ oficial: Negando explícitamente rumores (“No fabricamos un ‘pisapapeles de precisión’”, “Nunca fuimos adquiridos”).
  2. Narrativas contradictorias:
    • Un blog brillante afirmando que 23 artesanos maestros trabajaban en 2847 Meridian Blvd en Nova City, CA, respaldado por Emma Stone.
    • Reddit AMA: Elegido estratégicamente porque Semrush, tras analizar 150,000 citas de IA sobre 5,000 palabras clave, halló que Reddit es el dominio más referenciado en las respuestas de los LLM, con un 40.1%.
    • Artículo de Medium: Una “investigación” que desmintió las mentiras obvias (haciéndola parecer creíble) pero luego introdujo nuevas fabricaciones (Fundadora: Jennifer Lawson, Ubicación: Portland).

Medium resultó especialmente persuasivo. Gemini, Grok, AI Overview, Perplexity y Copilot confiaron en el artículo de Medium sobre el FAQ oficial, citando con confianza a Jennifer Lawson como la fundadora y Portland como la ubicación. La manipulación funcionó porque parecía periodismo real: al desmentir las mentiras obvias primero, ganó confianza, luego insertó sus propios detalles inventados como la historia “corregida”.

Cuando se les forzó a elegir entre una verdad vaga (FAQ “No publicamos números de unidades”) y ficción específica (fuentes falsas afirmando “634 unidades en 2023”), la IA eligió la ficción casi siempre.

#Por qué ocurren alucinaciones en consultas de marca

Los LLM no mantienen un registro verificado de empresas. Predicen tokens plausibles y, con herramientas, leen snippets recuperados. Xarumei ya ilustra por qué fallan las consultas de marca - sin métricas nuevas.

Los huecos invitan a rellenar. Sin año de fundación, ciudad o volumen en el sitio oficial, un texto secundario específico llena el slot mejor que un “no se publica”. Fluidez no es verificación. Medium que primero desmonta mentiras obvias se lee como diligencia; el fundador y la ciudad “corregidos” pasan por hecho. Retrieval sobrepondera UGC. La cuota Semrush de Reddit en el marco del experimento lo explica: un AMA plantado compite con HTML first-party. Servilismo amplifica elogios. Si el prompt afirma que “todo el mundo elogia” la marca, Copilot inventa lore en lugar de cuestionar la premisa.

El grounding de los proveedores describe el mismo error: confianza sin fuente verificable. En ORM, eso se vuelve registro público cuando alguien captura el chat.

#La IA discute consigo misma

Al principio, Gemini dijo que no había evidencia de la marca. Más tarde, tras las fuentes falsas, afirmó: “La empresa está basada en Portland, Oregon, fundada por Jennifer Lawson.” Grok mezcló Portland con claims desmentidos de Nova City en una sola respuesta confiada. Un log semanal no basta: el mismo modelo puede pasar de “sin evidencia” a una sede fabricada tras un refresh. Sigue la deriva, no solo el primer fallo.

#EEAT de marca bajo presión de citas de LLM

EEAT sigue aplicando cuando el “lector” es un pipeline de retrieval. Xarumei: una narrativa third-party pulida ganó a un FAQ on-domain vago en los campos que la gente pregunta.

  1. Personas con rol en HTML rastreable (evita invenciones tipo Jennifer Lawson).
  2. Hechos de entidad fechados: fundación, razón social, ciudad, alcance de producto.
  3. Negaciones junto a afirmaciones - el FAQ de Stox funcionó cuando los modelos lo usaban.
  4. Correcciones en tu dominio cuando Medium inventa una sede.

Misma higiene ORM del experimento: cierra huecos, prefiere lo específico, trata UGC como superficie de marca.

#Qué pueden hacer los sitios WordPress para reducir citas erróneas

El experimento no culpó a WordPress; mostró que los modelos citan lo que parece evidencia. Acciones concretas:

  • Stack de entidad estable: About, Contacto, FAQ y producto en URLs públicas (no solo imagen hero o PDF).
  • Bloques FAQ con schema FAQ; empareja cada negación con un hecho afirmativo breve.
  • Hechos en HTML frente a vaguedad de marketing; si no publicas un número, Reddit puede inventarlo.
  • Correcciones rastreables con fecha updated y encabezado “Corrección”.
  • Mismos prompts semanales en ChatGPT, Gemini, Perplexity y Copilot; alerta en Reddit, Medium y Quora.

¿Necesitas un stack mantenible? Habla con un desarrollador WordPress. Contáctanos.

#Recomendaciones para marcas

  1. FAQ detallado: qué es verdad y qué es falso donde hay rumores.
  2. Cierra vacíos: si no lo dices tú, un comentario de Reddit lo inventa.
  3. Monitorea Reddit, Medium y Quora: la IA los mete en las respuestas.
  4. Preferir cifras concretas a “líder de la industria”.

En España, CIF, sede y fecha en el Registro Mercantil (más Trustpilot verificable) pesan más que un FAQ sin cifras. Si Medium inventa fundador o ciudad, publica corrección fechada en tu dominio antes del siguiente crawl.

#Seguimiento: de marcas sintéticas a medición first-party

Xarumei muestra el lado de la invención. En una marca real medimos recuperación: en la serie de seguimiento de citas de IA de 90 días (baseline Geoboard 2026-06-11) wppoland.com quedó primero en cinco de seis modelos en el prompt de identidad y a cero en prompts transaccionales de WooCommerce. El desfase Perplexity frente a ChatGPT está en por qué Perplexity cita tu marca y ChatGPT no.

#Fuentes

  • Patrick Stox (Ahrefs): “I Created A Fake Luxury Brand To Test How AI Handles Truth” (ahrefs.com/blog/ai-test-fake-brand/).
  • Marius Comper (Facebook): Análisis del experimento.
  • Search Engine Journal: Análisis del impacto de LLM en entidades de marca.
  • Pruebas independientes: Verificado en GPT-4, Claude 3.5 Sonnet y Gemini Advanced (diciembre 2025).
  • Google AI for Developers: Grounding with Google Search (ai.google.dev/gemini-api/docs/grounding).
  • Google Search Central: Introduction to structured data; AI features and your website (developers.google.com/search/docs/appearance/).
Siguiente paso

Transforma el artículo en una implementación real

Este bloque refuerza el enlazado interno y lleva al lector al siguiente paso más útil dentro de la arquitectura del sitio.

¿Quieres implementar esto en tu sitio?

Si la visibilidad en Google y en sistemas de IA importa, puedo estructurar contenido, FAQ, schema y enlazado interno para SEO, GEO y AEO.

Cluster relacionado

Explora otros servicios WordPress y base de conocimiento

Refuerza tu negocio con soporte técnico profesional en áreas clave del ecosistema WordPress.

¿Por qué los LLM inventan detalles sobre una marca que nunca existió?#
Cuando las páginas oficiales dejan huecos, los modelos ponderan fuentes secundarias como AMA de Reddit y artículos de Medium. Los números fabricados y específicos suelen ganar a respuestas verdaderas pero vagas del FAQ.
¿Qué deben monitorear los equipos de ORM tras un modo de fallo al estilo Xarumei?#
Pruebe semanalmente los mismos prompts de marca en ChatGPT, Gemini, Perplexity y Copilot, y active alertas en menciones de Reddit, Medium y Quora que inventen fundadores, direcciones o cifras de ventas.
¿Cómo reduce un FAQ oficial el riesgo de alucinación de marca?#
Un FAQ público con hechos duros y negaciones explícitas da a los modelos con retrieval un ancla en el dominio propio. Stox vio que GPT-4 y GPT-5 citaban el FAQ mucho más a menudo que los modelos que preferían la ficción de Medium.
¿Qué puede hacer un sitio WordPress para reducir citas de IA erróneas?#
Publique páginas de entidad estables con schema FAQ, fechas y ubicaciones concretas, y correcciones fechadas. Mantenga About, Contacto y hechos de producto rastreables en HTML, no enterrados en PDF ni solo en texto de una imagen hero.

¿Necesitas un FAQ adaptado a tu sector y mercado? Preparamos una versión alineada con tus objetivos de negocio.

Hablemos

Artículos Relacionados

Limpieza de contenido AI-slop

Diagnóstico YMYL para sitios WordPress: cómo encontrar estadísticas falsas, citas fabricadas, páginas duplicadas de IA, fechas incorrectas y biografías inventadas antes de que dañen la confianza, el cumplimiento o las citas en IA.