Medir visibilidad en IA
ES

Medir visibilidad en IA

Última verificación: 1 de julio de 2026
18 min de lectura
Caso de estudio
PageSpeed 100/100

#Qué medimos y qué encontramos

Durante un trimestre apuntamos la monitorización de visibilidad en IA hacia nuestro propio sitio y anotamos lo que decía, incluidas las partes que no eran halagadoras. En resumen: nuestra tasa de citas de IA es baja justo donde más importa, ninguno de los tres instrumentos que usamos leyó el producto que un cliente abre de verdad, y una de nuestras cifras salió de una hoja que nadie rellenó. El resultado más útil del ejercicio fue aprender a desconfiar de una cifra de aspecto limpio que venía del instrumento equivocado. El más aleccionador fue descubrir que, durante medio trimestre, el instrumento equivocado éramos nosotros. Este es el primero de una serie trimestral, así que las cifras de abajo son una línea base, no una vuelta de honor.

La mayor parte de lo que se escribe sobre visibilidad en IA es consejo. Esto es medición. Somos una agencia que defiende servir a la IA HTML limpio renderizado en el servidor, así que era justo comprobar si la propia agencia es citada. La respuesta, a lo largo de tres instantáneas en abril, mayo y junio de 2026, fue más interesante que una sola cifra.

#Primero viene el problema del instrumento

Antes de cualquier hallazgo, la salvedad que reenmarca a todos los demás. Hay dos formas comunes de medir con qué frecuencia una IA te cita, y no coinciden.

La forma barata es un proxy de API. Envías tus prompts a través de la API de un modelo, lees el texto que vuelve y cuentas menciones de marca y enlaces. Es reproducible y casi gratis, por eso está en todas partes. Su debilidad es que la vía de la API no es el producto que usa un cliente. Las comparaciones publicadas sitúan el solapamiento de fuentes entre las respuestas de la API y la interfaz web de consumo en cifras bajas de un solo dígito, así que un proxy puede decirte que un modelo conoce tu nombre en abstracto sin decirte nada fiable sobre lo que ve un usuario real.

La forma honesta es monitorizar las salidas reales de consumo, las mismas respuestas que recibe una persona en la interfaz de ChatGPT o Perplexity, incluidas las fuentes que el producto muestra de verdad. Cuesta más y es más difícil de automatizar. Es también la única cifra que corresponde a una visita perdida o ganada.

Usamos tres variantes de la primera y ni una sola vez la segunda. La primera versión de este informe afirmaba lo contrario, y esa es justamente su lección más reutilizable: durante un trimestre entero medimos algo distinto de lo que anunciábamos medir, y no lo detectamos hasta que nos sentamos a escribir de dónde salía cada cifra.

#Abril: la línea base barata del proxy

Nuestra primera instantánea, el 6 de abril, fue una ejecución de proxy de API. Las cifras principales, sobre 26 consultas contra ChatGPT:

MétricaResultado
Tasa de mención de marca7,7 por ciento (2 de 26)
Tasa de cita de URL0 por ciento
Categoría más fuertePlugins, 14,3 por ciento de mención
Categoría transaccional12,5 por ciento de mención
Informativa y local0 por ciento de mención

Una tasa de mención por debajo del ocho por ciento y una tasa de cita de cero se leen como un desastre. El detalle más útil es a quién citaron en nuestro lugar. Cuando el modelo buscó una fuente sobre trabajo polaco con WordPress, nombró directorios y portales de empleo: pracuj.pl apareció tres veces, junto a clutch.co, olx.pl, home.pl, nazwa.pl y un anuncio de un meetup de desarrolladores. No son competidores que escribieran mejor que nosotros. Son agregadores en los que el modelo confía como respuestas genéricas a una pregunta comercial. Ese patrón, el asistente recurriendo a un directorio en lugar de a un especialista, resultó ser la verdadera historia, y el pulido en la propia página no lo arregla.

El propio informe llevaba la advertencia que queremos que lleves también: proxy de API, solo tendencias orientativas, alrededor del cuatro por ciento de solapamiento de fuentes con la interfaz web. Todavía no apreciábamos cuánto importaba esa advertencia.

#Mayo: la hoja vacía que produjo una cifra

La ejecución del 11 de mayo no fue tal ejecución. El panel de esa semana es una hoja en el repositorio: veinte consultas repartidas entre ChatGPT, Perplexity, Bing Copilot y Claude, una columna de resultado vacía junto a cada una, y arriba una línea Owner: _______ que nadie llegó a firmar. Nadie la rellenó. La tabla que nuestro script produjo a partir de ella, en cambio, parecía exactamente una medición:

MotorFilas en la hojaRellenadasResultado en el informe
ChatGPT60indeterminado
Perplexity60indeterminado
Bing Copilot40indeterminado
Claude40indeterminado

Todas las filas volvieron como indeterminadas, pero no porque el instrumento comprobara nada y se abstuviera de juzgar. scripts/compute-ai-citation-metrics.mjs lee una celda, la cuenta como cita si coincide con yes, y, true, 1 o x, como ausencia de cita si coincide con no, n, false o 0, y escribe unknown en cualquier otro caso. Una celda vacía no coincide con nada, así que recibe unknown. Veinte resultados indeterminados son veinte filas que nadie miró. En ese pipeline no hay detección de grounding, y nunca la hubo.

La última línea del informe es peor. La tasa de citas se calcula como citas con sí dividido entre todas las filas, así que esas veinte filas vacías fueron directas al denominador, y el fichero generado anuncia: tasa de citas 0 por ciento. Una hoja vacía entró en el script y salió por el otro lado como un informe bien formateado, con un cero en el titular y un desglose por cuatro motores debajo.

Así se ve este modo de fallo desde dentro. No un instrumento que informa con honestidad de que no puede ver. Un instrumento que convierte la falta de datos en un resultado y lo presenta con la misma seguridad que una medición. Se lo reprochamos a los paneles de visibilidad en IA unos párrafos más abajo, así que es justo decirlo sin rodeos: nuestro propio pipeline hacía exactamente eso, nadie lo notó, y el cero de mayo estuvo todo ese tiempo en el repositorio con aspecto de hallazgo. Una cifra no necesita ser inventada para inducir a error. Basta con que esté bien formateada.

#Junio: un segundo instrumento, un segundo punto ciego

El 11 de junio cambiamos de instrumento. Entonces nos lo describíamos a nosotros mismos como un salto de la API a las salidas reales de los modelos. No lo fue. Conectamos Geoboard, seis modelos entre ellos ChatGPT, Claude, Gemini, Perplexity, Grok y DeepSeek, contra un conjunto de prompts de intención de compra. Es otro proveedor, no otro tipo de medición: nuestro cliente para eso, scripts/geoboard-pull.mjs, son una docena de líneas que envuelven curl alrededor de una API REST. Interfaz de consumo no hay ahí en ningún momento.

La propia nota metodológica de Geoboard dice, por cierto, lo que nosotros no decíamos: la ejecución consulta a los modelos sin búsqueda web en vivo, con lo que mide el recuerdo de los datos de entrenamiento. Un ChatGPT real y un Gemini real buscan en vivo y encontrarían el sitio en funcionamiento. La ejecución de junio no medía, pues, si la IA nos cita. Medía si los modelos nos recuerdan del entrenamiento, y eso, para una agencia B2B de nicho, está cerca de cero por construcción. Habíamos cambiado un punto ciego por otro y por un momento lo tomamos por progreso.

La imagen se afinó igualmente, porque dos puntos ciegos en sitios distintos muestran juntos más que uno solo. Para una consulta acotada, un estudio polaco que atiende a clientes WordPress extranjeros, quedamos primeros en cinco de los seis modelos probados. Con la búsqueda en vivo desactivada eso significa algo concreto, y más fuerte de lo que habíamos supuesto: la asociación está en los propios modelos, no en resultados de búsqueda grapados sobre la marcha. Es una afirmación de identidad específica con poca competencia, exactamente el tipo de consulta que un especialista debería poseer.

Para las consultas transaccionales sobre WooCommerce, las consultas más cercanas a los ingresos, éramos casi invisibles. Los modelos respondieron con seguridad y no recurrieron a nosotros. ChatGPT fue de forma consistente el canal más débil para la marca, sin un solo acierto en todo el conjunto probado. Perplexity salió como el más fuerte.

Y aquí estuvimos a punto de cometer el error exacto del que trata este informe. La primera versión de este párrafo explicaba la ventaja de Perplexity diciendo que Perplexity se apoya con fuerza en la búsqueda web en vivo. La explicación es elegante, encaja con todo lo que se sabe del producto, y aquí no se sostiene: en esa ejecución ningún modelo tenía búsqueda en vivo. Fuera lo que fuera lo que dio la ventaja a Perplexity, no fue la búsqueda en vivo. No sabemos qué fue. Adivinar habría convertido una salvedad metodológica que teníamos por escrito en una frase con aire de conclusión, y habría sido el mismo gesto que el cero de mayo, solo que mejor vestido.

Los competidores que sí aparecieron eran en su mayoría agencias generales de SEO y SEM que se promocionan como proveedoras de “AI SEO”, no especialistas en WooCommerce. La brecha, dicho de otro modo, es de autoridad y asociación, no de calidad de la página.

#Qué suman las tres instantáneas

Leídas en conjunto, el trimestre dice tres cosas con claridad.

Primero, el método es parte de la cifra. Las tres ejecuciones abarcan unas nueve semanas y media, del 6 de abril al 11 de junio, y el sitio no se quedó quieto entre medias: en esa ventana publicamos nuevas guías de decisión en seis idiomas, apuntadas justo a la brecha que la medición había destapado. No podemos, por tanto, decir lo que nos gustaría decir, esto es, que fue el método el que movió la cifra y no la realidad. Nos falta el control para eso, porque la realidad también se movía. Podemos decir algo más débil y más firme: estos tres métodos divergen tanto que ninguna de esas cifras es interpretable sin el método que la produjo. Si una herramienta te da una tasa de citas de IA sin decirte si leyó la API o el producto, y si el modelo tenía la búsqueda en vivo activada, desconfía de ella.

La medición de primera mano es el objetivo de todo este ejercicio, y es la misma disciplina que aplicamos al trabajo de cliente: una cifra que no puedes reproducir no es prueba. Aprendimos la misma lección por las malas con un experimento de marca sintética, donde un modelo describió con seguridad una empresa que no existía. Medir una marca real tiene el modo de fallo opuesto, reportar con seguridad cero cuando la verdad es desconocida, y nuestro script de mayo hizo justo eso al pie de la letra. Ambos remiten al mismo deber: revisar el instrumento antes de fiarse de la lectura, también, y sobre todo, cuando el instrumento lo has escrito tú.

Segundo, las consultas de identidad son ganables y las transaccionales no, al menos no en la propia página. Mantenemos la consulta de posicionamiento acotada porque es específica y está poco disputada. Perdemos las consultas comerciales porque los modelos se apoyan en directorios y agencias generalistas, y ninguna cantidad de HTML más limpio cambia con quién asocia ya un modelo a un “desarrollador WooCommerce”. Eso es un problema de autoridad fuera de la página.

Tercero, el canal importa, incluso cuando todavía no sabes decir por qué. La misma marca salió como la más fuerte en Perplexity y no apareció en ChatGPT ni una vez, en la misma ejecución, sobre el mismo conjunto de consultas y con los mismos ajustes. Explicación para eso no tenemos. Lo que sí tenemos es el desglose por modelo que muestra la diferencia, y eso basta para saber dónde mirar después. Una única “puntuación de visibilidad en IA” mezclada esconde justo la información que necesitas, y encima regala la sensación falsa de haber entendido algo.

#Qué cambiamos

No reescribimos páginas como reacción a una cifra de proxy, porque eso sería optimizar para un instrumento en lugar de para un cliente. En su lugar, la medición cambió dónde invertimos el esfuerzo.

  • Fijamos el conjunto de consultas y la cadencia: una lista estable de consultas de identidad, informativas y transaccionales, registrada mensualmente, con el motor, la fecha y la firma de quien rellenó la fila. La línea Owner dejó de ser adorno.
  • Etiquetamos cada cifra con su instrumento y sus ajustes, incluido si el modelo tenía búsqueda en vivo, y no ponemos juntas cifras de dos instrumentos distintos.
  • Mayo se queda en la serie marcado como falta de datos, no como cero. El script de conteo sigue metiendo filas vacías en el denominador de la tasa de citas y, hasta que lo arreglemos, ningún cero salido de ese pipeline entra en un informe sin que alguien compruebe cuántas filas se rellenaron de verdad.
  • Movimos el trabajo de visibilidad transaccional fuera de la página, porque la brecha ahí es asociación y autoridad, no contenido en la propia página, y eso está documentado en nuestro enfoque de GEO y LLMO en lugar de en otra reescritura.
  • Seguimos sirviendo todo en HTML renderizado en el servidor, que es la condición previa para ser citables siquiera, y el tema de nuestra nota sobre por qué los asistentes occidentales leen HTML en bruto.

#Cómo hacerlo tú mismo

No necesitas nuestro presupuesto para empezar. La configuración honesta mínima es una lista fija de diez a veinte consultas que harían clientes reales, ejecutada una vez al mes, con tres columnas registradas cada vez: el motor, la fecha y si tu marca fue nombrada o tu URL enlazada. Añade una cuarta columna para qué otros dominios fueron citados, porque eso te dice contra quién compites de verdad en la respuesta, y rara vez es quien sospechas. Añade una quinta para quién rellenó la fila. Suena a burocracia exactamente hasta que ves un informe generado a partir de una hoja que nadie tocó.

Si usas una herramienta automatizada, hazle dos preguntas antes de fiarte de un solo gráfico: ¿estás leyendo la API o el producto, y tenía el modelo la búsqueda en vivo activada? Si no puede responder, trata el resultado solo como orientativo, igual que nuestras tres ejecuciones. Y si la herramienta es tuya, comprueba una cosa más: qué hace con una fila vacía. Nunca dejes que convierta la falta de datos en un cero confiado.

#Diseñar un panel que no premie el autoengaño

Antes de lanzar consultas, definimos qué cuenta como éxito. Distinguimos entre aparición del nombre, uso del dominio como fuente, enlace visible y recomendación explícita. Son señales relacionadas, pero no intercambiables. Una marca puede aparecer en una respuesta crítica, una URL puede figurar entre varias fuentes sin sostener la afirmación principal y una recomendación puede no incluir enlace. Guardar estas señales por separado evita que una cifra agregada convierta cualquier presencia en una victoria.

El panel también necesita denominadores claros. Si un producto no pudo acceder a la web o no mostró fuentes, el resultado no entra como ausencia confirmada. Se marca como indeterminado y se conserva para evaluar la fiabilidad del instrumento. Publicamos tanto el número de consultas válidas como el total intentado. De ese modo, una mejora aparente no puede proceder simplemente de descartar las ejecuciones incómodas o de mezclar veinte pruebas observables con otras veinte que no lo eran.

La clasificación de la consulta se decide de antemano: identidad, descubrimiento de problema, evaluación, comparación o contratación. Conservamos la redacción exacta durante el trimestre y evitamos añadir la marca cuando queremos medir descubrimiento sin ayuda. También anotamos idioma, mercado, fecha, producto, modalidad de acceso y estado de sesión. Estos detalles parecen burocráticos hasta que dos personas ejecutan la misma pregunta desde contextos distintos y obtienen fuentes diferentes.

#Del dato a una prioridad de negocio

No todas las citas tienen el mismo valor potencial. Una mención en una pregunta general sobre WordPress puede ampliar reconocimiento, mientras que aparecer en una comparación de proveedores puede influir en una lista corta. Por eso no perseguimos una tasa única. Revisamos cobertura por etapa de compra, mensaje asociado y página citada. Si la IA nos relaciona con un tema que no ofrecemos o lleva al usuario a una página sin siguiente paso, la cifra puede ser alta y el resultado comercial seguir siendo pobre.

La lectura práctica combina cuatro preguntas. ¿Aparecemos donde existe intención relevante? ¿La descripción de la empresa es correcta? ¿La fuente elegida demuestra capacidad? ¿La página permite avanzar sin fricción? La acción cambia según la respuesta. Un problema de identidad requiere coherencia entre el sitio y referencias externas. Una ausencia en comparaciones puede revelar falta de casos verificables o de cobertura independiente. Una cita correcta que no convierte exige revisar la propuesta, no fabricar más texto para el buscador.

La atribución también debe ser prudente. El usuario puede conocer una marca en un asistente, buscarla después en Google y contactar desde tráfico directo. Para acercarnos a la realidad, combinamos referencias visibles, evolución de búsquedas de marca, páginas de entrada y una pregunta breve en el formulario sobre el origen del contacto. Ninguna señal aislada demuestra que la IA generó el proyecto. Juntas permiten priorizar trabajo sin presentar correlación como causalidad.

#Controles de calidad para cada ronda

Una segunda persona debería revisar una muestra de respuestas sin ver la puntuación inicial. Su tarea es confirmar que la marca corresponde a la entidad correcta, que el enlace pertenece al dominio esperado y que la fuente realmente respalda el fragmento relevante. Los casos dudosos se documentan, no se fuerzan a positivo o negativo. También conservamos pruebas de la respuesta completa, porque los enlaces y resúmenes pueden cambiar después y dejar una hoja de cálculo imposible de auditar.

Cuando actualizamos contenido, no modificamos simultáneamente todas las variables si queremos aprender algo. Registramos qué páginas cambiaron, qué prueba nueva se añadió y cuándo pudo ser rastreada. Después observamos varias rondas antes de sacar conclusiones. La volatilidad entre ejecuciones hace que una sola mejora sea una pista, no una prueba. Este control es menos vistoso que un gráfico ascendente, pero protege decisiones de presupuesto.

#Lo que este estudio no puede demostrar

La muestra es pequeña, se limita a nuestro dominio y no representa a todas las empresas de WordPress ni a todos los mercados lingüísticos. Los productos cambian sus mecanismos de búsqueda, la disponibilidad de fuentes varía y no controlamos personalización, experimentos internos ni actualizaciones del índice. Además, junio usa un instrumento distinto del de abril, y mayo no entra en ninguna serie porque el panel se quedó sin rellenar. Ninguna de las tres ejecuciones leyó el producto de consumo, y entre la primera y la última pasaron unas nueve semanas y media en las que publicamos contenido nuevo. La diferencia ilustra el riesgo metodológico, pero no demuestra una subida mensual de rendimiento ni permite atribuir el movimiento al método en lugar de a la realidad.

Tampoco podemos observar la razón interna por la que un modelo seleccionó una fuente. Podemos contrastar páginas, autoridad externa y asociaciones temáticas, pero no asignar una causa cierta a cada cita. Por eso no prometemos que añadir FAQ, schema o una cantidad concreta de palabras produzca presencia. Esos recursos solo ayudan cuando expresan información real, accesible y respaldada. La medición sirve para encontrar brechas y comprobar tendencias bajo condiciones declaradas, no para garantizar posiciones.

#Un briefing escrito para convertir la medición en trabajo útil

Si quieres que revisemos tu visibilidad, envía por escrito el dominio, países e idiomas prioritarios, servicios con valor comercial, competidores que aparecen en ventas y las preguntas que escuchas antes de una contratación. Añade los asistentes que te interesa observar y cualquier migración, publicación o campaña reciente que pueda afectar la línea base. No hacen falta cientos de prompts: necesitamos un conjunto pequeño que represente decisiones reales.

Con ese briefing podemos separar reconocimiento de demanda, proponer una cadencia reproducible y señalar qué páginas o pruebas merecen intervención primero. También indicaremos qué no puede concluirse con los datos disponibles. El entregable útil no es una puntuación decorativa, sino una lista priorizada de consultas, fuentes competidoras, páginas de destino y acciones que puedan comprobarse en la siguiente ronda.

#La conclusión honesta

Un trimestre midiendo nuestras propias citas de IA produjo una cifra incómoda, nuestra tasa de cita transaccional es baja, y un hábito genuinamente valioso, nunca citar una cifra de visibilidad en IA sin el método que la produjo. Mayo no nos mostró en absoluto, solo lo parecía. Junio destapó una posición de identidad defendible que abril no alcanzaba a ver, y lo hizo midiendo algo distinto de lo que creíamos entonces. Las tres lecturas solo se volvieron útiles cuando anotamos cómo se tomó cada una. Antes de eso, una de ellas era simplemente un cero en un fichero. Este es el informe uno. Publicaremos la próxima instantánea al final del trimestre, sobre el mismo conjunto de consultas, para que la serie pueda compararse en lugar de admirarse. Si quieres que la IA te cite, empieza por medirlo con honestidad, e intégralo en el flujo de trabajo que describimos para GEO y LLMO.

Siguiente paso

Transforma el artículo en una implementación real

Este bloque refuerza el enlazado interno y lleva al lector al siguiente paso más útil dentro de la arquitectura del sitio.

¿Quieres implementar esto en tu sitio?

Si la visibilidad en Google y en sistemas de IA importa, puedo estructurar contenido, FAQ, schema y enlazado interno para SEO, GEO y AEO.

Cluster relacionado

Explora otros servicios WordPress y base de conocimiento

Refuerza tu negocio con soporte técnico profesional en áreas clave del ecosistema WordPress.

¿Qué es una tasa de citas de IA y por qué medirla?#
Es la frecuencia con la que un asistente de IA nombra tu marca, o enlaza tu URL, cuando responde a una pregunta relevante. Importa porque las respuestas de IA se sitúan cada vez más entre quien busca y tu sitio. Si el asistente cita un directorio en lugar de a ti, pierdes la visita antes incluso de que el SEO clásico entre en juego. No puedes mejorar lo que no mides, así que el primer paso es una línea base.
¿Por qué las tres ejecuciones dieron cifras tan distintas?#
Porque fueron tres instrumentos distintos y ninguno leyó el producto que usa un cliente. La ejecución de abril pasó por la API de un modelo, y su propia nota cifra el solapamiento de fuentes con la interfaz web en un pequeño porcentaje. El panel de mayo era una hoja que nadie rellenó, así que aquel cero nunca fue una medición. La ejecución de junio consultó a seis modelos por la API REST de un proveedor, con la búsqueda en vivo desactivada, y midió memoria de entrenamiento. Son tres preguntas distintas, no tres lecturas de la misma magnitud.
¿Qué mostró realmente la ejecución de junio?#
Una división, aunque más estrecha de lo que supusimos al principio. Para la consulta de identidad acotada sobre un estudio polaco que atiende a clientes WordPress extranjeros, quedamos primeros en cinco de seis modelos. Con la búsqueda en vivo desactivada, eso significa que la asociación está en los propios modelos. Para las consultas transaccionales sobre WooCommerce, donde está el dinero, éramos casi invisibles. ChatGPT fue el canal más débil para nosotros y Perplexity el más fuerte, pero no sabemos por qué, porque ningún modelo de esa ejecución tenía búsqueda en vivo.
¿Con qué frecuencia debo medir las citas de IA?#
Mensualmente basta para un sitio pequeño, porque el comportamiento de los modelos y tu propio contenido se mueven ambos despacio respecto al ruido de la medición. Elige un conjunto fijo de consultas, registra el motor, la fecha y los ajustes en cada cifra y nunca pongas juntas cifras de dos instrumentos distintos. Anota también quién rellenó la fila, o no distinguirás la ausencia de cita de la ausencia de medición. Publicamos una instantánea trimestral para que la serie se mantenga honesta y comparable.
¿Vale la pena perseguir una tasa de citas de IA alta en todas las consultas?#
No. Las consultas de identidad e informativas son más fáciles de ganar y conviene mantenerlas, pero las consultas transaccionales son donde competidores y directorios luchan con más fuerza, y donde el trabajo en la propia página rara vez mueve la aguja. Para esas, la autoridad fuera de la página importa más. Mide primero, y luego invierte donde la brecha es real, no donde la cifra es fácil de mejorar.

¿Necesitas un FAQ adaptado a tu sector y mercado? Preparamos una versión alineada con tus objetivos de negocio.

Hablemos

Artículos Relacionados

Por qué Perplexity cita tu marca y ChatGPT no

Nuestra propia referencia de Geoboard mostró a Perplexity como el motor más fuerte y a ChatGPT con presencia cero en ocho prompts monitorizados en la misma ejecución. Aquí está el mecanismo detrás de esa división, y qué significa para compras, evaluadores y agencias que reportan visibilidad en IA a sus clientes.

Monitorización de citas IA: qué rastrear y con qué frecuencia

La mayoría de los dashboards de visibilidad IA venden un solo número. Mostramos las familias de consultas, las métricas que realmente predicen ingresos, el stack de monitorización que ejecutamos en nuestro propio sitio y la tabla de cadencia que los equipos de procurement deben exigir a cualquier proveedor GEO.