A maioria das ferramentas de visibilidade IA vende um único score. Não o comprem. Um número que mistura o quão bem se posicionam num prompt de identidade com marca com o quão invisíveis são num prompt de compra transacional não é uma métrica - é uma média que esconde a lacuna que estão a pagar para fechar. A nossa própria baseline Geoboard, datada de 2026-06-11, colocou wppoland.com em primeiro em cinco de seis modelos no prompt estreito de identidade «Polish agency for foreign WordPress clients» e mostrou zero de presença nas famílias transacionais WooCommerce e de implementação IA na mesma corrida. Um score teria reportado isso como «forte visibilidade IA». A divisão diz a verdade: o mecanismo que produz uma lacuna não é o mecanismo que produz a outra, e precisam de correcções diferentes. Este guia é a camada de monitorização desse programa: que famílias de consultas acompanhar, que métricas realmente preveem receita, a stack que corremos no nosso próprio site, e uma tabela de cadência que podem entregar a um fornecedor ou a um responsável de procurement.
O material em bruto em que este guia se apoia já o publicámos: o lançamento de acompanhamento de 90 dias que definiu a baseline, e o ciclo de medição Q2 2026 que mostrou quanto o próprio instrumento de medição pode mover o número reportado. Este artigo transforma ambos num manual operativo: o que acompanhar, com que frequência, e o que exigir de quem vos vende um relatório de «visibilidade IA».
Porque um único score de visibilidade IA falha o procurement
Um score composto existe para um slide parecer limpo, não para uma decisão ser defensável. Comprime pelo menos quatro sinais diferentes - reconhecimento de identidade, presença em consultas informativas, taxa de citação transacional e share of voice da concorrência - num único número, e a média através deles destrói exactamente a informação de que um comprador precisa.
Aqui está o problema mecânico. O nosso resultado de prompt de identidade (primeiro em cinco de seis modelos) e o nosso resultado transacional (zero de presença) sentam-se na mesma corrida de baseline Geoboard, na mesma data, para o mesmo domínio. Façam a média e obtêm um score médio que parece «espaço para melhorar». Reportem-nos como divisão e obtêm a história exacta: uma posição defensável que custa pouco a manter, ao lado de uma lacuna real que custa trabalho off-page real a fechar. Um fornecedor que vos entrega um único número ou não separou as famílias de consultas ou não quer que vejam a divisão.
No contexto português de procurement, o mesmo erro aparece quando agências colocam um «score de visibilidade IA» ao lado de exports de SEMrush ou Ahrefs e o tratam como mais um KPI na tabela do concurso. O procurement deve tratar um único score de visibilidade IA como trataria um único «SEO score» de uma extensão de browser: um artefacto de marketing, não um input de auditoria. Peçam a tabela em vez do número, sempre.
Famílias de consultas a monitorizar
Separem prompts por intenção antes de contarem qualquer coisa. Quatro famílias cobrem a maior parte do comportamento de compra B2B em torno de WordPress e WooCommerce, e cada uma responde a uma pergunta de negócio diferente.
Prompts de identidade e posicionamento são perguntas estreitas, com marca, que um comprador faz quando já sabe que podem estar no âmbito: «Polish agency for foreign WordPress clients», posicionamento nearshore a partir da Polónia, entrega em fuso horário da UE. Esta família mede se os modelos resolvem quem são. Ganhar aqui é necessário e, sozinho, vale muito pouco para um pipeline de vendas.
Prompts informativos e de practitioner espelham como um avaliador técnico pesquisa antes de existir um RFP: trade-offs de WordPress headless, abordagens de integração WooCommerce com ERP, Core Web Vitals em catálogos grandes. As respostas IA substituem cada vez mais os primeiros resultados de pesquisa que um practitioner teria aberto, por isso a ausência aqui significa que não estão na conversa de shortlist mesmo quando o prompt de identidade está em primeiro. Em lojas portuguesas vemos isto em consultas sobre Multibanco, MB Way, PHC ou Primavera ERP - os modelos citam frequentemente blogs SEO genéricos, não os especialistas Woo que realmente constroem essas pontes.
Prompts transacionais WooCommerce são onde os orçamentos realmente sentam: contratar um developer WooCommerce, parceiro de integração WooCommerce e ERP, corrigir checkout lento numa loja grande, agência para Woo mais automação IA. A nossa própria baseline mostrou zero de presença aqui.
Prompts de implementação IA correm em paralelo ao WooCommerce: integração IA com WordPress, feeds de produto prontos para agentes, governance de plugins IA, exposição MCP para dados da loja. O mesmo resultado de baseline, zero em 2026-06-11, e cada vez mais empacotados em pacotes de procurement enterprise que emparelham trabalho de plataforma com «AI readiness».
| Família de consultas | O que testa | O nosso sinal de baseline (2026-06-11) | O que exigir do relatório do fornecedor |
|---|---|---|---|
| Identidade / posicionamento | Resolução de entidade para o vosso nicho | #1 em 5/6 modelos no prompt âncora | Confirmem a formulação exacta do prompt, não uma paráfrase |
| Informativa / practitioner | Shortlist técnica antes de um RFP | Misto, não a métrica de cabeçalho | Perguntem que perguntas de practitioner foram testadas |
| Transacional (ex. WooCommerce) | Intenção de contratação próxima da receita | Zero de presença | Peçam domínios de concorrentes citados em vez de vós |
| Implementação IA | Procurement de agentes e automação | Zero de presença | Perguntem se esta família foi testada de todo |
Se um relatório não separa estas quatro linhas, não é um relatório de monitorização - é um resumo desenhado para ser acreditado em vez de auditado.
Métricas que importam
Quando as famílias de consultas estão separadas, quatro métricas carregam o sinal real. Tudo o resto é um agregado de vaidade vestido de dados.
Menção da marca. O assistente nomeou a vossa marca em algum lado da resposta, independentemente de link. Este é o sinal mais frouxo e o mais fácil de atingir, por isso tratem uma taxa de menções a subir sozinha como evidência fraca.
Citação de URL. O assistente ligou à vossa página específica. Isto está mais perto de um referral real e muito mais difícil de ganhar do que uma menção nua, especialmente em famílias transacionais onde os modelos tendem a citar directórios em vez de especialistas.
Domínios de concorrentes citados. Que outros domínios apareceram em vez de vós, registados por nome, não resumidos como «concorrentes». Nas nossas próprias verificações transacionais, os domínios que surgiram foram lojas SEO ou SEM gerais a anunciar «AI SEO», não especialistas WooCommerce - isso é em si um achado: a lacuna é associação e autoridade, não qualidade de conteúdo. No mercado português vemos frequentemente directórios de agências e landing pages genéricas de «visibilidade IA» sem profundidade Woo ou ERP.
Share of voice. A vossa contagem de citações dividida pelo total de citações no conjunto de prompts acompanhado, calculada por família de consultas, por motor. Esta é a única das quatro que se comporta como um KPI real ao longo do tempo, porque é relativa e comparável entre reexecuções, desde que a lista de prompts se mantenha fixa.
O que está deliberadamente ausente: uma única «percentagem de visibilidade IA», um «score AI SEO» de 0 a 100, ou qualquer métrica que não possa ser rastreada até um prompt, motor e data específicos. Se um dashboard não consegue mostrar o prompt por trás de um número, o número não é evidência.
A stack de monitorização que realmente usamos
Corremos quatro camadas no nosso próprio site, e cada uma cobre um modo de falha que as outras falham.
Reexecuções batch Geoboard dão cobertura multi-modelo repetível contra um conjunto de prompts declarado. A nossa baseline congelada de 2026-06-11 produziu a divisão identidade-versus-transacional descrita acima, juntamente com o skew de motores entre ChatGPT e Perplexity. Ferramentas batch são a camada certa para comparação de tendência, não para monitorização diária, porque o polling multi-modelo diário mede sobretudo ruído de interface.
Verificações manuais semanais em interfaces de consumidor - ChatGPT, Perplexity, Copilot e Claude onde aplicável - captam mudanças de produto depressa. Registamos quatro campos de cada vez: data, motor, família de prompt e resultado (menção da marca, URL citado, domínios de concorrentes ou nenhum). Esta camada é o sistema de aviso precoce quando um modelo adiciona ou remove browsing ao vivo. Em clientes portugueses com Microsoft 365, as mesmas verificações captam frequentemente deriva do Copilot mais cedo do que as corridas batch, porque a UI de consumidor e o contexto do tenant podem divergir.
Tracking estilo brand-radar para domínios de citação de concorrentes. Geoboard e verificações manuais dizem se apareceram. Esta camada diz quem apareceu em vez de vós - é o input que o plano de autoridade off-page realmente precisa. Saber que lojas SEO generalistas, não especialistas Woo, estão a ganhar a família transacional muda para onde o orçamento de remediação deve ir.
O portão de renderização. Nada do acima importa se os factos de suporte de carga não estiverem na resposta HTML em bruto desde o início. A experiência de Andre Alpar de junho de 2026, publicada via CitationOne, descobriu que seis de sete assistentes IA ocidentais lêem apenas HTML em bruto, não JavaScript executado. Antes de confiarem num resultado de zero citações como problema de conteúdo ou autoridade, confirmem que o conteúdo estava realmente visível para o fetch do assistente. Um zero causado por renderização do lado do cliente é uma correcção completamente diferente de um zero causado por corroboração off-page em falta. Sob a CNPD e requisitos de cookies, vale também verificar se banners de consentimento escondem factos críticos atrás de JS do cliente - um padrão que vemos em temas de loja PT mais vezes do que em setups puramente server-rendered.
Cadência: com que frequência correr cada camada
A cadência é onde a maioria dos programas de monitorização ou queima orçamento em ruído ou perde deriva real. Três intervalos, mapeados para aquilo em que cada um é bom:
| Cadência | O que corre | Porque este intervalo |
|---|---|---|
| Semanal | Verificações manuais, lista fixa de prompts, UIs de consumidor | Captura mudanças de modelo ou UI depressa; barato o suficiente para sustentar indefinidamente |
| A cada 6-8 semanas | Reexecução batch multi-modelo estilo Geoboard | Longo o suficiente para mudanças off-page e on-page terem sido crawled e associadas; curto o suficiente para captar regressões antes do fecho do trimestre |
| Trimestral | Leitura ao nível do programa para stakeholders, ligada a orçamento ou revisão de fornecedor | Alinha com ciclos de reporting de procurement e marketing; evita overclaim de tendência a partir de ruído |
O polling diário ou mesmo a cada poucos dias através de muitos modelos mede sobretudo variância de interface, não mudança real em como os modelos associam a vossa marca a uma consulta. Aprendemos isto directamente: o nosso ciclo de medição Q2 2026 mostrou que um snapshot de proxy e um snapshot de UI de consumidor discordavam o suficiente nas mesmas semanas para que o instrumento, não a realidade subjacente, explicasse a maior parte da diferença. A disciplina de cadência existe para impedir que esse tipo de ruído seja confundido com uma tendência. Nas equipas de procurement portuguesas, a leitura trimestral costuma encaixar nos mesmos ciclos de revisão de fornecedores IT e aprovações de orçamento após o ano fiscal - não nos stand-ups semanais de SEO.
Perplexity versus ChatGPT: porque a divisão de motores é obrigatória
Tratar «visibilidade IA» como um único número através de motores esconde um modo de falha concreto e mensurável. Na nossa própria corrida de baseline, o ChatGPT mostrou zero de presença em oito prompts acompanhados no corte blind-spot do conjunto de consultas, enquanto o Perplexity foi o motor mais forte na mesma corrida. Não é coincidência de uma semana má. O Perplexity fundamenta-se fortemente em pesquisa web ao vivo, por isso tende a fazer surface de matches mais frescos e mais estreitos. O comportamento default do ChatGPT no mesmo período inclinava-se de forma diferente, e a lacuna entre os dois foi grande o suficiente para mudar toda a leitura da saúde de citações da marca consoante o motor que acontecia estarem a verificar.
A consequência prática para o âmbito da monitorização: nunca reportem ChatGPT sozinho como «visibilidade IA», e nunca façam a média de resultados ChatGPT e Perplexity numa única figura. Um âmbito que para no ChatGPT vai sub-reportar uma marca que o Perplexity já cita, e um âmbito que para no Perplexity vai exagerar o quão visíveis são para a audiência que ainda faz default ao ChatGPT. Acompanhem ambos, reportem ambos, e se o orçamento força uma escolha entre adicionar um terceiro motor ou corrigir esta divisão, corrijam a divisão primeiro. A decomposição informativa completa de porque a divisão acontece está em porque o Perplexity cita a vossa marca e o ChatGPT não.
Checklist de procurement: o que exigir dos fornecedores
Antes de assinarem qualquer fornecedor de monitorização de visibilidade IA ou GEO, exijam respostas a todos os pontos seguintes. Se um fornecedor não conseguir responder a um deles por escrito, tratem os números dele como material de marketing, não como medição.
- A lista exacta de prompts, não um rótulo de categoria como «consultas WooCommerce». A formulação muda resultados.
- Que motores foram testados, e se os resultados são reportados por motor ou misturados num único score.
- Se cada número veio de uma interface virada ao consumidor ou de um proxy API. O nosso próprio ciclo Q2 mostrou que estes discordam o suficiente para que misturar seja enganador por defeito.
- A data em que cada figura foi produzida. Um snapshot de citações de há três meses não é um estado actual.
- Domínios de concorrentes citados no vosso lugar, não só a vossa própria presença ou ausência.
- Famílias de consultas reportadas em separado: identidade, informativa, transacional, e qualquer família de implementação ou específica de agentes relevante para o vosso negócio.
- Se a monitorização teve em conta a renderização. Se o vosso site ou o conjunto de concorrentes usa renderização pesada do lado do cliente, perguntem se o método do fornecedor consegue sequer detectar conteúdo atrás de JavaScript.
O que on-page versus off-page corrige em cada tipo de lacuna
A monitorização diz-vos qual família está partida. Não corrige nada sozinha, e a correcção depende do tipo de lacuna que estão a ver.
Lacunas de identidade e informação respondem normalmente a trabalho on-page: HTML renderizado no servidor com factos de suporte de carga presentes na resposta em bruto, dados estruturados, blocos de conteúdo densos em factos, e sinais claros de entidade que resolvem quem são e o que fazem. Este é o piso, e é table stakes precisamente porque a maioria dos assistentes IA ocidentais só lê HTML em bruto em vez de executar JavaScript do lado do cliente. Se os vossos factos-chave carregam atrás de um script, nenhum polimento on-page corrige a lacuna, porque o assistente nunca viu o conteúdo para começar.
Lacunas transacionais e de implementação IA raramente fecham com mais um bloco FAQ ou uma landing page reescrita. Os modelos citam o que a web aberta corrobora: respostas técnicas independentes, listagens verificáveis em directórios, menções de terceiros e sinais off-page que reforçam a entidade para além do vosso próprio domínio. O nosso zero de baseline em prompts WooCommerce e de implementação IA persistiu apesar de conteúdo on-page já maduro - isso é em si o diagnóstico: quando a qualidade on-page não é o gargalo, a correcção tem de sair off-page. Em lojas Woo portuguesas isso significa muitas vezes visibilidade em comparações independentes de integradores ERP e case studies de parceiros, não mais um H2 na própria página de serviços.
O playbook de visibilidade AI e LLM ordena estas alavancas da forma como as implementamos em programas de clientes: primeiro on-page como piso, depois off-page como a alavanca que realmente move taxas de citação transacional.
Nota de fecho
A monitorização não é a linha de chegada - é o instrumento que diz onde gastar. Um único score de visibilidade IA vai sempre lisonjear a vossa vitória mais fácil e esconder a lacuna mais cara, que é exactamente o contrário do que o procurement precisa. Separem por família de consultas, acompanhem menção da marca, citação de URL, domínios de concorrentes e share of voice em vez de um agregado misturado, corram verificações semanais e reexecuções batch a cada seis a oito semanas, e nunca citem um número sem declarar o motor, a data e se veio de uma interface de consumidor ou de um proxy API. Uma checklist de implementação específica para WordPress está em prontidão WordPress para pesquisa IA (GEO/AEO). Se quiserem esta instrumentação construída e operada contra a vossa própria propriedade, ligada às correcções on-page e off-page que cada tipo de lacuna realmente precisa - esse é o programa que o nosso serviço de otimização GEO e LLMO entrega.




