
Auditoria de usabilidade por IA: 35% dos achados eram falsos
Por Redação News Responsivo · Studio Responsivo
· 4 min de leitura
Auditoria de usabilidade por IA ainda não substitui a revisão humana. Em outubro de 2026, a MeasuringU comparou ChatGPT e Gemini com um pesquisador experiente no mesmo vídeo de teste: os 6 problemas que só a IA apontou, 35% do total, eram alarmes falsos ou alucinações. A IA ajuda a acelerar, mas precisa de alguém experiente conferindo.
- 35%
- dos problemas apontados eram achados só da IA, e todos estavam errados
- 0%
- de problemas reais encontrados pela IA que o pesquisador tenha deixado passar
- 47%
- de concordância média entre ChatGPT e o pesquisador
Ferramentas que prometem auditar a usabilidade do seu site com IA se multiplicaram. Você cola um link ou sobe um vídeo e recebe, em minutos, uma lista de problemas com prioridade e sugestão de correção. Para um founder com pouco tempo e pouco orçamento, a oferta é tentadora.
A pergunta é se a lista está certa. Em 6 de outubro de 2026, Jim Lewis e Jeff Sauro, da MeasuringU, publicaram um teste direto: colocaram duas IAs e um pesquisador experiente para analisar a mesma sessão de teste de usabilidade. O resultado ajuda a entender o que a IA consegue, e o que ela ainda inventa.
Como foi o teste da MeasuringU
O material foi o vídeo de um teste de usabilidade no site da PetSmart. Nele, um participante tentou agendar um banho e tosa para o cachorro e não conseguiu.
Um pesquisador de UX montou a linha do tempo da sessão e a lista de problemas. Em paralelo, o ChatGPT-5.4 Thinking e o Gemini 3 Flash Thinking analisaram o mesmo vídeo, quatro vezes cada, com o mesmo pedido. Depois, os autores compararam as listas.

O que a IA acertou e o que ela inventou
Somando todas as listas, apareceram 17 problemas únicos. Os números:
- O pesquisador encontrou 11, ou 65% do total.
- O ChatGPT encontrou 8 dos 11 problemas do pesquisador, e ainda apontou 2 alarmes falsos e 1 alucinação. A concordância média com o pesquisador foi de 47%.
- O Gemini encontrou 5 dos 11, com 1 alarme falso e 2 alucinações. Concordância média de 39%.
- Entre as próprias rodadas de IA, a concordância média foi de 58%. Ou seja, a mesma IA, com o mesmo pedido, não dá sempre a mesma resposta.
- 6 problemas apareceram só nas listas das IAs. Eles somam 35% do total. E todos eram erros: metade alarmes falsos, metade alucinações.
O dado mais forte é este: a IA não encontrou nenhum problema real que o pesquisador tivesse deixado passar. Zero.
Os autores explicam por quê: “Usability problems aren’t like observing a visual defect in a product. They require judgment.” Problema de usabilidade não é um defeito visual. Exige julgamento.
O que é alarme falso e o que é alucinação
Vale separar os dois, porque os dois custam caro de jeitos diferentes.
- Alarme falso é apontar como problema algo que não atrapalhou o usuário. A tela pode até não ser perfeita, mas não foi ela que causou a falha.
- Alucinação é descrever algo que não aconteceu. Um clique que o participante não deu, uma mensagem que não apareceu.
No estudo, os dois somaram 35% de erro da IA, cerca de 18% cada. Os autores também registram que as alucinações voltaram neste vídeo, com três casos documentados, depois de não aparecerem num vídeo anterior da mesma série.
Por que um achado falso não é inofensivo
Pode parecer que uma lista com problemas a mais é só excesso de zelo. Não é. Cada item na lista vira uma tarefa para o time. Um problema que não existe consome horas de design e de desenvolvimento, e pode piorar algo que funcionava.
Pior: se a lista mistura problemas reais com inventados, sem marcação, você não sabe em qual confiar. Lewis e Sauro tiram a conclusão sem rodeio: “If an expert human is required in the loop for these analyses, the value added by AI is low.” Se um especialista precisa conferir tudo, o ganho trazido pela IA é baixo.
Auditoria por IA vs revisão humana: quando usar cada uma
Com base no estudo, dá para montar um critério prático:
- Use IA para organizar, não para decidir. Transcrever sessões, montar linha do tempo e agrupar observações são tarefas em que ela economiza tempo.
- Trate cada problema apontado como hipótese. Só vira tarefa depois que alguém confere no vídeo ou na tela.
- Desconfie de achados que só a IA viu. No estudo, todos eram errados.
- Rode mais de uma vez e compare. Se a mesma IA dá respostas diferentes, o que muda entre as rodadas é o que pede mais cuidado.
- Mantenha alguém experiente no fim da linha. É ele quem decide o que entra na fila de correção.
Nosso teste na mesma linha
O Studio está montando um comparativo parecido: auditoria por IA e revisão humana na mesma página. [Comparativo a publicar: página analisada, ferramentas usadas, número de problemas encontrados por cada lado e quantos se confirmaram. Leonel completar quando o teste estiver pronto.]
Até lá, vale a regra que o estudo sugere. Usamos IA no design e no build, com Claude Code e Figma, e [confirmar: quem decide o que é problema de usabilidade é uma pessoa da equipe, não a ferramenta]. [Como o Studio usa IA hoje em revisões de usabilidade de sites: Leonel completar.]
O que isso muda para você
Se alguém te entregar uma auditoria de usabilidade feita só por IA, leia como um rascunho. Pergunte quais problemas foram conferidos por uma pessoa e em que evidência cada um se apoia. Se não houver resposta, não reescreva sua página com base nela.
Um site que converte depende de decisões certas sobre o que mudar, e de não gastar tempo mudando o que já funciona. Se você precisa de um site revisado por quem sabe separar problema real de ruído, é esse o trabalho que o Studio faz em sites.
Perguntas frequentes
Então não vale usar IA para avaliar a usabilidade do meu site?
Vale como apoio, não como juiz. A IA pode ajudar a organizar observações e sugerir hipóteses, mas cada problema apontado precisa ser conferido por alguém que entenda de usabilidade.
O que é uma alucinação numa auditoria de usabilidade?
É quando a IA descreve algo que não aconteceu no vídeo ou na tela, como um clique ou uma mensagem de erro que nunca existiu. No estudo, foram 3 casos assim.
Quanto custa corrigir um problema que não existe?
O custo é o tempo do time redesenhando algo que funcionava, e o risco de piorar a experiência. Por isso um achado falso não é inofensivo.
Fontes
Serviço relacionado
Sites e landing pages
Páginas que convertem, publicadas em Framer
News Responsivo
Receba o próximo artigo no seu e-mail
Custo, prazo, IA e bastidores de quem coloca produto no ar. Sem spam.


