Duas pilhas de relatórios lado a lado, uma organizada e outra desalinhada

Auditoria de usabilidade por IA: 35% dos achados eram falsos

Por Redação News Responsivo · Studio Responsivo

· 4 min de leitura

Resposta curta

Auditoria de usabilidade por IA ainda não substitui a revisão humana. Em outubro de 2026, a MeasuringU comparou ChatGPT e Gemini com um pesquisador experiente no mesmo vídeo de teste: os 6 problemas que só a IA apontou, 35% do total, eram alarmes falsos ou alucinações. A IA ajuda a acelerar, mas precisa de alguém experiente conferindo.

35%
dos problemas apontados eram achados só da IA, e todos estavam errados
0%
de problemas reais encontrados pela IA que o pesquisador tenha deixado passar
47%
de concordância média entre ChatGPT e o pesquisador

Ferramentas que prometem auditar a usabilidade do seu site com IA se multiplicaram. Você cola um link ou sobe um vídeo e recebe, em minutos, uma lista de problemas com prioridade e sugestão de correção. Para um founder com pouco tempo e pouco orçamento, a oferta é tentadora.

A pergunta é se a lista está certa. Em 6 de outubro de 2026, Jim Lewis e Jeff Sauro, da MeasuringU, publicaram um teste direto: colocaram duas IAs e um pesquisador experiente para analisar a mesma sessão de teste de usabilidade. O resultado ajuda a entender o que a IA consegue, e o que ela ainda inventa.

Como foi o teste da MeasuringU

O material foi o vídeo de um teste de usabilidade no site da PetSmart. Nele, um participante tentou agendar um banho e tosa para o cachorro e não conseguiu.

Um pesquisador de UX montou a linha do tempo da sessão e a lista de problemas. Em paralelo, o ChatGPT-5.4 Thinking e o Gemini 3 Flash Thinking analisaram o mesmo vídeo, quatro vezes cada, com o mesmo pedido. Depois, os autores compararam as listas.

Lupa sobre telas de aplicativo impressas numa mesa escura
Auditoria por IA acelera a triagem; a validação continua humana.

O que a IA acertou e o que ela inventou

Somando todas as listas, apareceram 17 problemas únicos. Os números:

  • O pesquisador encontrou 11, ou 65% do total.
  • O ChatGPT encontrou 8 dos 11 problemas do pesquisador, e ainda apontou 2 alarmes falsos e 1 alucinação. A concordância média com o pesquisador foi de 47%.
  • O Gemini encontrou 5 dos 11, com 1 alarme falso e 2 alucinações. Concordância média de 39%.
  • Entre as próprias rodadas de IA, a concordância média foi de 58%. Ou seja, a mesma IA, com o mesmo pedido, não dá sempre a mesma resposta.
  • 6 problemas apareceram só nas listas das IAs. Eles somam 35% do total. E todos eram erros: metade alarmes falsos, metade alucinações.

O dado mais forte é este: a IA não encontrou nenhum problema real que o pesquisador tivesse deixado passar. Zero.

Os autores explicam por quê: “Usability problems aren’t like observing a visual defect in a product. They require judgment.” Problema de usabilidade não é um defeito visual. Exige julgamento.

O que é alarme falso e o que é alucinação

Vale separar os dois, porque os dois custam caro de jeitos diferentes.

  • Alarme falso é apontar como problema algo que não atrapalhou o usuário. A tela pode até não ser perfeita, mas não foi ela que causou a falha.
  • Alucinação é descrever algo que não aconteceu. Um clique que o participante não deu, uma mensagem que não apareceu.

No estudo, os dois somaram 35% de erro da IA, cerca de 18% cada. Os autores também registram que as alucinações voltaram neste vídeo, com três casos documentados, depois de não aparecerem num vídeo anterior da mesma série.

Por que um achado falso não é inofensivo

Pode parecer que uma lista com problemas a mais é só excesso de zelo. Não é. Cada item na lista vira uma tarefa para o time. Um problema que não existe consome horas de design e de desenvolvimento, e pode piorar algo que funcionava.

Pior: se a lista mistura problemas reais com inventados, sem marcação, você não sabe em qual confiar. Lewis e Sauro tiram a conclusão sem rodeio: “If an expert human is required in the loop for these analyses, the value added by AI is low.” Se um especialista precisa conferir tudo, o ganho trazido pela IA é baixo.

Auditoria por IA vs revisão humana: quando usar cada uma

Com base no estudo, dá para montar um critério prático:

  1. Use IA para organizar, não para decidir. Transcrever sessões, montar linha do tempo e agrupar observações são tarefas em que ela economiza tempo.
  2. Trate cada problema apontado como hipótese. Só vira tarefa depois que alguém confere no vídeo ou na tela.
  3. Desconfie de achados que só a IA viu. No estudo, todos eram errados.
  4. Rode mais de uma vez e compare. Se a mesma IA dá respostas diferentes, o que muda entre as rodadas é o que pede mais cuidado.
  5. Mantenha alguém experiente no fim da linha. É ele quem decide o que entra na fila de correção.

Nosso teste na mesma linha

O Studio está montando um comparativo parecido: auditoria por IA e revisão humana na mesma página. [Comparativo a publicar: página analisada, ferramentas usadas, número de problemas encontrados por cada lado e quantos se confirmaram. Leonel completar quando o teste estiver pronto.]

Até lá, vale a regra que o estudo sugere. Usamos IA no design e no build, com Claude Code e Figma, e [confirmar: quem decide o que é problema de usabilidade é uma pessoa da equipe, não a ferramenta]. [Como o Studio usa IA hoje em revisões de usabilidade de sites: Leonel completar.]

O que isso muda para você

Se alguém te entregar uma auditoria de usabilidade feita só por IA, leia como um rascunho. Pergunte quais problemas foram conferidos por uma pessoa e em que evidência cada um se apoia. Se não houver resposta, não reescreva sua página com base nela.

Um site que converte depende de decisões certas sobre o que mudar, e de não gastar tempo mudando o que já funciona. Se você precisa de um site revisado por quem sabe separar problema real de ruído, é esse o trabalho que o Studio faz em sites.

Perguntas frequentes

Então não vale usar IA para avaliar a usabilidade do meu site?

Vale como apoio, não como juiz. A IA pode ajudar a organizar observações e sugerir hipóteses, mas cada problema apontado precisa ser conferido por alguém que entenda de usabilidade.

O que é uma alucinação numa auditoria de usabilidade?

É quando a IA descreve algo que não aconteceu no vídeo ou na tela, como um clique ou uma mensagem de erro que nunca existiu. No estudo, foram 3 casos assim.

Quanto custa corrigir um problema que não existe?

O custo é o tempo do time redesenhando algo que funcionava, e o risco de piorar a experiência. Por isso um achado falso não é inofensivo.

Fontes

  1. Using AI To Find Usability Problems: Examining Task FailureMeasuringU · Jim Lewis e Jeff Sauro · 2026-10-06 · EN

Serviço relacionado

Sites e landing pages

Páginas que convertem, publicadas em Framer

Falar com o Studio

Redação News Responsivo

Dados de fontes públicas, com link para cada uma

News Responsivo

Receba o próximo artigo no seu e-mail

Custo, prazo, IA e bastidores de quem coloca produto no ar. Sem spam.

Newsletter

News Responsivo

Os artigos novos do Studio no seu e-mail: custo, prazo, IA e o que aprendemos colocando produto no ar. Sem spam. Cancele quando quiser.

Confira o e-mail.

Seus dados ficam só com o Studio. Privacidade