
Código de IA compila. Mas é seguro?
Por Redação News Responsivo · Studio Responsivo
· 4 min de leitura
Na maioria das vezes, não dá para saber sem checar. O relatório de julho de 2026 da Veracode mostra que o código gerado por IA compila em quase 100% dos casos, mas passa nos testes de segurança só 56% das vezes, número praticamente parado há um ano. Código de IA precisa ser revisado e escaneado como qualquer código que ninguém revisou.
- 56%
- do código gerado por IA passa nos testes de segurança
- ~100%
- do código gerado compila sem erro de sintaxe
- 100+
- modelos de IA avaliados desde o início do programa
Os modelos de IA que escrevem código ficam melhores a cada poucos meses. Escrevem mais rápido, erram menos a sintaxe e resolvem problemas maiores. Mas uma pergunta continua sem a resposta que todo mundo queria: esse código é seguro?
Em 28 de julho de 2026, a Veracode, empresa americana de segurança de aplicações, divulgou o relatório GenAI Code Security de 2026. A resposta curta: em pouco mais da metade das vezes.
O que a Veracode mediu
A empresa acompanha mais de 100 modelos de IA, em quatro rodadas de testes desde o início do programa. O ranking do meio de 2026 tem 11 modelos. Os resultados principais:
- O código gerado compila em aproximadamente 100% dos casos.
- A taxa média de aprovação nos testes de segurança é de 56%.
- Sem pedir segurança de forma explícita no prompt, a falha chega perto de 44%.
- O número está “praticamente inalterado desde o relatório do ano passado”.
Em outras palavras: o código roda quase sempre e é seguro pouco mais da metade das vezes. E essa metade não está melhorando.

Modelo maior não resolve
O relatório derruba algumas intuições comuns.
- O melhor modelo do ranking, o GPT-5.5 da OpenAI, passou em 68% dos testes. O pior, o Qwen3.7-max da Alibaba, em 50%.
- Seis dos 11 modelos ficaram entre 50% e 53%.
- Modelos especializados em código tiraram 51%. Modelos de uso geral, 52%.
- Modelos grandes, com mais de 100 bilhões de parâmetros, tiraram 53%. Médios e pequenos, 51%.
- Modelos com raciocínio foram melhor: 56% contra 51%.
A linguagem também pesa. Código em Python passou em 63% dos testes. Em Java, só 30%, embora seja a única linguagem com melhora consistente no último ano.
Chris Wysopal, cofundador da Veracode, resume o problema: os modelos podem ser “quase perfeitos na sintaxe”, mas ainda falham em quase metade das tarefas.
Por que isso importa para quem está lançando
O founder que monta um produto com IA vê o app abrir, o botão funcionar e o cadastro salvar. Tudo compila. É natural concluir que está pronto.
O relatório mostra por que essa conclusão é perigosa. Compilar é o teste mais fácil. Segurança é invisível até o dia em que alguém explora a falha. E quando isso acontece com um produto que guarda dados de clientes, o prejuízo não é só técnico. É de confiança, e às vezes jurídico.
[Muitos dos resgates que chegam ao Studio começam assim: o produto funciona, mas ninguém sabe dizer se ele é seguro.] [Exemplo de caso de resgate com problema de segurança, para o Leonel completar ou remover.]
Por que o número não sai do lugar
O dado mais incômodo do relatório não é o 56%. É a estagnação. Em um ano, os modelos ficaram mais rápidos, mais baratos e melhores em resolver tarefas longas. A taxa de segurança ficou parada.
Uma leitura possível é que os modelos aprendem com o código que já existe na internet, e muito desse código tem as mesmas falhas. Outra é que segurança depende de contexto: quem é o usuário, que dado ele pode ver, o que acontece se alguém mal-intencionado mandar uma entrada estranha. A IA escreve o que você pede. Se você não pede segurança, nem descreve esse contexto, ela não tem como adivinhar.
Para o founder, a consequência prática é simples: esperar o próximo modelo resolver não é plano. A checagem precisa estar no processo.
O que checamos antes de colocar no ar
A recomendação de Wysopal é tratar código de IA “como qualquer código não revisado: escaneie, corrija e nunca publique às cegas”. No Studio, usamos Claude Code todos os dias. Por isso mesmo, [nada que a IA escreve vai para produção sem passar por estes pontos (confirmar a lista)]:
- Login e permissões. Quem pode ver o quê. Um usuário consegue acessar dados de outro trocando um número na URL?
- Entrada de dados. Todo campo que o usuário preenche é tratado antes de chegar ao banco ou à tela?
- Segredos. Chaves de API, senhas e tokens ficam fora do código e fora do navegador.
- Dependências. As bibliotecas que a IA escolheu estão atualizadas e sem falhas conhecidas?
- Prompt com segurança explícita. O próprio relatório mostra que, sem pedir segurança, a falha sobe. Pedimos sempre.
- Revisão humana. Alguém do time lê e responde pelo código que vai para produção. [Detalhar ferramentas de análise estática usadas no Studio, para o Leonel completar.]
Depois do lançamento, todo sistema sai com um agente de IA que roda todo dia, aponta falhas, sugere melhorias e confere se os dados fazem sentido. A checagem não termina no dia em que o produto vai ao ar.
O que isso muda para você
Se o seu produto foi feito com IA, por você, por um freelancer ou por outro estúdio, faça três perguntas:
- Alguém revisou o código além da própria IA?
- Alguém testou o que acontece quando um usuário tenta acessar o que não deveria?
- Onde estão guardadas as chaves e senhas do sistema?
Se a resposta para qualquer uma for “não sei”, o produto pode funcionar perfeitamente e ainda assim estar exposto.
Se você tem um produto feito com IA e quer saber o que está por baixo antes de crescer, o nosso serviço de resgate começa por esse diagnóstico.
Perguntas frequentes
Se meu app foi feito com IA e está funcionando, ele é inseguro?
Não necessariamente, mas funcionar não prova nada sobre segurança. Pelos dados da Veracode, quase metade das tarefas falha nos testes de segurança. Vale uma revisão antes de crescer a base de usuários.
Usar o modelo de IA mais caro resolve?
Ajuda pouco. O melhor modelo do ranking passou em 68% dos testes; seis de onze ficaram entre 50% e 53%. Nenhum dispensa revisão.
O que revisar primeiro num produto feito com IA?
Login e permissões, entrada de dados de usuário, segredos e chaves no código e dependências. São os pontos onde uma falha expõe dados de clientes.
Fontes
Serviço relacionado
Resgate de projeto
Projeto travado ou código sem dono? A gente coloca no ar
News Responsivo
Receba o próximo artigo no seu e-mail
Custo, prazo, IA e bastidores de quem coloca produto no ar. Sem spam.


