Como sei que o código que meu assistente de IA escreveu está realmente correto?
Oportunidade
LLMs produzem código que passa em testes unitários, mas não satisfaz nenhuma propriedade formal. Um modelo pode construir testes que passam por construção, não porque a lógica está correta. Ferramentas de verificação formal existem, mas exigem escrever especificações em sintaxe de provador de teoremas, o que quase nenhum desenvolvedor em atividade faz. Benchmarks recentes mostram que modelos de fronteira alcançam apenas 3,2 por cento de sucesso na geração de código verificável de ponta a ponta, o que significa que a lacuna entre código de aparência plausível e código comprovadamente correto está quase completamente em aberto. Equipes que colocam código escrito por IA em produção estão apostando em cobertura de testes que os próprios modelos conseguem manipular.
Por que importa
Garantias automatizadas de correção para código gerado por IA são o que transforma assistentes de programação de ferramentas de velocidade em ferramentas de confiabilidade.
Como avalio a oportunidade
A Pontuação de Oportunidade é minha própria leitura, não uma medição: o quanto dói, com que frequência aparece e o quanto pouco existe para resolvê-lo hoje. Quanto maior, mais vale a pena construir, na minha opinião.
O quanto de dor causa quando aparece.
Com que frequência as pessoas realmente se deparam com isso.
O quanto pouco de boas ferramentas existe para isso hoje.
Mais problemas que merecem ser resolvidos
Por que todo aplicativo de IA me esquece no momento em que fecho a aba?
AIPor que aprender uma nova área ainda depende de saber o que perguntar?
AIPor que uma pessoa sem especialização não consegue verificar o que uma IA acabou de dizer?
AIPor que testamos modelos em benchmarks mas os lançamos em produção no achismo?
AIPor que agentes de IA não têm memória dos próprios erros?
AIPor que não consigo auditar em que um modelo foi realmente treinado?