Skip to content
AI

Por que testamos modelos em benchmarks mas os lançamos em produção no achismo?

81

Oportunidade

As equipes escolhem um modelo de um leaderboard e o colocam em produção com quase nenhuma avaliação contínua, barata e específica para a tarefa. Quando a qualidade cai, ninguém percebe até um usuário reclamar. As ferramentas para realmente medir se o seu recurso de IA ainda está bom faltam para a maioria dos desenvolvedores.

Por que importa

Você não pode operar o que não consegue medir, e hoje a maioria dos recursos de IA não é medida.

Como avalio a oportunidade

A Pontuação de Oportunidade é minha própria leitura, não uma medição: o quanto dói, com que frequência aparece e o quanto pouco existe para resolvê-lo hoje. Quanto maior, mais vale a pena construir, na minha opinião.

Gravidade7/10

O quanto de dor causa quando aparece.

Frequência8/10

Com que frequência as pessoas realmente se deparam com isso.

Lacuna8/10

O quanto pouco de boas ferramentas existe para isso hoje.

Mais problemas que merecem ser resolvidos