Skip to content
AI

Por que não posso confiar na pontuação de confiança de um modelo quando ela mais importa?

88

Oportunidade

Modelos de linguagem modernos rotineiramente produzem tokens de alta confiança em respostas erradas e tokens de baixa confiança em respostas corretas. A diferença entre a probabilidade declarada e a precisão real, chamada de erro de calibração, foi documentada em modelos de fronteira em uma pesquisa de 2025 que abrange métodos baseados em entropia, logit e perturbação. Agentes em produção que usam essas pontuações para decidir quando delegar ou se abster herdam diretamente a descalibração, então ou alucinam com falsa certeza ou recusam respostas corretas desnecessariamente. Nenhum primitivo pronto oferece um sinal de incerteza calibrado e acionável barato o suficiente para rodar no tempo de inferência em cada token de saída em uma resposta em streaming.

Por que importa

A calibração é o primitivo de confiança por trás de toda decisão agêntica, e sem ela cada limiar de segurança downstream repousa sobre areia.

Como avalio a oportunidade

A Pontuação de Oportunidade é minha própria leitura, não uma medição: o quanto dói, com que frequência aparece e o quanto pouco existe para resolvê-lo hoje. Quanto maior, mais vale a pena construir, na minha opinião.

Gravidade9/10

O quanto de dor causa quando aparece.

Frequência9/10

Com que frequência as pessoas realmente se deparam com isso.

Lacuna7/10

O quanto pouco de boas ferramentas existe para isso hoje.

Mais problemas que merecem ser resolvidos