Skip to content
AI

Pourquoi ne puis-je pas faire confiance au score de confiance d'un modèle quand cela compte le plus ?

88

Opportunité

Les modèles de langage modernes produisent régulièrement des tokens à haute confiance sur des réponses erronées et des tokens à faible confiance sur des réponses correctes. L'écart entre la probabilité annoncée et la précision réelle, appelé erreur de calibration, a été documenté sur les modèles frontières dans une étude de 2025 couvrant les méthodes basées sur l'entropie, les logits et la perturbation. Les agents en production qui utilisent ces scores pour décider quand différer ou s'abstenir héritent directement de cette mauvaise calibration, si bien qu'ils hallucinent avec une fausse certitude ou refusent inutilement des réponses correctes. Aucune primitive prête à l'emploi ne fournit un signal d'incertitude calibré et actionnable, suffisamment peu coûteux pour être exécuté à l'inférence sur chaque token de sortie dans une réponse en streaming.

Pourquoi c'est important

La calibration est le primitif de confiance à la base de chaque décision agentique, et sans elle, chaque seuil de sécurité en aval repose sur du sable.

Comment j'évalue l'opportunité

Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.

Gravité9/10

L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.

Fréquence9/10

La fréquence à laquelle les gens y sont réellement confrontés.

Espace libre7/10

Le peu de bons outils qui existent pour y remédier aujourd'hui.

D'autres problèmes qui méritent d'être résolus