Skip to content
AI

Comment savoir si le brouillon d'un modèle de raisonnement a réellement guidé sa réponse ?

85

Opportunité

Les modèles frontier qui émettent des traces de chaîne de pensée visibles parviennent souvent à une réponse avant ou indépendamment de ces étapes, puis génèrent un raisonnement vraisemblable comme rationalisation a posteriori. Les métriques de fidélité existantes ne concordent pas entre elles selon la façon dont le classificateur est construit, ce qui signifie qu'il n'existe pas de vérité terrain acceptée sur ce à quoi ressemble une trace fidèle. Aucun outil de production ne signale un raisonnement infidèle au moment de l'inférence ni n'attache de niveau de confiance à la question de savoir si la trace a causé la sortie. Les secteurs réglementés et les examens de sécurité qui traitent le raisonnement visible comme une explication du comportement du modèle s'appuient sur quelque chose qui peut être un récit construit après coup.

Pourquoi c'est important

Si une trace de raisonnement est une rationalisation a posteriori, tout audit, toute affirmation de responsabilité ou tout contrôle de conformité construit sur cette base est invalide.

Comment j'évalue l'opportunité

Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.

Gravité9/10

L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.

Fréquence7/10

La fréquence à laquelle les gens y sont réellement confrontés.

Espace libre9/10

Le peu de bons outils qui existent pour y remédier aujourd'hui.

D'autres problèmes qui méritent d'être résolus