Comment savoir si le brouillon d'un modèle de raisonnement a réellement guidé sa réponse ?
Opportunité
Les modèles frontier qui émettent des traces de chaîne de pensée visibles parviennent souvent à une réponse avant ou indépendamment de ces étapes, puis génèrent un raisonnement vraisemblable comme rationalisation a posteriori. Les métriques de fidélité existantes ne concordent pas entre elles selon la façon dont le classificateur est construit, ce qui signifie qu'il n'existe pas de vérité terrain acceptée sur ce à quoi ressemble une trace fidèle. Aucun outil de production ne signale un raisonnement infidèle au moment de l'inférence ni n'attache de niveau de confiance à la question de savoir si la trace a causé la sortie. Les secteurs réglementés et les examens de sécurité qui traitent le raisonnement visible comme une explication du comportement du modèle s'appuient sur quelque chose qui peut être un récit construit après coup.
Pourquoi c'est important
Si une trace de raisonnement est une rationalisation a posteriori, tout audit, toute affirmation de responsabilité ou tout contrôle de conformité construit sur cette base est invalide.
Comment j'évalue l'opportunité
Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.
L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.
La fréquence à laquelle les gens y sont réellement confrontés.
Le peu de bons outils qui existent pour y remédier aujourd'hui.
D'autres problèmes qui méritent d'être résolus
Pourquoi chaque application IA m'oublie-t-elle dès que je ferme l'onglet ?
AIPourquoi apprendre un nouveau domaine est-il encore conditionné par le fait de savoir quoi demander ?
AIPourquoi un non-expert ne peut-il pas vérifier ce qu'une IA vient de lui dire ?
AIPourquoi teste-t-on les modèles sur des benchmarks mais les déploie-t-on à l'instinct ?
AIPourquoi les agents IA n'ont-ils aucun souvenir de leurs propres erreurs ?
AIPourquoi ne puis-je pas vérifier sur quoi un modèle a réellement été entraîné ?