Skip to content
AI

如何判断推理模型的草稿本是否真正驱动了它的答案?

85

机会

输出可见思维链的前沿模型,往往在这些推理步骤之前或独立于这些步骤便得出了答案,随后才生成看似合理的推理作为事后合理化。现有的忠实度指标因分类器构建方式不同而相互矛盾,这意味着对于忠实的轨迹究竟是什么样子,目前并没有公认的基准。没有任何生产级工具能在推理时标记不忠实的推理过程,也没有工具能对轨迹是否导致输出给出任何置信度。将可见推理视为模型行为解释的受监管行业和安全审查,实际上依赖的可能只是事后构建的叙事。

为什么重要

如果推理轨迹只是事后的合理化,那么建立在其上的每一项审计、问责主张或合规检查都将失效。

我如何评估机会

机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。

严重性9/10

出现时造成的痛苦程度。

频率7/10

人们实际遇到它的频率。

空白空间9/10

当前针对它的优质工具有多匮乏。

更多值得解决的问题