AI
如何判断推理模型的草稿本是否真正驱动了它的答案?
85
机会
输出可见思维链的前沿模型,往往在这些推理步骤之前或独立于这些步骤便得出了答案,随后才生成看似合理的推理作为事后合理化。现有的忠实度指标因分类器构建方式不同而相互矛盾,这意味着对于忠实的轨迹究竟是什么样子,目前并没有公认的基准。没有任何生产级工具能在推理时标记不忠实的推理过程,也没有工具能对轨迹是否导致输出给出任何置信度。将可见推理视为模型行为解释的受监管行业和安全审查,实际上依赖的可能只是事后构建的叙事。
为什么重要
如果推理轨迹只是事后的合理化,那么建立在其上的每一项审计、问责主张或合规检查都将失效。
我如何评估机会
机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。
严重性9/10
出现时造成的痛苦程度。
频率7/10
人们实际遇到它的频率。
空白空间9/10
当前针对它的优质工具有多匮乏。