AI
为什么当测试集从未出现在训练数据中时,模型排行榜分数会骤然崩溃?
82
机会
MMLU 等静态基准的数据污染率高达 45%,改写或翻译后的测试题能够绕过精确匹配去污染手段,同时仍然虚高已发布的分数。一个模型可以在受污染的任务上登顶排行榜,却在同一任务被干净地改写后失败。定期刷新任务的动态基准虽然存在,但缺乏标准化的设计标准,导致其结果无法相互比较,也无法验证是否能真正代表所声称衡量的能力。排行榜上发布的每一项能力和安全声明,都依赖于没有任何独立方能验证其清洁性的数据。
为什么重要
可信的评估是所有下游安全与部署决策的前提,而这些决策所依赖的数据目前并不可信。
我如何评估机会
机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。
严重性8/10
出现时造成的痛苦程度。
频率8/10
人们实际遇到它的频率。
空白空间8/10
当前针对它的优质工具有多匮乏。