Skip to content
AI

为什么当测试集从未出现在训练数据中时,模型排行榜分数会骤然崩溃?

82

机会

MMLU 等静态基准的数据污染率高达 45%,改写或翻译后的测试题能够绕过精确匹配去污染手段,同时仍然虚高已发布的分数。一个模型可以在受污染的任务上登顶排行榜,却在同一任务被干净地改写后失败。定期刷新任务的动态基准虽然存在,但缺乏标准化的设计标准,导致其结果无法相互比较,也无法验证是否能真正代表所声称衡量的能力。排行榜上发布的每一项能力和安全声明,都依赖于没有任何独立方能验证其清洁性的数据。

为什么重要

可信的评估是所有下游安全与部署决策的前提,而这些决策所依赖的数据目前并不可信。

我如何评估机会

机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。

严重性8/10

出现时造成的痛苦程度。

频率8/10

人们实际遇到它的频率。

空白空间8/10

当前针对它的优质工具有多匮乏。

更多值得解决的问题