AI
テストセットが学習データに含まれていない場合、モデルのリーダーボードスコアはなぜ崩壊するのか?
82
機会
MMLUのような静的ベンチマークには最大45%のデータ汚染率があり、テスト問題の言い換えや翻訳版は完全一致によるデータ除染を免れながら、公開スコアを押し上げ続ける。汚染されたタスクでリーダーボードの首位に立ったモデルが、同じタスクを明確に言い換えると失敗することもある。タスクを定期的に更新する動的ベンチマークは存在するが、標準化された設計基準を欠いているため、結果を相互比較したり、測定対象のスキルを代表するものとして検証したりすることができない。リーダーボードに掲載されるあらゆる性能・安全性に関する主張は、独立した第三者がクリーンであると検証できない数値に基づいている。
重要な理由
信頼できる評価はあらゆる下流の安全性・展開判断の前提条件であり、これらの判断の根拠となる数値は現時点では信頼に値しない。
機会をどう評価するか
Opportunity Scoreは測定値ではなく、私自身の見解です。どれほど痛みを伴うか、どれほど頻繁に影響を与えるか、そして今日時点で解決策がいかに少ないか。スコアが高いほど、構築する価値が高いと私は考えています。
深刻度8/10
それが現れたときにどれほどの痛みをもたらすか。
頻度8/10
実際にどれほど頻繁に人々がそれに直面するか。
ホワイトスペース8/10
今日時点で、それに対する優れたツールがいかに少ないか。