AI
モデルをベンチマークでテストしながら、なぜ感覚だけで本番に投入するのか?
81
機会
チームはリーダーボードからモデルを選び、継続的で低コストなタスク固有の評価をほぼ行わないまま本番環境で動かす。品質が低下しても、ユーザーが不満を言うまで誰も気づかない。AIフィーチャーが今も機能しているかを実際に測定するツールは、ほとんどの開発者には存在しない。
重要な理由
測定できないものは運用できない。そして今、ほとんどのAIフィーチャーは測定されていない。
機会をどう評価するか
Opportunity Scoreは測定値ではなく、私自身の見解です。どれほど痛みを伴うか、どれほど頻繁に影響を与えるか、そして今日時点で解決策がいかに少ないか。スコアが高いほど、構築する価値が高いと私は考えています。
深刻度7/10
それが現れたときにどれほどの痛みをもたらすか。
頻度8/10
実際にどれほど頻繁に人々がそれに直面するか。
ホワイトスペース8/10
今日時点で、それに対する優れたツールがいかに少ないか。