AI
ファインチューニング中のオープンウェイトベースモデルが汚染されていないとどうやって確認できますか?
83
機会
事前学習済みモデルの重みに埋め込まれたバックドアは、トリガーパターンが目的シフトや部分的凍結戦略を生き延びるため、全パラメーターファインチューニング、アダプタートレーニング、RLHFアップデートを経ても持続します。これらのトリガーは標準的な行動安全テストやベンチマーク評価には検出されません。検出にはホワイトボックスの重み分析が必要ですが、平均的なファインチューニング実践者はこれを実施しませんし、主要なモデルハブはチェックポイントを公開ダウンロード可能にする前に必須スキャンを適用していません。侵害されたベースモデル上で本番システムを構築している組織は、デプロイ時にトリガーが発火するまで何も問題がないというシグナルを受け取れません。
重要な理由
オープンウェイトのファインチューニングサプライチェーンにはセキュリティゲートがなく、その障害モードはあらゆる標準的なチェックを生き延びるバックドアです。
機会をどう評価するか
Opportunity Scoreは測定値ではなく、私自身の見解です。どれほど痛みを伴うか、どれほど頻繁に影響を与えるか、そして今日時点で解決策がいかに少ないか。スコアが高いほど、構築する価値が高いと私は考えています。
深刻度9/10
それが現れたときにどれほどの痛みをもたらすか。
頻度7/10
実際にどれほど頻繁に人々がそれに直面するか。
ホワイトスペース8/10
今日時点で、それに対する優れたツールがいかに少ないか。