Skip to content
AI

ファインチューニング中のオープンウェイトベースモデルが汚染されていないとどうやって確認できますか?

83

機会

事前学習済みモデルの重みに埋め込まれたバックドアは、トリガーパターンが目的シフトや部分的凍結戦略を生き延びるため、全パラメーターファインチューニング、アダプタートレーニング、RLHFアップデートを経ても持続します。これらのトリガーは標準的な行動安全テストやベンチマーク評価には検出されません。検出にはホワイトボックスの重み分析が必要ですが、平均的なファインチューニング実践者はこれを実施しませんし、主要なモデルハブはチェックポイントを公開ダウンロード可能にする前に必須スキャンを適用していません。侵害されたベースモデル上で本番システムを構築している組織は、デプロイ時にトリガーが発火するまで何も問題がないというシグナルを受け取れません。

重要な理由

オープンウェイトのファインチューニングサプライチェーンにはセキュリティゲートがなく、その障害モードはあらゆる標準的なチェックを生き延びるバックドアです。

機会をどう評価するか

Opportunity Scoreは測定値ではなく、私自身の見解です。どれほど痛みを伴うか、どれほど頻繁に影響を与えるか、そして今日時点で解決策がいかに少ないか。スコアが高いほど、構築する価値が高いと私は考えています。

深刻度9/10

それが現れたときにどれほどの痛みをもたらすか。

頻度7/10

実際にどれほど頻繁に人々がそれに直面するか。

ホワイトスペース8/10

今日時点で、それに対する優れたツールがいかに少ないか。

解決する価値のある問題をもっと見る