AI
オープンソースモデルによって生成されたテキストを、そのモデルに確実に追跡することができないのはなぜでしょうか?
84
機会
クローズドモデルのプロバイダーは、推論時に生成テキストへ統計的透かしを埋め込むことができ、後からコンテンツを特定のモデルに帰属させることが可能です。オープンソースモデルはデコード手順への完全なアクセスをユーザーに与えるため、サンプリングコードを数行変更するだけで生成時の透かしを除去できます。すでに生成されたテキストへの事後透かしはパラフレーズ攻撃に対して脆弱です。モデルの重みにマーカーを埋め込む手法は一部の攻撃には耐えられますが、ファインチューニングには耐えられません。ローカルの重みを使用している人なら誰でも午後一日あれば適用できます。2025年末時点で、オープンウェイトモデルの出力に対して実用的かつ除去耐性のある出所マーキングを提供するスキームは存在せず、研究コミュニティはこの問題が未解決であることを認めています。
重要な理由
オープンモデルに透かしがない状況では、AI生成テキストの出所は、生成者が協力することを選択した場合にのみ追跡可能です。
機会をどう評価するか
Opportunity Scoreは測定値ではなく、私自身の見解です。どれほど痛みを伴うか、どれほど頻繁に影響を与えるか、そして今日時点で解決策がいかに少ないか。スコアが高いほど、構築する価値が高いと私は考えています。
深刻度8/10
それが現れたときにどれほどの痛みをもたらすか。
頻度8/10
実際にどれほど頻繁に人々がそれに直面するか。
ホワイトスペース9/10
今日時点で、それに対する優れたツールがいかに少ないか。