AIがAIの弱点発見、人超え
OpenAI Details GPT-Red: An Internal Automated Red-Teaming Model That Beat Human Red-Teamers 84% To 13% On Prompt Injection

OpenAIが開発したAI「GPT-Red」が、AIの弱点を見つける能力で人間を大幅に上回りました。これにより、AIの安全性が大きく向上し、悪用を防ぐ対策が強化されます。
今週、OpenAIは社内専用の自動レッドチームモデルであるGPT-Redの詳細を公開しました。その役割は、OpenAI自身のモデルを攻撃し、prompt injectionの脆弱性を見つけることです。OpenAIは2つの理由を挙げています。人間のレッドチーム活動は時間集約的であり、スケールしません。一般的に使用されている堅牢性評価は、最新モデルではすでに飽和状態にあります。一方、攻撃対象領域は拡大しています。エージェントはブラウザ、接続されたアプリ、ローカルファイル、ツールを通じてサードパーティのデータを読み取ります。これらの機能は実際の作業に必要です。また、攻撃者がそのデータに細工された指示を仕込むことも可能にします。GPT-Redとは何でしょうか?GPT-Redはモデルであり、静的なベンチマークやプロンプトライブラリではありません。人間のレッドチーム担当者のように機能します。プロンプトを送信し、応答を観察し、目標に向かって反復します。OpenAIチームは、最大の訓練後実行の一部と同じ計算規模で、純粋に安全のためにこれを訓練しました。2つの展開決定が重要です。まず、GPT-Redは展開されているモデルとは別に保たれています。これにより、その悪意ある能力が敵対的なアクターから遠ざけられます。次に、2つの仕事をします。展開前に脆弱性を発見し、訓練中に攻撃を生成します。2番目の仕事は以下の訓練ループに依存します。自己対戦学習はどのように機能するのでしょうか?GPT-Redは自己対戦強化学習を使用して訓練されます。攻撃者と多様なdefender LLMのコレクションが、幅広いレッドチームシナリオで同時に訓練されます。報酬構造が核心的なアイデアです。GPT-Redは、成功したprompt injectionのような有効な失敗を引き出すことで報酬を得ます。Defenderモデルは、攻撃に抵抗し、元のタスクを完了することで報酬を得ます。この2番目の条項が重要です。defenderはすべてを拒否することで勝つことはできません。なぜなら、それでもタスクを完了しなければならないからです。各環境には脅威モデルがあります。それはGPT-Redが何を制御し、何が成功と見なされるかを指定します。GPT-Redは、ローカルファイルの一部、ウェブページのバナー、メール本文、またはツールの出力の一部を制御する可能性があります。defenderが強化されるにつれて、GPT-Redはより強力な攻撃を発見することを強いられます。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。