OpenAI、AIの安全確認を強化
OpenAI’s Deployment Simulation Extends Pre-Deployment Risk Assessment to Agentic Coding Through Simulated Tool Calls

OpenAIは、AIを公開する前の安全性を確認する「デプロイメントシミュレーション」を導入。過去の利用状況を再現し、問題行動を事前に予測することで、より安全なAIの提供に貢献します。
OpenAIは、Deployment Simulationと呼ばれる新しいデプロイ前安全性評価方法を発表しました。その考え方は直接的です。モデルをリリースする前に、まずそのデプロイメントをシミュレートします。新しい候補モデルを通して過去の会話を再生し、現実的な文脈でどのように振る舞うかを研究します。OpenAIはすでにモデル開発中にこの方法から得られた知見を活用しています。これは緩和策やデプロイメントの決定に情報を提供し、従来の評価における盲点を明らかにしました。https://cdn.openai.com/pdf/predicting-llm-safety-before-release-by-simulating-deployment.pdfDeployment Simulationの理解Deployment Simulationは、将来のデプロイメントが起こる前にそれをシミュレートする方法です。OpenAIは、新しい候補モデルで以前の会話を再生することによってこれを行います。再生はプライバシーを保護しながら行われます。この技術は本質的にシンプルです。デプロイメントから最近の会話を取り出します。古いモデルからの元のAIアシスタントの応答を削除します。リリースされる候補モデルでその応答を再生成し、新しい失敗モードがないか完成度を評価します。これらの完成度から、OpenAIはデプロイメント時の望ましくない行動の頻度を推定します。同じ測定は、リリース後に実際のトラフィックでも実行できます。これにより、デプロイ前の予測が後で検証可能になります。ただし、限界もあります。このアプローチは、200,000メッセージに1回未満で発生する行動を測定することはできません。これは、最もまれなイベントではなく、テールリスクではないものを対象としています。パイプラインの仕組み従来の評価は、合成された、手書きの、または本番環境のプロンプトを混ぜて使用します。これらは、困難な、重大度の高い、または敵対的なものとして選ばれます。Deployment Simulationは代わりに、最近の使用状況を代表する分布をサンプリングします。この代表性は、3つの既知の問題を解決します。手作業で選ばれたプロンプトによる選択バイアスを減らします。単にシミュレートすることでカバレッジを向上させます。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。