研究tldr-ai2026-07-09
AIコード評価の信頼性を調査
Auditing the Reliability of Coding Benchmarks

OpenAIは、AIのコード作成能力を測る評価方法に約3割の問題を発見。不正確な評価は、AIの能力や安全性の判断を誤らせるため重要です。
OpenAIはSWE-Bench Proの構造、モデルの失敗、タスクのメタデータを調査し、その公開されているタスクの約30%が壊れていると結論付けました。この分析は、欠陥のある評価がコーディング能力、安全性、およびモデルの進捗の評価をいかに歪めるかを示しました。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。