研究openai2026-07-08
プログラミングAI評価に課題
Separating signal from noise in coding evaluations

OpenAIが人気のプログラミングAI評価基準「SWE-Bench Pro」に信頼性の問題があると指摘し、AIモデルの正確な評価の難しさが明らかになりました。
OpenAIによる新しい分析で、人気のプログラミング評価基準であるSWE-Bench Proに問題があることが明らかになり、AIモデルの評価における信頼性と正確性について懸念が高まっています。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。