研究tldr-ai2026-06-10
AIの賢さ、計算量で変化
Implications of Large-Scale Test-Time Compute

AIの賢さは試す時の計算量で大きく変わり、今までの評価方法では本当の性能が見えにくくなるため、AIの進化を正しく捉えるには新しい評価が必要です。
ベンチマークの評価表は本当の状況を隠しています。なぜなら、LLMの能力は現在、テスト時の計算量に依存する機能となっているからです。これは、GPT-5.5が最大計算量のサイバー評価ではGPT-5.4とわずかにしか変わらないように見えても、tokens、cost、またはlatencyをX軸で制御すると大幅に強力になることで示されています。性能の限界は現在、経験的に非常に遠く、より強力なモデルはその限界をさらに押し広げるため、単一の数値で表されるベンチマークスコアは、リリースごとに情報量が少なくなるでしょう。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。