研究tldr-ai2026-06-18
AIは考えすぎると失敗する?
Brain the Size of a Planet: Are LLMs Thonking too Hard?

最新のAIモデルは、セキュリティの弱点を見つける際に、深く考えさせすぎるとかえって性能が落ちることが研究で分かりました。これは、AIの利用方法を最適化する上で重要な発見です。
以前の研究では、Opus 4.6、GPT 5.4、Gemini 3.1-pro-preview、Deepseek R1-0528、およびQwen 3.6-plusが、Mythosのブログ記事で議論された2つの脆弱性を、非常に明らかなヒントなしには発見できなかったことが示されました。本研究は、26種類のClaude-4.6/4.7とGPT-5.4/5.5の組み合わせ、および異なるコンテキストウィンドウサイズと推論努力を用いて、以前の実験を継続しました。その結果、より高い推論努力、さらには新しいモデルでさえも、セキュリティ結果のトリアージ(優先順位付け)には常に優れているわけではないことが判明しました。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。