研究tldr-ai2026-06-29
AIの新しい学習方法に課題
The Next Paradigm

AIの学習方法に限界が見つかり、継続的に学ぶには一時的な記憶でなくAI自身の知識を変える必要があり、今後のAI開発の転換点です。
AI研究機関は、検証可能な報酬からの強化学習(RLVR)を数百万もの多様なタスクにわたってスケールさせることで、汎用人工知能を達成できると賭けています。しかし、この手法は決定論的なシミュレーターがない領域では限界に直面します。真の継続学習には、一時的なin-context memoryを超えて、モデルの重み自体に学習を戻すことが必要です。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。