モデルtldr-ai2026-06-18
MolmoMotion 言葉で動きを予測
MolmoMotion: Language-guided 3D motion forecasting

MolmoMotionが言葉の指示で動画内の3Dの動きを予測する新モデルを発表。116万本の動画データで学習し、既存の予測精度を大きく上回ります。
MolmoMotionは、新しいmotion forecastingモデルで、言語の指示と初期の物体の位置を使って、動画内の未来の3D点軌跡を予測し、既存の手法を上回ります。 このモデルとデータセットであるMolmoMotion-1Mは、116万本の動画から得られた膨大な3D点軌跡データセットを特徴とし、精度テスト用のベンチマークも備えています。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。