Qwen、ロボット動かすAIを3種公開
Meet Qwen-RobotSuite: Three Embodied AI Models for VLA Manipulation, Video World Modeling, and Navigation

Qwenがロボットの操作、未来予測、道案内に特化した3種類のAIモデルを公開。ロボット開発のデータ断片化問題を解決し、実用化を大きく前進させます。
Qwenチームは、Qwen-Robot-Suiteとしてグループ化された3つのembodied AIモデルをリリースしました。これら3つは、Qwen-RobotManip、Qwen-RobotWorld、Qwen-RobotNavです。それぞれがQwenのvision-language backboneに基づいて構築されており、異なるロボット工学の問題を対象としています。Qwen-RobotManipは、Qwen3.5-4B上に構築された操作のためのVision-Language-Actionモデルです。Qwen-RobotWorldは、60層のMMDiTとfrozenのQwen2.5-VL encoderを備えたlanguage-conditioned video world modelです。Qwen-RobotNavは、Qwen3-VL上に構築されたナビゲーションモデルで、2B、4B、8Bのサイズで利用可能です。Qwen-Robot-Suiteは単一のモデルではありません。これは3つの独立したfoundation modelのスイートです。そのうちの2つ、RobotManipとRobotNavは、公開されているGitHubリポジトリと共に提供されます。 Roboticsデータは、ハードウェアやタスク間で断片化されています。異なるロボットは互換性のないobservationおよびactionフォーマットを使用します。あるアームでトレーニングされたpolicyが別のアームに転送されることはめったにありません。これら3つの研究レポートは、この断片化に異なる方法で対処しています。RobotManipはaction representationを調整し、操作データがスケールするようにします。RobotWorldは、言語をビデオ予測のための統一されたaction interfaceとして使用します。RobotNavは、ナビゲーションタスクのために制御可能なobservation interfaceを公開します。以下に、3つのリリース間の主要な分割を示します: モデル 問題 バックボーン 出力 Qwen-RobotManip ロボット操作 Qwen3.5-4B (Qwen-VL) 連続的なロボットアクション Qwen-RobotWorld Embodied world modeling Frozen Qwen2.5-VL 予測された将来のビデオ Qwen-RobotNav モバイルナビゲーション Qwen3-VL (2B/4B/8B) Waypoint trajectories Qwen-RobotManip: Alignmentが操作のスケールを解除 Qwen-RobotManipはVision-Language-Action (VLA) foundation modelです。これはQwen-VL上に構築されており、連続的なロボットアクションを予測します。VLAモデルはカメラの視点と言語指示を受け取ります。その後、低レベルのロボットアクションを出力します。課題は、操作データが本質的に異種であることです。異なるロボットは、互換性のないフォーマットで状態とアクションを記録します。表現が一致しないデモンストレーションが到着すると、
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。