ロボットAI「LingBot-VLA 2.0」公開
Robbyant Releases LingBot-VLA 2.0: An Open-Source 6B Vision-Language-Action (VLA) Model for Cross-Embodiment Robot Manipulation

Robbyantが、カメラ画像と指示でロボットを動かすAI「LingBot-VLA 2.0」を公開。多様なロボットで実用的に使えるように進化しました。
Ant GroupのRobbyantは、ロボット向けのVision-Language-Action(VLA)基盤モデルであるLingBot-VLA 2.0をリリースしました。このリリースには、技術レポート、Apache-2.0のコードベース、および6Bのチェックポイントが含まれています。研究チームは、VLAモデルがラボでは機能するものの、展開時に問題を起こすというよく知られたギャップをターゲットにしています。LingBot-VLA 2.0は、汎化、拡張されたアクションスペース、予測ダイナミクスモデリングという3つの実用的な軸に沿って、以前のバージョンを進化させています。LingBot-VLA 2.0とは何ですか?LingBot-VLA 2.0は、ビジョン・言語バックボーン上に構築された汎用ロボットポリシーです。カメラ画像と自然言語の指示をロボットのアクションに変換します。公開されているモデルはlingbot-vla-v2-6bで、6Bの「native depth」チェックポイントです。VLMバックボーンとしてQwen3-VL-4B-Instructを使用しています。LingBot-DepthとDINO-Videoという2つの教師モデルが、蒸留を通じてトレーニングを監督します。NVIDIA GeForce RTX 4090Dで1回の推論呼び出しには約130ミリ秒かかります。この測定は10のdenoisingステップを使用しています。アクションエキスパートは、スケーリングのためにMixture-of-Experts(MoE)設計を使用しています。データパイプライン:20種類の構成で60,000時間汎化はデータから始まります。研究チームは、約60,000時間の事前トレーニングデータをキュレーションしています。これには、50,000時間のロボット軌道と10,000時間の自己視点人間ビデオが含まれます。ロボットデータは、単腕リグからフルヒューマノイドまで、20種類のロボット構成にわたります。生のデータプールはさらに大きく、約90,000時間のロボットデータと20,000時間の自己視点データがありました。再設計されたパイプラインは、ノイズの多いサンプルを高品質なセットにフィルタリングします。フィルタリングは明示的で測定可能です。研究チームは、各エンボディメントごとに、速度と加速度のZスコアとともに3次ジャークを計算します。異常な滑らかさや95%以上の静的信号を持つエピソードは削除されます。ビデオは、各ロボットのURDFを使用して再生された状態と照合されます。アノテーターは、ぼやけ、オクルージョン、ドロップされたフレーム、マルチビューのずれを削除します。自己視点クリップはVLMフィルターを通過した後、自己視点SLAMとMANOハンドポーズ再構築が行われます。アノテーションは
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。