アントグループ、ロボットAI新開発
Ant Group’s Robbyant Unveils LingBot-VA 2.0: A Causal Video-Action Model Built Natively for Physical AI

アントグループのRobbyantが、ロボットが現実世界で効率的に動くための新しいAI「LingBot-VA 2.0」を発表。これにより、ロボットの作業精度が向上します。
アントグループ内のembodied AI部門であるRobbyantは、LingBot-VA 2.0をリリースしました。これは初のembodied-native foundation modelです。汎用ロボット操作のためのvideo-action foundation modelと説明されています。研究チームは、video generatorのfine-tuningではなく、embodimentのためにスタック全体をpretrainしています。 LingBot-VA 2.0とは何でしょうか?ほとんどのvideo-action modelは、デジタルコンテンツ作成用に構築された2つのコンポーネントを再利用しています。1つは再構築指向のVAEです。もう1つは、action moduleが取り付けられた双方向のvideo-diffusion backboneです。これには3つの制限があります。ピクセル再構築のlatentsは外観を保持しますが、物理的な構造は限られています。video tokensに対する反復的なdenoisingは、closed-loop controlには遅すぎます。一般的な動画の目的では、行動が世界をどのように再形成するかを教えることはできません。4つ目の不一致は構造的なものです。backbonesは双方向のattentionを使用しますが、制御は厳密に時間的に前方へと展開します。LingBot VA Version 1.0は、そのスタックをcausal modelにfine-tuneしました。Version 2.0は、causal DiTをネイティブにpretrainします。https://github.com/Robbyant/lingbot-va/blob/main/LingBot_VA2_paper.pdf バージョン1:The Semantic Visual-Action Tokenizer その動機に基づいて、最初の段階では圧縮専用のVAEを置き換えます。RepWAMに続き、tokenizerは再構築に2つの目的を追加します。Semantic alignmentは、視覚的なlatentsを固定されたPerception Encoder teacherへと引き寄せます。latent-action objectiveは、連続するlatents間のコンパクトな遷移変数を抽出します。inverse dynamics modelは各latent actionを予測します。forward dynamics modelはそれをtransport mapとresidualにデコードします。世界の状態と行動は現在、1つのlatent spaceを共有しています。したがって、ラベル付けされていないウェブ動画は、行動に関連するsupervisionを運びます。 バージョン2:A Causal DiT With a Sparse MoE Video Stream その空間の上に、バージョン2はcausal DiTをpretrainします。これはバージョン1.0のMixture-of-Transformersのレイアウトを維持しています。video expertとaction expertは1つのcausal self-attentionを共有します。それぞれが独立したfeed-forward pathwayを持っています。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。