AIが仮想世界を動かす新技術
Meet LingBot-World-Infinity: An Open Causal World Model With An Agentic Harness

Ant Groupが、AIが仮想世界でリアルタイムに動き続ける「LingBot-World-Infinity」を発表。AIがより複雑な行動を学ぶ基盤となります。
Robbyant(Ant Groupの身体性AI部門)は、LingBot-World-Infinity(LingBot-World 2.0)をリリースしました。これは、インタラクティブな世界シミュレーターとして機能する因果的な動画生成モデルです。このモデルは、長期間にわたるドリフトとインタラクティブな遅延という2つの失敗モードに対処するために開発されました。 LingBot-World-Infinityとは何でしょうか?インタラクティブな世界モデルは、ユーザーのアクションのストリームに基づいて、動画をフレームごとに生成します。各状態は、過去のフレームと現在の入力のみに依存します。研究チームはこれを因果的因数分解として定式化しています。p_θ(x_1:T | a_1:T) = Π_t p_θ(x_t | x_<t, a_≤t) ここで、x_tは時刻tにおける視覚状態です。アクションa_tは、カメラのポーズとテキストプロンプトを組み合わせたものです。カメラのポーズはPlücker embeddingsを使用し、adaptive layer normalization (AdaLN) を通じて注入されます。テキストはcross-attentionを通じてチャンクごとのプロンプトとして入力されます。 研究チームは、LingBot-Worldと比較して4つのアップグレードを主張しています。一貫した出力品質を持つ無制限のインタラクション期間。720pの動画ストリームを60 fpsで駆動するのに十分な、蒸留されたリアルタイムバリアント。攻撃、アーチェリー、呪文詠唱、射撃を含む、より広範なアクション空間。パイロットエージェントとディレクターエージェントを組み合わせたagentic harness。主要モデルは14Bです。軽量な1.3Bモデルは、単一のGPUで展開可能とされています。 アーキテクチャ:MoBAと2段階学習 核となる貢献は、Mixture of Bidirectional and Autoregressive (MoBA) Attention Maskです。これはドリフトを説明します。標準的な自己回帰型動画学習では、teacher forcing maskを使用します。各ノイズのあるフレームは、それ自体とクリーンなコンテキストに注意を向けます。研究チームはここに失敗を発見しました。コンテキストが大きくなるにつれて、モデルは将来のフレームを予測する代わりに、そのコンテキストに依存するようになります。その結果、過学習と視覚品質の劣化が生じます。MoBAは、teacher forcing maskに双方向の完全なattentionブロックを追加します。このブロックは正則化器として機能します。また、モデルが柔軟な長さの生成を処理するのにも役立ちます。cross-attention m
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。