NVIDIA、ロボット向け軽量AI発表
NVIDIA Releases Cosmos 3 Edge: A 4B-Parameter Open World Model That Reasons and Generates Robot Actions On-Device

NVIDIAがロボット向けに、その場で考えて動く軽量AI「Cosmos 3 Edge」を発表。これにより、限られた環境のロボットでも高度な判断と行動が可能になります。
NVIDIAは、デバイス上で動作するように構築された40億パラメータのオープンワールドモデルであるCosmos 3 Edgeをリリースしました。これは、ロボットやビジョンAIエージェントが周囲を理解し、リアルタイムで推論し、ロボットの行動をローカルで生成するのに役立ちます。Cosmos 3ファミリーには、2026年5月31日にGTC Taipeiで出荷されたCosmos 3 Nano(16B)とCosmos 3 Super(64B)が含まれていました。Edgeは、Superの約16分の1のサイズで、3番目の最小のティアです。問題は具体的です。機械は工場、倉庫、病院の「エッジ」で動作します。それらは、メモリが制約されたシステムでデータセンターレベルのパフォーマンスを必要とします。Cosmos 3 Edgeはそのギャップをターゲットとしています。 <body>(function(){ var f=document.getElementById("mtp-cosmos3edge-showcase"); window.addEventListener("message",function(e){ if(e&&e.data&&e.data.c3e==="height"&&e.data.height){ f.style.height=(e.data.height)+"px"; } }); })();</body>ワールドモデルとは何か?ワールドモデルは、環境が時間とともにどのように変化するかを学習します。それは、オブジェクト、動き、空間関係、および行動の影響を表します。オブジェクトに手を伸ばすロボットを考えてみましょう。オブジェクトを認識することは最初のステップにすぎません。ロボットは、オブジェクトがどこにあるか、グリッパーがどのように動くか、接触時に何が起こるかも追跡する必要があります。ワールドモデルはこれらの関係について推論します。それは、行動の視覚的な結果を予測したり、変化を引き起こした行動を推論したり、目標を達成するための行動を生成したりできます。Cosmos 3 Edgeは、これらの機能を1つのオンデバイスモデルに統合します。その共有表現により、システムは現在の世界の状況を理解し、可能な未来をシミュレートし、それらの未来を行動に結びつけることができます。 <body>2つのtransformerタワー、1つの共有表現</body>Cosmos 3は、NVIDIA'sの技術レポートで説明されているように、2つのタワーを持つMixture-of-Transformersアーキテクチャを使用しています。自己回帰タワーは、理解と推論のためにビジョンとテキストのトークンを処理します。拡散タワーは、予測、生成、およびニューラルシミュレーションのためにビジョン、オーディオ、およびアクションのトークンを処理します。2つのタワーは別々の正規化レイヤーを保持し、
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。