カメラ1つで動くロボットAI登場
Mistral AI Releases Robostral Navigate: An 8B Model Enabling Robots to Navigate Complex Environments Using a Single RGB Camera

Mistral AIがカメラ1つで複雑な場所を進むロボットAIを発表。多くのセンサーが不要になり、より効率的で広範囲なロボットの活用が期待されます。
Mistral AIは、身体を持つロボットのナビゲーション用に構築された初のモデルであるRobostral Navigateをリリースしました。この8Bモデルは、RGB画像と平易な言語の指示を受け取り、ロボットを動かします。特筆すべきは、単一のRGBカメラのみを使用し、R2R-CE検証の未知の環境で76.6%の成功率を達成している点です。Robostral Navigateとは何ですか?Robostral Navigateは、複雑な環境をロボットがナビゲーションするための8Bモデルです。これらの環境には、オフィス、住宅、商業ビル、屋外が含まれます。1つの指示を与えるだけで、タスク全体を単独で完了します。例えば、「ロビーを出て、廊下を通り、備品室に入り、2番目の棚に向かって止まってください」といった指示です。重要なのは、訓練で一度も見たことのない、人々や障害物でいっぱいの実際の空間を移動することです。さらに、ほとんどのナビゲーションシステムは、深度センサー、LiDAR、または複数のカメラを組み合わせて使用します。対照的に、Robostral Navigateは1つの通常のRGBカメラを使用し、深度センサーは使用しません。センサーが少ないことで、このシステムはマルチセンサーアプローチよりも効率的になります。ポインティングによるナビゲーション:仕組みハードウェアを超えて、次の疑問は、モデルがどこに移動するかをどのように決定するかです。各移動を選択するために、モデルは「pointing」と呼ばれる手法を使用します。タスクと観測履歴が与えられると、ロボットが次にどこに移動するかを予測します。具体的には、現在のカメラビューにおけるターゲットの画像座標を推論します。また、到着時の望ましい向きも予測します。この選択には明確な利点があります。メートル単位の変位に基づくコマンドとは異なり、pointingはカメラの内部パラメータや世界スケールの変化に対して堅牢性を保ちます。しかし、ターゲットが現在の視野の外にある場合、pointingは機能しません。その場合、モデルはロボットのローカル座標系における変位にフォールバックします。例えば、「2メートル前進し、1.5メートル左に移動し、25度左に曲がってください」といった指示です。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。