NVIDIA、AIが3D空間を正確に認識
NVIDIA AI Introduce SpatialClaw: A Training-Free Agent That Treats Code as the Action Interface for Spatial Reasoning

NVIDIAがAIの3D空間認識を向上させる「SpatialClaw」を発表。AIがコードを指示役として使うことで、訓練なしで高い精度を達成し、物体の位置や動きの理解が大きく進みます。
NVIDIA Researchは、空間推論のための訓練不要なフレームワークSpatialClawをリリースしました。これは、Vision-Language Models (VLM) における根強い弱点に対処するものです。これらのモデルは、物体がどこにあるか、どのように関連しているか、3D空間でどのように動くかを判断するのに依然として苦労しています。SpatialClawはモデルを再訓練しません。その代わりに、エージェントが知覚ツールを呼び出すために使用するアクションインターフェースを変更します。研究チームは、インターフェースがボトルネックであると主張しています。彼らの解決策は、コードをアクションインターフェースとして扱うことです。20のベンチマークにおいて、SpatialClawは平均59.9%の精度を達成しました。これは、最近の空間エージェントSpaceToolsを11.2ポイント上回っています。What is SpatialClaw SpatialClawは、ステートフルなPythonカーネルを囲むエージェントループです。このカーネルには、入力フレームと一連のプリミティブが事前にロードされています。知覚ツールは通常のPython呼び出し可能オブジェクトです。マスク、深度マップ、カメラジオメトリ、軌道を含むそれらの出力は、通常のPython変数です。カーネルは6つの公開エントリーポイントを公開しています。InputImagesはサンプリングされたフレームを保持します。Metadataはフレームレート、期間、フレームインデックスを運びます。toolsは知覚およびジオメトリプリミティブを公開します。show()は画像をエージェントの次のコンテキストに埋め込みます。vlmはクエリを別のVLMセッションにディスパッチします。ReturnAnswer()は最終的な回答を提出します。Two perception tools are central. tools.ReconstructはDepth Anything 3をラップし、フレームごとの深度、カメラ内部パラメータ、外部パラメータ、および密な点群マップを返します。tools.SAM3はSAM 3をラップし、テキスト、点、またはボックスのプロンプトから画像またはビデオマスクを生成します。このフレームワークは、軽量なユーティリティを追加します:tools.Geometry、tools.Mask、tools.Time、tools.Graph、tools.Draw。これは訓練不要です。同じシステムプロンプト、ツールセット、およびハイパーパラメータが、すべてのベンチマークとバックボーンで実行されます。https://spatialclaw.github.io/static/pdfs/spatialclaw.pdf Why the Action Interface Matters 研究チームは、同じ質問に対して3つのアクションインターフェースを研究しました。ヒーターとドアの間の最短距離を測定することを考えてみましょう。Single-p
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。