NVIDIA、映像AIを賢く進化
NVIDIA Released DeepStream 9.1: Bringing Agentic AI to Vision AI With 13 Skills and Multi-View 3D Tracking

NVIDIAの映像AIツールDeepStream 9.1が新機能で進化。複数のカメラで物体を賢く追跡し、開発者がAIシステムを素早く作れるようになります。
NVIDIAはDeepStream 9.1をリリースしました。このアップデートは、ビデオ分析における長年の課題を解決します。従来、複数のカメラで一つの物体を追跡するには、手動でのカメラキャリブレーションと複雑な計算が必要でした。DeepStream 9.1は、Multi-View 3D Tracking (MV3DT) と AutoMagicCalib (AMC) という2つの追加機能でこれに対応します。どちらもコーディングエージェント向けのagentic skillとして提供されます。これにより、開発者はコンセプトから実行可能なパイプラインへとより迅速に移行できます。 映像AIツールDeepStream 9.1とは何か このアップデートを理解するには、まず基本プラットフォームから始めましょう。DeepStreamは、NVIDIAのAIベースのビデオおよび画像理解のためのストリーミング分析ツールキットです。NVIDIA GPU上でマルチストリーム、マルチモデル推論を行うためのGStreamerベースのフレームワークを提供します。パイプラインは、ハードウェアアクセラレーションによるデコードとエンコード、TensorRT推論、物体追跡、メッセージブローカー統合を組み合わせます。 この基盤の上に、バージョン9.1では以下の5つの注目すべき項目が追加されます: 13のagentic skill。 クロス-カメラ追跡のためのMV3DT skill。 自動キャリブレーションのためのAMC skill。 Jetson OrinおよびThorエッジデバイス向けのNVIDIA JetPack 7.2サポート。 CC-BY-4.0およびApache-2.0の下で統一されたオープンソースGitHubリポジトリ。 MV3DTが複数のカメラで物体を追跡する方法 これらの追加機能の中で、MV3DTが主要なskillであるため、その仕組みを考えてみましょう。MV3DTの核となるのは、複数のキャリブレーションされたカメラからの検出結果を共有の3D座標系に投影することです。次に、異なるカメラビューからの同じ物体の観測を関連付けます。最後に、グローバルに一貫した単一の物体IDを割り当てます。具体的には、データフローは4つのステージで実行されます。検出では、各カメラストリームが物体検出器を実行します。MV3DTは、以下の3つのモデルをすぐにサポートします: PeopleNetTransformer: トランスフォーマーベースの人物検出器で、歩行者シーンのデフォルト。 PeopleNet v2.6.3: DetectNet_v2アーキテクチャに基づく高効率検出器。 RT-DETR 2D: 歩行者、運搬車、フォークリフト用のマルチクラス検出器。 次に、単眼3D認識のために、各カメラは3×4の投影行列を使用します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。