境界に強い視覚AIを公開
Ant Group’s Robbyant Open-Sources LingBot-Vision: A 1B Boundary-Centric Vision Foundation Model for Dense Spatial Perception

アントグループのRobbyantが、物の境界を正確に捉える視覚AI「LingBot-Vision」を公開。このAIは、少ない学習データとコストで、より大きなAIと同等以上の性能を発揮し、ロボットの認識能力向上に貢献します。
Ant Group内のエンボディードAI企業であるRobbyantは、密な空間認識のために構築された自己教師ありVision TransformersのファミリーであるLingBot-Visionをオープンソース化しました。重みはApache-2.0ライセンスの下、Hugging FaceでViT-giant、ViT-large、ViT-base、ViT-smallの4つのサイズで、技術レポートと推論コードと共に提供されます。ほとんどのビジョン基盤モデルは意味的な不変性のために訓練されます。これらは画像に何があるかを答えることを学習しますが、ロボットやその他の物理的に具現化されたシステムが依存する、オブジェクトの境界、輪郭、深さの不連続性といったきめ細かい空間構造を正確に捨て去ります。LingBot-Visionはその優先順位を逆転させます。これは境界をダウンストリーム出力ではなく、ネイティブな事前学習信号として扱い、その結果、7BのDINOv3を含む、密な空間タスクにおいて最大7倍大きいモデルと同等かそれ以上の性能を発揮する1Bパラメーターのバックボーンが実現しました。LingBot-Visionとは? LingBot-Visionは、空間的に構造化されたダウンストリームタスクのための自己教師あり事前学習エンコーダーです。フラッグシップのViT-g/16は、約1.1Bのパラメーターを持ち、masked boundary modelingと呼ばれる新しい目的関数を用いて、人間によるラベル付け、外部のエッジ検出器、事前学習済みバックボーンなしで、2Bのウェブプールから選定された約1億6100万枚の画像の厳選されたコーパスで訓練されています。この訓練はまた、著しく経済的です。コーパスはDINOv3のLVD-1689Mよりも一桁小さく、モデルが消費する訓練サンプルはDINOv3の3分の1未満です。エンコーダーは、凍結された読み出しを意図した密なパッチトークン特徴量を出力します。より小さな予算での展開のために、フラッグシップはViT-L(300M)、ViT-B(86M)、ViT-Sの生徒モデルに蒸留され、それぞれのサイズクラス内で密な予測をリードします。Masked Boundary Modelingの仕組み この手法はDINO/iBOTの自己蒸留パラダイムに基づいて構築されています。教師モデル(生徒モデルのEMAコピー)がオンラインターゲットを生成し、生徒モデルはマスクされたビューからそれらを復元します。標準的なmasked image modelingは、ランダムにパッチを隠しますが、何がそこにあるかを無視します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。