NVIDIA、AIの検索技術を公開し1位に
NVIDIA AI Releases Nemotron 3 Embed: An Open Embedding Collection Whose 8B Checkpoint Ranks #1 on RTEB

NVIDIAがAIが情報を探し出すための新しい技術「Nemotron 3 Embed」を公開。特に8Bモデルが性能評価で世界一となり、AIの検索精度と効率を大きく向上させます。
Embedding modelsは、エージェント(AI)がどのような文章を見るかを決定します。NVIDIAは、その層で機能するNemotron 3 Embedモデルをリリースしました。これは、本番環境規模のRAG、agentic retrieval、code retrieval、およびagent memoryを対象としています。Nemotron 3 Embedとは何でしょうか?このモデルコレクションには、3つのオープンなチェックポイントが含まれています。Nemotron-3-Embed-8B-BF16は、精度を最優先するオプションです。Nemotron-3-Embed-1B-BF16は、同じ設計をより小さなフットプリントで実現します。Nemotron-3-Embed-1B-NVFP4は、Blackwellに最適化された4ビットパスです。これら3つはすべて、双方向アテンションマスキングで訓練されたtransformer encodersです。最終的なembeddingは、トークンレベルの表現の平均プーリングから得られます。最大シーケンス長は、すべてのチェックポイントで32,768トークンです。各モデルは34言語で評価されました。これら3つはすべて、OpenMDW License Agreement, version 1.1 (OpenMDW-1.1)に準拠しています。注目すべきは、ベースがMistralモデルであることです。8BはMinistral-3-8B-Instruct-2512で構築されています。両方の1BバリアントはMinistral-3-3B-Instruct-2512を使用しています。パフォーマンスNemotron-3-Embed-8B-BF16は、RTEB(Retrieval Embedding Benchmark)において全体で1位にランクインしています(2026年7月17日時点)。評価は16の公開タスクをカバーしています。以下のすべての数値は、モデルシーケンス長4096における平均NDCG@10です。Model Params Emb dim RTEB ViDoRe-V3 text MMTEB (Retrieval)Nemotron-3-Embed-8B-BF16 ~8B 4096 78.46 60.60 75.45Nemotron-3-Embed-1B-BF16 1.14B 2048 72.38 57.74 71.04Nemotron-3-Embed-1B-NVFP4 1.14B 2048 72.00 — —llama-nemotron-embed-vl-1b-v2 — — 61.98 52.54 59.71llama-nemotron-embed-1b-v2 — — 60.47 52.10 59.58注目すべき2つのギャップがあります。1Bモデルは、前世代のベースラインであるllama-nemotron-embed-vl-1b-v2と比較して、RTEBスコアで10.4ポイント向上しています。また、NVFP4はBF16の親モデルと比較して0.38 RTEBポイントの低下に留まり、99.5%の性能を維持しています。1Bモデルはどのように構築されたか?これらの1Bスコアは、より小規模なトレーニング実行ではなく、圧縮パイプラインから得られたものです。親モデルはnemotron-3-embed-3bで、NVIDIA ModelOpt mcore_minitron Neural Aを使用して2回の反復ラウンドで剪定および蒸留されました。まず、3Bの親モデルは2Bに剪定されました。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。