小さなAIが巨大AI並みに賢く
VibeThinker-3B: A 3B Dense Reasoning Model Built on Qwen2.5-Coder-3B With the Spectrum-to-Signal Post-Training Pipeline

VibeThinker-3Bという30億の小さなAIが、数学やプログラミングで数百倍大きなAIと同じ性能を発揮し、効率的なAI開発の可能性を示しました。
AIが考える能力における最近の進歩は、主に数十億ものパラメーターを投入して複雑な認知の壁を越えるという大規模なアプローチによって推進されてきました。しかし、VibeThinker-3Bは全く異なる道を切り開いています。中国のSina Weibo Incの研究者によって開発されたこの30億パラメーターのモデルは、効率性がそのサイズをはるかに超える性能を発揮できることを証明しています。オープンソースのMITライセンスでリリースされたVibeThinker-3Bは、数学、コーディング、STEM分野といった検証可能なタスクにおいて、数百倍のサイズを持つモデルの性能に匹敵します。VibeThinker-3Bとは何か VibeThinker-3Bは、Qwen2.5-Coder-3Bをベースに構築されたコンパクトな密なモデルです。これはゼロから事前学習されたものではなく、事後学習されています。研究チームは、その上に教師ありファインチューニング(SFT)、強化学習(RL)、自己蒸留を適用しています。この学習フレームワークは、以前のVibeThinker-1.5Bから続くSpectrum-to-Signal Principle (SSP) を継承しています。SFTは、有効な推論経路の広い空間である「Spectrum」を構築し、RLは正しい経路である「Signal」を増幅します。このモデルは、検証者が答えを確認できる推論という一つのタスクを目的としています。研究チームは、オープンな知識タスクにはより大きな汎用モデルを推奨しています。VibeThinker-3Bは、設計上スペシャリストです。標準的なスタックで動作します。モデルの重みにはtransformers>=4.54.0が必要です。より高速な推論のためには、vLLM==0.10.1またはSGLang>=0.4.9.post6を推奨しています。BF16の重みは約6 GBで、単一のGPUで十分な小ささです。https://arxiv.org/pdf/2606.16140v1 ベンチマーク AIME26において、VibeThinker-3Bは94.3点を獲得しました。研究論文によると、これはDeepSeek V3.2 (671B) やKimi K2.5 (1T) に匹敵するとのことです。LiveCodeBench v6では、Pass@1で80.2に達しました。別のコードベンチマークであるOJBenchでは38.6点を記録し、最大のモデルには及ばないものの、HMMT25では89.3点、BruMO25では93.8点に達しました。400問のIMOレベルのセットであるIMO-AnswerBenchでは76.4点を記録しました。以下の表は、はるかに大きな推論モデルと比較したものです。'+CLR&
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。