小型AIが思考を模倣し個人端末で動く
Someone Fine-Tuned OpenBMB’s MiniCPM5-1B on Claude Fable 5 Traces to Ship a 657MB Local Thinking Model

個人端末で動く小型AIが、強力なAIの思考を模倣。ネット不要で高度なAI体験が可能ですが、実際の推論能力は模倣にとどまります。
コミュニティ開発者のGnLOLot氏が、完全にローカルハードウェアで動作する1Bモデルを公開しました。モデルはMiniCPM5-1B-Claude-Opus-Fable5-Thinkingで、llama.cpp互換のランタイム向けにGGUFビルドが提供されています。APIキーは不要で、クラウドへの呼び出しも行いません。提案されたモデル
このモデルはopenbmb/MiniCPM5-1Bをベースに構築されています。このベースは、OpenBMBから正式に文書化されたリリースです。これは標準的なLlamaForCausalLMアーキテクチャを使用する、密な1.08Bパラメータモデルです。24層、grouped-query attention、131,072トークンのコンテキスト長を持っています。OpenBMBは、独自の比較セット内で1BクラスのオープンソースSOTAを報告しています。このベースはすでにネイティブの思考テンプレートを搭載しています。推論はenable_thinkingを介して切り替えられ、ThinkモードとNo Thinkモードの両方を提供します。派生モデルはこのテンプレートとMiniCPM5のツール呼び出し形式を維持しています。このベースの上に、開発者はfine-tuneを適用しました。カードには、コーディングと指示の追従を改善するために「Fable 5データでさらにfine-tuneされた」と記載されています。GGUFカードでは、これを「Fable 5データでpost-trainedされた」と繰り返しています。実際にどのように構築されているか
記述された方法は古典的なdistillationではありません。元のモデルを縮小するわけではありません。代わりに、教師モデルと多くの会話を生成します。その応答と推論のトレースをテキストとしてキャプチャします。次に、そのトレースに基づいて小さなベースモデルをsupervised-fine-tuneします。この区別は精度にとって重要です。古典的なdistillationは、教師のlogitsまたはweightsからシグナルを転送します。Claudeのweightsまたはlogitsにアクセスできる人はいません。したがって、これは生成された出力に対するsupervised fine-tuningであり、weightレベルのdistillationではありません。対照的に、OpenBMB自身のベースモデルは、独自の教師と生徒のチェックポイント間で文書化されたOn-Policy Distillationステージを使用しています。実用的な効果としては、この1Bモデルが応答形式とスタイルを模倣することを学習するということです。教師の根底にある能力を吸収するわけではありません。1Bパラメータの予算では、最先端の推論を保持することはできません。スペックは
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。