AIが自分でコード学習法を開発
DeepReinforce Releases Ornith-1.0: An Open-Source Coding Model Family That Learns Its Own RL Scaffolds

DeepReinforceが、自分でコードの学習方法を考えるAI「Ornith-1.0」をオープンソースで公開。同規模のAIで最高性能を達成し、AI開発の効率化に期待されます。
DeepReinforceは、エージェント型コーディング用に構築されたオープンソースのモデルファミリー「Ornith-1.0」をリリースしました。このラインナップは、9BのDenseモデルから397Bのmixture-of-expertsフラッグシップまで、4つのサイズに及びます。すべてのチェックポイントはHugging FaceでMITライセンスの下で提供されます。これらのモデルは、事前学習済みのGemma 4とQwen 3.5をベースに後処理学習されています。ほとんどのコーディングエージェントは、モデルと固定された人間が設計したハーネスを組み合わせています。Ornith-1.0は代わりに、独自のハーネスを記述することを学習します。DeepReinforceの研究チームは、同規模のオープンモデルの中で最先端の結果を報告しています。TL;DR Ornith-1.0は、9B、31B、35B-MoE、397B-MoEのサイズでMITライセンスの下で提供され、Gemma 4とQwen 3.5をベースに構築されています。このモデルは、RL中に独自のscaffoldを学習し、ハーネスとソリューションを共同で最適化します。Ornith-1.0-397Bは、両方の主要ベンチマークでClaude Opus 4.7を上回りますが、Opus 4.8やより大きなGLM-5.2-744Bには及びません。固定された信頼境界、決定論的モニター、凍結されたLLM judgeの3つの層が、報酬ハッキングを防ぎます。Ornith-1.0とは何ですか?Ornith-1.0は、コーディングエージェント向けにチューニングされた一連の推論モデルです。バリアントは、9B Dense、31B Dense、35B MoE、397B MoEです。35Bモデルはmixture-of-expertsであり、トークンあたり約3Bのパラメータをアクティブ化します。FP8およびGGUFビルドも、より高速なローカルサービングのために公開されています。各モデルは推論モデルです。返答は、最終的な回答の前に<think>ブロックで始まります。サービングレシピは推論パーサーを可能にし、トレースが個別のreasoning_contentフィールドで返されるようにします。モデルはまた、エージェントループのために整形式のツール呼び出しを発行します。デプロイは簡単です。9Bモデルはbf16で約19GBであり、単一の80GB GPUで動作します。サービングレシピはvLLM、SGLang、およびTransformersを対象としています。各モデルはOpenAI互換のエンドポイントを公開しています。したがって、標準的なエージェントフレームワークはコード変更なしで動作します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。