Prime Intellectが賢いAI学習ツールを更新
Prime Intellect Releases prime-rl 0.6.0 to Train Trillion-Parameter MoE Models on Agentic RL Workloads

Prime Intellectが、超巨大AIモデルを効率よく学習させる「prime-rl 0.6.0」を公開。AIが複雑な作業をより賢く、短時間でこなせるようになります。
Prime Intellectはprime-rlバージョン0.6.0をリリースしました。このフレームワークは、兆個のパラメータを持つMixture-of-Experts (MoE) モデルにおける強化学習を対象としています。特に、長期間にわたるソフトウェアエンジニアリングタスクのような、重いagenticなワークロードに焦点を当てています。研究チームは、最大131kのシーケンス長でSWEタスクにおいてGLM-5を学習させました。ステップ時間は5分未満に抑えられました。バッチサイズは256ロールアウトでした。この実行にはわずか28台のH200ノードしか使用されませんでした。TL;DR prime-rl 0.6.0は、agenticなRLワークロードにおいて兆個のパラメータを持つMoEモデルを学習させます。GLM-5は、131kのシーケンス長、5分未満のステップ時間、28台のH200ノードでSWEタスクを学習しました。非同期RLは、独立した最適化のためにトレーナーと推論を分離します。推論にはFP8、Wide EP、P/D disaggregation、KV offloading、およびrouter replayが使用されます。学習には、3次元並列処理(FSDP、EP、CP)とblock-scaled FP8が使用されます。prime-rl 0.6.0とは何ですか?prime-rlは、非同期強化学習のためのオープンフレームワークです。これは、agenticなタスクにおいて大規模なオープンソースモデルを後学習(post-trains)させます。バージョン0.6.0は、これを兆個のパラメータを持つMoEスケールに拡張します。発表における例示モデルはzai-org/GLM-5.1です。この最適化は、他の大規模なMoEモデルにも適用されます。例としては、moonshotai/Kimi-K2.7-Codeやnvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16が含まれます。完全なGLM-5.1の実行は、Slurmクラスター上で1つのコマンドで開始されます。Copy Code Copied Use a different Browser uv run rl @ examples/glm5_llmd/rl.toml --output-dir /shared/outputs/glm5-llmd非同期RLの役割Agenticなタスクには、長期間にわたる外れ値があります。一部のコーディングロールアウトは何時間も実行されます。ポリシー更新の前にそれらを待つと、GPUがアイドル状態になります。非同期RLはこれを回避します。トレーナーと推論システムは分離されています。それらは独立して実行およびスケーリングされます。オプティマイザーステップが完了するとすぐに推論ポリシーが更新されます。同期ポイントは1つだけです。それはポリシー更新です。prime-rlは、新しい重みが存在する限り、すぐにプッシュします。すでにディスパッチされたロールアウトは、アクティブなプレフィックスキャッシュを保持します。そのため、単一のロールアウトは複数のポリシーバージョンからのトークンを混在させる可能性があります。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。