ディープシーク、AI生成を高速化
DeepSeek Releases DSpark, a Speculative Decoding Framework That Accelerates DeepSeek-V4 Per-User Generation 60–85% Over MTP-1

DeepSeekがDSparkを公開。AIの文章生成速度を60-85%高速化し、利用者の待ち時間を大幅に短縮します。
DeepSeekは、オープンソースのチェックポイントとトレーニングコードを含む、投機的デコーディングフレームワークであるDSparkをリリースしました。これは新しいモデルではなく、サービス提供の最適化です。チェックポイントのDeepSeek-V4-Pro-DSparkとDeepSeek-V4-Flash-DSparkは、既存のV4の重みを再利用し、ドラフトモジュールが付属しています。DeepSeekの研究チームは、投機的デコーディングドラフターのトレーニングと評価のためのMITライセンスのコードベースであるDeepSpecもオープンソース化しました。この取り組みは、多忙な本番環境での大規模モデルの推論を高速化するという一つの問題を対象としています。DSparkは、並列ドラフトバックボーンと小さなシーケンシャルヘッドを組み合わせることで、サフィックスの減衰を抑制します。信頼度ヘッドとロードアウェアスケジューラは、GPUがアイドル状態のときにより多くのトークンを検証し、ビジー状態のときにはより少ないトークンを検証します。オフラインでは、受け入れられる長さがEagle3と比較して26〜31%増加し、DFlashと比較して16〜18%増加しました。DeepSeek-V4での本番環境では、ユーザーごとの生成がMTP-1ベースラインよりも60〜85%高速に実行されます。出力はロスレスのままであり、チェックポイントとDeepSpecのトレーニングコードはオープンソースです。DSparkとは何ですか?投機的デコーディングは、生成を2つの役割に分けます。小さなドラフトモデルがトークンのブロックを提案します。その後、完全なターゲットモデルがそのブロックを1回のフォワードパスで検証します。リジェクションサンプリングは、最も長い有効なプレフィックスを受け入れ、1つのボーナストークンを追加します。このルールはターゲット分布を正確に保持するため、品質の損失はありません。DSparkはこの保証を維持します。DSparkは、トークンがどのようにドラフトされ、いくつ検証されるかを変更します。最適化するレイテンシの計算式: トークンごとのレイテンシは、論文の1つの式に従います。L = (T draft + T verify ) / τ 。ここでτは、サイクルごとに受け入れられるトークンの数です。速度向上は3つのレバーからのみ得られます。T draftを下げてドラフトを速くするか、τを上げてドラフトを良くするか、または無駄なT verifyを減らして検証を賢くするかです。DSparkはこれら3つのレバーすべてを同時に引きます。仕組み: 半自己回帰生成: 以前のドラフターはトレードオフを強いられました。Eagle3のような自己回帰ドラフターは、各トークンを前のトークンに条件付けします。これにより高い受け入れ率が得られますが、ブロックサイズとともにドラフトコストが増加します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。