Kyutai、複数の楽器の音を楽譜にするAI公開
Kyutai Releases MuScriptor: An Open-Weight Decoder-Only Transformer for Multi-Instrument Music Transcription to MIDI

Kyutaiが、複数の楽器の音を楽譜に書き出すAI「MuScriptor」を公開。これまで難しかった複数楽器の楽譜化を可能にし、音楽制作を助けます。
自動音楽書き起こし(AMT)は、音声録音を記号的な音符、通常はMIDIに変換します。単一楽器の書き起こしはすでにかなりうまく機能しています。しかし、完全な複数楽器のミックスを書き起こすことは依然として困難です。KyutaiとMireloチームは、このギャップを埋めるためにMuScriptorをリリースしました。これは、多くのジャンルにわたる実際の複数楽器の録音でトレーニングされたオープンウェイトモデルです。この記事では、MuScriptorがどのように機能するか、ベンチマークが何を示しているか、そしてどのように実行するかを説明します。<br>MuScriptorとは?<br>その核となるのは、音楽書き起こし用のdecoder-only Transformerです。まず、短いオーディオセグメントのmel-spectrogramを読み取ります。次に、ピッチ、タイミング、楽器のMIDIライクなトークンを自己回帰的に予測します。実質的に、書き起こしはMT3 tokenization schemeに従う言語モデリングタスクになります。このリリースでは、Hugging Faceで3つの重みバリアントが提供されています。それらのサイズは、small(103M)、medium(307M、デフォルト)、large(1.4B)です。推論コードはMITライセンスを使用しています。重みはCC BY-NC 4.0を使用しているため、商用利用は制限されています。<br>3段階パイプラインの仕組み<br>MuScriptorの主なアイデアは、アーキテクチャではなくデータです。したがって、トレーニングは3段階で進行し、それぞれが前の段階に基づいて構築されます。事前トレーニングでは、約145万のMIDIファイルであるDSynthを使用します。オンザフライのパイプラインは、トレーニング中にそれらを合成します。拡張には、ピッチシフト、テンポ変更、ベロシティ調整、楽器のランダム化が含まれます。250を超えるsoundfontsとランダムなデチューニングにより、ほぼ無限のオーディオ実現が得られます。ファインチューニングでは、17万の録音の内部セットであるDRealを使用します。これらを合わせると、アラインされた音符アノテーション付きで合計11,000時間以上になります。ほとんどのアライメントは、補間とdynamic time warpingを使用したオーディオシンボリック同期から得られます。不良なペアは、warping distanceと最大時間拡張係数によってフィルタリングされます。強化学習による後処理トレーニングでは、手動で検証された300トラックであるDRLを使用します。チームはREINFOを組み合わせたGRPOライクな手法を適用します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。