
フル尺の高速生成
全尺を一括生成するので、4分トラックでも逐次モデルより所要時間が大幅に小さくなります。
ASLP Lab
いつもの時間の一部でフル尺の曲を生成します。
要点
数値は検証済み 2026-08-10。この分野は動きが速いので、鵜呑みにする前にもう一度確認してください。
速度の理由は最適化ではなくアーキテクチャです。多くの曲モデルは時間方向に音声を順次予測するため、4分のトラックは1分ものの約4倍かかります。DiffRhythm は全尺を同時生成するので、長さのコストが大幅に下がります。セルフホストでは経済性に直結します。GPU 時間あたりのスループットが、自前運用が API より安いかを決め、ここで DiffRhythm は勝ちます。品質のトレードオフは現実です。ボーカルはクローズドの先行モデルより表情が乏しく、ロングレンジ構造はゆるい—一括生成は速度を買う代わりに、逐次モデルがほぼタダで得る物語的一貫性の一部を失います。インフラを作る人にとって、単に曲を生成するだけでなく、最もアーキテクチャ的におもしろいオープンモデルです。
強み

全尺を一括生成するので、4分トラックでも逐次モデルより所要時間が大幅に小さくなります。

オープンウェイトなので、その速度優位を API 越しに借りるのではなく自前デプロイで使えます。

インフラを作るなら本当に示唆的なアーキテクチャです。周囲のモデルとは別種のトレードオフを見せてくれます。
比較するとどうか
DiffRhythm は、逐次ではなく一括で全体を生成する拡散手法を用い、フル尺のトラックを異常に速く作ることで目立つオープンウェイトの曲生成モデルです。
MusicGenerateと比較
diffrhythm、diffrhythm ai、fast ai music generation で検索されています。論点はスループットただ一つ。セルフホストする人には重要ですが、1曲だけ作る人にはどうでもいい話です。
理由は最適化ではなくアーキテクチャです。多くの曲モデルは逐次生成なので、4分トラックは1分ものの約4倍かかります。DiffRhythm は全尺を一度に生成するため、長さのコストが大幅に下がります。
ロングレンジ構造がゆるく、ボーカルはクローズドの先行モデルより表情が乏しいことです。すべてを同時生成すると速度は得られますが、逐次モデルがほぼタダで得る物語的一貫性の一部を失います。
GPU 時間あたりのスループットが、自前運用が API に勝てるかを決めます。インフラを作る人にとって、これは最もおもしろいオープンモデルです。
研究志向の条件でのオープンウェイトで、このディレクトリの Apache 2.0 モデルより制限が厳しめです。商用展開前に入手するリリースの個別ライセンスを確認してください。
ウェイトは公開されていますが、研究志向の条件で、このディレクトリの Apache 2.0 より制限が厳しめです。商用展開前に対象リリースのライセンスを確認してください。
フル尺生成がボトルネックでなくなる程度には速いです。全尺を一度に生成するため、長さのコストが逐次モデルより桁違いに小さくなります。
ほかのモデル
追跡しているモデルとプラットフォームを、性能とライセンスで比較します。