AI音楽モデル
最良の音楽モデルは数週間ごとに入れ替わるので、ひとつに縛られるのは悪手です。こちらが 28 追跡しているモデルです—それぞれが本当に得意なこと、弱いところ、そのライセンスが出力で何を許すかを示します。
ベンチマークの前にライセンスを読みましょう
よく知られたオープンモデルのうち2つは、販売するものを作る用途には使えません。 MusicGen はCC BY-NCです—制限は出力に付随するので、セルフホストしても何も変わりません—そして Stable Audio Open は一般的な商用許諾ではないコミュニティライセンスで提供されています。多くのチームは、上に積み上げた後で遅れてそれに気づきます。 ACE-Step および YuE はApache 2.0で、話は別です。モデルのライセンスと学習データの来歴は別問題であり、ここにあるのは法的助言ではありません。
30秒で自分のモデルを見つける

他のあらゆる曲モデルが比べられる、ボーカルのベンチマークです。
Weights: see page
- 出力
- ボーカル入りのフル曲
- 基本の長さ
- ~4分、延長可能
- サンプルレート
- 44.1 kHz(最上位ティアは48 kHz)
- ウェイト
- クローズド
- 現状で最も説得力のあるボーカル表現です
- ループの継ぎはぎではない本物の曲構成です
- 初回生成の当たり率が非常に高いです
ボーカル入りのフル楽曲
歌詞、メロディ、アレンジ、そして歌唱までを一度でまとめて生成します。
Suno v5
Suno
他のあらゆる曲モデルが比べられる、ボーカルのベンチマークです。
Udio
Udio
初回生成のあとも編集を続けられる曲モデルです
Google Lyria 3
Google DeepMind
直接販売ではなく、Google経由で配布される DeepMind の楽曲モデルです。
ElevenLabs Music
ElevenLabs
生成前に構成を指定できる楽曲モデルです。
MiniMax Music 2.5
MiniMax
プレミアム層の生成単価のごく一部のコストでフルの曲を生成できます。
MiniMax Music 1.5
MiniMax
テキスト説明ではなく、リファレンス音源クリップによるスタイル・コンディショニングです。
MiniMax Music-01
MiniMax
下書き用のモデル—その場で試行錯誤できるだけ十分に速くて安いです。
Mureka
Kunlun Tech
異常に速いリリース頻度を持つ API 優先の曲生成です。
Riffusion
Riffusion
スペクトログラム実験が曲プラットフォームへと化けた存在です。
インストゥルメンタル&サウンドデザイン
ボーカルなしの音楽です—ベッド、ループ、テクスチャ、エフェクト。
オープンウェイト
ダウンロードしてセルフホストできるモデルです。ライセンス条件は大きく異なります。
ACE-Step
ACE Studio & StepFun
本当にビジネスに使えるライセンスのオープンな楽曲モデルです。
YuE
マルチモーダル・アート・プロジェクション
あなたが渡した言葉を実際にそのまま歌うオープンモデルです。
DiffRhythm
ASLP Lab
いつもの時間の一部でフル尺の曲を生成します。
Stable Audio Open
Stability AI
学習データを実名で示せるオープンモデルです。
MusicGen
Meta AI
ひらめきをハミングすると編曲まで仕上がります—元祖メロディ条件付きモデルです。
MAGNeT
Meta AI
Metaの高速モデルです — 逐次的な待ち時間なしで同等の品質です。
分離
仕上がったミックスをステムに戻して分割します。
製品&プラットフォーム
生成モデルの上に構築されたコンシューマー向け/クリエイター向けツールです。
Musicfy
Musicfy
曲ジェネレーターではなく、ボーカル変換のプラットフォームです
Soundful
Soundful
驚きより予測可能を求めるクリエイター向けのテンプレートベースのトラックです。
Loudly
Loudly
生成にライブラリを足して、生成だけで外したときの保険にします。
Soundraw
Soundraw
全体を再生成する代わりに、セクションごとにアレンジを編集できます。
Boomy
Boomy
ゼロから配信サービス上のトラックまでの最短経路です。
Mubert
Mubert
埋め込み用途のために作られた、途切れず繰り返さない音楽です。
AIVA
AIVA Technologies
完成音源ではなくMIDIを渡してくれるタイプです。
LALAL.AI
LALAL.AI
何もインストールしたくない人のためのstem分離です。
これをどう使っているか
MusicGenerateは、一つのモデルに賭けるのではなく、モデル間をルーティングする前提で作られています。上のカタログは当社が追跡し評価している対象です。どのモデルが今この瞬間にプロダクトへ配線されているかは別問題で、業界の動きに合わせて答えは変わります。各ページの数値には検証日が付いています。このカテゴリのベンチマークは四半期で陳腐化するからです。
中身
追跡しているモデルとプラットフォームです。
出力、どこまでコントロールできるか、そしてライセンスで何が許されるかで比較します。
1 / 5
差を生む本質は商用権利です。
音は似ていても、成果物を公開してよいかは真逆ということがあります。そこは最後ではなく最初に問うべき点です。
オープンウェイトとオープンライセンスは同じではありません。
ダウンロード可能なモデルでも非商用条項が付くことがあります。自前ホスティングしても、許される範囲はライセンスで決まったままです。
仕様の変化は記事より速いです。
すべての項目に検証日を記載します。見た目だけ新しくて実は古いページは、古さを認めているページより悪いからです。
制限事項を公開します。
制限事項のないモデル紹介は、ただのパンフレットです。みんなが探しているのは制限です。
よくある質問
最高のAI音楽モデルはどれですか?
用途次第です。ボーカルのリアリズムはSuno、生成後の編集はUdio、構造の制御はElevenLabs、インストゥルメンタルの質感とセルフホスティングはStable Audio、編集可能なMIDIはAIVAが強みです。
ローカルで実行できるAI音楽モデルはどれですか?
Stable Audio Open、ACE-Step、YuE、MusicGen、MAGNeT、DiffRhythm はいずれもオープンな重みを公開しています。ライセンスは大きく異なり、ACE-Step と YuE は Apache 2.0、他は商用展開を制限します。
モデルとプラットフォームの違いは何ですか?
モデルは音声を生成する仕組みで、プラットフォームはそれを包む製品です。Suno と Udio はクローズドなモデルを抱えるプラットフォームで、MusicGen は自分で走らせられるモデルです。
オープンウェイトの音楽モデルは商用利用を許可していますか?
一部だけです。Apache 2.0 のモデルは明確に許可しますが、複数のリサーチライセンスは許可しません。ライセンスが対象にするのは重みであり、学習に使われたデータについては何も語りません。そこは別のリスクです。
最もリアルなAIボーカルを持つモデルはどれですか?
現時点では Suno v5 がベンチマークです。ブレス、ビブラート、ダイナミックなフレージングが“近似”ではなく“演じられており”、このディレクトリ中のどのモデルにもない明確な優位点になっています。
このディレクトリはどのくらいの頻度で更新されていますか?
各エントリには事実を最後に検証した日付が付いています。動きが速い分野ですので、数カ月前の仕様はベンダーでの再確認に値すると考えてください。

















