MusicGenerate

Demucs (HTDemucs)

Meta AI 研究

其他一切都会拿它当分离基准的模型。

一句话

Demucs(其混合 Transformer 形态为 HTDemucs)是 Meta 研究团队的源分离模型,也是将一首混音拆成人声、鼓、贝斯和其他部分的最高质量开源选项。它不是生成模型。

Demucs (HTDemucs) 规格

输出
4 个分轨:鼓、贝斯、人声、其它
质量
~9.0–9.2 dB SDR(MUSDB HQ)
架构
混合 Transformer,时域
权重
开放
运行时
建议使用 GPU
状态
评估中

数据已核实 2026-08-10。 这个领域变化很快——在依赖它们前请再核对一遍。

关于 Demucs (HTDemucs)

分离和生成是两码事,而 Demucs 是分离的参考解法。给它一首完成的立体声混音,它能还原各个来源,比替代方案的伪影明显更少——尤其在瞬态上,差的模型会把鼓点抹成一团。这很要命,因为瞬态受损会让分离出来的 stem 在 remix 里没法用:人声稍微发闷还能想办法,鼓丢了击破感就没救。几乎所有商业的 stem 分轨服务跑的都是 Demucs 或它的变体,知道这一点能帮你在付费前动动脑子。它本地运行很简单,不需要奇特硬件,也能把未发布素材留在你自己的机器上。持续维护意味着质量不是停在论文发布那天,而是在变得更好。

长处

Demucs (HTDemucs) 擅长什么

公开可用中分离质量最佳

伪影比任何其他开源选项都少,而这在分离里就是全部——一条能听见算法在动手的 stem,就是一条没法用的 stem。

瞬态保留得好

鼓的击打在分离后还能完整保留;而瞬态受损,正是让分离出来的 stem 在 remix 里变得没用的罪魁祸首。

积极维护中

持续维护意味着质量在发表后还在提升,而不是定格不动——这对科研发布并不常见。

Demucs (HTDemucs) 限制

  • 模型大,需要不小的算力
  • 不能在浏览器标签页里运行
  • 四个固定分轨

怎么比

选择 Demucs (HTDemucs)

会生成什么

Demucs(其混合 Transformer 形态为 HTDemucs)是 Meta 研究团队的源分离模型,也是将一首混音拆成人声、鼓、贝斯和其他部分的最高质量开源选项。它不是生成模型。

与 MusicGenerate 对比

Demucs (HTDemucs) 评测、定价与替代品

常见搜索词:demucs、htdemucs、demucs stem separation、demucs github、best stem separation。最后那个才是实话——付费服务就是拿它当基准搭起来的。

Demucs (HTDemucs) — 常见问题

Demucs 是现在最好的 stem 分轨吗?

它是开源里质量最高的选项,也是别人对标的基准。大多数商业 stem 分轨服务跑的都是 Demucs 或它的变体。

为什么 Demucs 的 stem 听起来比别的工具好?

伪影更少,尤其是瞬态保留得更好。瞬态受损会让分离出来的鼓在 remix 里完全不可用——人声稍微发闷还能想办法,鼓没了击破感就没法救。

普通电脑能跑 Demucs 吗?

能。它本地就能跑,不需要奇特硬件,还能保证你的未发布素材不落在别人的服务器上。

把音轨做分离就有权发布吗?

没有。分离不会产生任何新权利。自用练习和研究没问题;公开发布要先和原始录音的权利人清算授权。

Demucs 是免费的吗?

是。它开源,本地跑免费。多数商业的 stem 分轨服务收的钱,本质上就是给它套了个托管外壳。

Demucs 分离一首歌要多久?

用 CPU 几分钟,用 GPU 会短得多,取决于你选的模型变体和 shift 等设置——这些设置本来就是用时间换质量。

Demucs (HTDemucs)

其他一切都会拿它当分离基准的模型。