
公开可用中分离质量最佳
伪影比任何其他开源选项都少,而这在分离里就是全部——一条能听见算法在动手的 stem,就是一条没法用的 stem。
Meta AI 研究
其他一切都会拿它当分离基准的模型。
一句话
数据已核实 2026-08-10。 这个领域变化很快——在依赖它们前请再核对一遍。
分离和生成是两码事,而 Demucs 是分离的参考解法。给它一首完成的立体声混音,它能还原各个来源,比替代方案的伪影明显更少——尤其在瞬态上,差的模型会把鼓点抹成一团。这很要命,因为瞬态受损会让分离出来的 stem 在 remix 里没法用:人声稍微发闷还能想办法,鼓丢了击破感就没救。几乎所有商业的 stem 分轨服务跑的都是 Demucs 或它的变体,知道这一点能帮你在付费前动动脑子。它本地运行很简单,不需要奇特硬件,也能把未发布素材留在你自己的机器上。持续维护意味着质量不是停在论文发布那天,而是在变得更好。
长处

伪影比任何其他开源选项都少,而这在分离里就是全部——一条能听见算法在动手的 stem,就是一条没法用的 stem。

鼓的击打在分离后还能完整保留;而瞬态受损,正是让分离出来的 stem 在 remix 里变得没用的罪魁祸首。

持续维护意味着质量在发表后还在提升,而不是定格不动——这对科研发布并不常见。
怎么比
Demucs(其混合 Transformer 形态为 HTDemucs)是 Meta 研究团队的源分离模型,也是将一首混音拆成人声、鼓、贝斯和其他部分的最高质量开源选项。它不是生成模型。
与 MusicGenerate 对比
常见搜索词:demucs、htdemucs、demucs stem separation、demucs github、best stem separation。最后那个才是实话——付费服务就是拿它当基准搭起来的。
它是开源里质量最高的选项,也是别人对标的基准。大多数商业 stem 分轨服务跑的都是 Demucs 或它的变体。
伪影更少,尤其是瞬态保留得更好。瞬态受损会让分离出来的鼓在 remix 里完全不可用——人声稍微发闷还能想办法,鼓没了击破感就没法救。
能。它本地就能跑,不需要奇特硬件,还能保证你的未发布素材不落在别人的服务器上。
没有。分离不会产生任何新权利。自用练习和研究没问题;公开发布要先和原始录音的权利人清算授权。
是。它开源,本地跑免费。多数商业的 stem 分轨服务收的钱,本质上就是给它套了个托管外壳。
用 CPU 几分钟,用 GPU 会短得多,取决于你选的模型变体和 shift 等设置——这些设置本来就是用时间换质量。
继续探索
更多模型
我们跟踪的模型与平台,按能力与许可对比。