
Hurtig generering i fuld længde
At generere hele varigheden på én gang betyder, at et fire-minutters track koster langt mindre tid end sekventielle modeller tager for samme længde.
ASLP Lab
Sange i fuld længde genereres på en brøkdel af den normale tid.
Kort sagt
Tal verificeret 2026-08-10. Dette felt flytter sig hurtigt — dobbelttjek før du stoler på dem.
Hastighed er DiffRhythms argument og den kommer fra arkitekturen, ikke fra optimering. De fleste song-modeller genererer sekventielt og forudsiger lyd fremad i tid, hvilket betyder, at et fire-minutters track tager cirka fire gange så lang tid som et ét-minuts. DiffRhythms diffusion-tilgang genererer hele varigheden samtidigt, så længde koster langt mindre end andre steder. For self-hosting ændrer det økonomien direkte: throughput per GPU-time afgør, om det er billigere at køre din egen model end en API, og her vinder DiffRhythm. Kvalitetsafvejningen er reel. Vocals er mindre udtryksfulde end hos de lukkede frontløbere, og langtrækkende struktur er løsere — at generere alt på én gang køber hastighed og koster noget af den narrative sammenhæng, som sekventielle modeller får næsten gratis. Det er den mest arkitektonisk interessante åbne model for alle, der bygger infrastruktur, ikke bare genererer sange.
Styrker

At generere hele varigheden på én gang betyder, at et fire-minutters track koster langt mindre tid end sekventielle modeller tager for samme længde.

Åbne vægte gør hastighedsfordelen brugbar i din egen deployment i stedet for noget, du lejer gennem en API.

Arkitekturen er reelt lærerig, hvis du bygger infrastruktur, fordi den demonstrerer en anden afvejning end alt omkring den.
Hvordan det står sig
DiffRhythm er en model med åbne vægte til song generation, bemærkelsesværdig for at lave tracks i fuld længde usædvanligt hurtigt, med en diffusion-tilgang der genererer hele stykket på én gang i stedet for sekventielt.
Sammenlign med MusicGenerate
Søges som diffrhythm, diffrhythm ai og fast ai music generation. Throughput er hele argumentet — det betyder noget for enhver, der self-hoster, og for ingen, der genererer én sang.
Arkitektur frem for optimering. De fleste song-modeller genererer sekventielt, så et fire-minutters track tager cirka fire gange så lang tid som et ét-minuts. DiffRhythm genererer hele varigheden på én gang, så længde koster meget mindre.
Langdistance-struktur er løsere, og vocals er mindre udtryksfulde end hos de lukkede frontløbere. At generere alt samtidig køber hastighed og koster noget af den narrative sammenhæng, som sekventielle modeller får næsten gratis.
Det er den mest interessante åbne model for alle, der bygger infrastruktur, fordi throughput per GPU-time afgør, om det kan betale sig at køre din egen model frem for en API.
Åbne vægte under forskningsorienterede vilkår, mere restriktiv end Apache 2.0-modellerne i dette katalog. Tjek den specifikke licens på den release, du downloader, før kommerciel deployment.
Vægtene er frit tilgængelige, under forskningsorienterede vilkår, som er mere restriktive end Apache 2.0-modellerne her. Tjek licensen på din specifikke release, før du deployer kommercielt.
Hurtig nok til, at fuldlængde-generering ikke længere er flaskehalsen. Fordi den genererer hele varigheden på én gang, koster længde meget mindre end på sekventielle modeller.
Bliv ved med at udforske
Flere modeller
Modeller og platforme vi følger, sammenlignet på evner og licens.
Sange i fuld længde genereres på en brøkdel af den normale tid.