
Snabb fullängdsgenerering
Att generera hela längden på en gång gör att ett fyraminuters spår kostar mycket mindre tid än vad sekventiella modeller tar för samma längd.
ASLP Lab
Låtar i full längd genereras på en bråkdel av den vanliga tiden.
Kort sagt
Siffror verifierade 2026-08-10. Det här fältet rör sig snabbt — dubbelkolla innan du litar på dem.
Hastighet är DiffRhythms poäng och den kommer från arkitekturen snarare än optimering. De flesta låtmodeller genererar sekventiellt och förutspår ljud framåt i tiden, vilket gör att ett fyraminuters spår tar ungefär fyra gånger så lång tid som ett på en minut. DiffRhythms diffusionssätt genererar hela längden samtidigt, så längd kostar mycket mindre än annars. För egen drift ändrar det kalkylen direkt: genomströmning per GPU-timme avgör om det är billigare att köra din egen modell än ett API, och här vinner DiffRhythm. Kvalitetsavvägningen är verklig. Sången är mindre uttrycksfull än hos de slutna ledarna och långräckviddsstrukturen är lösare — att generera allt på en gång köper fart men kostar en del av den narrativa sammanhållning som sekventiella modeller får nästan gratis. Det är den mest arkitektoniskt intressanta öppna modellen för den som bygger infrastruktur snarare än bara genererar låtar.
Styrkor

Att generera hela längden på en gång gör att ett fyraminuters spår kostar mycket mindre tid än vad sekventiella modeller tar för samma längd.

Öppna vikter gör hastighetsfördelen användbar i din egen drift i stället för något du hyr via ett API.

Arkitekturen är på riktigt lärorik om du bygger infrastruktur, för den visar en annan avvägning än allt runtomkring.
Hur det står sig
DiffRhythm är en modell med öppna vikter för låtgenerering som utmärker sig genom att skapa spår i full längd ovanligt snabbt, med en diffusionsmetod som genererar hela stycket på en gång i stället för sekventiellt.
Jämför med MusicGenerate
Söks som diffrhythm, diffrhythm ai och fast ai music generation. Genomströmning är hela poängen, vilket spelar roll för alla som kör själva och för ingen som bara genererar en låt.
Arkitektur snarare än optimering. De flesta låtmodeller genererar sekventiellt, så ett fyraminuters spår tar ungefär fyra gånger så lång tid som ett på en minut. DiffRhythm genererar hela längden på en gång, så längd kostar mycket mindre.
Långräckviddsstrukturen är lösare och sången mindre uttrycksfull än hos de slutna ledarna. Att generera allt samtidigt köper fart men kostar en del av den narrativa sammanhållning som sekventiella modeller får nästan gratis.
Det är den mest intressanta öppna modellen för alla som bygger infrastruktur, eftersom genomströmning per GPU-timme avgör om din egen modell slår ett API.
Öppna vikter under forskningsinriktade villkor, mer restriktiva än Apache 2.0-modellerna i den här katalogen. Kolla den specifika licensen för releasen du laddar ner innan kommersiell drift.
Vikterna är öppet tillgängliga, under forskningsinriktade villkor som är mer restriktiva än Apache 2.0-modellerna här. Kolla licensen för just din release innan kommersiell drift.
Tillräckligt snabb för att fullängdsgenerering slutar vara flaskhalsen. Eftersom den genererar hela längden på en gång kostar längd mycket mindre än på sekventiella modeller.
Fortsätt utforska
Fler modeller
Modeller och plattformar vi följer, jämförda på förmåga och licens.
Låtar i full längd genereras på en bråkdel av den vanliga tiden.