
Rask generering i full lengde
Å generere hele varigheten på én gang betyr at et fireminutters spor koster langt mindre tid enn sekvensielle modeller tar for samme lengde.
ASLP Lab
Sanger i full lengde genereres på en brøkdel av vanlig tid.
Kort fortalt
Tall verifisert 2026-08-10. Feltet beveger seg raskt — dobbeltsjekk før du stoler på dem.
Hastighet er DiffRhythms sak, og den kommer fra arkitektur, ikke finpuss. De fleste sangmodeller genererer sekvensielt, de forutsier lyd fremover i tid, som betyr at et fireminutters spor tar omtrent fire ganger så lang tid som et på ett minutt. DiffRhythms diffusjonsmetode genererer hele varigheten samtidig, så lengde koster langt mindre enn ellers. For selvhosting endrer det regnestykket direkte: gjennomstrømning per GPU-time avgjør om det lønner seg å kjøre egen modell kontra en API, og her vinner DiffRhythm. Kvalitetsavveiningen er reell. Vokalen er mindre uttrykksfull enn hos de lukkede lederne, og langdistanse-strukturen er løsere — å generere alt på én gang kjøper fart og koster noe av den fortellende sammenhengen sekvensielle modeller får nesten gratis. Det er den mest arkitektonisk interessante åpne modellen for deg som bygger infrastruktur, ikke bare genererer sanger.
Styrker

Å generere hele varigheten på én gang betyr at et fireminutters spor koster langt mindre tid enn sekvensielle modeller tar for samme lengde.

Åpne vekter gjør fartsfordelen brukbar i egen drift, ikke noe du må leie via en API.

Arkitekturen er faktisk lærerik hvis du bygger infrastruktur, fordi den viser en annen avveining enn alt rundt.
Hvordan det står seg
DiffRhythm er en open-weight sanggenerator som skiller seg ut ved å lage spor i full lengde uvanlig raskt, med en diffusjonsmetode som genererer hele stykket på én gang i stedet for sekvensielt.
Sammenlign med MusicGenerate
Søkes som diffrhythm, diffrhythm ai og fast ai music generation. Gjennomstrømning er hele argumentet — det betyr noe for alle som selvhoster og null for den som skal lage én sang.
Arkitektur, ikke optimalisering. De fleste sangmodeller genererer sekvensielt, så et fireminutters spor tar omtrent fire ganger så lang tid som et på ett minutt. DiffRhythm genererer hele varigheten på én gang, så lengde koster langt mindre.
Langtrekkende struktur er løsere og vokalen mindre uttrykksfull enn hos de lukkede lederne. Å generere alt samtidig kjøper fart og koster noe av den fortellende sammenhengen sekvensielle modeller får nesten gratis.
Det er den mest interessante åpne modellen for deg som bygger infrastruktur, fordi gjennomstrømning per GPU-time avgjør om egen drift slår en API.
Åpne vekter under forskningsrettede vilkår, mer restriktiv enn Apache 2.0-modellene i denne oversikten. Sjekk den konkrete lisensen på utgivelsen du laster ned før kommersiell bruk.
Vektene er åpent tilgjengelige, under forskningsrettede vilkår som er mer restriktive enn Apache 2.0-modellene her. Sjekk lisensen på din konkrete utgivelse før kommersiell bruk.
Rask nok til at generering i full lengde slutter å være flaskehalsen. Fordi den genererer hele varigheten på én gang, koster lengde langt mindre enn på sekvensielle modeller.
Fortsett å utforske
Flere modeller
Modeller og plattformer vi følger, sammenlignet på evner og lisens.
Sanger i full lengde genereres på en brøkdel av vanlig tid.