
Generazione rapida di canzoni complete
Generare tutta la durata in una volta significa che una traccia di quattro minuti costa molto meno tempo rispetto ai modelli sequenziali per la stessa lunghezza.
ASLP Lab
Canzoni a lunghezza piena generate in una frazione del tempo normale.
In breve
Dati verificati 2026-08-10 Questo settore si muove in fretta — ricontrolla prima di farci affidamento.
La velocità è l’argomento di DiffRhythm e viene dall’architettura, non dall’ottimizzazione. La maggior parte dei modelli di canzoni genera in modo sequenziale, predicendo l’audio in avanti nel tempo: significa che una traccia di quattro minuti richiede circa quattro volte il tempo di una da un minuto. L’approccio a diffusione di DiffRhythm genera tutta la durata simultaneamente, quindi la lunghezza costa molto meno che altrove. Per il self-hosting questo cambia direttamente l’economia: il throughput per GPU-ora decide se far girare il tuo modello costa meno di un API, ed è qui che DiffRhythm vince. Il compromesso sulla qualità è reale. Le voci sono meno espressive dei leader chiusi e la struttura di lungo raggio è più lasca — generare tutto in una volta compra velocità e costa parte della coerenza narrativa che i modelli sequenziali ottengono quasi gratis. È il modello aperto più interessante a livello architetturale per chi costruisce infrastruttura, non solo per chi genera canzoni.
Punti di forza

Generare tutta la durata in una volta significa che una traccia di quattro minuti costa molto meno tempo rispetto ai modelli sequenziali per la stessa lunghezza.

I pesi aperti rendono il vantaggio di velocità utilizzabile nel tuo deployment invece di affittarlo tramite un API.

L’architettura è davvero istruttiva se stai costruendo infrastruttura, perché mostra un compromesso diverso da tutto ciò che la circonda.
Come si confronta
DiffRhythm è un modello di generazione di canzoni a pesi aperti, notevole per produrre tracce a lunghezza piena insolitamente in fretta, usando un approccio a diffusione che genera l’intero pezzo in una volta sola invece che in sequenza.
Confronta con MusicGenerate
Cercato come diffrhythm, diffrhythm ai e fast ai music generation. Il throughput è tutta la questione: conta per chi fa self-hosting e per nessuno che genera una sola canzone.
Architettura, non ottimizzazione. La maggior parte dei modelli di canzoni genera in sequenza, quindi una traccia di quattro minuti richiede circa quattro volte il tempo di una da un minuto. DiffRhythm genera tutta la durata in una volta, quindi la lunghezza costa molto meno.
La struttura di lungo raggio è più lasca e le voci sono meno espressive rispetto ai leader chiusi. Generare tutto simultaneamente compra velocità e costa parte della coerenza narrativa che i modelli sequenziali ottengono quasi gratis.
È il modello aperto più interessante per chi costruisce infrastruttura, perché il throughput per GPU-ora decide se far girare il tuo modello batte un API.
Pesi aperti con termini orientati alla ricerca, più restrittivi dei modelli Apache 2.0 in questa directory. Controlla la licenza specifica sulla release che scarichi prima di distribuire commercialmente.
I pesi sono disponibili apertamente, con termini orientati alla ricerca più restrittivi degli Apache 2.0 qui. Controlla la licenza della tua release specifica prima di un deploy commerciale.
Abbastanza perché la generazione a lunghezza piena smetta di essere il collo di bottiglia. Poiché genera tutta la durata in una volta, la lunghezza costa molto meno che sui modelli sequenziali.
Continua a esplorare
Altri modelli
Modelli e piattaforme che seguiamo, confrontati per capacità e licenza.
Canzoni a lunghezza piena generate in una frazione del tempo normale.