
Generación rápida de canciones completas
Generar toda la duración de una vez significa que una pista de cuatro minutos cuesta mucho menos tiempo que lo que cobran los modelos secuenciales por la misma longitud.
ASLP Lab
Canciones de larga duración generadas en una fracción del tiempo habitual.
En pocas palabras
Cifras verificadas 2026-08-10. Este campo se mueve rápido — vuelve a comprobarlas antes de fiarte.
La velocidad es el argumento de DiffRhythm y viene de la arquitectura, no de la optimización. La mayoría de modelos de canciones generan de forma secuencial, prediciendo el audio hacia adelante en el tiempo, lo que implica que una pista de cuatro minutos tarda más o menos cuatro veces lo que una de un minuto. El enfoque de difusión de DiffRhythm genera toda la duración simultáneamente, así que la longitud cuesta mucho menos que en otros sitios. Para autoalojar eso cambia la economía directamente: el throughput por hora de GPU es lo que determina si correr tu propio modelo sale más barato que un API, y aquí es donde DiffRhythm gana. El compromiso de calidad es real. Las voces son menos expresivas que las de los líderes cerrados y la estructura de largo alcance es más suelta: generar todo a la vez compra velocidad y cuesta parte de la coherencia narrativa que los modelos secuenciales logran casi gratis. Es el modelo abierto más interesante a nivel arquitectónico para quien construye infraestructura y no solo genera canciones.
Fortalezas

Generar toda la duración de una vez significa que una pista de cuatro minutos cuesta mucho menos tiempo que lo que cobran los modelos secuenciales por la misma longitud.

Los pesos abiertos hacen que la ventaja de velocidad sea usable en tu propio despliegue, en lugar de algo que alquilas mediante un API.

La arquitectura es realmente instructiva si estás construyendo infraestructura, porque muestra un compromiso distinto al del resto.
Cómo se compara
DiffRhythm es un modelo de generación de canciones con pesos abiertos, notable por producir pistas de larga duración inusualmente rápido, usando un enfoque de difusión que genera la pieza completa de una vez en lugar de hacerlo de forma secuencial.
Comparar con MusicGenerate
Buscado como diffrhythm, diffrhythm ai y fast ai music generation. El throughput es todo el argumento: le importa a quien se autoaloja y a nadie que solo genera una canción.
Arquitectura, no optimización. La mayoría de modelos de canciones generan secuencialmente, así que una pista de cuatro minutos tarda más o menos cuatro veces lo que una de un minuto. DiffRhythm genera toda la duración a la vez, así que la longitud cuesta mucho menos.
La estructura de largo alcance es más suelta y las voces son menos expresivas que las de los líderes cerrados. Generar todo simultáneamente compra velocidad y cuesta parte de la coherencia narrativa que los modelos secuenciales obtienen casi gratis.
Es el modelo abierto más interesante para quien construye infraestructura, porque el throughput por hora de GPU decide si correr tu propio modelo vence a un API.
Pesos abiertos bajo términos orientados a investigación, más restrictivos que los modelos Apache 2.0 de este directorio. Revisa la licencia de tu versión específica antes de un uso comercial.
Los pesos están disponibles abiertamente, bajo términos orientados a investigación más restrictivos que los Apache 2.0 aquí. Revisa la licencia de tu versión específica antes de desplegar comercialmente.
Lo suficiente para que la generación de larga duración deje de ser el cuello de botella. Como genera toda la duración a la vez, la longitud cuesta mucho menos que en los modelos secuenciales.
Sigue explorando
Más modelos
Modelos y plataformas que seguimos, comparados por capacidad y licencia.
Canciones de larga duración generadas en una fracción del tiempo habitual.