
Geração rápida de música completa
Gerar a duração inteira de uma vez faz uma faixa de quatro minutos custar bem menos tempo do que modelos sequenciais cobram pelo mesmo comprimento.
ASLP Lab
Músicas de duração completa geradas em uma fração do tempo usual.
Em resumo
Números verificados 2026-08-10. Este campo muda rápido — confira de novo antes de se apoiar neles.
Velocidade é o argumento do DiffRhythm e vem da arquitetura, não de otimização. A maioria dos modelos de música gera de forma sequencial, prevendo o áudio ao longo do tempo, o que significa que uma faixa de quatro minutos leva cerca de quatro vezes mais que uma de um minuto. A difusão do DiffRhythm gera a duração inteira simultaneamente, então o comprimento custa bem menos do que em outros. Para hospedar por conta própria isso muda a economia direto: a vazão por hora de GPU é o que decide se rodar seu próprio modelo sai mais barato que uma API, e é aqui que o DiffRhythm ganha. A troca de qualidade é real. Os vocais são menos expressivos que os líderes fechados e a estrutura de longo alcance é mais solta — gerar tudo de uma vez compra velocidade e custa parte da coerência narrativa que modelos sequenciais ganham quase de graça. É o modelo aberto mais interessante do ponto de vista de arquitetura para quem está construindo infraestrutura, não só gerando músicas.
Pontos fortes

Gerar a duração inteira de uma vez faz uma faixa de quatro minutos custar bem menos tempo do que modelos sequenciais cobram pelo mesmo comprimento.

Pesos abertos tornam a vantagem de velocidade utilizável no seu próprio deployment em vez de algo que você aluga via API.

A arquitetura é genuinamente instrutiva se você está construindo infraestrutura, porque demonstra uma troca diferente de tudo ao redor.
Como ele se compara
DiffRhythm é um modelo de geração de música com pesos abertos, notável por produzir faixas de duração completa incomumente rápido, usando uma abordagem de difusão que gera a peça toda de uma vez em vez de sequencialmente.
Comparar com MusicGenerate
Pesquisado como diffrhythm, diffrhythm ai e fast ai music generation. Vazão é o argumento inteiro, o que importa para quem hospeda por conta própria e para ninguém que gera uma música só.
Arquitetura, não otimização. A maioria dos modelos de música gera sequencialmente, então uma faixa de quatro minutos leva cerca de quatro vezes mais que uma de um minuto. O DiffRhythm gera a duração inteira de uma vez, então o comprimento custa bem menos.
A estrutura de longo alcance é mais solta e os vocais são menos expressivos que os líderes fechados. Gerar tudo simultaneamente compra velocidade e custa parte da coerência narrativa que modelos sequenciais ganham quase de graça.
É o modelo aberto mais interessante para quem está construindo infraestrutura, porque a vazão por hora de GPU é o que decide se rodar seu próprio modelo ganha de uma API.
Pesos abertos sob termos voltados à pesquisa, mais restritivos que os modelos Apache 2.0 neste diretório. Confira a licença específica do release que você baixar antes de uso comercial.
Os pesos estão disponíveis abertamente, sob termos voltados à pesquisa mais restritivos que os Apache 2.0 aqui. Confira a licença do seu release específico antes de implantar comercialmente.
Rápido o bastante para a geração de duração completa deixar de ser gargalo. Como ele gera a duração inteira de uma vez, o comprimento custa bem menos do que em modelos sequenciais.
Continue explorando
Mais modelos
Modelos e plataformas que acompanhamos, comparados por capacidade e licença.
Músicas de duração completa geradas em uma fração do tempo usual.