
Быстрая генерация полноценных песен
Генерация всей длительности сразу означает, что четырёхминутный трек стоит куда меньше времени, чем у последовательных моделей за ту же длину.
ASLP Lab
Полноценные песни генерируются за долю обычного времени.
Коротко
Цифры проверены 2026-08-10. Эта область меняется быстро — перепроверьте, прежде чем на них полагаться.
Скорость — это аргумент DiffRhythm, и он из архитектуры, а не из оптимизаций. Большинство моделей песен генерируют последовательно, предсказывая аудио вперёд по времени, поэтому четырёхминутный трек занимает примерно в четыре раза дольше, чем минутный. Диффузионный подход DiffRhythm генерирует всю длительность одновременно, так что длина стоит куда меньше. Для самостоятельного хостинга это напрямую меняет экономику: пропускная способность на GPU-час и решает, выгоднее ли крутить свою модель, чем платить за API, — и здесь DiffRhythm выигрывает. Компромисс по качеству реален. Вокал менее выразительный, чем у закрытых лидеров, а дальняя структура слабее — генерируя всё сразу, вы получаете скорость и теряете часть повествовательной связности, которую последовательные модели получают почти бесплатно. Это самая архитектурно интересная открытая модель для тех, кто строит инфраструктуру, а не просто генерирует песни.
Сильные стороны

Генерация всей длительности сразу означает, что четырёхминутный трек стоит куда меньше времени, чем у последовательных моделей за ту же длину.

Открытые веса делают преимущество в скорости пригодным в вашем собственном развёртывании, а не чем-то, что вы арендуете через API.

Архитектура действительно поучительна, если вы строите инфраструктуру: она демонстрирует иной компромисс, чем всё вокруг.
Как это выглядит в сравнении
DiffRhythm — это модель генерации песен с открытыми весами, примечательная тем, что необычно быстро выдаёт полноразмерные треки, используя диффузионный подход, который генерирует всю пьесу сразу, а не последовательно.
Сравнить с MusicGenerate
Ищут как diffrhythm, diffrhythm ai и fast ai music generation. Вся суть — пропускная способность, это важно тем, кто хостит у себя, и не важно никому, кто генерирует одну песню.
Дело в архитектуре, а не в оптимизации. Большинство моделей песен генерируют последовательно, поэтому четырёхминутный трек занимает примерно в четыре раза дольше минутного. DiffRhythm генерирует всю длительность сразу, так что длина стоит куда меньше.
Дальняя структура слабее, а вокал менее выразительный, чем у закрытых лидеров. Генерация всего одновременно даёт скорость и стоит части повествовательной связности, которую последовательные модели получают почти бесплатно.
Это самая интересная открытая модель для тех, кто строит инфраструктуру, потому что пропускная способность на GPU-час и решает, выгоднее ли крутить свою модель, чем использовать API.
Открытые веса на исследовательских условиях, более ограничительных, чем у моделей с Apache 2.0 в этом разделе. Перед коммерческим развёртыванием проверьте конкретную лицензию вашего релиза.
Веса доступны открыто, на исследовательских условиях, более ограничительных, чем у Apache 2.0 здесь. Перед коммерческим развёртыванием проверьте лицензию вашего релиза.
Настолько быстрый, что полноразмерная генерация перестаёт быть узким местом. Поскольку он генерирует всю длительность сразу, длина стоит куда меньше, чем у последовательных моделей.
Продолжайте изучать
Больше моделей
Модели и платформы, за которыми мы следим, — сравнение по возможностям и лицензии.
Полноценные песни генерируются за долю обычного времени.