
Швидка генерація повноцінних пісень
Генерація всієї тривалості одразу означає, що чотирихвилинний трек коштує значно менше часу, ніж беруть послідовні моделі за ту саму довжину.
ASLP Lab
Повноцінні пісні генеруються за частку звичного часу.
Коротко
Цифри перевірені 2026-08-10. Ця сфера змінюється швидко — перевіряйте ще раз, перш ніж на них покладатися.
Швидкість — головний аргумент DiffRhythm, і походить він від архітектури, а не оптимізації. Більшість моделей пісень генерують послідовно, прогнозуючи аудіо вперед у часі, тож чотирихвилинний трек займає приблизно вчетверо більше часу, ніж однихвилинний. Дифузійний підхід DiffRhythm генерує всю тривалість одночасно, тож довжина коштує значно менше, ніж деінде. Для самохостингу це напряму змінює економіку: пропускна здатність на GPU-годину визначає, чи дешевше крутити власну модель, ніж користуватися API — і тут DiffRhythm перемагає. Компроміс якості реальний. Вокал менш виразний, ніж у закритих лідерів, а довгодистанційна структура вільніша — генерувати все одразу дає швидкість і коштує частини наративної зв'язності, яку послідовні моделі майже отримують безплатно. Це найцікавіша з погляду архітектури відкрита модель для тих, хто будує інфраструктуру, а не просто генерує пісні.
Сильні сторони

Генерація всієї тривалості одразу означає, що чотирихвилинний трек коштує значно менше часу, ніж беруть послідовні моделі за ту саму довжину.

Відкриті ваги роблять перевагу в швидкості придатною у вашому власному розгортанні, а не чимось, що ви орендуєте через API.

Архітектура справді повчальна, якщо ви будуєте інфраструктуру, бо показує інший компроміс, ніж усе навколо.
Як це порівнюється
DiffRhythm — це модель генерації пісень з відкритими вагами, відома тим, що незвично швидко створює повноцінні треки, використовуючи дифузійний підхід, який генерує весь твір одразу, а не послідовно.
Порівняйте з MusicGenerate
Шукають як diffrhythm, diffrhythm ai та fast ai music generation. Уся суть — у пропускній здатності: це важливо для тих, хто хостить сам, і нецікаво для тих, хто генерує одну пісню.
Архітектура, а не оптимізація. Більшість моделей пісень генерують послідовно, тому чотирихвилинний трек триває приблизно вчетверо довше за однихвилинний. DiffRhythm генерує всю тривалість одразу, тож довжина коштує значно менше.
Довгодистанційна структура вільніша, а вокал менш виразний, ніж у закритих лідерів. Генерування всього одночасно дає швидкість і коштує частини наративної зв'язності, яку послідовні моделі майже отримують безплатно.
Це найцікавіша відкрита модель для тих, хто будує інфраструктуру, бо пропускна здатність на GPU-годину вирішує, чи вигідніше запускати власну модель, ніж користуватися API.
Відкриті ваги на умовах, орієнтованих на дослідження, суворіші, ніж у моделей Apache 2.0 в цьому каталозі. Перевірте конкретну ліцензію релізу, який ви завантажуєте, перед комерційним розгортанням.
Ваги доступні відкрито — на умовах, орієнтованих на дослідження, суворіших, ніж у моделей Apache 2.0 тут. Перевірте ліцензію вашого конкретного релізу перед комерційним розгортанням.
Достатньо швидкий, щоб генерація повної тривалості перестала бути вузьким місцем. Бо він генерує всю тривалість одразу, тож довжина коштує значно менше, ніж у послідовних моделях.
Продовжуйте досліджувати
Більше моделей
Моделі й платформи, за якими ми стежимо, порівняні за можливостями та ліцензіями.