
Бързо генериране на цели песни
Генерирането на цялата продължителност наведнъж означава, че четириминутен трак струва далеч по-малко време, отколкото искат последователните модели за същата дължина.
ASLP Lab
Песни в пълна дължина се генерират за частица от обичайното време.
Накратко
Данните са проверени 2026-08-10. Тази област се променя бързо — проверете отново, преди да се опрете на тях.
Скоростта е аргументът на DiffRhythm и идва от архитектурата, а не от оптимизация. Повечето модели за песни генерират последователно, предсказвайки аудио напред във времето, което означава, че четириминутен трак отнема приблизително четири пъти колкото едноминутен. Дифузионният подход на DiffRhythm генерира пълната продължителност едновременно, така че дължината струва далеч по-малко. За самостоятелно хостване това променя икономиката директно: пропускателната способност на GPU-час решава дали да пускате собствен модел е по-евтино от API, и тук DiffRhythm печели. Компромисът в качеството е реален. Вокалите са по-малко експресивни от водещите затворени модели и дългосрочната структура е по-хлабава — генерирането на всичко наведнъж купува скорост и струва част от наративната свързаност, която последователните модели получават почти безплатно. Това е най-интересният откъм архитектура отворен модел за всеки, който строи инфраструктура, а не просто генерира песни.
Силни страни

Генерирането на цялата продължителност наведнъж означава, че четириминутен трак струва далеч по-малко време, отколкото искат последователните модели за същата дължина.

Отворените тегла правят предимството в скоростта използваемо във Вашето собствено разгръщане, вместо нещо, което наемате през API.

Архитектурата е наистина поучителна, ако изграждате инфраструктура, защото демонстрира различен компромис от всичко наоколо.
Как се сравнява
DiffRhythm е модел за генериране на песни с отворени тегла, забележим с това, че създава тракове в пълна дължина необичайно бързо, използвайки дифузионен подход, който генерира цялото произведение наведнъж, а не последователно.
Сравнете с MusicGenerate
Търсено като diffrhythm, diffrhythm ai и fast ai music generation. Пропускателната способност е целият аргумент — важи за всеки, който хоства сам, и за никого, който генерира една песен.
Архитектура, не оптимизация. Повечето модели за песни генерират последователно, затова четириминутен трак отнема приблизително четири пъти колкото едноминутен. DiffRhythm генерира цялата продължителност наведнъж, така че дължината струва много по-малко.
Дългосрочната структура е по-хлабава и вокалите са по-малко експресивни от водещите затворени модели. Генерирането на всичко едновременно купува скорост и струва част от наративната свързаност, която последователните модели получават почти безплатно.
Това е най-интересният отворен модел за всеки, който изгражда инфраструктура, защото пропускателната способност на GPU-час решава дали да пускате собствен модел е по-изгодно от API.
Отворени тегла при научно-ориентирани условия, по-ограничителни от Apache 2.0 моделите тук. Проверете конкретния лиценз на изданието, което изтегляте, преди комерсиално разгръщане.
Теглата са публично достъпни при научно-ориентирани условия, по-ограничителни от Apache 2.0 моделите тук. Проверете лиценза на конкретното издание, преди да го внедрите комерсиално.
Достатъчно бърз, че генерирането в пълна дължина спира да е тясното място. Понеже генерира цялата продължителност наведнъж, дължината струва много по-малко, отколкото при последователните модели.
Продължете да разглеждате
Още модели
Модели и платформи, които следим, сравнени по възможности и лиценз.
Песни в пълна дължина се генерират за частица от обичайното време.