
Schnelle Generierung von Songs in voller Länge
Die gesamte Dauer auf einmal zu generieren bedeutet: Ein Vier-Minuten-Track kostet deutlich weniger Zeit, als sequentielle Modelle für dieselbe Länge verlangen.
ASLP Lab
Vollständige Songs in einem Bruchteil der üblichen Zeit generiert.
Kurz gesagt
Zahlen verifiziert 2026-08-10. Dieses Feld bewegt sich schnell — prüf sie noch mal, bevor du dich darauf verlässt.
Geschwindigkeit ist DiffRhythms Punkt, und sie kommt aus der Architektur, nicht aus Optimierung. Die meisten Song-Modelle generieren sequentiell und sagen Audio in der Zeit nach vorn voraus – ein Vier-Minuten-Track dauert also grob viermal so lang wie ein Ein-Minuten-Track. DiffRhythms Diffusionsansatz generiert die volle Dauer gleichzeitig, daher kostet Länge viel weniger als anderswo. Für Self-Hosting ändert das direkt die Ökonomie: Durchsatz pro GPU-Stunde entscheidet, ob dein eigenes Modell günstiger ist als eine API – und hier punktet DiffRhythm. Der Qualitäts-Trade-off ist real. Vocals sind weniger ausdrucksstark als bei den geschlossenen Spitzenreitern und die Langstreckenstruktur ist lockerer – alles auf einmal zu generieren kauft Tempo und kostet etwas von der narrativen Kohärenz, die sequentielle Modelle fast gratis bekommen. Es ist das architektonisch interessanteste Open-Modell für alle, die Infrastruktur bauen statt nur Songs zu generieren.
Stärken

Die gesamte Dauer auf einmal zu generieren bedeutet: Ein Vier-Minuten-Track kostet deutlich weniger Zeit, als sequentielle Modelle für dieselbe Länge verlangen.

Offene Gewichte machen den Geschwindigkeitsvorteil in deiner eigenen Umgebung nutzbar, statt ihn nur über eine API zu mieten.

Die Architektur ist wirklich lehrreich, wenn du Infrastruktur baust, weil sie einen anderen Trade-off zeigt als alles drumherum.
Wie es abschneidet
DiffRhythm ist ein Open-Weight-Modell zur Song-Generierung, das vollständige Tracks ungewöhnlich schnell erzeugt – mit einem Diffusionsansatz, der das ganze Stück auf einmal statt sequentiell generiert.
Mit MusicGenerate vergleichen
Gesucht als diffrhythm, diffrhythm ai und fast ai music generation. Durchsatz ist das ganze Argument — relevant für alle, die selbst hosten, und für niemanden, der nur einen Song generiert.
Architektur statt Optimierung. Die meisten Song-Modelle generieren sequentiell, also dauert ein Vier-Minuten-Track grob viermal so lang wie ein Ein-Minuten-Track. DiffRhythm generiert die volle Dauer auf einmal, daher kostet Länge viel weniger.
Die Langzeitstruktur ist lockerer und die Vocals sind weniger expressiv als bei den geschlossenen Spitzenreitern. Alles gleichzeitig zu generieren bringt Tempo, kostet aber etwas von der narrativen Kohärenz, die sequentielle Modelle fast gratis bekommen.
Es ist das interessanteste Open-Modell für alle, die Infrastruktur bauen, weil der Durchsatz pro GPU-Stunde entscheidet, ob dein eigenes Modell eine API schlägt.
Offene Gewichte unter forschungsorientierten Bedingungen, restriktiver als die Apache-2.0-Modelle in diesem Verzeichnis. Prüfe die Lizenz deiner konkreten Release, bevor du kommerziell einsetzt.
Die Gewichte sind offen verfügbar, unter forschungsorientierten Bedingungen, restriktiver als die Apache-2.0-Modelle hier. Prüfe die Lizenz deiner konkreten Release, bevor du kommerziell einsetzt.
Schnell genug, dass die Generierung in voller Länge nicht mehr der Engpass ist. Weil es die gesamte Dauer auf einmal generiert, kostet Länge viel weniger als bei sequentiellen Modellen.
Weiter erkunden
Weitere Modelle
Modelle und Plattformen, die wir verfolgen, verglichen nach Fähigkeiten und Lizenz.
Vollständige Songs in einem Bruchteil der üblichen Zeit generiert.