Suno Speech verbindet gesprochene Erzählungen und Musik in einer Audiospur

Suno Speech verbindet gesprochene Erzählungen und Musik in einer Audiospur

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
4. 10. 2026
2 Minuten Lesezeit
Artikel anhören
Audioversion des Artikels
Suno Speech verbindet gesprochene Erzählungen und Musik in einer Audiospur

Suno hat die offene Beta von Speech freigeschaltet. Das Modell erzeugt aus Text eine gesprochene Erzählung samt eigener musikalischer Begleitung. Beide Bestandteile entstehen gemeinsam als durchgehende Audiospur. Dadurch können Vortrag und Musik etwa bei Pausen, Übergängen oder Veränderungen der Stimmintensität aufeinander abgestimmt werden.

Text, Stimmcharakter und musikalische Richtung

Die Eingabe besteht aus drei Teilen: dem vorzulesenden Text, einer Beschreibung der Stimme und Vorgaben für die Begleitmusik. Der Stimmcharakter lässt sich über einen Akzent oder eine historische Epoche bestimmen, aber auch über Tonfall und Stimmlage. Für die Musik beschreibt der Nutzer das gewünschte Genre, die Stimmung oder die dramatische Wirkung.

Zu den beschriebenen Einsatzmöglichkeiten gehören dramatisierte Lesungen von Gedichten und Geschichten sowie persönliche Nachrichten mit musikalischer Begleitung. Weitere Ansätze sind die stimmliche Darstellung von Figuren und geführte Audioaufnahmen, etwa Meditationen. Kurze Medienbeiträge kommen dort infrage, wo Unterschiede zwischen einzelnen Generierungen akzeptabel sind.

Musik kann Pausen und dramatischen Vortrag begleiten

Bei der gemeinsamen Generierung kann eine Sprechpause mit einem musikalischen Übergang zusammenfallen. Eine intensivere Stimme kann mit einer Steigerung der Begleitung oder einem rhythmischen Akzent einhergehen. AlphaSignal sieht darin die Möglichkeit, bei gelungenen kurzen Aufnahmen den nachträglichen Bearbeitungsaufwand zu verringern, sofern ihr Einsatz kein präzises und wiederholbares Timing erfordert.

Suno demonstrierte den Ansatz anhand einer Passage aus der Odyssee, die in den Slang der Generation Z übertragen wurde. In einer zweiten Demo wurde die Bitte an einen Mitbewohner, das Geschirr abzuwaschen, auf viktorianischem Englisch vorgetragen. In beiden von Suno gezeigten Beispielen folgte die Musik dem Sprechtempo und dem dramatischen Verlauf des Vortrags.

Akzent und Timing schwanken noch

Suno weist darauf hin, dass die Ergebnisse der Beta uneinheitlich sind. Der Akzent kann sich innerhalb einer Aufnahme verschieben, etwa von britischer zu australischer Aussprache. Pausen können länger ausfallen als gewünscht, und bei erneuter Generierung können sich Tempo und Interpretation ändern.

Zu den angegebenen Funktionen der Beta gehören weder die Steuerung der exakten Aufnahmedauer noch das Timing einzelner Wörter. Speech wirbt auch nicht mit einer gezielten Platzierung musikalischer Einsätze. Ebenso fehlen in der Beschreibung eine deterministische erneute Generierung und das Klonen einer Stimme anhand einer Referenzaufnahme.

Zugang für alle Nutzer der Suno-App

Speech ist für alle Nutzer direkt in der Suno-App verfügbar. Der breiten Freigabe ging eine einmonatige geschlossene Beta mit einer kleineren Nutzergruppe voraus. Die Funktion verwendet denselben Arbeitsablauf wie der Songgenerator der App.

Für die Generierung gelten die bestehenden kreditbasierten Tarife von Suno; eine separate Preisliste für Speech wurde nicht veröffentlicht.

Der Zugang bleibt vorerst auf die App beschränkt. Suno hat weder eine API noch ein SDK oder einen anderen programmatischen Zugang angekündigt. Damit gibt es für Entwickler bislang keinen angekündigten Weg, Skripte automatisiert einzureichen oder die Generierung in einen Produktionsprozess einzubinden.

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Ideogram 4.5 ermöglicht präzise Bildbearbeitung und übersetzt SchriftzügeIdeogram 4.5 ermöglicht präzise Bildbearbeitung und übersetzt Schriftzüge
Ideograms neues Modell ist auf aufeinanderfolgende Bildbearbeitungen ausgelegt. Es unterstützt Referenzbilder, Masken und hochauflösende Bildausschnitte sowie das Ändern und Übersetzen von Text direkt im Bild.
3 Min. Lesezeit
4. 10. 2026
Google verlagert Berechnungen für föderiertes Lernen von Geräten auf ServerGoogle verlagert Berechnungen für föderiertes Lernen von Geräten auf Server
Google Research hat ein TEE-basiertes System für föderiertes Lernen vorgestellt. Gboard nutzt es bereits zur Vorhersage des nächsten Wortes auf Englisch und Japanisch. Laut Google liefert es genauere Modelle und beschleunigt das Training.
3 Min. Lesezeit
4. 10. 2026
Shopify stellt Canvas vor: Onlineshops per Chat mit KI erstellenShopify stellt Canvas vor: Onlineshops per Chat mit KI erstellen
Canvas verbindet die Erstellung von Onlineshops mit dem KI-Agenten Sidekick. Änderungen erscheinen in Echtzeit; Händler können interaktive Elemente, Animationen und die Darstellung auf verschiedenen Bildschirmgrößen testen.
1 Min. Lesezeit
4. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok