Suno hat die offene Beta von Speech freigeschaltet. Das Modell erzeugt aus Text eine gesprochene Erzählung samt eigener musikalischer Begleitung. Beide Bestandteile entstehen gemeinsam als durchgehende Audiospur. Dadurch können Vortrag und Musik etwa bei Pausen, Übergängen oder Veränderungen der Stimmintensität aufeinander abgestimmt werden.
Text, Stimmcharakter und musikalische Richtung
Die Eingabe besteht aus drei Teilen: dem vorzulesenden Text, einer Beschreibung der Stimme und Vorgaben für die Begleitmusik. Der Stimmcharakter lässt sich über einen Akzent oder eine historische Epoche bestimmen, aber auch über Tonfall und Stimmlage. Für die Musik beschreibt der Nutzer das gewünschte Genre, die Stimmung oder die dramatische Wirkung.
Zu den beschriebenen Einsatzmöglichkeiten gehören dramatisierte Lesungen von Gedichten und Geschichten sowie persönliche Nachrichten mit musikalischer Begleitung. Weitere Ansätze sind die stimmliche Darstellung von Figuren und geführte Audioaufnahmen, etwa Meditationen. Kurze Medienbeiträge kommen dort infrage, wo Unterschiede zwischen einzelnen Generierungen akzeptabel sind.
Musik kann Pausen und dramatischen Vortrag begleiten
Bei der gemeinsamen Generierung kann eine Sprechpause mit einem musikalischen Übergang zusammenfallen. Eine intensivere Stimme kann mit einer Steigerung der Begleitung oder einem rhythmischen Akzent einhergehen. AlphaSignal sieht darin die Möglichkeit, bei gelungenen kurzen Aufnahmen den nachträglichen Bearbeitungsaufwand zu verringern, sofern ihr Einsatz kein präzises und wiederholbares Timing erfordert.
Suno demonstrierte den Ansatz anhand einer Passage aus der Odyssee, die in den Slang der Generation Z übertragen wurde. In einer zweiten Demo wurde die Bitte an einen Mitbewohner, das Geschirr abzuwaschen, auf viktorianischem Englisch vorgetragen. In beiden von Suno gezeigten Beispielen folgte die Musik dem Sprechtempo und dem dramatischen Verlauf des Vortrags.
Akzent und Timing schwanken noch
Suno weist darauf hin, dass die Ergebnisse der Beta uneinheitlich sind. Der Akzent kann sich innerhalb einer Aufnahme verschieben, etwa von britischer zu australischer Aussprache. Pausen können länger ausfallen als gewünscht, und bei erneuter Generierung können sich Tempo und Interpretation ändern.
Zu den angegebenen Funktionen der Beta gehören weder die Steuerung der exakten Aufnahmedauer noch das Timing einzelner Wörter. Speech wirbt auch nicht mit einer gezielten Platzierung musikalischer Einsätze. Ebenso fehlen in der Beschreibung eine deterministische erneute Generierung und das Klonen einer Stimme anhand einer Referenzaufnahme.
Zugang für alle Nutzer der Suno-App
Speech ist für alle Nutzer direkt in der Suno-App verfügbar. Der breiten Freigabe ging eine einmonatige geschlossene Beta mit einer kleineren Nutzergruppe voraus. Die Funktion verwendet denselben Arbeitsablauf wie der Songgenerator der App.
Für die Generierung gelten die bestehenden kreditbasierten Tarife von Suno; eine separate Preisliste für Speech wurde nicht veröffentlicht.
Der Zugang bleibt vorerst auf die App beschränkt. Suno hat weder eine API noch ein SDK oder einen anderen programmatischen Zugang angekündigt. Damit gibt es für Entwickler bislang keinen angekündigten Weg, Skripte automatisiert einzureichen oder die Generierung in einen Produktionsprozess einzubinden.



