Suno zpřístupnilo otevřenou betaverzi Speech, modelu, který z textu vytváří mluvené vyprávění spolu s původním hudebním doprovodem. Obě složky vznikají společně jako jedna souvislá zvuková stopa. Přednes a hudba se tak mohou vzájemně sladit například v pauzách, přechodech nebo při změně intenzity hlasu.
Text, charakter hlasu a hudební směr
Zadání má tři části: text určený k přednesu, popis hlasu a instrukce pro hudební doprovod. Charakter hlasu lze vymezit přízvukem nebo historickým obdobím, ale také tónem a hlasovým rejstříkem. U hudby uživatel popisuje požadovaný žánr, náladu či dramatické vyznění.
Mezi popsané způsoby využití patří dramatizované čtení básní a příběhů nebo osobní zprávy doplněné hudbou. Dalšími náměty jsou hlasové ztvárnění postav a vedené nahrávky, například meditace. U krátkých mediálních výstupů se počítá s použitím tam, kde lze přijmout rozdíly mezi jednotlivými generováními.
Hudba může sledovat pauzy i dramatický přednes
Při společném generování může přestávka v řeči připadnout na hudební přechod a zesílení hlasu se spojit s gradací doprovodu nebo rytmickým akcentem. AlphaSignal v tom vidí možnost omezit následné úpravy povedených krátkých nahrávek, pokud jejich použití nevyžaduje přesné a opakovatelné časování.
Suno tento přístup předvedlo na pasáži z Odyssey převedené do slangu generace Z. Druhá ukázka pojala žádost spolubydlícímu o umytí nádobí jako přednes ve viktoriánské angličtině. V obou firemních demonstracích hudba sledovala tempo řeči a její dramatický průběh.
Přízvuk a časování zatím kolísají
Suno upozorňuje, že výsledky betaverze nejsou vyrovnané. Přízvuk se může během jedné nahrávky posouvat, například od britské výslovnosti směrem k australské. Pauzy mohou trvat déle, než uživatel požadoval, a opakované generování může přinést jiné tempo i interpretaci.
Mezi uváděnými možnostmi betaverze není ovládání přesné délky nahrávky ani časování jednotlivých slov. Speech také neinzeruje řízení umístění hudebních nástupů. V popisu chybí i deterministické opětovné generování a klonování hlasu podle referenční nahrávky.
Přístup v aplikaci Suno pro všechny uživatele
Speech je dostupné všem uživatelům přímo v aplikaci Suno. Širšímu zpřístupnění předcházela měsíční uzavřená beta s menší skupinou uživatelů. Funkce používá stejný pracovní postup jako zdejší generátor písní.
Generování využívá stávající kreditové tarify Suno; samostatný ceník pro Speech nebyl zveřejněn.
Přístup zatím zůstává omezený na aplikaci. Suno neoznámilo API, SDK ani jinou programovou cestu, takže vývojáři nemají oznámený způsob, jak automaticky zadávat scénáře nebo začlenit generování do produkčního procesu.



