← Späť Píše AI. Človek kontroluje.
ai tím Novinko

Keď počítač číta text prirodzene: Ako fungujú hlasy vytvorené umelou inteligenciou

Foto: AI ilustrácia
Hlas, ktorý číta článok alebo odpovedá v zákazníckej podpore, už nemusí byť nahrávkou konkrétnej vety. Neurónová syntéza reči dokáže vytvoriť zvuk z nového textu a prispôsobiť jeho tempo, dôraz či intonáciu. Vysvetľujúci materiál ElevenLabs, aktualizovaný 8. októbra, približuje fungovanie technológie; nejde o oznámenie novej služby spustenej dnes.

Staršie systémy prevodu textu na reč často skladali výstup z vopred nahraných úsekov alebo vytvárali zvuk podľa zjednodušených pravidiel. Moderné modely sa učia zo záznamov reči a pri novom texte vytvárajú aj spôsob, akým má veta znieť. Nestačí totiž správne vysloviť jednotlivé slová. Pauza na inom mieste alebo dôraz na inom slove môže zmeniť význam celej vety.

Pri jednom z bežných technických postupov systém najprv upraví písaný text do podoby vhodnej na čítanie. Musí rozhodnúť, ako vysloviť skratku, číslo, dátum či slovo s viacerými možnými výslovnosťami. Ďalšia časť predpovie vlastnosti reči, napríklad jej výšku, trvanie hlások a rytmus. Napokon sa táto zvuková reprezentácia zmení na počuteľnú nahrávku. Takýto viacstupňový postup opisujú aj výskumné práce o modeloch Tacotron 2 a HiFi-GAN. Konkrétne riešenia jednotlivých firiem sa však môžu líšiť.

Pre čitateľa je najviditeľnejším použitím hlasné prehratie článku. Rovnaká technológia slúži pri audioknihách, navigácii, výučbových materiáloch či hlasových asistentoch. Hovorená verzia môže niektorým ľuďom uľahčiť prístup k obsahu, no jej prínos závisí od kvality prevedenia. Ak syntetický hlas nesprávne prečíta meno, číslo alebo dôležitú vetu, plynulý prejav chybu nezachráni. Pri spravodajskom texte je preto potrebná kontrola výslednej nahrávky.

Dôležitá je aj rýchlosť. Pri vopred pripravenej audioknihe môže systém spracovať text bez toho, aby poslucháč čakal na každú odpoveď. Hlasový asistent musí začať hovoriť takmer okamžite. Vývojári preto volia model podľa účelu: prirodzenosti prejavu, času odozvy, podporovaných jazykov a nákladov. ElevenLabs vo svojej dokumentácii uvádza, že jednotlivé modely majú rozdielne vlastnosti; podporu slovenčiny uvádza aj pri aktuálnej modelovej rodine Eleven v4. Podpora jazyka však sama osebe nezaručuje bezchybnú výslovnosť každého slovenského mena či odborného výrazu.

Schopnosť vytvoriť presvedčivý hlas má aj druhú stránku. Syntéza môže sprístupniť obsah vo viacerých jazykoch a hlasových podobách, ale napodobnenie rozpoznateľného hlasu bez súhlasu môže poslucháča zavádzať. Pri redakčnom použití je preto podstatné vedieť, komu hlas patrí, mať oprávnenie na jeho použitie a jasne označiť syntetickú nahrávku tam, kde by si ju poslucháč mohol pomýliť s autentickým prejavom človeka.

Neurónový prevod textu na reč tak nie je iba otázkou toho, či hlas „znie ľudsky“. Pre vydavateľov a tvorcov rozhoduje, či presne sprostredkuje obsah, funguje spoľahlivo v danom jazyku a poslucháč vie, čo počúva. Najlepším testom zostáva konkrétny text vrátane mien, čísel a viet, pri ktorých záleží na správnom dôraze.

← Všetky správy