← Späť Píše AI. Človek kontroluje.
ai tím Novinko

Google predstavil novú generáciu hlasovej AI — Gemini 3.8 Live vedie svetový rebríček v konverzačnej kvalite

Foto: AI ilustrácia
Google predstavil dva nové modely na hlasovú konverzáciu s umelou inteligenciou — Gemini 3.8 Live a pokročilejší Gemini 3.8 Live Extended Thinking. Podľa nezávislého rebríčka Artificial Analysis ide o aktuálne najkvalitnejší hlasový AI model na svete, ktorý dokáže plynulo prepínať medzi 97 jazykmi počas jedného rozhovoru.

Google predstavil dvojicu nových modelov určených na prirodzenú hlasovú konverzáciu s umelou inteligenciou — Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking. Kým prvý model je stavaný na rýchlosť a nákladovú efektivitu pri bežnej konverzácii s vizuálnym kontextom, druhý je určený na zložitejšie úlohy vyžadujúce viackrokové uvažovanie priamo počas rozhovoru.

Podľa nezávislého hodnotenia Artificial Analysis obsadil Gemini 3.8 Live Extended Thinking prvé miesto na svete v kvalite hlasovej konverzácie (index 82,6 bodu), s najlepším výsledkom aj v plnení zložitejších úloh v reálnom čase (68,6 % v teste τ-Voice) vrátane bankových operácií. V teste logického uvažovania Big Bench Audio dosiahol 97,7 % úspešnosť, pri súčasne konkurencieschopnej cene v porovnaní s ostatnými špičkovými modelmi. Rýchlejší variant Gemini 3.8 Live sa zase umiestnil na druhom mieste v rebríčku Speech Agent Arena, kde hodnotenie modelov robia priamo používatelia porovnávaním párov odpovedí.

Praktickým prínosom nových modelov je najmä to, ako plynulo dokážu pracovať na pozadí. Model spracúva vizuálne vstupy takmer v reálnom čase — teda dokáže napríklad počas rozhovoru "vidieť", čo mu ukazujete cez kameru alebo obrazovku, a reagovať na to priamo v konverzácii. Automaticky rozpozná a preplína medzi až 97 podporovanými jazykmi priamo uprostred rozhovoru, bez nutnosti manuálne prepínať jazyk. Pri zložitejších úlohách navyše model spustí vykonávanie na pozadí (napríklad vyhľadanie informácie alebo rezerváciu) a súčasne pokračuje v prirodzenej konverzácii — podobne, ako by to urobil človek, ktorý povie "moment, pozriem sa na to" a medzitým pokračuje v rozhovore.

Google zdôrazňuje aj transparentnosť — všetok zvuk generovaný týmito modelmi je označený neviditeľným vodoznakom SynthID, ktorý má pomôcť rozlíšiť AI generovaný obsah od skutočného ľudského hlasu a obmedziť riziko zneužitia na dezinformácie.

Modely sú od dnešného dňa postupne dostupné vývojárom cez Gemini API a Google AI Studio, firmám cez Gemini Enterprise, a bežným používateľom priamo v aplikácii Gemini, vo vyhľadávaní Google (Search Live) a v nástrojoch Google Workspace ako Gmail, Dokumenty a Keep — plná funkcionalita Extended Thinking vo Workspace je zatiaľ vyhradená pre predplatiteľov Google AI Pro a Ultra.

Uvedenie zapadá do širšieho preteku veľkých technologických firiem o čo najprirodzenejšiu hlasovú AI, ktorá sa čoraz viac stáva bránou k používaniu umelej inteligencie namiesto písaného textu — podobne, ako sme písali aj pri iných hlasových asistentoch tento rok.

← Všetky správy