A Google bemutatta a Gemini 3.8 Flash TTS és a Gemini 3.8 Flash-Lite TTS modelleket, amelyekkel a fejlesztők és a vállalatok a korábbi, rögzített hangbeállítások helyett egyedi beszédhangokat hozhatnak létre. A rendszerek természetes nyelvű utasításokkal vezérelhetők, így a beszéd tempója, érzelmi tónusa, akcentusa és előadásmódja is meghatározható.

Egyedi hangok és hangmásolás

A Gemini 3.8 Flash TTS szereplők és karakterek hangjának megtervezésére készült. A Google szerint több mint 100 nyelven és nyelvjárásban lehet új hangokat létrehozni, miközben a felhasználók a szerepet, az akcentust és más hangjellemzőket is megadhatják. A modellhez több mint 2000, gyártásra kész hangból álló könyvtár is kapcsolódik.

A rendszer egy legalább 30 másodperces hangminta alapján is képes hangprofilt létrehozni, de ehhez a hang tulajdonosának szóbeli hozzájárulását is ellenőrzik. A Google közlése szerint a generált hangfelvételeket SynthID-vízjellel látják el, a hangmásoláshoz pedig C2PA-igazolás is társulhat.

Soronként irányítható párbeszédek

Mindkét modellnél külön megadható, hogyan hangozzon el az egyes szövegrészlet. A beszéd tempója, érzelmi hangsúlya, a szünetek és a társalgási reakciók is szabályozhatók. A technológia két beszélő párbeszédeit is támogatja, a hosszabb hanganyagoknál pedig a Google a hangminőség és a szereplők hangkarakterének megőrzését emeli ki.

A Flash-Lite változatot a vállalat nagy mennyiségű, költséghatékony hangelőállításra, szinkronizálásra és hangalapú ügynökökre optimalizálta. Az új modellek a bejelentés szerint elérhetővé válnak a Google AI Studio és a Gemini API felületén, a Gemini 3.8 Flash TTS pedig a Gemini Notebookban is használható lesz. A Flash-Lite modell a Google Vidsben jelenik meg. A hangmásolási funkció Google AI Studioban Illinois, Texas, az Európai Gazdasági Térség, az Egyesült Királyság, Svájc és India területén nem érhető el.