A Google új hangalapú modelleket tett hozzáférhetővé a Gemini API-ban és a Google AI Studio felületén. A Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking olyan fejlesztői megoldásokhoz használható, amelyek beszélgetés közben képesek feladatokat végrehajtani.
Beszéd közbeni műveletek és vizuális értelmezés
A modellek támogatják az aszinkron függvényhívást, így az API- és eszközhívások a hangválasz streamelése közben, háttérben is lefuthatnak. A párbeszéd élő vizuális bemenetekkel is kiegészíthető, a rendszer pedig alfanumerikus adatokat, például megerősítő kódokat és technikai információkat is kezelhet. A Gemini 3.8 Live 97 vagy több nyelvet támogat.
Az Extended Thinking változat konfigurálható gondolkodási folyamatot kínál összetett, több lépésből álló feladatokhoz. A modellek a Live API-n keresztül érhetők el; az audio bemenet díja percenként 0,005, a kimeneté 0,018 dollár.
Átírás több mint 85 nyelven
A Gemini 3.5 Transcribe beszédfelismerésre készült. A Google közlése szerint streaming módban 4,0, nem streaming módban pedig 2,6 százalékos átlagos Word Error Rate-et ért el. A modell több mint 85 nyelven működik, kezeli a mondaton belüli nyelvváltást, valamint egy legfeljebb 1000 kifejezésből álló egyéni szókincs is megadható számára.
Az átírás strukturált formázást, önkorrekciók kezelését és a töltelékszavak eltávolítását is támogathatja. A Gemini 3.5 Transcribe az Interactions API-n keresztül legfeljebb egyórás hangfájlok feldolgozására is használható, időbélyegekkel és beszélő-elkülönítéssel.







