A Google két új hangalapú mesterségesintelligencia-modellt jelentett be: a Gemini 3.8 Live-ot és a Gemini 3.8 Live Extended Thinkinget. A vállalat közlése szerint az új modellek célja, hogy gördülékenyebbé tegyék a valós idejű beszélgetéseket, miközben összetett feladatok végrehajtására is használhatók.

Valós idejű hang- és képi környezet

A Gemini 3.8 Live a Google leírása alapján gyors párbeszédekre, vizuális kontextus értelmezésére és költséghatékony, nagyobb léptékű használatra készült. A modell a beszélgetés közben képes háttérben eszközöket és API-hívásokat futtatni, így a felhasználóval folytatott kommunikáció nem szakad meg a feladatok feldolgozása alatt.

A rendszer a Google szerint 97 támogatott nyelv között képes automatikusan váltani beszélgetés közben. A vizuális bemenetek közel valós időben segíthetik a válaszadást, ezért a modell olyan helyzetekben is használható, amikor a beszélgetőpartner egy látott tartalomról kérdez.

Összetettebb feladatokra készült változat

A Gemini 3.8 Live Extended Thinkinget a Google nagyobb összetettségű munkafolyamatokra szánja. A vállalat állítása szerint a modell a gondolkodási folyamat és a beszéd párhuzamos kezelésével képes több lépésből álló feladatokat végrehajtani, miközben a párbeszéd folytatódik. A rendszer a feldolgozás előrehaladásáról is jelezhet, és háttérben futó műveleteket, például eszköz- vagy API-hívásokat koordinálhat.

A Google által ismertetett mérések szerint a Gemini 3.8 Live Extended Thinking 82,6 pontot ért el az Artificial Analysis Speech to Speech Quality Indexén. A τ-Voice teszten 68,6 százalékos, a Sierra τ-Voice-banking benchmarkján pedig 35,1 százalékos eredményt közöltek róla; a Big Bench Audio értéke 97,7 százalék volt. Ezeket az adatokat a vállalat saját bejelentésében ismertette.

Elérhetőség fejlesztőknek és felhasználóknak

A Gemini 3.8 Live bevezetése a Google szerint a fejlesztők számára a Gemini API-ban és a Google AI Studióban kezdődik. Vállalati ügyfeleknek a modell kezdetben privát előnézetben érhető el a Gemini Enterprise rendszerben, míg a Search Live szolgáltatásban minden felhasználó számára fokozatosan jelenik meg.

A Gemini 3.8 Live Extended Thinking vállalati környezetben szintén privát előnézetként indul a Gemini Enterprise-ban. A Google közlése szerint a modell a Gemini Live-ban is elérhetővé válik, a Google AI Pro és Ultra előfizetői pedig a Workspace Docs funkcióiban használhatják. A Gmail és a Keep esetében minden Google AI-előfizető számára tervezik az elérést.

A Google azt is közölte, hogy az AI-termékei által előállított hangot SynthID-vízjellel látják el. A vállalat szerint a nem érzékelhető jelölés segíthet az AI által generált hangok felismerésében.

Ez is most történt – olvassa el!

Új Gemini-modellekkel fejleszthetők valós idejű hangalapú alkalmazások

A Google elérhetővé tette a Gemini 3.8 Live, a Gemini 3.8 Live Extended Thinking és a Gemini 3.5 Transcribe modelleket a fejlesztők számára. Az újdonságok valós idejű beszédalapú alkalmazások, hangügynökök és átírási feladatok készítését célozzák, többek között a Gemini API-n keresztül.

Tovább a cikkhez →