A Gemini 3.8 Live új változata vizuális avatárral bővíti a vállalati felhasználásra szánt beszélgető mesterséges intelligenciát. A Google bejelentése szerint a Live Avatar a beszédet valós időhöz közeli videógenerálással kapcsolja össze, így egy dinamikus vizuális szereplő vesz részt a párbeszédben.

Beszéd, kép és háttérben futó feladatok

A rendszer egyszerre dolgozza fel a vizuális és hangbemeneteket, majd ezekre kifejező hanggal és videóval válaszol. A funkcióhoz pontos ajakszinkron, természetes arckifejezések és folyamatosabb beszédváltás tartozik. A Google szerint a Live Avatar közben háttérben is képes eszközhívásokat indítani és adatokat lekérni, miközben a beszélgetés nem szakad meg. A bemutatott példák között egy szállodai vendég bejelentkezésének kezelése is szerepel.

97 nyelv és testreszabható avatárok

A Live Avatar natív, többnyelvű beszéd–beszéd szinkronizációt használ, és a Google állítása szerint 97 nyelv között is képes váltani. Ilyenkor az ajakszinkron és az arckifejezések is alkalmazkodnak, a videó minőségének romlása vagy látványos elcsúszás nélkül.

A Gemini Enterprise felhasználói előre elkészített avatárok közül választhatnak. A szervezetek egy kiváló minőségű referencia-képből saját, animált avatárt is létrehozhatnak, amely megőrizheti a kiinduló kép jellegzetességeit, a márka vizuális stílusát vagy egy karakterazonosságot. Ez a lehetőség jelenleg csak vállalati engedélyezéssel érhető el.

Vízjel az AI által készített tartalmakon

A Google közlése szerint a Live Avatar hang- és videókimenetét a SynthID láthatatlan vízjelével látják el. A vállalat ezt az AI által létrehozott tartalmak felismerhetőségének és eredetük megkülönböztetésének támogatására használja. A Gemini 3.8 Live with Live Avatar a bejelentés szerint már elérhető a Gemini Enterprise-ban, a használat megkezdéséhez pedig API-dokumentáció is rendelkezésre áll.