模型发布·Google DeepMind

Google 发布 Gemini 3.8 Live with Live Avatar,支持实时视频对话

Google 推出 Gemini 3.8 Live with Live Avatar,为对话式 AI 增加实时视觉形象。该功能将视频生成与语音结合,实现精准唇形同步和自然表情,并支持 97 种语言无缝切换。即日起在 Gemini Enterprise 中可用。

Google 宣布推出 Gemini 3.8 Live with Live Avatar,在上一周发布的 Gemini 3.8 Live 基础上,为原生实时对话模型增加近实时的视觉呈现。该功能将视频生成与语音配对,让 AI 具备一个能听、能看、能说话且带有动态视觉形象的数字人。

Live Avatar 的核心能力包括精准的唇形同步、自然的面部表情和流畅的对话轮转。它同时处理视觉和音频输入,并生成相应的音视频回应。此外,该功能支持异步工具调用,AI 可以在后台执行工具调用和获取数据的同时,保持对话不中断。官方演示了酒店前台办理入住的场景。

Live Avatar 支持 97 种语言的原生多语言语音到语音同步,切换语言时唇形和表情会自动适配,不会降低视频质量或产生视觉漂移。企业可以从预设形象库中选择,也可以通过高质量参考图片定制专属虚拟形象,定制功能目前仅限企业白名单用户。

所有 AI 生成内容均使用 SynthID 水印,该水印直接嵌入音频和视频输出,以帮助识别 AI 生成内容。Gemini 3.8 Live with Live Avatar 即日起在 Gemini Enterprise 中提供。

#Google#Gemini 3.8#虚拟形象

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。