↑

Google|Gemini 3.8 Live with Live Avatar上线企业版

PromptTree|阅读 0
2026/09/25 07:45
GoogleGeminiLive Avatar企业智能体SynthID
Google于9月24日发布Gemini 3.8 Live with Live Avatar,将近实时视频形象与语音对话耦合,支持表情口型同步、异步工具调用与约97种语言切换;即日起在Gemini Enterprise可用,输出含SynthID水印。

企业客服与导览如果只能「听得见、看不见」,体验会停在电话机器人时代。Google把近实时视频形象接到Gemini的实时对话栈上,产品名是Gemini 3.8 Live with Live Avatar。

官方博客日期为2026年9月24日。功能建立在上周Gemini 3.8 Live与Extended Thinking发布之后:把低时延流式视频与语音原生耦合,提供口型同步、自然表情与流畅轮转,让企业智能体在对话时具备可视化身位。公开能力点包括:同时处理视觉与音频输入;异步工具调用——后台拉数据、查房态的同时保持连续对话;约97种语言的语音到语音同步,切换语言时口型与表情跟随且尽量避免画面漂移;除预设形象库外,可用高质量参考图生成定制Avatar(企业白名单)。信任侧,音视频输出嵌入SynthID水印,并指向模型卡说明安全部署口径。

落地入口写明即日起在Gemini Enterprise可用,文档指向Gemini Enterprise Agent Platform的Live API。对客服、酒店入住、产品讲解等场景,可视化身位降低「纯语音Agent」的信任摩擦;对企业品牌,定制形象把助手从通用脸孔拉回品牌人设。约束同样明确:定制生成仍受allowlist限制;近实时并不等于零延迟;水印提高可检测性,但不自动解决深度伪造治理的全部问题。

把Live Avatar放进2026年的Agent竞赛里看:一边是能打电话、能下单的工具型Agent,一边是更接近真人接待的多模态在场。Google选择先把能力放在企业通道,而不是消费端全民推送,暗示真实对话的安全与体验仍需小步校准。下一步可观察调用配额、形象定制开放节奏,以及与客服工单、CRM工具链的集成深度。