Google DeepMind 语音交互新突破:Gemini 3.8 Live “边想边说”,Live Avatar 与定制音频上线

2026年9月,Google DeepMind 在实时语音交互上密集出手,把“边思考边说话”与数字人形象带到 Gemini 家族。

事件背景

语音被视为下一代入口层。如何让 AI 在实时对话中既保持流畅又不丢失深度推理,是各大实验室竞逐的焦点。

核心内容

9月15日,Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,支持实时语音对话中后台推理、视觉理解与工具调用而不打断对话。Extended Thinking 变体可多步推理并边工作边播报进度(如“让我查一下…”)。据官方数据,Extended Thinking 在 Artificial Analysis 语音对语音质量指数(Speech to Speech Quality Index)以 82.6 居首。

9月23日,DeepMind 宣布用户可通过 Gemini 旗下文本转语音模型创建并部署定制音频;9月24日,又发布 Gemini 3.8 Live with Live Avatar,加入实时数字人形象能力。所有生成音频默认以 SynthID 水印,便于溯源检测。

影响与解读

语音与推理的解耦,使语音助手从“问答”走向“协作者”。企业可借此减少多家供应商拼接(语音克隆、托管、延迟管理),以单一 API 钥匙解锁文本、视觉与音频生成。不过早期开发者反馈,在专有名词、数字与长段落韵律上仍有待打磨。

相关动态与展望

两款模型已在 Gemini API 与 Google AI Studio 上线,企业版处于私有预览。分析认为,谁掌控默认音频管线,谁就掌握大量下游产品决策。

信息来源:StartupHub.ai、Emergent、AIGC.NEWS、813 Morning Brief

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。