谷歌发布 Gemini 3.8 Live 与 Live Extended Thinking:能「边聊边推理」的实时语音模型

9月16日,Google 在官方博客发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,面向语音助手、智能体与近乎实时的复杂推理场景。两款模型均支持在对话进行中融合视觉信息、自动跨 97 种语言切换,并已在 Gemini API、Google AI Studio、Search Live 与 Gemini 应用中陆续推送。

事件背景

近一年来,前沿实验室普遍把「低延迟语音」当作与文本生成平行的一条独立能力赛道来竞争,比拼的指标不再是传统文本或图像榜单,而是轮替流畅度、对话中推理、以及不冷场的前提下调用工具。Gemini 3.8 Live 系列正是这一趋势的典型产物。

核心内容

Gemini 3.8 Live 定位为低成本、可规模化的实时交互模型;Gemini 3.8 Live Extended Thinking 则面向需要多步推理的复杂任务,能够在维持对话流畅的同时「边说边想」,并在后台发起工具或 API 调用而不打断交流。Google 称,Extended Thinking 在第三方机构 Artificial Analysis 的「语音到语音质量指数」(Speech-to-Speech Quality Index)上排名第一,得分 82.6,并在 tau-Voice 智能体基准上取得 68.6% 的成绩;基础版则在另一语音智能体榜单中位列第二。

面向开发者,Google 联合 Agora、LiveKit、LangChain、Pipecat、Vercel 等平台,简化实时媒体流与语音界面搭建;Salesforce、Genspark、Lumeris 等企业也已表态将接入该能力。所有 AI 生成音频均嵌入 SynthID 水印,以辅助识别深度伪造与虚假信息。

影响与解读

语音正成为 AI 智能体的一等交互界面,这将显著降低使用门槛——不擅长打字或阅读的用户也能借助自然语言完成任务,对无障碍与低识字率人群是实质性跃迁。对开发者而言,「对话中不冷场地调用工具」打开了客服、陪伴、现场协作等新形态应用的想象空间。

相关动态 / 展望

随着语音模型与 Workspace(Docs Live、Gmail Live、Keep Live)深度整合,办公套件的交互方式可能从「打字」转向「说话」。下一阶段竞争焦点将落在延迟、工具调用可靠性与多语言口音覆盖上。

信息来源:Google 官方博客

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。