谷歌推出 Gemini 3.8 Live 实时语音模型与 Lyria 3.5 音乐模型,多模态再扩容

9 月,谷歌在模型矩阵上密集更新:9 月 15 日发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型;此前 9 月 3 日已正式推出下一代音乐生成模型 Lyria 3.5。

事件背景

在 9 月 2 日 Gemini 3.8 Flash 正式版(GA)落地之后,谷歌把更新重点延伸到“实时语音”与“音频生成”两大场景,试图让与人类的自然对话与音乐创作都更接近“生产可用”。

核心内容

本轮更新的要点包括:

  • Gemini 3.8 Live 主打低延迟语音代理与实时对话,支持近实时视觉输入,可在对话中自动切换 97 种语言,并能在后台执行工具与 API 调用而不打断对话。
  • Gemini 3.8 Live Extended Thinking 面向高复杂度任务,支持边思考边语音交流;在 Artificial Analysis 的 Speech-to-Speech Quality Index 上以 82.6 分登顶,并在 τ-Voice 等智能体任务完成度基准上领先。
  • Lyria 3.5 可生成高保真 44.1 kHz 立体声音频,支持完整歌曲(主歌/副歌)、自定义歌词与时间轴结构控制,并为所有生成音频加入 SynthID 水印。

影响与解读

语音模型从“能聊天”走向“能执行后台任务”,意味着 AI 助手可以一边与用户对话、一边完成订票、查资料等操作,语音代理正成为企业级应用的新入口。Lyria 3.5 配合 SynthID 水印,也体现了生成式音频在版权与可追溯性上的合规取向。

相关动态与展望

谷歌表示,Gemini 3.8 Live 系列已通过 Gemini API、Google AI Studio 向开发者开放,并在 Search Live 与 Gemini Live 中逐步上线;Lyria 3.5 则已进入 AI Studio、Gemini API 与 Gemini App。

信息来源:Google 官方博客、Google Gemini API 版本说明、每日经济新闻 等。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。