
当地时间 9 月 23 日,Google DeepMind 推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,把“用自然语言描述声音”推向了创作工具层级。
事件背景
语音 AI 正成为 AI 市场中最具争议的细分战场之一。ElevenLabs 靠富表现力的克隆与配音建立生意,OpenAI、亚马逊、微软也都推出了各自的语音栈。谷歌此次的思路是:不再把 TTS 当成“念稿工具”,而是当成带演员、口音与舞台指令的创作工具。
核心内容
两款模型已通过 Gemini API 与 Google AI Studio 上线(官方 changelog 标注 9 月 22 日 GA)。
- 声音设计:开发者用自然语言描述角色、口音与性格,模型即可“凭空”生成匹配的新声音,并支持逐句控制语气、语速与口音。
- 覆盖范围:支持 100 多种语言与方言,开箱即用地提供 2000 多种现成声音;并可用 30 秒音频样本复刻声音。
- 定位差异:Flash TTS 面向声音与角色设计、录音室级保真;Flash-Lite TTS 面向大规模音频生成与高效配音。
影响与解读
据谷歌披露,Gemini 3.8 Flash TTS 在 Hume AI 的 Voice Design Benchmark 上以 71.4 分位居第一,口音建模得分 60.8。模型基于 Gemini 3 Pro,文本输入上限 8K token、音频输出上限 64K token,并支持双说话人剧本式编排。
安全方面,每段音频都内嵌 SynthID 水印,复刻声音需通过同意验证,并附带 C2PA 凭证。前沿安全评估认为其未较 Gemini 3.7 Flash 出现新的能力跃升。
相关动态 / 展望
这是谷歌不到一个月内第三次音频模型发布。语音正在从“朗读”走向“表演生成”,游戏、有声书、播客与交互媒体的内容生产链路有望被重构。企业级 API 访问预计稍后开放。
信息来源:Google Gemini API 官方更新日志、Unite.AI 报道
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。

评论(0)