物界前沿 · 资讯情报卡(IT之家 · 2026/9/23)
谷歌发布 Gemini 3.8 Flash 系列文本转语音模型
核心事实
- 谷歌推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款文本转语音模型。
- Flash TTS 面向角色设计与创意场景,Flash-Lite 面向大容量低成本配音。
- 模型支持 100 多种语言,语音库从 30 种扩展至 2000 多种现成语音。
- 语音复制仅需 30 秒音频样本,并加入同意验证与 SynthID 水印。
- 两款模型已在 Gemini API 和 Google AI Studio 向开发者推送。
关键数据
71.4 分Hume AI 语音设计基准总分
60.8 分Hume AI 口音建模得分
100 多种支持语言和方言数
2000 多种现成语音库规模
物界观察
语音合成正从选预设音色转向按台词精细编排,这对有声书、播客和游戏配音是实打实的生产力工具。但语音复制门槛降到 30 秒,加上区域禁用名单,说明合规压力已经先于产品落地,行业接下来拼的不只是音质,还有授权与溯源机制。
来源:IT之家原文 ↗
物界前沿