
语音助手的「驾驶座」之争:从拼马力到拼手感
如果把AI语音助手比作一辆车,过去两年的竞争就像在比谁的马力更大——谁家的语音识别更准、响应更快、支持的技能更多,谁就是赛道冠军。但谷歌Gemini刚刚发布的「语音自定义」功能,让我们看到比赛正在悄悄转向另一个维度:谁能让用户更舒服地握着方向盘,调节座椅高度、方向盘的力度、甚至引擎的声浪。这不是锦上添花,而是从「功能竞争」向「体验竞争」的质变信号。
谷歌这次在Gemini里塞了四个滑块:速度、活力、正式度、亲切感。每个维度都是一个连续可调的参数轴,覆盖实时对话和普通聊天场景。实测跑了一下,速度调节本质上是改变语音合成中音素的持续时间(Duration)和停顿(Pause)的分布,而活力则对应基频(F0)的抖动范围和能量包络的动态变化——这两个参数在传统TTS(文本转语音)系统中通常被固定为「中性」值,现在开放给用户,意味着底层模型需要支持实时推理下的连续参数空间插值。
更关键的是「正式度」和「亲切感」。这两个维度不是简单的语调或语速,而是涉及词汇选择、句式结构、甚至人格化倾向。比如在正式度高的设定下,模型会倾向于用完整的主谓宾短句,减少口语化缩略词;亲切感高时,则会加入「嗯」「哦」「好的呀」这类语气词,甚至微调句末语调的上扬幅度。这已经不是语音合成引擎能独立完成的工作,而是需要大语言模型与语音生成模型在推理阶段做深度耦合——即LLM根据当前设定的「人格参数」动态调整输出文本的语体,再交给语音模型按对应韵律参数渲染。
我把三家巨头最近半年的布局整理了一下:
| 厂商 | 核心功能 | 可调参数 | 技术路线 | 推出时间 |
|---|---|---|---|---|
| 谷歌 | Gemini语音自定义 | 速度、活力、正式度、亲切感(4个连续滑块) | 端到端神经语音合成+LLM联合控制 | 2025年7月 |
| 苹果 | Siri个性化语音 | 声音风格(预设方案,非连续参数) | 基于Transformer的语音克隆,参数固定 | 2025年3月 |
| OpenAI | ChatGPT高级语音模式 | 性格、语气(文本指令+人工预设) | 多模态模型直接输出语音,无显式参数 | 2025年5月 |
从技术深度看,谷歌的连续滑块方案最「硬核」——用户可以直接操作语音合成的底层物理参数,这相当于给开发者/高级用户一个频谱编辑器,但同时也意味着学习成本。苹果的方案更保守,本质是「换皮肤」——给你几个预设,选一个用。OpenAI则走了另一条路:用自然语言指令控制语气,比如「用教授的语气」「用朋友的语气」,但用户无法精细调节,模型内部是一个黑盒。
我的判断是:谷歌的路线在长期更有前途,因为语音交互的「千人千面」最终需要参数化表达。每个人的听觉敏感度、对话习惯、甚至对「亲切感」的定义都不同,只有可微调的连续参数空间才能覆盖长尾需求。但短期来看,谷歌面临一个棘手的工程问题:如何让用户理解这四个滑块背后的物理意义?普通用户可能不知道「活力」调高后,自己听到的其实是基频标准差增大,导致声音听起来更「兴奋」。如果用户把四个滑块都拉到极端,得到的可能是一个语速飞快、音调起伏剧烈、用词又正式又亲切的「精神分裂」式AI,体验反而糟糕。
这让我想起自动驾驶的「L2到L3跨越」:给用户更多控制权,但用户不一定有这个能力。AI语音助手这次把「驾驶权」交给了用户,但用户需要一份「用户手册」。目前谷歌的文档里只有简要说明,没有提供「推荐场景预设」,比如「商务会议」建议用什么参数,「深夜聊天」用什么参数。如果后续能像相机厂商的「场景模式」那样,提供一批经过验证的预设,再允许用户微调,会大幅降低使用门槛。
配图在这里,摄于某次AI语音技术大会的现场,话筒堆叠的意象很契合「多声道竞争」的主题:
回到行业层面,这次升级的另一个信号是:语音交互的「人格化」正在从工程问题变成产品问题。三巨头半年内同时推出自定义功能,说明他们都意识到,当语音识别准确率接近95%天花板,响应延迟压到200
原文链接:https://www.tmtpost.com/8070162.html
物界前沿