社区讨论 · 政策

Gemini语音自定义怎么玩,我从头跑了一遍

天玑天玑8月17日2026/08/17 280 浏览

Gemini 的语音自定义这两天陆续放出来了,实时对话和普通聊天里都能用。核心玩法就是录几段你自己的声音,AI 学你的音色和语气,之后对话就全用这个声音回你。我花了两天从头跑了一遍,能跑通,就是有几个坑得提前绕开。

步骤其实很短:打开 Gemini 应用,右上角头像进设置,找到语音,进语音自定义,点创建新语音。系统会让你照着屏幕给的文本录 10 到 20 句样本,读完点生成,等十几秒到半分钟,试听,满意就保存,回去把新声音设为默认。整个流程不超过十分钟,免费版就能用。

样本读取这一下最考验耐心。我第一遍读得飞快,每句两三秒就过,生成的语音发飘,重音全不对。后来认认真真把每句话按正常节奏读完,效果立刻正常了。模型吃的就是音色底子,样本太短学不全,等于白录。安静也很关键。我在客厅录了一版,风扇底噪进去了,生成的语音句尾能听出一丝沙沙声,换到卧室重录就干净了。不需要专业麦,但得找一个没环境音的房间。

另外有个坑,改完设置后第一次对话可能还是旧声音,通常是缓存没刷过来,把 Gemini 彻底关掉再重开就好。我这边安卓上更容易出现,iOS 上没遇到。

录完的音色相似度我体感七八成,停顿习惯和语气词学得挺像,但方言口音会被拉向标准发音,想保留地域腔可能得多试几版样本。我试了几次就放弃了,反而接受了这个设定。

这功能让我想起早报里马克斯普朗克那个研究,预训练阶段的知识暴露决定能力上限,后训练只能激发不能创造。语音自定义也有点这个意思,你喂什么样本它就只在这个范围内发挥,想让它突然吐出你没录过的风格,不可能。目前看更多是“把你的声音复刻一遍”,而不是“学完后自由发挥”。

下一步我打算把语音自定义和自动化场景串起来,早上让它语音播报天气和日程,顺带研究下声纹能不能在同一设备上区分不同人。这个还没跑通,后面有结果再更新。

2 条回复

?
Ctrl + Enter 快速回复
梁姐看估值

这个技术天花板挺明显的,样本质量决定输出上限,和预训练知识暴露的理论一致。语音赛道竞争格局看,谁能把采样效率和音色还原度做上去,谁才能拉开差距。

投早的
投早的8月17日

读太快那个太真实了……我第一次也赶着念完,出来声音跟念经似的。老老实实按正常语速读一遍立马就对了。