微软MAI Realtime语音模型上手:从零开始搭一个双语对话助手
这篇教程写的时机有点巧。前天IT之家报微软在测自研的全双工语音模型MAI Realtime,支持16种语言、听说并行、还能中途切语言。我正好这几天在帮朋友试类似的语音交互方案,就把自己踩的坑整理一下。
先说清楚,MAI Realtime目前还在内测阶段,普通用户还没法直接打开网页就用。但如果你有微软合作伙伴账号,或者能拿到MAI Playground的测试资格,下面的步骤可以直接套用。没有资格的朋友也别急,逻辑是一样的,后面Copilot大概率会集成这个能力。
第一天:拿到测试资格,搞清楚“全双工”是什么
第一步,登录 MAI Playground 平台。如果你收到的邀请邮件里有链接,直接点进去,用微软工作或学校账号登录。界面长什么样?左边是模型列表,右边是对话窗口,中间有几个参数调节滑块。
选模型的时候,在列表里找 MAI Realtime。注意不是MAI-Voice-1,那是纯语音生成模型,不是实时的。选完之后,你先看到的是“语音设置”面板。这里要解释一下“全双工”是什么意思——就是你和AI可以同时说话,不用像对讲机那样“你一句我一句,说完等对方回”。普通语音助手(比如Siri)是半双工的,你说完它才处理;MAI Realtime是边听边想边说,中间没有停顿感。
设置语言:目前支持中文、英语、日语、西班牙语等16种。默认是“auto-detect”模式,它会自动识别你说的是哪种语言。我建议你先手动选成“中文(简体)”,因为auto在背景噪音大的时候会误判。
语音风格有两种:Neutral(中性)和Warm(温暖)。我第一天试的是中性,听起来像客服。后来换成温暖,感觉像朋友聊天。这个看个人偏好。
第三天:测试中英混说和打断
第二天我基本在乱试,没出什么有价值的东西。第三天开始认真跑测试。
关键操作一:中英混说。你直接在对话里说“今天天气怎么样,顺便帮我查一下Hong Kong的flight status”。MAI Realtime会自动识别语言切换,不用手动选。我测下来,如果一句话里中文占比超过60%,它会把整句当作中文处理,只把英文单词当成外来词。反过来也一样。这个逻辑比我想象的聪明,但偶尔会出错——比如“I want to 订个酒店”这种,它有时候会卡住半秒,然后重新问一遍。
关键操作二:打断测试。你正常说话,说到一半突然说“等一下,我换个说法”。MAI Realtime会立刻停止当前输出,重新听你的新指令。我试了三次,每次打断到恢复的延迟大概在0.3-0.5秒,体感上几乎没有等待。这个比GPT-4o的语音模式快,我猜是微软的模型架构更轻量。
踩坑记录:我在第三天犯了一个低级错误。我同时开了两个浏览器标签页,一个在测试MAI Realtime,另一个在放YouTube视频。结果模型把我视频里的对话也识别进去了,导致回答混乱。解决办法:测试时关掉其他音频输出,或者只用耳机麦克风,不要用外放。
一周后:组合使用,以及下一步可以试什么
用了一周,我总结出两个最有价值的场景。
场景一:实时翻译助手。你对着麦克风说中文,它自动翻成英文输出。反过来也行。这个功能对于商务谈判、电话会议非常实用。我试过让它把一段中文产品介绍翻成日语,输出质量不错,专业术语(比如“CPLD”、“FPGA”)也能准确识别。
场景二:多轮打断的复杂任务。比如“帮我查一下明天北京到上海的航班,等等,我改一下,后天,哦不对,大后天,并且只看上午的”。MAI Realtime能完整跟踪你的每一次修改,最终给出正确结果。这个能力在普通语音助手上是做不到的,它们通常只记住最后一句话。
目前已知的限制:一是模型支持的语言里,中文和英文的准确率最高,小语种(比如阿拉伯语)偶尔会吞词。二是延迟虽然低,但超过30秒的连续对话后,偶尔会出现“回声”,—就是把你刚才说的话重复一遍。这个可能是bug,等后续更新修复。
学完这个,下一步可以试试把你的MAI Realtime对话记录导出,看看它能不能帮你自动生成会议纪要。 我自己试了一下,效果还行,但格式有点乱,需要手动整理。
你最近在测什么语音模型?有没有遇到比我更离谱的bug?
物界前沿