语音直接替你操作电脑,VoiceOS新手设置全流程
我花了两天试了一下VoiceOS,就是ProductHunt上那个所谓「语音操作系统」。简单说,它能把你说的话直接变成电脑上的操作,不用再一个个点开邮件客户端、日历、浏览器来回切。官方给了一组对比数字:传统打字速度算1倍,普通语音转文字是4倍,VoiceOS直接操作是10倍。这个数字看看就好,但方向我觉得是真的。
先给完全没接触过的新手解释两个词。语音转文字(Dictation)是你说话,它把话变成文字打在屏幕上。语音操作(Agent)是你说话,它直接替你把事办了,比如你说「给张三发邮件说会议改到三点」,它自己打开邮件应用、新建草稿、填好收件人和正文。VoiceOS这两个模式都有,所以它管自己叫「语音到行动」。
安装不复杂。App Store里搜VoiceOS,免费下载,是家叫VarMeta的团队做的。Mac和Windows都能用,我这边主要试了Mac版。下载完打开,第一步会要麦克风权限,这个在系统设置的「隐私与安全性」里允许,不然它听不见你说话。
第二步是选模式。主界面有两个入口,一个是Agent Mode,一个是Dictation Mode。新手建议先别碰Agent,先把Dictation跑通。点进Dictation Mode,选好语言,默认是英文,中文也支持但识别率目前明显不如英文稳。按下快捷键开始说话,屏幕上会实时跳出转写文字。我试了试口述一小段会议纪要,大概四十秒的录音,转出来的文字基本能用,个别专业名词不对,需要手动改。
把Dictation跑顺了,再试Agent Mode。这里要说清楚,Agent是真正会操作你电脑的,给它权限之前想清楚。第一次用,它会弹一个列表,问你要允许它控制哪些应用,比如邮件、日历、浏览器。建议先只勾邮件和日历,别一上来全给。
然后就是说话。我试了句「给王老师发邮件,明天下午三点开会,地点在302」。它愣了一下,然后自己打开邮件应用,新建了草稿,收件人自动填了王老师,正文写了「明天下午三点开会,地点在302」。整个过程大概十几秒,我全程盯着,没出大错。但有个细节,它把「302」理解成了「302室」,这个如果是正式邮件就得自己改回来。
踩坑的地方,我拢了拢,新手最容易栽在四个地方。
权限不给全。只给麦克风权限,不给辅助功能权限,VoiceOS能听但动不了手,Agent Mode点了没反应。解决方法是去系统设置里把VoiceOS加入「辅助功能」和「自动化」的允许列表。
中文命令的识别问题。同样一句话,英文指令的成功率明显高。我建议新手先用英文指令练手,比如「open calendar」「send email to John」,中文等熟悉了再试。也可能我这边普通话不够标准。
背景噪音。开着风扇或者放着音乐的时候,识别率掉得厉害,特别是Agent Mode,听岔一个字可能就办了错事。安静环境或者戴耳机,体验完全不同。
第四,Agent改错东西的善后。它真会动手,比如把邮件发出去这种事,新手操作前最好先确认一下。它界面上有个「确认后执行」的开关,默认是关的,建议新手打开,让它每次执行前问你一句。
我这边测下来,整体感觉是:VoiceOS把「说一句话」到「办成一件事」之间的链路缩短了,但这个链路还比较脆。它更像一个很听话但有点笨的实习生,大事能干,细节要盯。
反过来看,这类产品让我比较在意的不是功能完成度,是它背后的交互逻辑。语音转文字工具很多,但「语音到操作」是另一个维度的东西,它抢的是入口,是用户和操作系统之间的那层关系。这个赛道如果跑出来,估值逻辑就不是按工具算,是按平台算。当然,现在下结论还早,端侧模型的能力、系统权限的开放程度、用户习惯的迁移成本,哪一条都不好啃。
学完这个,下一步可以试的事:先花十分钟把Dictation Mode跑通,写一封短邮件或者一段会议纪要,感受一下语音转文字的流畅度。再挑一个不那么重要的操作,比如「打开浏览器搜索VoiceOS评测」,用Agent Mode试一次,看看它替你动手的体验。等这两步都熟了,再考虑把日常高频操作交给它。
本文编译自 ProductHunt,原文:https://www.producthunt.com/products/voiceos
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿