
WorkBuddy 拿了 8.60 分第一,但榜单第一和你能用好是两回事
那份 2026 AI 办公智能体横评我看了,WorkBuddy 8.60 分排TRAE Work 7.92,千问办公 7.87,这个结果我认。但这两个月用下来,我最大的感受是,分数和你能不能把它用好,中间隔着一整套用法。我踩的坑基本跟能力无关,全在用法上。
九月底那场展回来,我桌上堆了两摞东西。一摞是名片,六十来张,一半是客户自己手写的,字迹我认不出来。另一摞是供应商塞的报价资料,两份 Excel 三份 PDF,中英文混着,货币单位有 USD 有 EUR 还有越南盾。搁以前,接下来两个下午别想干别的。
这次我换了个干法。
我先在 D 盘建了个文件夹叫 leads_0930,下面开三个子目录,raw、mid、out。raw 放原始名片照片和 PDF,mid 放中间产物,out 放最终能导进 CRM 的表。这个目录隔离的习惯我养了有一阵了,一是防止它把原始文件改坏,二是出了问题我能一眼看出来是哪一步出的错。
然后我做了三件事,每件事单独开一个对话。
第一件,只做 OCR。六十张照片一次性丢进 raw,指令写死:逐张提取,输出一个 CSV,字段固定为公司名、联系人、职位、国家、邮箱、WhatsApp、备注。手写的识别率大概七成到八成,打印体基本没问题。这一步花了大概二十分钟,中间有两张拍歪的它标了无法识别,我自己补的。
第二件,去重。同一个客户在不同场合给过两张名片,还有的公司中英文两种写法,比如一个深圳的供应商,一张写「Shenzhen XX Tech」,一张写「深圳某某科技」。我把第一步的 CSV 丢进去,让它按邮箱和电话做主键合并。这一步最省事,十来分钟出结果,六十条压到四十七条。
第三件,匹配。把名片里的公司名跟报价资料里的抬头对上,输出一张表,左边客户右边报价。这一步我返工了两次,第一次它把两家名字里都带科技的公司搞混了。
三个步骤走完,大概一个半小时,出了初稿。我自己又过了一遍,改了二十来处。这个活以前我要两个下午,现在一个上午能收工。这是我这两个月里,WorkBuddy 帮我省得最实的一次。
但我要说的是它的坑。
那份横评里 WorkBuddy 成本透明只给了 6.0 分,我觉得这个分还给高了。它的计费是按输入输出双向算的,每一轮追问会把历史对话重新算一遍 token。我做过一次实验,一个中等复杂度的表格清洗任务,单轮大概花 15 到 25 积分。但你要是同一个对话里连着追问七八轮,第六轮的时候你会发现前面的对话还在被重复计费,最后总额能翻两倍多。社区里管它叫「积分刺客」,不冤。
还有一个更隐蔽的,默认的 Auto 模式经常给简单任务调最贵的推理模型。不同模型的倍率最高差二十几倍,差距是断崖式的。
我后来摸出三条做法,照做之后同样一批活,消耗大概降了四成。查资料切 Ask 模式,只有要产物才开 Craft。一个任务做完就新建对话,别在旧对话里接着聊。简单任务手动选 Hy3 或者 DeepSeek-V4-Flash 这类低倍率模型,别用 Auto。这三条听着简单,但第二条我以前老忘,总觉得接着上下文聊更聪明,其实是又贵又容易跑偏。
再说说它跟另外两家的区别,这也是我看那份榜单时最有共鸣的地方。
TRAE Work 排工程能力 9.5 是全场最高。我试过拿它做同一批名片整理,出来的东西结构特别漂亮,一个带完整目录的项目文件夹,JSON 加 Markdown 加日志,工程上挑不出毛病。问题是我要的只是一张能直接跟进客户的表。它交付的东西正确,但不好用,我得自己再转一道手。
千问办公 7.87,办公交付 9.0 是全场最高,成品质量确实最好。但它模型不能换,这个对我是硬伤。外贸这边的活差异很大,整理一份长合同时需要长上下文的模型,跑一批短邮件草稿时需要便宜快速的模型,一刀切我接受不了。
WorkBuddy 是那个什么都能干、什么都不算最尖的。自主执行 9.0,生态连接 9.5,模型自由 9.5,三项都在线,但 3D 和复杂视觉那块它确实弱,PPT 也出过图表没显示的情况。这就是典型的加权制冠军,没有短板,但没有一项是绝对碾压。
对外贸这种一个人要干十件事的场景,全能比最尖更值钱。
不过我这话有个前提,就是你的活得是那种什么都有点的活。你要是专做一件事,比如只写代码,那 TRAE 或者 Cursor 更对口,不用非凑这个热闹。
还有两条边界我得说清楚。
WorkBuddy 不是 CRM。这个我三周前专门写过一篇。它把脏线索洗成干净的表,但跟进、记录、提醒、成交阶段这些还是得进 CRM。我现在的流程是,WorkBuddy 洗完出表,导进 CRM,后面的动作在 CRM 里做。两个工具各管一段,硬要合在一起用,两头都不舒服。
它也不适合做实时回话。客户在 WhatsApp 上甩一句「上次那款还有货吗」,你不可能等它跑两分钟再回。这种活我交给别的工具,贸译 AI 我这几天刚上手,还在试,用了一周不到,暂时不下判断。
最后说说适合谁。
手上有一堆非结构化资料、一个人当三个人用、愿意花点时间把指令写清楚的人,它值。想开箱即用、指望它自己猜你在想什么、或者一天就跑两三个小任务的人,积分这块先算清楚,不一定划算。
你们在积分这块是怎么控制的?我上面那三条是笨办法,靠纪律省,有没有人是靠工具本身或者外部脚本去管的。
物界前沿