WorkBuddy 用了一个月,我觉得它最该补的是可验证中间层
结论先放这里。WorkBuddy 这类 AI 办公工具现在最不缺把一堆材料变成一段漂亮结论的能力,最缺把结论拆回可追溯责任链的能力。我用了 WorkBuddy 大概一个月,Skill 这块昨天才开始碰。本来只是想把客户邮件、会议转写、工单截图整理成一条能交接的待办,结果多 Skill 串联跑了几次之后,我更确定一件事。没有可验证中间层,办公 AI 越自动化,越容易把错信息包装成团队共识。
昨天我写过一篇 WorkBuddy 多 Skill 串联卡住,当时怀疑是额度或者任务太长。这两天又跑了几个真实协作场景,想法有点变。卡住不一定只是额度,也可能是任务被拆得太自然语言了。邮件抽取、会议归一、工单状态映射、待办生成,每个动作都像独立 Skill,但它们之间传的是松散的文本和表格,很难当稳定契约用。第一次跑成功,不代表下次还能复现。你交给同事,他也不知道该复核哪一步。
昨晚十一点我还在处理客户反馈。手边有三十多封邮件、几段会议转写、几张工单截图、两个客户群聊导出。我本来不想加班,但信息源实在太碎。OpenRefine、Python、Hexomatic 这些工具我也试过,清洗和抓取能解决一部分,可管道要自己搭。WorkBuddy 的价值在于它愿意把入口做得像办公,不像开发。于是我把这批文件丢进去,先不要求它出客户满意度结论,只要求它做分类和抽取。
这里插一句 Archify。昨天刷到一篇关于 Archify 的文章,它让 AI Agent 在对话里生成可验证架构图,核心在中间有一层 Typed JSON IR,每次变更都经过 schema 校验,失败时返回机器可读的修复提示。
我觉得这个思路对 WorkBuddy 很重要。办公协作比架构图更碎,信息源更多,如果还是让模型直接输出最终交付物,出错成本会很高。
Archify 的价值在图之外。它把生成拆成了可验证的结构中间层。
所以这次我把 WorkBuddy 的用法改了。以前我总想一次说清楚,把客户反馈整理成行动项,按负责人统计,生成给老板看的结论。现在我先让它生成一个 JSON/CSV 草稿,字段固定,包括 source_type、source_id、channel、customer、event_time、issue、suggested_action、status、evidence、confidence、review_status。我大约一个月前开始用 JSON Schema,也试过 Pydantic,知道字段契约不是玄学。WorkBuddy 负责把邮件、转写和截图里的内容填进去,不负责判断这个客户是否要升级。这一步很关键,它把 AI 从裁判降级成录入员。录入员会错,但至少错在明处。
具体跑下来,我大概分四步。第一步让 WorkBuddy 做信息源分类,把邮件、会议转写、工单截图、群聊导出分开。这一步它比我预想稳,大部分能识别,有两张拍歪的工单截图被分到 unknown,需要我手动拉一下。第二步抽取字段。这里问题开始出来,有的时间写成不同格式,有的邮件把客户名写进正文,有的截图把状态识别成符号。第三步我没有直接重跑,改让 WorkBuddy 只输出不符合字段规则的行。这一步很省时间。以前错一行就全量重跑,越跑越慢,也越跑越不知道错哪了。第四步才是汇总,我让它按 customer 和 status 出一张待办队列,并且把 review_status 不是 passed 的行单独列出来。
我这边测下来,三十多份文件,第一次搭字段规则大概二十分钟,后续真正跑 WorkBuddy 大概十五到二十分钟,最后人工复核异常行十分钟左右。总计大约四十分钟,比之前手动复制、截图识别、对齐状态省了至少一半时间。以前这种脏活经常要拖到晚上九点以后。现在能更早睡,但前提是我不接受它直接交最终结论。WorkBuddy 真正省命的地方,是替我把一堆没法交接的碎片变成可追溯的证据。
不过 WorkBuddy 也有毛病。它的问题是黑盒感还是重。我用了 n8n 大概一个月,也知道 API、webhook 那一套。同样一个抽取任务,n8n 能把每一步状态打出来,Python 可以抛异常,OpenRefine 有操作痕迹。WorkBuddy 更顺手,但一旦结果不对,我很难判断是文件解析、模型理解、字段映射,还是 Skill 串联顺序的问题。昨天刚上手 Skill,我确实还是新手。可就算我是新手,也能感觉到,多 Skill 串联如果只靠自然语言传话,迟早会翻车。就像几个人接力搬箱子,每个人都说我搬完了,最后箱子少了,没人知道在哪丢的。
如果和同类工具比,我的判断是 WorkBuddy 不适合和 BI 看板拼可视化,也不适合和抓取工具拼边界。它更适合放在办公信息进入协作系统前的第一道证据预处理。BI 工具适合把已经干净的数据做成看板,网页抓取工具适合结构化页面,清洗工具适合列转换。WorkBuddy 的优势是入口自然,能处理邮件、会议、工单、截图这些杂事。劣势是验证、留痕、错误归因还不够硬。如果 WorkBuddy 未来只继续加强生成好看的东西,我会觉得这是退步。如果它把 Skill 之间交换的数据契约、校验规则、失败留痕做出来,它才真的能进企业流程。
这也影响我对它适合谁的看法。适合的人是每天被邮件、会议、工单、截图折磨的人,适合把重复抽取、分类、格式统一交给它。不适合的人是希望一句话生成老板满意结论的人,也不适合不愿复核的人。很多团队把 AI 办公工具当自动化,其实自动化最危险的地方是错误也被自动放大。尤其客户成功、运营、项目协作这种场景,一个时间识别错,一个负责人漏掉,后面排期全歪。WorkBuddy 如果能把异常行、字段缺失、来源文件、置信度、人工确认状态做出来,价值会大很多。
从 Archify 那篇文章看,我觉得未来办公 AI 工具会往端到端生成可验证中间层走,少追最终交付物。架构图需要 JSON IR,办公协作也需要字段 schema、来源留痕、异常队列、局部重试。WorkBuddy 现在已经有文件处理和 Skill 的雏形,但它还需要把“我生成了”变成“我能证明我哪里没生成对”。这一步如果补齐,它就能从聪明点的办公软件变成协作证据管道。
往后看,我猜接下来一年,办公 AI 工具的竞争重点会从漂亮 PPT 转向可追溯待办。WorkBuddy 这种工具如果继续堆 Skill,但没有统一的输入输出契约,最后会变成一堆看起来会干活的入口。如果它能把邮件、会议、工单、图片的抽取结果标准化,再给每个字段留来源和状态,那它才配得上办公效率工具这四个字。
我现在不想听空泛的业务口号,也不想看虚的提效说法。我只想知道昨晚那批客户反馈,哪个待办错了,错在哪封邮件、哪段会议、哪张截图,能不能只重跑那一条。WorkBuddy 要是把这个做顺,我就继续用。
物界前沿