用 WorkBuddy 把「AI 生成代码」的留存率,从 76% 提到 95% 的笨办法
Cursor 那份报告说 AI 生成代码的 60 分钟留存率到了 81%,我看完没啥感觉。留存率这指标,说白了就是「AI 写完你愿不愿意留着」。我这边测下来,用 WorkBuddy 处理日常表格和文档,留存率比这高多了,基本 95% 往上。不是 WorkBuddy 比 Cursor 强,是任务复杂度不一样。
但有个问题是一样的:AI 干活,意图对不上,结果就是废的。
上周我拿 WorkBuddy 整理三季度的项目复盘数据。需求很简单,把飞书文档里散落的十几个周报,合并成一张汇总表,按模块分类,标出延期项。我一开始直接说「帮我整理一下这些周报」,结果它给我按时间排了序,没按模块分。能用,但不是我要的。
后来我改了策略。
打开 WorkBuddy → 新建任务 → 粘贴需求摘要,这一步是关键。我不再甩一句话,而是把需求拆成三行:第一行说数据源在哪,第二行说我要什么结构,第三行说哪些字段不能丢。然后让它先生成一个操作清单,我确认了再执行。
具体操作是:任务模板 → 自定义 → 添加步骤,我设了三个步骤。第一步,读取飞书文档里「三季报」文件夹下所有周报;第二步,按「项目模块」字段分组,提取每个模块的延期项和风险点;第三步,生成汇总表,输出到指定目录。参数上,我设了「匹配字段」为模块名称,模糊匹配阈值拉到 80%,这样它不会因为「支付模块」和「支付中心」这种写法差异漏掉数据。
跑完大概四分钟,出来的表是对的。有一处周报里写的是「支付模块-退款链路」,它归到了「支付」下面,没问题。
避坑经验有一条。别让它一次干太多事,我试过把「整理周报+生成 PPT+发邮件」塞一个任务里,结果 PPT 的配色它自己发挥了一下,不太行。后来拆成两个任务,PPT 单独跑,让它用公司模板,别自由发挥。能用,但没必要让它发挥。
权限这块,我设的是「任务结果仅创建者可见」,跑完没问题再手动分享给组里人。不是不信任它,是省得中间结果被看到,还要解释。协作上,WorkBuddy 的模板可以设 审核人,我让组长在最后一步确认,他看过没问题再归档。这一步费不了两分钟,但能避免「AI 跑的没人负责」这种尴尬。
日常运维,我每周一上班先跑一遍「上周任务复查」。不是重跑,是打开历史任务列表,看看哪些任务结果被改过。改得多的地方,说明需求描述有问题,下次拆细一点。
现在我说说那 81% 的事。我看了下报告,说自动合并的占比从 7% 涨到 36%,说明信任度在涨。但代码这行,留存率高不代表对,只能说明「60 分钟内没被发现是错的」。办公场景不一样,WorkBuddy 干的活,错了当场就能看出来,表结构不对一眼就懂。所以意图对齐这件事,在办公工具上比在代码上更紧迫。写代码还有单测兜底,整理表格没有。
我的判断是,AI 工具下一步的竞争点不在「能不能干」,在「第一次就干对」。谁能在任务下发前把意图锁死,谁留存率就高。WorkBuddy 的任务模板算是提前做了一件事,但还不够。我设 80% 的模糊匹配阈值,就是在跟它磨合,让它更懂我要什么。
往后看,这类工具会越来越像新员工,你得先教它一次,后面就不用反复说了。但前提是,你得愿意花那一次教它的时间。
物界前沿