WorkBuddy 用一个月后,我拿它接了 AI 视频模型横评,它救了我半天但没救我的审美
我最烦“选型横评”。不是烦模型,是烦一堆参数、截图、群聊、PDF 在桌面上叠成隔夜拿铁。九月初我这边要做内部视频生成工具评估,需求很典型:运营想看哪个开源模型能本地跑,法务只看协议,开发看显存,我自己看输出能不能看。刷到一篇 AI 视频模型横评,五个可本地部署模型排得挺满,分辨率、时长、音频、参数、架构,一眼过去像体检报告。我第一反应不是“真全”,而是“这要是让我自己拼,我得把命拼进去”。于是我把那篇横评、几个模型卡、同事发的录屏、邮件里的限制条件,全丢进 WorkBuddy,想让它先做一轮脏活。
WorkBuddy 这一个月我主要用来处理文档归档、表格合并、邮件摘要和会议纪要。前几天我还写过它混合输入把字段映射搞乱,这次又踩了一遍。它一开始很积极,像刚睡醒的 Bug,把桌上东西全扫到地上。LTX 2.5 的 4K 被它塞到 MiniMax H3 旁边,HappyHorse 的 API 属性被它写成可本地部署,协议那一列直接没了。最离谱的是,它把“最长时长”统一成“时长”,于是 5 秒和 15 秒看起来像同一类东西。那一刻我几乎想关软件。界面我也挑,导出表默认字号像隔夜的拿铁,灰底白字糊成一片。但丑归丑,它确实把二十多个文件拆成了行。
我后来学乖了,不指望它一步生成“正确横评”。我给它一个字段契约,让它先别急着结论,先做证据表:模型名、来源、原话、抽取字段、置信度、待确认项。这个操作很 WorkBuddy,它不像模型跑分那样直接给答案,而是能把一堆散东西搬进同一个筐里。我让它把每份资料单独处理,不许跨源合并;等它把来源拆干净,再让它按字段映射。第二遍准确率就高很多,我这边测下来,第一遍大概七成能用,第二遍接近九成,剩下那一成全是语义坑:开源权重、可本地部署、API 可用、商用许可、默认分辨率、最高分辨率,这几个词在文档里经常互相冒充。
这里就能看出 WorkBuddy 的位置。它不是替我做选型,它是替我把选型前的垃圾分拣干净。AI 视频模型横评看着是技术比较,实际是信息治理。参数表越漂亮,越容易骗人。一个模型写“支持 4K”,另一个写“最高分辨率 4K(需特定配置)”,再一个写“社区版可本地部署,官方 API 更稳”,这些句子放进同一张表,不加来源就是耍流氓。WorkBuddy 的好处是它能把来源列带上,坏处是它没有审美也没有责任,不会替你判断哪个说法值得信。WorkBuddy 真正的价值不是替我做选型,而是替我把选型前的垃圾分拣干净。 这句话我之前写它“不该和三秒海报比美”时就想说,这次更确定了。
我把整理后的字段表导成 PPT 大纲时,WorkBuddy 给了三页:能力矩阵、风险清单、试点建议。内容能用,版式难看。标题间距像没对齐,表格边框像用尺子随手画的,我看了两秒就把配色删了。但我承认,它帮我省掉的不是“做表”的十分钟,而是“找证据”的四十分钟。以前这种活最碎,横评文章里一个表,README 里一段,群聊里一句“这个能跑”,邮件里又加一个“法务说协议不行”。WorkBuddy 把这些脏活接过去以后,我才能把时间花在真正需要人的地方:判断哪个字段该高亮,哪个模型对团队有意义,哪张图不该为了好看而误导。
这也让我想到最近那些视频模型榜单。Top 10 里能本地部署的不多,开源赛道又分参数、显存、时长、音频、协议,每个维度都在卷。可办公工具这边卷的不一样。WorkBuddy 不生成 4K 视频,也不替你训练模型,它卷的是你桌面上那堆乱七八糟的输入。一个模型参数错了,可能只是跑分不严谨;一个字段映射错了,会直接变成会议纪要里的承诺、PPT 里的结论、邮件里的甩锅。所以我现在看 AI 办公工具,不太看它能不能“生成惊艳报告”,更看它能不能把错的东西拦住。比如字段契约,比如来源追溯,比如回滚权限。我甚至觉得,把回滚权限硬编码进流程比写文档更有效,这次 WorkBuddy 第一遍错后,我能退回上一版证据表,而不是重新从文件堆里捞,这比它给我一段漂亮话更有用。
不过 WorkBuddy 也有不适合的地方。它不适合直接做最终选型报告。它能把资料整理成结构化草稿,但不会替你承担判断。尤其涉及协议、本地部署、商用限制,它偶尔会把相近概念搅在一起,像把两种灰混成一种脏。它也不适合纯视觉物料,你让它排版横评图表,它会给你一个逻辑正确、审美崩溃的结果。UI 设计师最怕的不是丑,是丑得很有理,表格里每个格子都对,整体却像没做过设计评审。WorkBuddy 的界面和功能也有一点这种味道,功能路径清楚,视觉细节毛糙,按钮间距像被谁拖过,导出模板也懒得做。我嫌弃它,但工作里又离不开它,这大概就是成年人和工具的关系。
往后看,我反而觉得这类横评会倒逼 WorkBuddy 这种工具变得更“有边界”。现在 AI 视频模型卷参数,办公工具卷流程。谁能把多源输入拆成证据链,谁能把字段映射做成可校验,谁就能从“生成器”变成“执行器”。我不希望 WorkBuddy 以后变成一个更会写漂亮结论的 AI,我希望它更像一个有洁癖的档案员。每个字段必须有来源,每个合并必须有冲突提示,每个导出必须保留上一版,每个错误必须能回滚。界面当然也要改,别再用那种灰底糊字模板,至少把表格对齐、字号层级、来源列宽度做干净。丑的我用不下去,这是真话。
如果你也要用 WorkBuddy 处理类似横评、选型、多文档合并,我的建议很直接:别把它当报告生成器,把它当分拣员。先给它一个字段契约,再让它做证据表,最后人工校验关键字段。把“本地部署”和“开源权重”分开,把“最高分辨率”和“默认输出”分开,把“协议”和“许可范围”分开。让它每行都带来源,让它先别总结。你可以接受它第一遍乱,但要给它第二遍的纠错路径。工具负责把下限锁住,人负责把不完美补上。Bug 刚才跳上键盘,把我导出表删了,我懒得骂,正好重新跑一遍回滚。
物界前沿