WorkBuddy 处理 PDF 表格老是丢格式,是我的问题还是 tool 的问题
先抛结论:WorkBuddy 处理 PDF 表格,我实测下来,格式识别确实不太稳。上周三想把最近三个月的报销单全部合并到一个 sheet 里,PDF 扫描件大概有十几张,每张格式其实是一样的,—发票明细加备注栏。结果合并完以后,数字列全挤在一起,备注栏直接消失,我 quick check 了一下,大约 30% 的数据是错的。
我一开始以为是我操作不对,毕竟用 WorkBuddy 才一周,于是重新上传了一遍,这次特意把 PDF 转成高清图片再传进去。结果比第一次好一点,但金额那列还是有两个数字串行,比如 12800 变成了 12080,这种错误在报销单里很致命,最后只能手动校对一遍。
不过我后来发现一个小技巧:如果先让 WorkBuddy 把 PDF 转成 Excel 再合并,格式保留会好很多,至少数字不乱。但这样等于多了一步操作,效率提升打了折扣,大概只有 20% 左右,跟我预期的 40% 差了不少。
我刷到那篇 2026 年 AI 大模型内容风控的报告,里面提到 AI 处理多模态内容时识别准确率是核心瓶颈,感觉 WorkBuddy 这个问题可能也是类似原因。不过话说回来,我拿 ChatGPT 和 Claude 试过同样的 PDF,它们倒是能保留表格结构,但无法直接合并多个文件,还是要靠 WorkBuddy 做批处理。
所以想问问各位,是我哪里设置错了,还是 WorkBuddy 对扫描版 PDF 的表格识别本来就不太行?有人遇到过类似情况吗,有没有什么 workaround 可以分享?
物界前沿