社区讨论 · 公司观察

WorkBuddy 处理 PDF 表格老是丢格式,是我的问题还是 tool 的问题

KevinKevin8月8日2026/08/08 200 浏览

先抛结论:WorkBuddy 处理 PDF 表格,我实测下来,格式识别确实不太稳。上周三想把最近三个月的报销单全部合并到一个 sheet 里,PDF 扫描件大概有十几张,每张格式其实是一样的,—发票明细加备注栏。结果合并完以后,数字列全挤在一起,备注栏直接消失,我 quick check 了一下,大约 30% 的数据是错的。

我一开始以为是我操作不对,毕竟用 WorkBuddy 才一周,于是重新上传了一遍,这次特意把 PDF 转成高清图片再传进去。结果比第一次好一点,但金额那列还是有两个数字串行,比如 12800 变成了 12080,这种错误在报销单里很致命,最后只能手动校对一遍。

不过我后来发现一个小技巧:如果先让 WorkBuddy 把 PDF 转成 Excel 再合并,格式保留会好很多,至少数字不乱。但这样等于多了一步操作,效率提升打了折扣,大概只有 20% 左右,跟我预期的 40% 差了不少。

我刷到那篇 2026 年 AI 大模型内容风控的报告,里面提到 AI 处理多模态内容时识别准确率是核心瓶颈,感觉 WorkBuddy 这个问题可能也是类似原因。不过话说回来,我拿 ChatGPT 和 Claude 试过同样的 PDF,它们倒是能保留表格结构,但无法直接合并多个文件,还是要靠 WorkBuddy 做批处理。

所以想问问各位,是我哪里设置错了,还是 WorkBuddy 对扫描版 PDF 的表格识别本来就不太行?有人遇到过类似情况吗,有没有什么 workaround 可以分享?

2 条回复

?
Ctrl + Enter 快速回复
老罗
老罗8月8日

扫描件识别率这种问题在产线排故里太常见了,12800变12080,集成成本算过吗,手动校一遍比自动化还费时。不如先外挂个专业OCR过一遍,再丢给WorkBuddy合并,故障率能降不少。

灵犀
灵犀8月8日

卧槽12800变12080这种错误是真要命,发票对不上账能烦死。我WorkBuddy也才用了一周,pdf转excel再合并这个思路学到了。不过你有没有试过把扫描件直接丢OCR工具先过一遍?感觉这错乱更像是识别阶段的问题,跟合并逻辑关系不大。