社区讨论 · 公司观察

WorkBuddy 在金融场景的真实边界,我用中信证券的研报做了个测试

KevinKevin8月19日2026/08/19 249 浏览

先抛结论:WorkBuddy 处理金融文档的效率和坑,都远超我的预期。说清楚点就是,它能帮你省 60% 的时间,但那剩余的部分,如果你没提前想明白,它会让你亏得更多。

上周二我把中信证券研究首页最近一个月的研报全部拖进 WorkBuddy,想让它自动做一个摘要库。我的需求很简单,把这十几篇报告按产业链、投资建议、风险提示三个维度拆出来,形成一个复盘模板,省得我每周手动翻。

结果是,目录识别、作者信息提取、核心观点归纳这三件事,WorkBuddy 做得相当漂亮,大约 90% 的准确率。但我发现一个很有意思的问题,就是它把报告里的估值模型数据全部识别成了文本,而不是数字。这导致我后续想做数据透视表的时候,发现无法直接引用,算是踩了个坑。

我 quick check 了一下,问题出在 PDF 本身的排版上。中信证券的研报有个特点,就是表格线和文字间距非常紧凑,加上数字字体是特殊的等宽字体,WorkBuddy 的 OCR 引擎在处理这种密集排版时,会优先保证文字的完整性,而牺牲掉表格结构的识别。换句话说,它把表格当成了连续文本读。

这个事让我重新思考了 WorkBuddy 在金融场景下的真实边界。

先说它强的地方。我平时用得最频繁的两个场景,一是研报摘要整理,二是对账单合并。

前者 WorkBuddy 几乎是碾压级的优势,它能在 5 秒内读完一份 80 页的行业深度报告,然后按我的预设模板输出产业链、核心标的、估值区间、风险提示这几个板块。这个效率提升非常明显,手动整理至少需要 40 分钟,现在大概 15 分钟就够,省出来的时间足以做更有价值的工作。

不过这也是我要说的第二个问题。WorkBuddy 的摘要有个倾向,就是它会过度忠实于原文,而缺少对市场情绪的判断。比如 8 月 18 日那篇《反攻仍将持续》的策略报告,WorkBuddy 会把里面的乐观表述原封不动地提炼出来,但不会告诉你这篇报告发布前,市场已经连续两天缩量,这是典型的存量博弈信号。我看了半天 WorkBuddy 的输出,无奈笑了起来,它是个优秀的秘书,不是分析师。

再说它弱的方面。表格处理和数据一致性检测,我一直认为这是 WorkBuddy 最大的短板。7 月 31 日那篇亮马组合报告里有个持仓调整表格,WorkBuddy 合并后整个表格结构直接崩掉,备注列和权重列错位,数字格式也乱了。这个我已经在之前一篇帖子里提过,没想到过了一周,最新版本还是没有明显改善。

不过有意思的是,把 PDF 先转成 Excel 再喂给 WorkBuddy,这个问题能得到大幅缓解。我不知道后台是不是走了不同的解析管线,但实测下来,通过 Excel 中转后,表格识别的准确率从大约 70% 提升到了 95% 以上,特别是数字格式和日期格式,基本不会错。唯一的代价是多花两分钟做转换,以及偶尔会出现 Excel 源文件里的公式变成了纯数值,这对后续审计跟踪会带来一点额外工作量。

所以我现在的 workflow 是,处理研报摘要和定性内容时直接用 WorkBuddy 跑 PDF 原文件;处理数值型表格时,先转 Excel 再喂。这套流程跑了两周,整体效率大概提升了 37.5% 左右,踩坑率从最初的 30% 降到了 5% 以内。

换一句话说,WorkBuddy 对金融从业者的价值,本质上是重新定义了信息处理的前段。它把阅读和摘录这些机械性工作压缩到了接近零成本,这部分我认为是高 ROI 的投入。但它的天花板在于,当你处理到第二层、第三层信息的时候,比如跨报告的一致性比对、数据修正、逻辑链推断,它就明显力不从心了。

我也对比过 ChatGPT 和 Claude 在这个场景下的表现。ChatGPT 的通用摘要能力强但格式控制弱,输出经常超出我设定的模板,需要二次整理;Claude 的理解深度最好,但对中文研报的专业术语支持略逊,会把「CAPEX」误翻译成集中采购;WorkBuddy 是三者里最适配办公场景的,但也是最依赖用户预判的。你得清楚告诉它边界在哪里,否则它会在错误的方向上自信地输出两千字。

回到我最早提的那个问题:WorkBuddy 处理金融文档的真实边界。我现在的判断是,它适合做第一道粗加工,不适合做最终的决策依据。适合做信息聚合,不适合做逻辑推断。适合熟悉格式的用户用,不适合丢一个 PDF 进去就等成品的人。

看中信证券那份 AI 产业报告里提到的趋势,模型迭代周期在加速,企业级场景落地也在加速。我能理解整个方向的必然性,因为我自己就是被效率和算力惯坏的用户之一。但正因为如此,我更希望 WorkBuddy 把重心放在表格结构识别和跨文档一致性上,而不是堆更多花哨的自动化动作。毕竟对金融场景来说,数据错了比做得慢可怕得多。

2 条回复

?
Ctrl + Enter 快速回复
方案贩子
方案贩子8月20日

表格识别问题本质是OCR引擎的版面分析能力不足,尤其在金融场景,PDF里表格结构复杂性高,建议预处理时加一层表格区域检测模型,技术可行性没问题,客户付费意愿主要看这个坑的修复速度。

蒋志远
蒋志远8月19日

表格识别成文本这坑太真实了…我扫发票的时候数字也老被吞,感觉AI对密集排版就是头铁,每一步都得人眼过一遍才敢信。