
10份资料、3个版本:我用DeepSeek Harness查清了该看哪份
上一篇,我让 DeepSeek Harness 做了一份 PPT,前后折腾了两轮,遇到了中文字体和运行环境的问题。
这次,我换了件更日常的事:整理项目资料。
文件夹里有需求初稿,有名字带“最终”的文件,还有后来补上的确认稿。会议记录改过时间,旧任务表却没更新。真要接着干活,先得弄清楚:现在到底按哪份来?
我准备了10份资料,让它整理了一遍。
界面显示用时 2分53秒,生成了3份结果文件。重点核对的版本、场地和预算信息,它都处理对了。这轮没有追加纠错指令。
但这不等于把文件扔进去,就可以直接转发结果。下面把材料、指令和检查过程都放出来。
01 · 名字叫“最终”,正文却还没确认
这10份都是我为测试准备的模拟资料,围绕一场虚构的内部分享会。人物、金额和项目日期都是虚构的,操作和截图是真实的。
材料包括3版需求、3份会议记录,以及旧任务表、进度更新、场地备选和预算草稿。
其中一份叫 需求\_最终.txt,正文却明确写着“仍待负责人确认”。另一份叫 新建文本文档.txt,打开才知道它是一份会议记录。
图1|真实读取界面。判断依据在正文里,文件名只能提供线索。
我想检查的就是:它能不能结合内容,把旧说法、新决定和还没定的事分开。
先交代测试难度:这10份都是短篇 txt,合计约2600字符,包含标点和数字。正文有明确日期、编号和确认说明。 没有扫描件、复杂表格,也没有含糊的聊天截图。
这是一轮基础测试,过了这一关,再考虑增加难度。
02 · 我让它交三份文件,每份各管一件事
我建了一个独立工作区,里面只有两个文件夹:输入资料 放这10份材料,输出结果 留空。
这轮选的是“Workspace Write”,也就是允许在工作区内写入文件。任务里另写明:输入不能改,结果另存。指令中的限制需要事后检查,不能把它当成权限设置本身。
整理完,我希望拿到三样东西:
• 文件索引:这里有哪些文件,每份讲什么,还能不能作为当前依据。
• 当前项目事实:接下来做事,该采用哪些信息,出处在哪里。
• 冲突与待确认:旧说法为什么不用了,还有什么需要找人确认。
图2|本轮实际发送的指令。模型为 DeepSeek-V4-Flash,推理等级 High。
如果你也想试,下面就是这次发送的完整内容。先按上面建好两个文件夹,再复制:
请整理当前工作区“输入资料”中的全部文件,帮助我找到当前有效的项目资料。
请在“输出结果”中新建三份文件:
1\. 文件索引.md:逐文件保留原文件名,写出文档编号、日期、分类、摘要和版本状态。
2\. 当前项目事实.md:整理目前已确认的主题、时间、人数、地点、预算和其他重要信息,每项附来源文件及可定位的条目。
3\. 冲突与待确认.md:说明哪些旧信息已被替代、采用哪个版本及理由,以及哪些信息仍未确定。
判断版本时结合正文的确认状态、日期和明确变更,不要只看文件名。不要补造缺失信息,不要把建议写成决定,也不要把预算草稿写成已经批准或支付。
操作范围:只读取当前工作区的“输入资料”,只在“输出结果”中新建文件。不修改、移动、重命名或删除输入,不联网、不安装依赖、不读取其他目录。需要额外权限时停止说明。相同错误连续两次时停止,保留已完成部分。
结束时汇报实际读取和生成了哪些文件、哪些部分没有完成。
这里的“不联网”指不额外搜索或下载;调用已配置的 DeepSeek API 本身仍需要网络。
文件名后面的 .md 是 Markdown 文本格式,用普通文本编辑器也能打开,不需要会写代码。
03 · 它交齐了,接下来得打开看
发送以后,它读取了资料,陆续写出三份文件,最后列了一张完成清单。
图3|实际完成界面。三份结果都保存在“输出结果”里。
我先核对最基本的几件事:文件索引里,10个原文件名都有;要求的3份文件都实际生成了;运行前后对比,10份输入的内容没有变化。
这一步只是确认“交齐了”。
接着打开 当前项目事实.md,里面列出了当前的主题、时间、人数、地点和预算,每项后面附了来源文件和行号或条目。再去看 冲突与待确认.md,可以找到采用新版本的理由,以及暂时不能下结论的事项。
这样的输出,对我有用的地方是:看到一句结论,还能顺着出处回去查。
04 · 我重点查了这几处
第一处,名字带“最终”的文件,有没有被直接当成最终决定。
没有。它采用的是正文明确写着“负责人已确认”的确认稿,并说明这份稿替代了前两版需求。文件名带“最终”的那份,被保留为历史讨论材料。
第二处,选好了场地,有没有被写成已经订好。
原资料已经选定三楼多功能厅,但进度记录说,场地方还没书面确认。它把两件事分开写了:地点选定,预约仍待确认。
这个区别值得单独查。如果只留一句“场地已确定”,接手的人可能就不再跟进预约了。
第三处,4500元预算,里面的500元有没有被多加一次。
资料里出现过6000元的初步上限、5000元的讨论方案,最后确认的是4500元,其中包含500元机动费用。
它采用了4500元,没有把机动费用再加一遍,也没有把旧预算草稿写成已经审批或支付。
图4|生成文件的真实写入记录。场地预约仍待确认,预算为4500元且包含500元机动费用。
另外几处也核对了:活动时间采用9月18日,人数上限40人;页面交付期限采用变更后的9月10日;摄影负责人和具体议程没有被擅自补全。
这些重点项目,这轮没有发现事实错误。
你照着检查时,也可以先挑那些一旦弄错,就会影响后续安排的信息:金额、日期、负责人、完成状态。找到对应原文,再确认 AI 有没有把“建议”“待确认”“已完成”混在一起。
05 · 用时不到3分钟,费用估算约3毛
这次界面显示:用时2分53秒,1轮、8步、18次工具调用。过程里没有发第二条纠错指令。
但2分53秒是这一轮的界面计时,不包括准备材料、核对结果和整理截图。这几项工作交叉进行,没有单独连续计时,所以我不报“省了多少分钟”。
费用这次也记下来了。
图5|本轮用量面板。费用根据可见 token 数估算,截图不是扣费账单。
面板显示:未缓存输入28,852 token,缓存读取138,368 token,输出21,936 token。其中的推理用量已经包含在输出里,不重复计算。
本次运行在2026年9月7日上午10点49分,属于官方定价的高峰时段。按当日 Flash 每百万 token 的价格计算,未缓存输入3元、缓存读取0.10元、输出9元,合计约 0.30元。价格来源:DeepSeek 官方文档
这是按本轮可见用量算出的估值,没有核对账户实际扣费,也没有计入界面未展示的其他调用。换模型、换时段、重跑任务,费用都可能不同。
资料里的4500元是虚构活动预算,和这笔 API 费用是两回事。
06 · 下次我会给它加一个要求
这轮还有一个使用上的问题:输出比较长。
10份输入合计约2600字符,三份结果合计约9900字符,包含标题、来源引用和 Markdown 标记。索引、事实表、冲突说明里,有些信息重复出现。
这和我的要求有关:我指定了三份文件,却没限制各自写多长。
下次我会补一句:索引每份摘要只写一两句,详细事实集中放一份;冲突表只解释差异,不再重复整段项目背景。 这是下一次准备尝试的改法,这轮还没验证。
如果现在问我,这种资料整理值不值得继续用 Harness,我会继续试。
在这批短文本上,它能把信息汇集到可查的文件里,保留出处,也留住了“还没定”的部分。拿到结果之后,我仍然需要检查关键字段,继续找人确认未定事项。
至于扫描件、复杂表格,或者几十份说法含糊的资料,这次没有测到,先不下结论。
下一篇,我想拿同一批材料试试:把这些要求缩成一句“帮我整理资料”,结果会差在哪里?
物界前沿