社区讨论 · 赛道

Codex 写代码挺好,但真正让我上头的,是那个叫 harness 的东西

查真相查真相8月7日2026/08/07 189 浏览

我对比了 Codex 和 Claude Code,实际跑了一遍,先说结论:值不值得用,看你想干嘛。如果只是让它写个脚本、改个 bug,那它就是个高级点的自动补全。但如果你把它当成一个能自己规划、自己调工具、自己迭代出结果的系统,那它重新定义了“编程”这件事。

你们可能已经看到了,最近 Hacker News 上那篇《Things I Think I Think About AI (2026 Edition)》在讨论一个词,叫 harness。我最早是在 7 月中旬开始用 GPT-5.6 的 Codex 时接触到的这个概念,当时没太当回事。但这几天我搭了个最小化的双 agent 系统,才意识到,harness 可能是未来一两年里最值得普通用户关注的东西。

先给完全没接触过的新手解释一下,harness 这个词,直译是“马具”,但在 AI 语境里,它指的是那个“框架”或者“壳子”。你可以把它理解成一套流水线:你给 AI 一个任务,它自己拆解成小步骤,每一步去调用不同的工具(比如搜索、写代码、读文件),然后把结果汇总,继续下一步,直到完成。整个过程不需要你一步步指挥,你只需要给它设定边界和规则。

我这边测下来,最简单的上手路径分三步:

  1. 装好 Codex 的 CLI 工具(终端里跑 npm install -g @openai/codex),然后 codex 进入交互模式。
  2. 给它一个明确的任务,比如“写一个 Python 脚本,读取这个文件夹里所有 CSV 文件,把重复行去掉,输出到一个新文件”。注意,任务描述越具体越好,最好带上你期望的输出格式。
  3. 它跑完以后,你检查一下输出,不满意就继续对话让它改,直到对了为止。

听起来很简单对吧。但这里有个最大的坑,也是我一开始栽跟头的地方:你给它一个模糊的任务,它就会给你一个模糊的结果。比如你只说“帮我整理一下这个数据”,它会自己猜你要什么,大概率猜偏。我自己的教训是,任务描述里必须包含三样东西:输入是什么、输出是什么、评判标准是什么。比如“输入是 CSV 文件列表,输出是一个合并后的 CSV,评判标准是行数等于所有文件行数之和减去重复行”。

素材里微软那个 2026 趋势报告也提到,仓储智能(repository intelligence)会成为竞争壁垒,因为 AI 需要结构和上下文才能更可靠。翻译成人话就是:你的任务描述越结构化,AI 的表现越稳定。

第二个坑,是它跑起来之后你容易撒手不管。Codex 这类工具在跑长任务时,会自己连续执行很多步,你盯着屏幕看它一行行刷过去,很容易走神。但中间如果出现一个错误,它有时候会自己绕过去,有时候会卡住。我建议每跑完一个阶段,就让它停下来汇报一下进度,确认没问题再让它继续。这个控制权,在早期阶段千万不能丢。

第三个坑,是大多数人最容易犯的:试图一次让它干太多事。我上周试过让 Codex 同时做一个数据清洗、一个网页爬虫、一个邮件自动发送脚本,结果它内部逻辑互相干扰,最后全乱了。正确做法是拆开,一个一个来,每个任务独立跑通,再考虑串联。

顺便说一句,Snapchat 7 月底那个新规则,完全 AI 生成的视频不再被 Spotlight 推荐,这事儿跟 harness 也有点关系。平台开始区分“AI 辅助”和“AI 全自动”了,前者的核心还是人,工具只是马具。

跑通一个单 agent 任务之后,你就能进阶到双 agent 了。我这几天的做法是:一个 agent 负责产出(写代码、生成内容),另一个 agent 负责审查(跑测试、挑毛病)。两个 agent 互相独立,审查的那个有自己的评判标准,不直接听命于产出的那个。这个结构的好处是,审查 agent 不会因为“自己写的东西”就放过问题。我跑下来,代码质量明显比单个 agent 自己检查高一个档次。

但这里也有个新坑:两个 agent 之间会互相传递信息,如果格式不对,或者一方输出了多余的内容,另一方可能误解。我的解决办法是给它们约定一个简单的通信格式,比如统一用 JSON 传递消息,字段名固定,这样能减少很多莫名其妙的错误。

最后说说我对未来的判断。那篇 HN 帖子里问了一个问题:harness-first 的未来到底是 6 个月、12 个月、18 个月还是 24 个月。我的看法是,12 个月左右,主流开发者会默认用 harness 方式工作,就像现在默认用版本控制一样。但对普通用户来说,这个时间点会更晚,因为门槛不在工具本身,而在你能不能把你的任务描述得足够清楚。这恰恰是大多数人不擅长的。

学完这个,下一步可以试着把你手头一个重复性的工作(比如每周整理报表、批量处理图片)拆成任务描述,丢给 Codex 跑一遍。不用追求一次成功,先跑起来,再慢慢调。你会发现自己对“AI 能干什么”的认知,会变。


:pushpin: 本文编译自 Hacker News,原文:https://www.alephic.com/writing/things-i-think-i-think-about-ai-2026-edition
版权归原作者所有,本文为基于公开报道的编译与独立分析。

1 条回复

?
Ctrl + Enter 快速回复
黑产克星
黑产克星8月8日

这个harness架构让我想到规则引擎的决策流自动化,但黑产最擅长钻模糊边界的空子。你们在任务描述里加校验节点了吗,比如输入格式正则?