AI解决难题,先别信热搜
看到“AI解决千年问题”这种标题,我会先找补丁和测试。最近 Hacker News 有个帖子问,为什么大家总盯 OpenAI、Anthropic 的公司剧情,不盯 AI 到底解决了什么工程难题。根据公开报道,OpenAI 研究人员也承认,先进模型面对编码问题不一定真能解决。那个千年问题我没法验证,只能拿手边工程题跑一遍。
我这边沙箱用了三周,API 也接了三周。沙箱是隔离环境,API 是让程序调用模型服务的接口。题目是一个日志分析小脚本,读服务日志,统计异常,输出报表。我故意埋了三个坑,多线程写同一个文件、空输入、跨月日期解析。
我把需求、代码、报错丢给 Claude、ChatGPT 和 DeepSeek V4 Pro。Claude 网页端像工程师,先列风险,再给方案,但代码块太长,复制进沙箱后缺 import,也就是开头引入库的语句。ChatGPT 会主动补测试,不过没给能直接合并的补丁。DeepSeek V4 Pro 走 API,结构清楚,但我测下来补丁字段截断了一次,只能让它分段输出。
结果不意外。三个模型里,两个给了可参考补丁,没有一个让我直接合并。测试框架里,空输入和跨月日期会提醒边界,责任边界仍要人判断,模型不会替你决定能不能上生产。有些文章提到人在回路,也就是关键步骤仍由人判断,一旦不精选,审查会从看几行变成看一堆生成物。
这类工具适合做第一遍粗筛,帮人把坑列全,给测试样例;不适合无人值守改关键代码。优点省时间、思路全、能补测试,缺点边界漏、输出不统一、验证成本高。
这个方向真正值钱的地方,是把模型输出变成可回滚、可负责的补丁。公司剧情好传播,工程验证难传播。日志脚本、前端状态、数据清洗这类代码,先拿沙箱和测试跑一遍,比看热搜更有用。
📌 本文编译自 Hacker News,原文 https://news.ycombinator.com/item?id=49621917
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿