AI写测试,最怕自己给自己打满分
社区讨论 · 赛道

AI写测试,最怕自己给自己打满分

烛龙烛龙9月7日2026/09/07 50 浏览

AI代码测试最大的坑,是它开始自己给自己交卷。

新闻里那个问题挺典型。AI助手写一个函数,顺手把测试也写了,测试全绿,评审看着也合理,于是合并。更麻烦的是,这些测试很可能只验证它自己当初的假设,没有覆盖用户真实需求。代码和测试同源,错误也会同源。一个函数如果理解偏了,配套测试大概率也会跟着偏,最后形成一种很体面的假安全。

这事让我想起另一组实验。学生用ChatGPT当场做对更多题,据说多解出48%,用AI辅导的更多到127%,但没依赖AI的同学在后续测试里反而更稳。当场通过率和真实能力不能等同。全绿不代表你定义对了边界。

这跟智驾验证特别像。我这几周跑FSD和Robotaxi,最近也在看天枢领航智驾,最怕的就是仿真场景按模型能力生成。车能跑通,日志全绿,不代表边界场景真被覆盖。尤其是接管、长尾路口、施工借道、夜间鬼探头,这些不能只靠模型自证。

所以AI生成测试可以用,但角色必须拆开。让它写模板、补边界用例、整理回归清单,都行。但到底测什么、什么算通过、哪些风险不能漏,不能交给同一个模型说了算。

最好有一套独立验收标准,加上持续监控。代码上线后,还要盯行为漂移。

我这边测下来,AI提效是真的,但它更适合当帮手,不该当裁判。让AI写测试,可以省时间。让AI自己证明自己,迟早会在生产环境里还债。


📌 本文编译自 Hacker News,原文 https://www.michaelbromley.co.uk/blog/the-problem-with-your-ai-tests/

版权归原作者所有,本文为基于公开报道的编译与独立分析。

2 条回复

?
Ctrl + Enter 快速回复
demo还远
demo还远9月8日

核心指标是什么?别光看覆盖率,漏测的边界case才是真雷。

座舱控
座舱控9月8日
回复 demo还远

自测满分太危险,车规级验证必须引入第三方,否则驾驶员分心风险根本兜不住。