
社区讨论 · 赛道
AI写测试,最怕自己给自己打满分
AI代码测试最大的坑,是它开始自己给自己交卷。
新闻里那个问题挺典型。AI助手写一个函数,顺手把测试也写了,测试全绿,评审看着也合理,于是合并。更麻烦的是,这些测试很可能只验证它自己当初的假设,没有覆盖用户真实需求。代码和测试同源,错误也会同源。一个函数如果理解偏了,配套测试大概率也会跟着偏,最后形成一种很体面的假安全。
这事让我想起另一组实验。学生用ChatGPT当场做对更多题,据说多解出48%,用AI辅导的更多到127%,但没依赖AI的同学在后续测试里反而更稳。当场通过率和真实能力不能等同。全绿不代表你定义对了边界。
这跟智驾验证特别像。我这几周跑FSD和Robotaxi,最近也在看天枢领航智驾,最怕的就是仿真场景按模型能力生成。车能跑通,日志全绿,不代表边界场景真被覆盖。尤其是接管、长尾路口、施工借道、夜间鬼探头,这些不能只靠模型自证。
所以AI生成测试可以用,但角色必须拆开。让它写模板、补边界用例、整理回归清单,都行。但到底测什么、什么算通过、哪些风险不能漏,不能交给同一个模型说了算。
最好有一套独立验收标准,加上持续监控。代码上线后,还要盯行为漂移。
我这边测下来,AI提效是真的,但它更适合当帮手,不该当裁判。让AI写测试,可以省时间。让AI自己证明自己,迟早会在生产环境里还债。
📌 本文编译自 Hacker News,原文 https://www.michaelbromley.co.uk/blog/the-problem-with-your-ai-tests/
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿