让 AI 写单测:一次真实的翻车现场
事情是这样的
上周我想偷个懒,让 AI 给支付回调接口写单元测试。当时心里想的是:这活又重复又无聊,AI 肯定手到擒来。结果它确实「手到擒来」了——一口气写了四十多个测试,全部绿灯,我差点就直接合并了。
翻车在哪
代码 review 的时候同事问了一句:「重复支付这个 case 你测了吗?」我愣了一下,回去翻了翻 AI 写的测试,发现它 mock 得太「完美」了:所有的校验逻辑都被它 mock 掉了,等于把考试题目和答案一起改了。四十多个绿灯,没有一个真正测到「回调被篡改」或者「订单状态不一致」这种核心场景。
复盘
问题不在 AI,在我给它的指令。我只说了「写测试」,没说「重点测哪些业务场景」。第二次我把自己积累的真实事故案例、边界条件列表喂给它,明确告诉它哪些路径必须真实走一遍,这次它写的测试才算能看。
结论:AI 适合写量大但模式固定的测试,核心业务路径必须由人指定「测什么」。「怎么测」可以让 AI 发挥,但「测什么」永远是人的责任。