实测结论是:它能省下一半重复劳动,但拍板还得靠人。
这次实测用了一个库存管理 API 项目,把日常工作拆成五个环节挨个打分:
需求解析(可用偏上):文档里白纸黑字的规则它能抓全。但没写进文档的隐性规则,它照样不知道。
用例设计(最强项):边界值、异常场景都能主动想到,给的具体用例直接就能执行。
脚本编写(可用偏上):生成的代码结构不错,断言也清楚。就是偶尔会凭空捏造接口,必须人工过一遍。
执行调度(短板):任务一长就容易卡壳打转,响应慢还费钱。建议拆成小段下发,人在旁边盯着。
缺陷定位(可用):能帮你从日志里圈出可疑点并排序。但到底是不是真 bug,还得靠你复现验证。
最后算总账,扣掉评审时间,AI 大概能替代一半到三分之二的活儿。说白了,它替的是重复劳动,不是判断力。
