实测DeepSeek Harness:AI到底能替测试开发做多少工作?

简介: 本文实测DeepSeek Harness(dsh)在测试开发五大环节中的替代能力:需求解析(50%)、用例设计(70%)、脚本编写(60%)、执行调度(30%)、缺陷定位(40%),加权综合替代度约50%-67%。AI擅长重复劳动,判断力仍属人类。

上次我们发了 DeepSeek Harness(dsh)的实测文章,评论区被问得最多的就是这一句:它到底能替测试开发干多少活?这个问题听着简单,其实没法一句话回答——测试开发这条线很长,从读需求到定位缺陷,每一段的"含金量"并不一样。所以这次不给感觉,给账本:我们把日常工作拆成五个环节,逐项交给 dsh 做一遍,再逐项打分,最后算一笔综合替代度的账。

环境准备
启动方式两种。求快的一行流(需要 Node.js 环境):

npx @deepseek-ai/dsh web

默认 Web UI:http://127.0.0.1:3080

想跟着源码跑的:

git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
模型接入需要配置 API Key,走环境变量即可:

export DEEPSEEK_API_KEY=sk-xxxx # Linux/macOS
$env:DEEPSEEK_API_KEY="sk-xxxx" # Windows PowerShell
dsh 原生接 DeepSeek 模型,也可以通过 LLM 适配器接其他模型。运行模式有标准、PTC、极简、创造四种,本次打分全程用标准模式。再提醒一次:官方明确说当前是 developer preview,会有破坏性变更,下面的分数只对当前版本有效。

任务怎么下发
为了口径统一,五个环节用同一个背景项目:一个库存管理 API(录入、查询、出库三个接口),文档和代码都放在本地目录里。每个环节单独下发一次任务,避免长链路互相干扰。用例设计环节的提示词样例长这样:

阅读 ./docs 下的接口文档和 ./app 下的代码,提取测试需求,
输出用例设计要点:包含等价类划分、边界值和异常场景,逐条列出,
每条写清楚前置条件、操作步骤和预期结果。
分项打分
环节
评级
一句话结论
需求解析
可用偏上
能从文档和代码里提取输入输出与规则;隐性规则会漏,需要人补
用例设计
强
等价类、边界、异常覆盖较全,是全链路里最出彩的一环
脚本编写
可用偏上
pytest 形态良好、断言明确;偶有臆造接口,必须评审
执行调度
弱
能执行命令,但响应偏慢、长任务稳定性不足,偶发循环打转
缺陷定位
可用
能从日志里圈出可疑点并给假设;确认还得靠人
下面逐项说理由。

需求解析。 文档写得清楚,它提取得就齐:入参、出参、错误码都能列出来。但"库存为零不允许出库"这类没写进文档、只存在于业务方脑子里的规则,它不会凭空知道。解析的本质是翻译,翻译离不开原文——这一项的分数,其实有一半是给"文档和代码写得够不够清楚"的。

用例设计。 最省人的一环。它给的是具体可执行的用例描述,不是"测试正常流程"这种正确的废话;边界值会主动凑成对(刚好等于阈值、刚过阈值各一条),异常场景也知道往负数、超长字符串、缺字段上想。

脚本编写。 形态不错,会用 fixture、会参数化,断言具体到状态码。但它偶尔会编出不存在的接口,或者假设错返回结构,每一条都要人看。我们的做法是:生成完先跑一遍,红的先人工分类——是代码错还是用例错——再决定改哪边。

执行调度。 短板很明显:响应速度偏慢;任务链一长就容易不稳,实测中我们遇到过循环打转,反复读同一份日志不往前走;另外 API 成本随任务长度放大,长任务跑下来账单感受明显。建议拆段下发,每段有明确产出物,人守在旁边。

缺陷定位。 算是"好参谋":给它失败日志,它能圈出可疑行、给出几种可能原因的排序。但从"可疑"到"确认",中间隔着人工复现和验证,这一步它替不了。

打分背后:三件影响结论的事
分数之外,有三件事值得单独说,因为它们直接影响你怎么理解上面那张表。

其一,输入质量决定输出质量。需求解析得分高,前提是文档和代码写得清楚;我们把同一任务换到一份只有口头转述、没有文档的项目上重测,解析质量明显下滑。所以与其问"它有多聪明",不如先问"我喂进去的东西够不够清楚"。

其二,速度是体感的一部分。dsh 响应偏慢,单个环节等几分钟很正常,五个环节串下来,等待时间相当可观。它更适合"挂着跑、人干别的",而不适合坐在屏幕前盯着它一步步出结果。

其三,成本会随任务长度放大。环节越多、打转越多,API 账单越明显。我们实测中一次打转就多烧了一截 token。这提醒我们:把任务拆短、一次说清,不只是为稳定,也是为省钱。

算一笔综合替代度的账
最后做个加权粗算(权重按我们团队的日常工时占比估,仅供参考):

环节
权重
可替代度
需求解析
15%
约五成
用例设计
25%
约七成
脚本编写
25%
约六成
执行调度
20%
约三成
缺陷定位
15%
约四成
加权下来,综合替代度大约一半到三分之二。注意两个口径:其一,这个数指省下的是重复劳动的时间,还没扣评审耗时,把评审算进去,净收益还要打折;其二,替代度高的恰好是重复性强的环节,替代度低的恰好是需要判断的环节——这不是巧合。

所以结论很干脆:AI 替代的是重复劳动,不是判断力。铺用例量、写脚本骨架、跑命令、翻日志,这些 dsh 接得住;定测试策略、定验收标准、拍板风险,依然是人的事。它是强力助手,不是无人值守的替代者。

本文整理自霍格沃兹测试开发学社的原创分享,更多测试开发与 AI 测试实战内容,我们下一篇见。

相关文章
|
2月前
|
人工智能 Shell API
花了一整夜实测DeepSeek Harness:它比Claude Code强在哪?
DeepSeek Harness v0.1开源引爆社区:非Claude Code竞品,而是开放Agent底座。它将模型(大脑)与Harness(手脚+神经)解耦,支持插件化替换全部组件,可编排Claude Code/Codex等子Agent,具备Headless批量任务、高可观测性与低成本优势,适合需深度定制与自动化落地的开发者团队。
|
2月前
|
人工智能 JavaScript API
DeepSeek Harness 实测:大模型为什么还需要 Harness?
本文深度评测DeepSeek Harness——国产AI编程Agent新工具。作者实测三大任务(幸存者游戏、俄罗斯方块、梁子滑动变阻器),对比GPT/Codex,分析完成时间、Token消耗、费用与效果,并详解其“模型为脑、Harness为手脚”的执行闭环机制及蓬勃发展的插件生态(文件引用、多模态、数据库等)。
512 7
DeepSeek Harness 实测:大模型为什么还需要 Harness?
|
3天前
|
人工智能 JSON 自然语言处理
全网爆火Jev模型完整解析:实战测评+保姆级落地教程
最近有一款特殊AI模型在开发者圈子刷屏,它摒弃传统大模型擅长的对话聊天能力,专注做高速结构化决策,它就是TypeSafe AI推出的Jev模型。该模型由ChatGPT共同发明人Diogo Almeida主导研发,定位为**System One Model(系统一模型)**,对标人类大脑快速直觉判断的思维模式,在响应延迟、调用成本、结构化输出稳定性上相比传统生成式大模型有着巨大差异。本文会完整拆解Jev底层原理、三大核心原语能力、适用业务场景,同时提供可直接运行的curl、Python代码示例,并且结合多组实测数据,客观分析模型优势与能力边界,帮助普通开发者和AI应用从业者快速上手落地。
210 0
|
2月前
|
存储 缓存 JavaScript
DeepSeek Harness rc.8 更新解读:图片输入、自动打开网页,以及两个实用社区工具
DeepSeek Harness rc.8 带来了图片输入、子代理安装、Windows PowerShell 会话与 Web 自动打开等改进。本文解读更新重点,并介绍 dsh-launcher 启动器和 dsh-plugin-token-meter 计费统计插件。
DeepSeek Harness rc.8 更新解读:图片输入、自动打开网页,以及两个实用社区工具
|
2月前
|
Linux API iOS开发
Codex 怎么接入 DeepSeek V4-Flash:官方一键脚本 + 手动配置完整教程
DeepSeek V4-Flash 正式版于2026年7月31日开放公测,原生支持Codex所需的Responses API,告别本地代理与协议降级。官方提供一键配置脚本,跨平台兼容;同时详解手动配置(config.toml/models.json),全面释放子Agent、多工具调用等原生Agent能力。(239字)
1595 0
|
6月前
|
人工智能 自然语言处理 测试技术
Agent+MCP+Skills 重构自动化测试:从脚本生成到测试闭环
本文探讨AI驱动的测试范式变革:从单点脚本生成迈向“Agent+MCP+Skills”智能体系统,强调将测试经验工程化封装为可复用能力。核心在于重构全流程——规划、生成、执行、修复、沉淀,并依托知识库与工具链实现业务适配。未来测试工程师的核心竞争力,是设计智能化测试系统的能力。
|
12月前
|
机器学习/深度学习 人工智能 自然语言处理
AI检测技术:如何识别机器生成的“数字指纹”?
AI检测技术:如何识别机器生成的“数字指纹”?
685 115
|
2月前
|
数据采集 JavaScript 测试技术
DeepSeek Harness 原生 Agent 框架首发深度评测:从安装到实战,3 小时压测全记录
DeepSeek Harness是其全新Agent执行框架,支持四种运行模式、插件化扩展与Web UI。实测显示任务质量媲美Claude,但效率与稳定性待优化。目前处于公测阶段,潜力巨大。
|
3月前
|
存储 人工智能 数据安全/隐私保护
企业级AI知识库的技术架构应该怎么设计?
本文基于制造业企业AI知识库私有化落地实践,系统阐述六层技术架构:数据采集、异构存储(含混合云挂载与物理级隔离)、智能处理管线、三引擎索引(向量+全文+知识图谱)、RAG混合检索与重排序、本地大模型推理优化。强调安全合规为先,实证物理隔离必要性,并分享分块策略、模型选型、评测体系等关键踩坑经验。(239字)
280 3