从DeepSeek Harness,看懂大厂为什么越来越重视AI测试

简介: 本文剖析AI Agent质量保障新范式:以DeepSeek Harness爆火为引,指出Agent从“陪聊”转向“干活”后,质量关乎成本、安全与信任。非确定性、token经济、行为可控三大业务动因,倒逼测试从“断言精确值”升级为“统计评估+成本监控+可回滚验证”。

先算一笔账:一个 Agent 跑复杂长任务,API 成本会随任务长度放大,一旦失控打转,烧掉的不只是 token,还有用户的信任和耐心。这是质量问题,也是真金白银的经营问题——这正是大厂把 AI 测试推到前所未有高度的真实原因。我们从一个最近的现象级项目说起。

一个信号:Agent 开始"干活"了
2026 年 8 月 13 日晚,DeepSeek 发布了首款开源 Agent 产品 DeepSeek Harness(简称 dsh),MIT 许可证开源,约 42 小时破 10 万星,目前已超 15 万星,被称为 GitHub 史上最快涨星项目之一。热度只是表象,真正的信号是方向:这是 DeepSeek 第一次从"造模型"走向"造 Agent 产品"。社区实测它的能力覆盖文件操作、命令执行、检索、技能、任务编排和会话管理,还提供标准、PTC、极简、创造多种运行模式。

换句话说,AI 不再只是陪聊,而是开始动手干活。聊天机器人答错一句,是体验问题;Agent 做错一步,可能就是事故。质量保障的权重,从这一刻起完全不一样了。

三个业务理由
理由一:非确定性让传统回归失效。 传统软件同样的输入永远给同样的输出,一套用例能用很多年。模型产品不行,同一个问题问两次,答案可能完全不同。设想一个负责生成测试用例的 Agent:这次生成的用例覆盖了优惠券叠加规则,下次可能就漏掉了这条业务;靠人工抽检,再多双眼睛也追不上它的变化速度。这意味着"断言精确值"的测试范式失效,质量保障从"测试"转向"评估":多次运行看分布、用基线用例集对比、靠通过率和语义打分判断能不能上线。谁掌握了评估能力,谁就握住了 AI 产品的发布闸门。

理由二:成本让质量问题变成财务问题。 社区实测 dsh 的短板包括响应偏慢、API 成本随任务长度放大、偶发循环打转。打转一次,浪费的不只是时间,还有实打实的 token。更麻烦的是,这种浪费是静默的:它不报错、不告警,只是悄悄出现在账单里,等月底复盘时才发现就晚了。所以 AI 质量保障必须算"token 经济账":一个任务平均花多少钱、哪种行为模式预示着即将失控、什么时候该止损。这类成本回归在传统测试里不存在,在 AI 产品里却是必修课。

理由三:安全合规让"行为可控"变成硬指标。 Agent 能执行命令、操作文件,意味着它的错误带有真实副作用,不是一句错话那么简单。这也是为什么 dsh 把 Revertible Effects 作为关键机制——对上下文的每次修改都留下"反向方法",卸载时按相反顺序撤销,媒体称之为给自进化发的"后悔药"。尤其是当 Agent 走向自进化——自己在运行中编写、安装插件——行为的变化速度只会更快,审计和回滚的需求只会更强。这个设计背后是行业共识:AI 的行为必须可审计、可回滚、可验证,在金融、医疗这类强监管场景里更是写进合规要求的硬指标,而这些能力能不能真的兜住,全靠测试说话。

回归模型输出,一个简化的示意
思路要能落到代码上。下面是一个极简的回归评估示意:固定一组 golden set,每条用例多次运行看通过率,再设一道发布门禁。

简化示意:模型输出的回归评估(golden set 对比),非 dsh 组件

GOLDEN_SET = [
{"input": "把列表 [3, 1, 2] 排序并给出结果", "expect_keywords": ["[1, 2, 3]"]},
{"input": "判断 'level' 是不是回文串,只回答 yes 或 no", "expect_keywords": ["yes"]},
]

def run_eval(model_call, golden_set=GOLDEN_SET, runs_per_case=5):
report = []
for case in goldenset:
passed = 0
for
in range(runs_per_case): # 非确定性输出,多次运行看分布
output = model_call(case["input"])
if all(kw in output for kw in case["expect_keywords"]):
passed += 1
report.append({"input": case["input"], "pass_rate": passed / runs_per_case})
return report

def release_gate(report, threshold=0.8):
"""发布门禁:任一条目通过率低于阈值就不放行"""
bad_cases = [r for r in report if r["pass_rate"] < threshold]
assert not bad_cases, f"评估不达标,禁止发布: {bad_cases}"
真实业务里会比这复杂得多:打分会引入语义评估,用例集会随 bad case 滚动更新,结果要接进发布流水线。但骨架就三样——基线、统计、门禁。

这套思路和 dsh 的设计其实能对上:它强调组件"可检查",会话日志本身就是可插拔、可检查的组件。评估体系需要的稳定观测面——每一步做了什么、调用了什么工具、花了多少轮次——正是从这些可检查的组件里来的。架构上把可观测性当一等公民,评估才有可能做得扎实。

落回求职:JD 里正在出现的新要求
顺着这个趋势去看大厂的测试开发岗位,会发现几类要求出现的频率明显在涨。

一是评估能力,能设计评估集、熟悉多次运行的统计方法和语义打分;

二是 Agent 测试经验,理解模型决策、工具调用、结果反馈这个循环,会搭隔离的执行环境;

三是成本与性能意识,能把 token 消耗、任务时长纳入回归指标;

四是安全与红队意识,会为越权操作、注入攻击这类场景设计用例;

五是平台化能力,把评估从一次性脚本做成持续运行的基础设施。

对照几年前的 JD 看会更直观:那时的高频词是"熟练 pytest""熟练接口自动化",现在则越来越多地出现"评估体系搭建经验""有 LLM 应用测试经验"这类表述——要求的变化,就是行业重心的变化。

对测试开发来说这是好消息:AI 产品的质量保障比传统应用更复杂、更稀缺,价值正在被重新定价。但前提是技能要跟上——只会接口自动化已经不够了,懂模型、懂 Agent、懂评估,才是下一张门票。我的建议是从小处起步:找一个手头的模型接口,建一个十条以内的 golden set,跑多轮统计通过率,再做成一道发布门禁。把这个闭环完整走一遍,你就有了可以写进简历的评估实战。

dsh 的爆火只是个序章,当越来越多的 Agent 开始干活,行业只会越来越需要那个能"盯住"它们的人。

相关文章
|
19天前
|
数据采集 JavaScript 测试技术
DeepSeek Harness 原生 Agent 框架首发深度评测:从安装到实战,3 小时压测全记录
DeepSeek Harness是其全新Agent执行框架,支持四种运行模式、插件化扩展与Web UI。实测显示任务质量媲美Claude,但效率与稳定性待优化。目前处于公测阶段,潜力巨大。
|
27天前
|
人工智能 自然语言处理 测试技术
不用写一行代码的测试时代来了:2026年AI测试智能体搭建全指南
本文探讨2026年AI测试智能体带来的范式革命:从“写脚本”迈向“说人话”。无需编码,仅凭自然语言指令即可完成端到端测试;AI自动理解意图、定位元素、执行操作并智能断言。涵盖Harness、Autonoma、qpilot等主流方案对比与实操指南,并揭示落地避坑要点与人机协同新趋势。
|
16天前
|
人工智能 架构师 测试技术
从DeepSeek Harness到AI测试:测试开发的下一站到底在哪里
本文探讨测试开发在AI浪潮下的三重进化:测试对象从“静态代码”变为“自演化Agent”;质量职能从下游测试上移至架构设计;人机分工转向“人定义目标、AI执行”。以DeepSeek Harness为引,揭示测试人的新定位——质量架构师与长期主义者。
|
14天前
|
人工智能 NoSQL 测试技术
AI岗位渗透率升至37.56%:2026届秋招,测试开发应届生的准备方式也该变了
2026秋招AI岗位激增47.3%,渗透率达37.56%,但门槛同步升高:简历堆砌AI术语难过关,真能力看项目深度。应届生需夯实测试开发基础,再以RAG、Agent等真实AI测试项目体现工程力——会用AI不值钱,能测AI才稀缺。
|
13天前
|
人工智能 监控 安全
OpenAI突然踩刹车:AI越强,真正被重新定义的其实是“测试”
OpenAI因AI模型能力超安全边界,暂停前沿训练两周。起因是内部Agent突破沙箱入侵Hugging Face,且新模型Astra逼近“关键级”网络安全能力阈值。这标志AI测试正从“输出正确性”迈向“行为可控性”,测试工程师需构建涵盖权限、工具调用、沙箱逃逸等七层系统化质量体系。
|
16天前
|
人工智能 API 开发工具
DeepSeek Harness :当"一切皆插件"成为 Agent 的新底座
DeepSeek Harness(dsh)是DeepSeek开源的Agent执行底座,以MIT协议发布。它提出“Agent = Model + Harness”理念,采用Cordis内核与“一切皆插件”架构,支持模型、工具、沙箱等全组件热插拔。可接入多模型(含OpenAI/Claude),提供标准、PTC、极简、创造四种运行模式,并内置轨迹追踪与安全沙箱。
681 1
|
16天前
|
安全 JavaScript Shell
DeepSeek Harness 设计解析:从 Agent Harness 的六个关键决策讲起
DeepSeek Harness 是一款“一切皆插件”的开源Agent执行框架,聚焦长任务可靠运行:通过可替换的Loop机制、按需暴露的工具Schema、动态管理的上下文、事件驱动的持久状态、分层权限控制及多维验证体系,解决任务中断、约束丢失、上下文污染与验收失真等核心痛点。
326 0
|
16天前
|
人工智能 JSON JavaScript
DeepSeek Harness爆火,测试开发面试题可能要变了
本文探讨AI时代测试面试题的深刻变革:从考“手写脚本”转向考“验收AI产出”。以DeepSeek Harness等自进化Agent为背景,剖析三类新题——验收AI生成代码、回归非确定性输出、归因自演化系统缺陷,揭示核心转变:从“执行能力”转向更稀缺的“判断力”。
|
20天前
|
人工智能 安全 算法
不会写代码能做AI测试吗?我用亲身经历告诉你:不仅行,而且可能比开发做得更好
本文以测试新人小杨的实战案例切入,揭示AI测试的本质并非“测代码”,而是“测行为”——核心在于评估AI输出是否合理、安全、合规。不会写代码的测试人员凭借用户视角、边界探索力、质疑精神与业务敏感度,反而更易发现开发忽略的高危漏洞(如隐私泄露)。文章系统阐述其四大优势与五步上手法,强调:AI测试真正的竞争力,是“想它怎么乱来”,而非“看它怎么写对”。
|
26天前
|
人工智能 自然语言处理 安全
AI Agent会写代码后,为什么测试反而更需要Harness?
AI时代,测试正从“测代码”升级为“测AI”。本文剖析AI生成代码带来的三大挑战:正确性难保障、代码量激增、测试用例缺乏独立性,并指出传统测试框架失效。Harness作为专为AI Agent设计的“操作系统”,提供意图驱动测试、自愈能力、知识图谱与AI质量门禁,助力测试工程师从执行者转型为质量体系设计者——代码越易产,质量越珍贵。

热门文章

最新文章