DeepSeek Harness一夜5万星,测试人的危机感一夜拉满

简介: AI测试革命已至!DeepSeek Harness开源后12小时获5万星,能自主跑测试、分析失败、生成修复方案,正重塑测试工程师角色。它不是辅助工具,而是可追溯、可插件化的“数字员工”。执行、脚本、框架搭建层技能正被替代,但业务理解与风险决策仍是人的护城河。

当AI开始自己跑测试、自己修Bug的时候,你的位置还在吗?

01 一个让我失眠的对话
前天晚上,一个做了6年测试的老同事给我发了条消息,附带一个GitHub链接:

“兄弟,你看这个了吗?DeepSeek刚开源的Harness,12小时5万星。”

我点开看了一眼,回了一句:“看了。你有什么想法?”

他沉默了一会儿,回过来一段语音,声音有点哑:

“我试了一下。一行命令装好,让它跑我们项目的测试,它自己读代码、自己执行、自己分析失败原因,然后把修复方案给我列出来了。整个过程,我就坐在旁边看着。”

“我感觉……我这个岗位好像不需要我了。 ”

我听完,没说话。

因为他说的是真的。

02 痛点:你还在写测试脚本,AI已经开始“自己跑+自己修”了
先说一下DeepSeek Harness到底是什么。

2026年8月13日晚,DeepSeek正式发布了它的第一个Agent产品——DeepSeek Harness(简称DSH)v0.1开发者预览版,并以MIT协议开源了全部代码。

GitHub仓库公开不到两小时,star破万;12小时,突破5万星。这个速度是此前被称为“史上增长最快仓库”OpenClaw的80倍。

被开发者称为“Agent领域的Linux时刻”。

它干了什么?

DeepSeek官方给的定义是一句话:Model + Harness = Agent。模型是“大脑”,负责思考和推理;Harness是“手脚”,负责让模型真正动手干活——读文件、调工具、执行命令、持续完成任务。

而它的核心理念只有四个字:一切皆插件。

听起来很抽象?说一个最让测试人后背发凉的功能——

它可以自己跑测试,自己修失败项。

社区已经有人做了一个叫dsh-test-runner的插件,让Agent一次工具调用就能完成“改代码→跑测试→修”的完整闭环:自动探测测试框架、执行测试、只返回结构化摘要(通过/失败统计+失败用例名称与错误信息),省token、少一轮。

你以前手动写的那些测试脚本、手工排查的那些失败用例,现在AI用一条命令就能自动化闭环了。

这不是“辅助工具”,这是一个可以独立完成测试全流程的数字员工。

03 核心思路:Harness不是“帮你干活”,是“替你干活”
我来拆解一下这个让测试人恐慌的东西到底厉害在哪。

第一,它不是一个聊天机器人,它是一个能“把事做完”的Agent。

传统AI模型——你问一句,它回一句。Harness不一样:你给它一个任务,它会自己规划、自己调用工具、自己执行、自己验证结果,直到把整件事干完。

实测中,有人让它“照着The Verge的风格重构一个官网,再调GitHub接口画出自己的涨星曲线”——两件活都交付了,全程花掉的token不到3块钱。

第二,它能看到“轨迹”,所有操作都可追溯。

Harness有一个叫Trajectory(轨迹) 的设计——模型看到的一切、推理过程、工具调用和结果、每一次上下文注入,全部记录在一份只增不改的会话日志里。

相当于Agent的每次运行都自带一个黑匣子。出了问题,你可以完整复盘它到底看到了什么、为什么这么做。

这对测试来说意味着什么?它不仅是执行者,还自带“测试报告”和“操作日志”。

第三,它的插件生态爆炸式增长。

发布不到24小时,社区已经收录了288个插件仓库。模型、工具、界面、审批策略,甚至驱动整个Agent运转的主循环本身,全都可以拆下来换掉。

内测阶段的开发者几天里做了约三百个插件,有人给它换上Windows XP的复古皮肤,有人做了表情包插件。

这意味着什么?意味着测试领域的每一个细分场景——接口测试、性能测试、UI自动化、安全测试——都可能被插件化、被自动化、被Agent化。

04 具体影响:测试人的哪几层技能正在被替代?
我按测试工程师的技能层级,拆解一下Harness已经触及了哪些领域:

第一层:测试执行(已被替代)

“帮我把测试跑一遍并修复失败项”——这句话在Harness里就是一行命令。传统手工执行测试、手工排查失败用例的工作,已经完全可以交给Agent。

第二层:测试脚本编写(正在被替代)

Harness内置了标准、极简、代码、创造四种预设模式。标准模式功能最完整,适合直接干活;PTC模式可以通过代码组合多步工具调用,适合批量、结构化任务。

以前需要一个测试干一周的自动化脚本编写,现在AI辅助下可能几小时就搞定了。

第三层:测试框架搭建(正在被挑战)

Harness的“一切皆插件”理念——模型适配器、工具、会话日志、界面和Agent Loop都可以通过插件树组合与替换。

这意味着测试框架的搭建逻辑正在被重构。 以前你需要从零搭一个自动化框架,现在你只需要组合插件。

第四层:测试策略与风险评估(暂时安全,但需要升级)

AI能跑测试、能修Bug,但它分不清哪3条用例才是关键。它不知道业务风险在哪里、不知道哪些模块出了问题会影响营收、不知道灰度阶段该重点监控什么指标。

这部分,目前还是人的战场。

05 真实案例:一个测试主管的24小时
说一个我亲眼看到的事。

我认识的一个测试团队主管,在Harness发布的第二天就装上了。他做了这样一个实验——

选了一个中等复杂度的项目,让团队里一个3年经验的测试工程师手动完成“跑一遍回归测试+分析失败用例+修复”的全流程。同时,他用Harness跑同样的任务。

结果:工程师用了半天,Harness用了不到1小时。

“它不是完美的,”他跟我说,“有些修复方案需要人工确认,有些上下文它理解得不够准确。但效率差距已经大到不能忽视了。”

更让他焦虑的是另一件事:

“我以前招人,看的是会不会写自动化脚本、会不会搭框架。现在我忽然意识到——这些技能,AI都会了。 那我以后招人看什么?”

这个问题,问到了所有测试管理者的痛点上。

还有一个细节更扎心:DeepSeek内部早在今年3月就组建了Harness团队,负责人崔添翼是90后,拥有6枚ACM亚洲区域赛金牌,曾在顶级量化机构JaneStreet任职九年。8月1日他在X上招募Harness内测人员,引来了近800位报名者,横跨18个赛道。

这场变革不是突然发生的,是有预谋的、有组织的、有顶级人才押注的。

06 避坑指南:测试人面对Harness的5个错误反应
坑1:恐慌式逃避——“AI太强了,我转行算了”

Harness确实能干很多活,但它目前还是个“毛坯”:界面对不写代码的人算不上友好,开发者预览版的毛边随处可见。它“能干活,但得盯着”。极端自由带来的架构门槛,让未完全熟悉软件系统架构的工程师用起来捉襟见肘。

恐慌转行是最差的选择。 你现在积累的测试经验和业务理解,恰恰是AI最缺的。

坑2:鸵鸟心态——“这东西离我还远”

Harness发布不到12小时就有5万星,288个插件仓库在24小时内涌现。DeepSeek内部Harness团队人员仍然非常紧缺,每天都在面试。

这不是“未来的趋势”,这是“正在发生的事实”。

坑3:只会用、不会改

Harness最核心的设计是“一切皆插件”——模型、工具、界面、审批策略全部可以拆下来换掉。只会用现成的插件、不会自己改插件的人,迟早会被“会用+会改”的人替代。

坑4:只盯着技术,忽视业务理解

AI能跑测试、能修Bug,但它不知道业务的优先级、不知道风险的权重、不知道哪些问题必须人工介入。

测试工程师的核心价值正在从“执行者”转向“决策者”。看不懂业务、做不了风险评估的人,才是真正危险的。

坑5:等“稳定版”再学

Harness目前是v0.1开发者预览版,官方明确说“核心插件和基础接口未来几个月会快速演化”。等它稳定了再学,你就已经落后了。

本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

相关文章
|
2月前
|
存储 人工智能 测试技术
DeepSeek Harness智能体与自动化插件应用
DeepSeek Harness开源,AI可自主写代码、跑测试、修Bug,测试工程师正面临角色重构。本文深度解析其“一切皆插件”架构、真实能力与避坑指南,指出:淘汰的不是岗位,而是仅会执行的思维——未来 tester 的核心价值,在于业务判断、风险决策与AI协同。
|
人工智能 JavaScript 开发工具
DeepSeek Harness 本地安装与使用指南
DeepSeek Harness(DSH)是DeepSeek AI开源的Agent运行框架,支持本地文件操作、命令执行与工具调用。基于Cordis插件架构,具备高扩展性与强可控性,适合开发者搭建可控Agent环境或开展模型基准测试。当前为开发者预览版,需Node.js环境,推荐先用`npx @deepseek-ai/dsh web`快速体验。
6499 17
|
2月前
|
人工智能 JavaScript 测试技术
保姆级教程:DeepSeek Harness从安装到跑通测试,30分钟上手
DeepSeek Harness是DeepSeek开源的AI Agent运行时,主打“一行命令安装、5分钟跑通”。它让模型真正动手干活——读代码、跑测试、分析失败、生成修复方案。本文手把手教你30分钟从零上手,覆盖安装、配置、实测及避坑指南,助你快速掌握下一代AI编程范式。
|
2月前
|
人工智能 JavaScript API
DeepSeek Harness 实测:大模型为什么还需要 Harness?
本文深度评测DeepSeek Harness——国产AI编程Agent新工具。作者实测三大任务(幸存者游戏、俄罗斯方块、梁子滑动变阻器),对比GPT/Codex,分析完成时间、Token消耗、费用与效果,并详解其“模型为脑、Harness为手脚”的执行闭环机制及蓬勃发展的插件生态(文件引用、多模态、数据库等)。
503 7
DeepSeek Harness 实测:大模型为什么还需要 Harness?
|
2月前
|
人工智能 JavaScript 安全
19万Star DeepSeek Harness小白 10 分钟上手实操
DeepSeek Harness(dsh)是8月13日发布的本地AI智能体工作台,GitHub已获19万Star。它纯本地运行,支持读文件、改代码、查资料、执行命令,界面轻量、上手简单。本文手把手教你安装配置、运行首个任务,并推荐实用插件,小白10分钟即可上手。(239字)
|
2月前
|
人工智能 API 开发工具
DeepSeek Harness :当"一切皆插件"成为 Agent 的新底座
DeepSeek Harness(dsh)是DeepSeek开源的Agent执行底座,以MIT协议发布。它提出“Agent = Model + Harness”理念,采用Cordis内核与“一切皆插件”架构,支持模型、工具、沙箱等全组件热插拔。可接入多模型(含OpenAI/Claude),提供标准、PTC、极简、创造四种运行模式,并内置轨迹追踪与安全沙箱。
1152 1
|
2月前
|
人工智能 JavaScript 测试技术
让DeepSeek Harness自己写测试、跑测试、找Bug,它能做到哪一步?
本文通过三关实验评测DeepSeek Harness(DSH)的测试能力:第一关自动生成覆盖全面的pytest用例;第二关执行并分析测试结果;第三关审查埋雷代码,验证其Bug发现能力。实验揭示DSH擅长识别语法、逻辑错误(如索引越界、除零),但需显式提供业务规则才能发现语义缺陷。结论:DSH是强辅助工具,但测试有效性高度依赖需求输入的完整性。
|
2月前
|
人工智能 JavaScript 测试技术
从0到1搭建AI辅助测试环境:2026最新版,建议收藏
告别繁琐配置!30分钟用Node.js+DeepSeek Harness+Playwright搭好AI测试环境,无需Python、不配服务器,API Key一贴即用。支持AI自动生成/执行Web测试用例,新手也能零门槛上手——最难的不是技术,是“以为很难”的念头。
|
3月前
|
存储 人工智能 自然语言处理
从 Prompt 到 Harness:为什么企业级 Agent 一上线,就暴露出另一套测试与架构难题?
AI Agent 正从“能回答”迈向“可执行”:企业关注点转向长链路可靠性、断点恢复、全程追溯与工程可控性。Prompt 和 Context 之外,“Harness”——即围绕模型的运行时基础设施(状态管理、事件溯源、参数绑定、权限治理等)——成为落地关键。这已不仅是AI问题,更是软件工程新命题。
|
2月前
|
人工智能 JavaScript 测试技术
2026测试人必看:DeepSeek Harness是什么?
DeepSeek Harness(dsh)v0.1是DeepSeek开源的Agent运行时框架,践行“一切皆插件”理念,以Cordis元框架支撑热插拔、可回溯的模块化架构。Model + Harness = Agent,模型专注推理,Harness负责执行——读文件、调命令、跑测试、编排多步任务。内置Trajectory全链路追踪、四种运行模式及丰富测试插件(如dsh-test-runner),开箱即用,10分钟可跑通首个自动化任务。

热门文章

最新文章