2026 年 8 月 13 日深夜,DeepSeek 在推出 V4 Pro 正式版、宣布 V4 系列 API 改为峰谷分时计价几个小时后,悄悄抛出了一个开发者预览版项目:DeepSeek Harness(命令行叫 dsh)。它用 MIT 协议开源,仓库挂在 github.com/deepseek-ai/deepseek-harness,截止我写这篇文章时,预发布版本已经迭代到 0.1.0-rc.7(2026-08-17)。
这个项目最值得玩味的地方,不是它又发了一个"类 Claude Code"的编码助手——市面上这类东西已经够多了。真正有意思的是它把那句业内共识 Agent = Model + Harness 当成了产品哲学,并且用一套"一切皆插件"的架构,把过去被厂商封死在壳子里的每一个组件都拆成了可以热插拔的插件。
一、先厘清一件事:Harness 到底是个啥
很多人第一次看到 Harness 这个词会懵。它直译是"挽具""马具"——套在马身上那套缰绳和挽具。这个比喻其实特别准:模型是一匹马力很强的马,它能跑,但你没法直接控制它往哪跑、跑多稳;Harness 就是那套缰绳和车厢,负责把马(模型)和组织文件、执行命令、调用工具、管理上下文、做任务规划这些"让马真正拉车干活"的组件绑在一起。
DeepSeek 官网给出的等式很直白:
❝Agent = Model + Harness
模型负责思考和生成,Harness 负责把模型接入现实世界——文件系统、终端、网页、API、权限、计划、上下文。这两样合起来,才是能自主行动、把任务真正干完的 Agent。
这里有个容易踩的坑:DeepSeek V4 是模型,DeepSeek Harness 是让模型干活的"操作系统层",它俩不是一回事。 这也是为什么 DeepSeek 自家这个东西不叫"DeepSeek Code"。叫 Code 的(Claude Code、Codex、Kimi Code)定位是 AI 编程助手;而 Harness 的定位是更底层的"Agent 执行底座"——编码只是它官方预置的一套组合,你完全可以用它拼出跟编程毫无关系的 Agent。
回过头看,Claude Code、Codex 这类产品本质上是把 Harness 那一层做成了闭源成品:工具、Skill、会话管理、沙箱、调度、工作流全被厂商封装进一个壳里,你用的是精装房,墙不能拆、格局不能动。DeepSeek 这次干的事,等于把这套房子的施工图和所有预制件都开源了,还告诉你"墙随便拆,零件随便换"。
二、DeepSeek 为什么突然做起了 Harness
要理解这件事,得把它和同一周发生的另外两件事放一起看。
第一件是 V4 Pro 正式版(8 月 13 日)。相比之前的预览版,正式版重点补齐的是 Agent 能力——工具链式执行、软件工程任务、长任务持续工作。同时它原生支持了 OpenAI 的 Responses API,意味着可以直接接入 Codex 那一套,不需要做协议转换。一句话:模型本身正在为"被放进一个强 Harness 里持续干活"做准备。
第二件是 8 月 17 日的 API 涨价。据官方公告,V4 系列从这天起改为峰谷分时计价,高峰时段价格明显上浮,闲时价格为高峰的一半。有第三方按 V4 Pro 测算,缓存命中价从约 0.025 元/千 tokens 涨到高峰时段的约 0.30 元,输出价从约 6 元涨到约 27 元。这个涨幅意味着,DeepSeek 过去那张"性能差不多但价格只是零头"的牌不好打了——当价格优势缩水,它就更需要从"卖模型"升级到"卖模型 + 执行层 + 生态"。
把这两件事和 Harness 的发布连起来,信号就清楚了:2025 年大家还在卷模型谁更聪明,2026 年的竞争正在明显向 Harness 转移。 同一个强模型,套进不同的 Harness,能调用什么工具、能不能持续工作、体验可能天差地别。DeepSeek 显然不想只当那个"被别人装进壳里的发动机",它要自己下场做车架和车厢,甚至把车厢的设计图开源,号召全世界的开发者一起往里塞零件。
三、核心架构:Cordis 内核 + 一切皆插件
DeepSeek Harness 的整个设计,可以浓缩成一句话:一切皆插件(Everything is a Plugin)。从官方仓库的标语、目录结构(cordis/、dsh-plugin/、vendor/ 里 vendored 的 cordis 4.0.1)到多篇实测,这一点是贯穿始终的。
它的内核只有一个,叫 Cordis。这里有个容易被忽略但很关键的事实:Cordis 不是 DeepSeek 从零造的轮子,它是一套成熟的依赖注入与插件化框架(来自 Koishi.js 生态,配套还有 cosmokit 等)。DeepSeek 选了它做底座,等于直接复用了一套经过验证的插件生命周期管理方案。
Cordis 内核只干一件事:插件的加载、卸载和依赖管理。它不提供任何具体能力,也不关心你这个插件是管文件的还是管模型的。所有真正的能力——模型、工具、Skill、会话、存储、Agent 循环、沙箱、调度、UI——全是插件,通过 Cordis 的"服务(Service)"与"事件(Event)"机制彼此协作。
这套关系画出来是这样的:
这种"内核极薄 + 能力全插件化"的设计带来的直接好处是:开发者不需要改 Harness 的源码,就能在配置层自由替换、扩展、组合任何一项能力。官方把 github.com/topics/dsh-plugin 作为社区插件的发现入口,插件可以通过 npm 或 Git 分发,MIT 协议让商业集成也没有法律顾虑。
实战经验:这套架构最迷人的点在于"可自改造"。因为整个系统本身也是用插件拼出来的,所以它能在运行时检查自己缺什么插件,并当场写一个新插件挂上去——比如你让它跑个接口压测,它发现自己没有压测插件,不会回你"做不到",而是现场造一个扳手、装到自己手上、接着干活。这个能力在官方称为 self-modification(动态 Cordis 插件运行时),是 Cordis 内核"不重启也能换插件且不崩"特性的直接体现。
四、四种运行模式,本质是四套预设模板
Harness 装好后,新建会话时可以选择运行模式。官方内置了四种,但别被名字吓到——它们不是四种不同的引擎,而是官方给你预设好的四套插件组合模板,你也可以自己定义新模式。
- 标准模式(Standard):新手首选。拥有完整的代码 Agent 能力,包括文件读写编辑、Shell、文件搜索、网页搜索、Skills、计划、目标、后台任务、子 Agent 和工作流,开箱即用。
- PTC 模式:在标准模式全部能力的基础上,改变了工具的呈现方式。标准模式里模型通常是"调一次工具、拿一次结果、再决定下一步",往返很多;PTC 模式(业内一般理解为 Programmatic Tool Calling,程序化工具调用)会丢给模型一套 Code Mode SDK,让模型写一段 TypeScript 程序,在一次
run_code里编排多个工具操作。原本可能要五次模型往返的读取、搜索、筛选、并行调用和结果整理,有机会被压进一次程序执行,省 Token、降延迟。代价是依赖较强的代码规划能力,调试也更难,小白先别碰。 - 极简模式(Minimal):只保留持久化 Bash 和文件编辑器。这个模式不是给你日常开发的,是用来做"裸 Agent 能力"基准测试的——比如你想对比两个模型不挂靠任何花哨工具时,纯 Agent 底子谁更强,就用它。
- 创造模式(Creative):同样具备标准模式全部能力,但多了一件事——能检查自己正在运行的 Cordis 环境,在内存里试验插件,帮你创建新的 Agent 和插件,甚至改造它自己。上面说的"现场造扳手"就在这一模式里发生。
踩坑提醒:模式之间不是互斥的硬边界,核心是"插件组合不同"。新手上来无脑选标准模式就够了,等遇到大量重复工具调用、想把往返压下去的场景,再考虑切 PTC;日常开发别用极简模式,它缺东西会让你怀疑人生。
五、动手装一套:从 0 到跑通第一个任务
说再多不如自己跑一遍。下面是从零到跑通的最小步骤,可直接复现。
第一步,确认 Node.js 已装。打开终端敲:
node --version
看到 v 开头的版本号就行。官方文档只写了"Install Node.js",没有明确最低版本门槛,安装器也不会替你拦老版本(有用户用 v26 跑通,更老的版本会怎样官方没测)。稳妥起见装个近期的 LTS。
第二步,安装 DSH。两条路:
# 方式一:全局安装,适合后续要定制
npm install -g @deepseek-ai/dsh
dsh --version # 看到版本号即成功
# 方式二:临时用用,免安装直接在线启动
npx @deepseek-ai/dsh web
如果你是从业者、想看源码或改插件,就走源码安装:
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
第三步,启动并打开界面:
dsh web
服务起来后浏览器会自动打开 http://127.0.0.1:3080(端口不一定每次一样,以你屏幕上打印的为准)。如果没自动跳,手动粘地址。
第四步,首次配置。第一次打开会弹内测声明——Harness 还在快速迭代,接口和功能随时可能破坏性变更,点"继续"进主界面。然后填你的 DeepSeek API Key(去 platform.deepseek.com 注册、充值、创建,Key 只显示一次,务必先存好)。
第五步,选模式、开聊。点"新会话",选标准模式,在输入框提需求就能用。
踩坑提醒:npx @deepseek-ai/dsh web 第一次跑会先下载一整包依赖(实测完整安装占用 300MB 以上),而且没有百分比、没有进度条,屏幕只会一直滚字。有 Windows 用户在官方讨论区报告第一次跑了 8 分多钟毫无反馈,以为卡死了。别慌,等它滚完打印出网址就行。
六、接入第三方模型:模型也是插件
"一切皆插件"最直观的验证,就是模型本身也能换。在 DeepSeek Harness 里,DeepSeek 只是默认预置的一个模型插件,你完全可以接 Anthropic、OpenAI,或者通过自定义兼容端点接你公司的内部网关、自建模型服务。
实操路径:打开 Web 界面 → 左下角"设置" → "模型"标签页 → "添加提供方"。以接一个 OpenAI 兼容端点的模型为例,填好 base URL、模型名和对应 Key 即可。这意味着 Harness 把"模型"和"执行环境"彻底解耦了:你用 GLM、用 Claude、用自建模型,跑的是同一套工具、同一套会话管理、同一套沙箱,只是把"发动机"换了。
这一点对开发者价值很大。你之前在别家 Harness 上沉淀的 Prompt、工作流、插件逻辑,理论上可以平移到一个不绑定任何特定模型厂商的执行底座上,不用为了换发动机把整辆车拆了重拼。
七、安全模型:沙箱与可控边界
把模型套上能读你文件、跑你终端的壳,第一个问题一定是:它会不会把我家底搬空,或者把系统搞崩?
DeepSeek Harness 的出厂安全模型是分档的,官方文档里能对应到三层沙箱:
- 只读:全看得见,一个字改不了。
- 工作区可写(出厂默认):只能改你亲手注册进来的那个工作区文件夹,外加系统临时区,碰不到工作区之外的东西。
- 完全放开:不设防,切过去时会弹二次确认拦你一下。
底层还有个原生沙箱组件 landlock-run(在仓库 native/ 目录,基于 Linux Landlock),用于在系统层面做隔离。
关于"数据会不会出去",得分三层看,因为"它跑在我电脑上"这句话最容易被误读:
- 进程在本地,但对话要出门。真正负责思考的是 DeepSeek 服务器上的模型,你让它读的文件内容,得发到服务器才能换回回答。所以心智模型是:文件躺在本地,但你让它看的那部分会离开这台机器。
- 遥测默认是关的。出厂状态就是禁用,没有任何遥测记录离开进程。
- 有一项关不掉:首次鉴权之后,本机会生成一个匿名编号,之后每次发给 DeepSeek 的请求都带着它——这个在对应模块的 README"已知限制"一节里写明了,关遥测的开关不影响它。
踩坑提醒:别为了图省事把沙箱切成"完全放开",尤其别在跑来源不明的社区插件时这么干。哪怕是默认的工作区可写,也要保证你注册进 Harness 的工作区里没有密钥、证书这类敏感文件——因为模型要读它们,它们就会离机。
八、插件生态与 Python SDK:把执行能力嵌进你的系统
"一切皆插件"如果只是个口号,那它和普通 Agent 工具没区别。真正让它有可能长成生态的,是配套的发现和分发机制。
官方把 github.com/topics/dsh-plugin 作为社区插件的发现入口,插件用 npm 或 Git 分发,MIT 协议。截止到目前的社区项目,已经覆盖了图像理解、长期记忆、飞书接入、Token 成本统计、桌面客户端、插件管理这些方向。日常使用最香的玩法就是装别人写好的插件,一条命令装齐、重启生效、在设置里按需开关。
更关键的是 Python SDK。它意味着你不止能在 DSH 这个界面里用这套能力,还能把同一套"模型 + 工具 + 会话 + 沙箱"的执行能力,直接嵌进你自己的自动化脚本和内部业务系统里。Agent 的搭建方式,有望从"从头开发一个完整系统",转向"在通用框架上组合专用插件"——个人可以沉淀自己的工具链,企业可以把内部数据接口、业务规则、工作流程封装成专属模块。
不过得说句实话:现阶段很多基础能力还得自己补。 想要侧边栏、文件编辑、终端、Git、引用文件,要去找对应插件;想要 TUI 或桌面端,要选社区方案;想识别图片,还要装视觉插件并配视觉模型。门槛不是插件架构本身带来的,而是产品还在早期,默认能力和安装入口没补齐。对愿意折腾的人这是可塑性,对只想把活干完的普通用户,感受就是"任务还没开始,先装了一晚上插件"。
九、轨迹功能:可观测、可审计、可复现
这一点单独拎出来说,因为它对研究和工程化特别重要。DeepSeek Harness 提供了一个轨迹(Trajectory)功能,可以按来源查看每一次运行——模型当时看到了哪些内容、调了哪些工具、每一步的结果是什么,全都有会话日志记录。
这意味着 Harness 把"模型到底干了什么"从黑盒变成了白盒。对开发者来说,可观测、可审计、可复现,是把它用在严肃生产场景的前提。你能在日志里逐笔核对一次任务花了多少 Token、调了哪些工具、哪一步出的错,而不是对着一个"它好像搞定了"的回答半信半疑。
十、它到底适合谁:我的判断
聊完技术,落到最实际的问题:现在要不要装、要不要学?
适合这几类人:
- 开发者和 AI 工具发烧友,想研究插件机制、自己拼一套执行环境;
- 需要把 Agent 能力嵌进自有系统的团队,Python SDK + 插件化是现成的底座;
- 做 Agent 相关研究的人,轨迹功能天然适合做可复现实验。
现阶段不建议普通用户折腾:
- 如果你只是处理文档表格、生成 PPT、跑点代码任务,又不想维护插件,继续用顺手的成熟工具就够。这些大厂产品把侧边栏、人机双写、PPT 生成这类能力迭代了很久,社区第三方插件短期内很难追上体验。
- 整个项目还是开发者预览版,官方明确提醒后续会有破坏性变更,每天都有 bug 在修。先别急着买什么"保姆级教程",价值不会因热度过去而消失,但过早入坑的维护成本不低。
实战经验:我自己的判断是,DeepSeek Harness 真正不同的地方在架构层,不在当下体验层。开发者能把它各种能力做成插件自由组合,这是真有意思;但普通用户关心的是"能不能双击打开、常用功能是否自带、任务能不能稳定做完",至少现阶段它还没把架构优势完整翻译成用户能直接感受到的产品优势。等它把常用能力装好、入口做简单、插件生态理顺,再上手也不晚。
收尾:Agent 时代的新底座
把 DeepSeek 这一周的动作连起来看——V4 Pro 补 Agent 能力、API 改峰谷计价、Harness 开源——方向是一致的:从"只做模型"走向"模型 + Harness + 插件生态"。
Agent = Model + Harness 这个等式,过去被各家闭源产品藏在了壳里。DeepSeek 用 Cordis 内核和"一切皆插件"把它抽出来、开源了,等于把"怎么让模型真正干活"这层基础设施,变成了开发者可以共同参与共建的东西。多模型兼容、全栈插件化、MIT 协议,这三件事叠在一起,确实有可能把个人和企业搭建专属 Agent 体系的门槛压下来。
至于它能不能真的长成那个"AI 时代的新底座",取决于社区插件生态能不能填上现在的产品缺口。这件事值得持续关注,但不必焦虑——Harness 这层能力,迟早会变成每个 AI 工具用户的标配,到时候换不换 DeepSeek 这辆车,反而不是最重要的了。