DeepSeek Harness,为什么国内海外的评价两极分化?

简介: 老金来给你讲讲DeepSeek Harness到底是什么,应该怎么看带他。

最近一周,DeepSeek Harness的评价很割裂:国内不少人骂它慢、费Token、不直观;海外开发者却开始扒架构、改插件、换Agent Loop。

它现在确实上手费劲,但DeepSeek真正想抢的,可能不是Coding Agent,而是Agent的定义权。

现在把它当主力工具还早,但把它当成没做完的Coding Agent随手略过,也可能看早了。它把过去藏在Claude Code、Codex里的Agent底层,一块一块拆开摆到了开发者面前。

01|大家拿的根本不是一把尺子

普通用户关心的是今天能不能把活干完——改代码快不快、理解准不准、会不会抽风。按这个标准,Harness目前确实不占优,官方自己都标着Developer Preview。

但开发者还会多问一句:我到底能把这个东西改到哪一层?

这一扒就不一样了。

模型、Skills、Session、Sandbox、存储、调度、UI,甚至Agent Loop,都可以替换或重新组合。普通用户看到"怎么还没Codex顺手",开发者看到"连这个我也能改?"

所以分歧与其说在国内和海外之间,不如说在两种人之间:一种需要培训好的员工打开就能上班,另一种想要一套可以自己招人、配工具、定流程的公司底座。

他们都没看错,只是一个在评价成品,另一个在研究成品怎么造出来的。


Image

02|Harness到底是什么?

我们太容易把AI的所有能力都算在模型头上。其实模型只是一个聪明的脑子,它不会凭空知道项目在哪,也不会天然拥有终端、浏览器、数据库、记忆和文件权限。

把这些接到模型身上,并规定它什么时候看什么、调用什么、失败怎么重试的,就是Harness。官方公式很直接:Agent = Model + Harness。

同一个聪明员工,进了流程清晰的公司很快出结果;换到天天开会、标准混乱的公司,再聪明也能干稀碎。

模型也一样——同一个DeepSeek放进不同Harness,工具、上下文、任务循环不同,速度、稳定性和成本当然不同。

以后问"哪个模型写代码最强",得顺手再问一句:它在哪个Harness里上班?模型决定有多聪明,Harness决定聪明怎么被花出去。


Image

03|真正狠的不是开源,而是把"核心"也拆了

Harness的设计理念是:Everything is a plugin,一切皆插件。

普通产品的插件是换沙发加盏灯,房子结构还是公司定的。

但DeepSeek把模型适配器、工具注册表、Session Log、Agent Loop这些通常视为核心的东西,也做成了可从配置替换的组件——官方明确写着没有必须修改的"特权核心"。

别人开放的是房间,DeepSeek连承重墙的图纸都放出来了。


Image

底层有个叫Cordis的内核,负责插件的挂载、卸载和依赖关系,让Agent能力能像积木一样组合,而不是拔一块塌一片。

ImageImage

另一个设计:每一次运行都可以追踪。

系统提示词、上下文注入、工具调用和Subagent调度都进入只追加的Session Log,通过Trajectory视图可以追查它在哪一步跑偏。以前Agent是黑盒,错了不知道错在哪;现在至少可以把整个过程摊开看。


Image

官方还准备了四种运行模式:Standard是完整Coding Agent,Code Mode允许用TypeScript组合多轮工具调用,Minimal只留Shell和文件编辑器,Creator用于实验插件和制作Preset。

背后的观点是:不同任务,不一定该用同一套Agent工作方法。

04|海外开发者为什么开始改口?

有人实测说它很慢、Token消耗多、文档不直观,但同时承认它把DeepSeek性能榨得很充分,缓存命中率达99%。也有人喜欢它的UI和Code Mode,同时直说Subagent问题还多。

这些评价看起来矛盾,但老金觉得反而可信——真正用产品的人不会只剩"封神"和"垃圾"两个按钮。

真正让风向变化的,不是哪项功能修好了,而是开发者开始动手了:有人做自动生成会话标题的插件,有人接入Git Worktree,有人把成本余额实时显示到界面上。GitHub Discussions里出现了跨实例Agent协作插件,社区也有人重做Web UI、任务看板和桌面客户端。

封闭产品的成长由官方团队决定,用户缺功能只能等更新。但开放的Harness不一样——嫌界面不好可以换界面,嫌默认Loop不适合可以换Loop,甚至可以重新配置成另一种Agent。

一个开源项目最好的早期信号,不是所有人都说它完美,而是已经有人忍不住开始改它。

05|我们要的是更好用,还是更属于自己?

成熟产品喜欢把复杂度藏起来。Claude Code、Codex会替用户决定大部分运行方式,你不用研究Agent Loop,也不用管Session Log怎么存,打开说清楚需求就行。绝大多数人买车是为了开,不是为了研究变速箱。

DeepSeek Harness走的是另一条路——它把复杂度重新摊开,同时也把修改这些复杂度的权力交了出来。第一次打开会觉得配置多、概念绕,但这些麻烦恰恰也是它的控制权。


Image

不过开源不是免喷金牌,自由度高也不能替糟糕体验找借口。但反过来,也不能只拿"拎包入住"的标准,去嘲笑一套仍在施工的底座。

Claude Code和Codex解决的是怎么替你把事情做得更舒服。

DeepSeek Harness想解决的是:你能不能决定Agent到底应该怎么做事。成品替你做了大量决定,底座把做决定的权力还给你。

两种路线没有谁更高级,服务的本来就是不同的人。

普通用户需要稳定员工就继续用成熟产品,没必要为"开源"硬折腾。但如果你在做Agent、AI产品或企业工作流,Harness值得认真研究——很多过去被产品锁住的能力,终于可以被重新组合了。


Image

我的建议:
先从Standard开始。不要第一次打开插件列表就打算发明一套全新的Agent。先拿默认模式跑真实任务,确认问题出在模型、工具、上下文还是流程。

插件宁可少,不要乱装。第三方插件以你的本机权限运行,能读文件、访问网络,也可能接触凭据。开源社区不是应用商店,出现在列表里不等于通过了安全审计。

权限要放在工具层。不要把数据库写权限交给Agent,再在Prompt里求它"千万别乱改"。真正稳妥的方式,是压根不给它不该拥有的工具。

以后别只测模型。要一起看模型、Harness、工具、权限、上下文策略和任务成本。离开这些条件争谁最强,就跟只看发动机参数判断整辆车一样。

06|下一场Agent战争,已经从模型外面开始了

过去两年我们太习惯盯着模型——新模型上线就看榜单、看价格、看上下文,然后争谁超过谁。但模型越来越接近之后,真正拉开差距的,可能会变成模型外面的部分。

同一个模型,谁更会组织上下文,谁更会配置工具,谁能把权限卡住,谁能在做错后追查原因,谁能让Subagent真的分工而不是互相复读——这些才决定一份智能最后能不能变成生产力。

下一场Agent战争,争的可能不再是谁拥有最聪明的模型,而是谁最懂得怎么组织聪明。

我为什么对一个开发者向的底层项目感兴趣?因为我代码不会、英语也不算好,但这几年靠着AI做课程、做产品、搭工作流,我慢慢发现能力不一定非得全部长在一个人脑子里。我不会写代码,但我可以知道要解决什么问题;我不懂每个技术细节,但可以让AI去查、去做、去测试,再把关键判断和最终责任留在自己手里。

模型会换,产品会换,但你怎么拆问题、怎么组织任务、怎么核验结果、怎么把一次做成的经验留进系统里,这些不会跟着版本号消失。过去,一个人的上限常常取决于他本人会多少;未来,一个人的上限,可能取决于他能组织多少。


Image

以前很多路只有专业的人能走——得先把知识学完、技术练熟、进入那个行业,才有资格开始。可现在我不想再等自己先变成程序员或架构师,再去碰那些过去不属于我的问题。

我会先把问题摆到桌面上,把不会的部分交给模型,把不能放心的部分留给自己判断,再把每一次做成的过程留下来变成下一次还能用的系统。不是因为我已经足够厉害,而是我终于明白,人不必等到拥有全部能力,才配开始向前。

我们第一次有机会,不只是走一条别人铺好的路,而是边走,边把路修到自己真正想去的地方。

所以DeepSeek Harness最让我兴奋的,不是它又开源了一套代码,也不是它以后能不能打过Claude Code。而是它提醒了我:新的世界已经不只是在给普通人提供更好用的工具了,它开始把造工具的工具,也交到了我们手里。


Image
这一次,我不想站在路边,等别人把答案修好再走。

我想先迈出去。

然后亲手把下一段路,铺到过去的自己根本到不了的地方。


谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。

开源知识库地址(实时更新交流群):
https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf

相关文章
人工智能 缓存 前端开发
9384 44
人工智能 JavaScript 开发工具
3890 10
开发工具 Swift git
1503 2
缓存 JavaScript Shell
1786 3
人工智能 JavaScript 测试技术
1374 0
人工智能 Java BI
917 0
人工智能 JavaScript 测试技术
612 4
Shell API 调度
971 3

热门文章

最新文章