02|Agent Harness 的核心组成:模型、上下文、工具、文件系统和终端

在线体验各类最新模型,更有模型 免费Token 额度领取!
立即体验
简介: Agent Harness 是AI编程的工程执行系统,不止依赖大模型:模型负责推理,上下文精准供给信息,工具赋予行动力,文件系统承载代码修改,终端闭环验证结果,权限保障安全边界。五者协同,才能真正完成任务而非仅输出建议。(238字)

image.png

理解 Agent Harness,不能只看“它用了哪个模型”。真正决定体验的,是模型之外那一整套工程结构。

一个可用的编程 Agent,大致由五个部分组成:模型、上下文、工具、文件系统、终端。模型只是其中一个部件。没有后面四个,模型再强也只能给建议,不能完成任务。

一、模型:负责推理,不负责执行

模型的职责是理解目标、拆解任务、判断下一步该做什么。比如它会判断:这个 bug 应该先看登录模块,还是先跑测试;这个报错像类型问题,还是运行时问题;这个改动应该补单元测试,还是集成测试。

但模型不能直接读你的仓库,也不能自己运行 npm test。它需要 Harness 提供工具。

这也是为什么同一个模型,放在不同 Harness 里体验会差很多。聊天框里的模型只能回答;终端 Agent 里的模型可以读文件、改代码、跑命令、看错误输出,然后继续修。

二、上下文:决定 Agent 看见什么

上下文是 Agent 的工作台。

它可能包含:

  • 用户当前任务;
  • 当前对话历史;
  • 相关文件内容;
  • 搜索结果;
  • Git diff;
  • 终端输出;
  • 项目规则;
  • 历史记忆;
  • 外部文档;
  • 工具说明。

上下文不是越多越好。真正难的是选择。

比如你让 Agent 修支付回调问题,它应该优先看支付入口、订单服务、状态流转、队列消费者和测试,而不是整个前端目录。一个好的 Harness 会让模型逐步探索,而不是一次性吞下所有代码。

image.png

上下文管理的目标,是让模型在每一步拿到刚好够用的信息。

三、工具:让模型能行动

工具是 Harness 的手脚。

常见工具包括:

工具 作用
Read 读取文件
Edit 修改文件
Search 搜索文件名和内容
Shell 运行命令、测试、构建
Git 查看 diff、提交、分支
Browser 打开页面、截图、交互
MCP 连接外部系统
Subagent 分配子任务

工具调用的关键不是数量,而是反馈。每次工具返回结果,模型都要重新判断下一步。

例如:

运行测试 -> 发现失败 -> 读取失败文件 -> 修改实现 -> 再运行测试

这就是 Agentic Loop。

四、文件系统:真实世界的代码入口

编程 Agent 最重要的能力之一,是直接操作文件系统。

它能看到当前目录、子目录、配置文件、测试文件、构建脚本,也能创建新文件、修改已有文件。这个能力很强,也很危险。

一个成熟 Harness 必须处理好三个问题。

第一,作用范围。Agent 是否只能访问当前项目?能不能读上级目录?能不能访问用户主目录?

第二,改动可追踪。每次修改哪些文件、改了什么、能不能回滚。

第三,用户变更保护。用户已经改过但未提交的文件,Agent 不能随便覆盖。

这也是为什么 Git 状态和 diff 对 Agent 很重要。它不仅帮助模型理解当前工作,还保护人类开发者的现场。

五、终端:把验证闭环接起来

没有终端,Agent 写代码很容易停在“看起来对”。

有终端以后,它可以:

npm test
npm run lint
mvn test
cargo test
go test ./...
git diff

这让 Agent 从“生成代码”变成“验证代码”。

但终端也是风险最大的地方。读文件通常风险低,运行命令就复杂得多。npm test 可以允许,rm -rf 必须拦住,部署命令必须确认,数据库迁移要特别谨慎。

所以 Harness 一般会把命令分级:安全命令自动执行,普通命令询问确认,高危命令禁止或强制人工审批。

真实任务中的配合

假设任务是:

修复用户退出登录后仍能访问个人中心的问题。

Harness 的工作过程可能是:

  1. 模型理解目标;
  2. 搜索 logoutsessionauth middleware
  3. 读取路由守卫和会话逻辑;
  4. 运行现有认证测试;
  5. 修改退出登录后的状态清理;
  6. 新增“退出后访问个人中心返回 401”的测试;
  7. 运行相关测试;
  8. 输出改动说明。

这里每一步都用到不同组件。模型负责判断,搜索和读取提供上下文,文件系统承载修改,终端完成验证。

容易被忽略的部分

很多人只关心模型能力,却忽略了 Harness 的细节。

比如搜索工具慢,Agent 就会浪费大量时间;上下文压缩差,长任务会丢关键指令;权限设计粗糙,用户会不敢让它自动执行;测试反馈不清晰,模型会反复修错方向。

因此,Agent Harness 的质量往往体现在小地方:文件搜索是否快、diff 是否清楚、命令输出是否截断合理、错误是否能被模型读懂、上下文是否能被稳定保留。

总结

Agent Harness 不是一个“AI 对话框”,而是一套工程执行系统。

它的核心组成可以归纳为:

模型负责推理
上下文负责提供信息
工具负责行动
文件系统负责落地
终端负责验证
权限负责边界

只有这些部分配合好,AI 编程才会从“生成一段代码”走向“完成一个任务”。

目录
相关文章
|
1月前
|
消息中间件 人工智能 安全
01|什么是 Agent Harness:为什么大模型需要一个“工程外壳”
Agent Harness 是连接大模型与真实工程环境的执行层,解决AI“只会生成文本、无法完成任务”的痛点。它整合上下文管理、工具调用、安全执行、权限控制、结果验证与记忆机制,将自然语言指令转化为可观察、可控制、可验证的工程动作闭环,是AI真正落地开发的关键基础设施。(239字)
211 0
|
1月前
|
数据采集 人工智能 监控
医疗AI智能体:整体效能评估可视化:从原理到实践的10大核心量化指标体系.130
本文系统阐述医疗AI智能体的量化评估体系,强调其行业特殊性——关乎生命健康、强合规要求、用户多元、闭环严苛。提出覆盖技术(幻觉率、准确率、响应时间、召回率)与业务(满意度、审核通过率、问诊完成率、交互时长)的8大核心指标,配套数据采集、计算、监控、迭代闭环流程及可落地代码实现,为临床合规落地提供客观依据。
281 9
|
1月前
|
人工智能 IDE 前端开发
04|Claude Code、Codex、Cursor、OpenCode 的 Harness 差异
本文深度解析2026年四大AI编程工具本质差异:Claude Code(终端工程Agent)、Codex(OpenAI生态本地Agent)、Cursor(IDE内嵌Agent Harness)、OpenCode(开源多模型可定制平台),强调选型关键在匹配真实工作流,而非单纯比模型。
711 3
|
14天前
|
弹性计算 人工智能 运维
保姆级实操:阿里云ECS/轻量服务器完整部署Hermes Agent全流程手册
阿里云服务器部署Hermes Agent可解决本地部署的稳定性问题,实现全天候在线智能体服务。三种部署方案覆盖不同用户需求,一键部署适合新手,手动部署适合自定义配置。通过合理配置模型密钥、端口放行与运维优化,可长期稳定运行Hermes Agent,用于代码开发、自动化任务、数据处理等各类场景。
242 3
|
1月前
|
人工智能 监控 前端开发
学习AI Agent编程-第二天-LangGraph ReAct模式实现
本文介绍了LangChain中ReAct(推理-行动)模式的实践应用:通过“会议室申请”流程,演示LLM如何循环执行“决策→调用工具→评估结果→调整策略”,实现多步任务自动化。代码涵盖流程定义、工具函数与多轮会话测试,验证了其在空闲检查、报备审批、异常处理等场景的可靠性。(239字)
278 7
学习AI Agent编程-第二天-LangGraph ReAct模式实现
|
1月前
|
存储 SQL 安全
【Java并发编程】JMM Java内存模型:原子性、可见性、有序性、happens-before原则(附《思维导图》+《面试高频考点清单》)
Java内存模型(JMM)是Java并发编程的基石,抽象定义主内存与线程工作内存的交互规则,系统解决可见性、原子性、有序性三大核心问题,并通过happens-before、volatile、synchronized等机制保障多线程安全与跨平台一致性。
|
22天前
|
数据采集 人工智能 分布式计算
多Agent集群中的"情报官"设计:为什么系统需要一个RDD
在多Agent系统中,信息采集环节的失误往往是级联错误的根源。本文从行业实践和学术研究两个维度,论证了专职情报采集Agent的必要性,并详细解析了枢衡RDD(资源探测)的五大架构设计原则,包括与CAD的对抗性协作机制等。最后提供了一套可落地的自检清单,帮助开发者判断自己的Agent集群是否需要引入专职情报官角色。
|
2月前
|
人工智能 自然语言处理 机器人
[开源框架-实战]用 Hermes Agent 搭一个微信播报机器人
30 分钟,零 Python 代码,搭出一个每天早上 9 点把 GitHub Trending 推送到你微信的机器人。顺带把 Hermes 的 Skill、Gateway、Cron 四个招牌能力全用上。
784 8
|
1月前
|
人工智能 分布式计算 监控
多智能体集群审计机制设计:免疫、熔断与信誉治理
多智能体系统(MAS)在提升 LLM 应用能力的同时,也带来了幻觉级联、伪共识等新型风险。本文基于枢衡(Shuheng)V2 集群的工程实践,系统阐述审计角色(CAD)的架构设计——涵盖免疫系统与熔断器的双职能模型、职责隔离的四项红线、五类实质性测试的审计协议、多维信誉账本的动态治理机制,以及审计与创新之间的张力平衡。文末提供可直接落地的协议设计参考。
|
2月前
|
运维 Java 开发者
[015][web模块]基于Spring Boot的HTTP客户端日志与默认配置实战
本文详解基于Spring Boot的HTTP客户端统一配置方案,支持RestTemplate、RestClient与WebClient三种客户端,实现无侵入的日志记录(请求/响应头、状态码)、默认请求头注入(如X-Request-Id)、非2xx异常自动转换及链路追踪支持,全部通过Customizer与Filter机制自动装配,开箱即用,提升微服务调用可观测性与开发效率。(239字)
243 5
[015][web模块]基于Spring Boot的HTTP客户端日志与默认配置实战