02|Agent Harness 的核心组成:模型、上下文、工具、文件系统和终端

简介: Agent Harness 是AI编程的工程执行系统,不止依赖大模型:模型负责推理,上下文精准供给信息,工具赋予行动力,文件系统承载代码修改,终端闭环验证结果,权限保障安全边界。五者协同,才能真正完成任务而非仅输出建议。(238字)

image.png

理解 Agent Harness,不能只看“它用了哪个模型”。真正决定体验的,是模型之外那一整套工程结构。

一个可用的编程 Agent,大致由五个部分组成:模型、上下文、工具、文件系统、终端。模型只是其中一个部件。没有后面四个,模型再强也只能给建议,不能完成任务。

一、模型:负责推理,不负责执行

模型的职责是理解目标、拆解任务、判断下一步该做什么。比如它会判断:这个 bug 应该先看登录模块,还是先跑测试;这个报错像类型问题,还是运行时问题;这个改动应该补单元测试,还是集成测试。

但模型不能直接读你的仓库,也不能自己运行 npm test。它需要 Harness 提供工具。

这也是为什么同一个模型,放在不同 Harness 里体验会差很多。聊天框里的模型只能回答;终端 Agent 里的模型可以读文件、改代码、跑命令、看错误输出,然后继续修。

二、上下文:决定 Agent 看见什么

上下文是 Agent 的工作台。

它可能包含:

  • 用户当前任务;
  • 当前对话历史;
  • 相关文件内容;
  • 搜索结果;
  • Git diff;
  • 终端输出;
  • 项目规则;
  • 历史记忆;
  • 外部文档;
  • 工具说明。

上下文不是越多越好。真正难的是选择。

比如你让 Agent 修支付回调问题,它应该优先看支付入口、订单服务、状态流转、队列消费者和测试,而不是整个前端目录。一个好的 Harness 会让模型逐步探索,而不是一次性吞下所有代码。

image.png

上下文管理的目标,是让模型在每一步拿到刚好够用的信息。

三、工具:让模型能行动

工具是 Harness 的手脚。

常见工具包括:

工具 作用
Read 读取文件
Edit 修改文件
Search 搜索文件名和内容
Shell 运行命令、测试、构建
Git 查看 diff、提交、分支
Browser 打开页面、截图、交互
MCP 连接外部系统
Subagent 分配子任务

工具调用的关键不是数量,而是反馈。每次工具返回结果,模型都要重新判断下一步。

例如:

运行测试 -> 发现失败 -> 读取失败文件 -> 修改实现 -> 再运行测试

这就是 Agentic Loop。

四、文件系统:真实世界的代码入口

编程 Agent 最重要的能力之一,是直接操作文件系统。

它能看到当前目录、子目录、配置文件、测试文件、构建脚本,也能创建新文件、修改已有文件。这个能力很强,也很危险。

一个成熟 Harness 必须处理好三个问题。

第一,作用范围。Agent 是否只能访问当前项目?能不能读上级目录?能不能访问用户主目录?

第二,改动可追踪。每次修改哪些文件、改了什么、能不能回滚。

第三,用户变更保护。用户已经改过但未提交的文件,Agent 不能随便覆盖。

这也是为什么 Git 状态和 diff 对 Agent 很重要。它不仅帮助模型理解当前工作,还保护人类开发者的现场。

五、终端:把验证闭环接起来

没有终端,Agent 写代码很容易停在“看起来对”。

有终端以后,它可以:

npm test
npm run lint
mvn test
cargo test
go test ./...
git diff

这让 Agent 从“生成代码”变成“验证代码”。

但终端也是风险最大的地方。读文件通常风险低,运行命令就复杂得多。npm test 可以允许,rm -rf 必须拦住,部署命令必须确认,数据库迁移要特别谨慎。

所以 Harness 一般会把命令分级:安全命令自动执行,普通命令询问确认,高危命令禁止或强制人工审批。

真实任务中的配合

假设任务是:

修复用户退出登录后仍能访问个人中心的问题。

Harness 的工作过程可能是:

  1. 模型理解目标;
  2. 搜索 logout、session、auth middleware;
  3. 读取路由守卫和会话逻辑;
  4. 运行现有认证测试;
  5. 修改退出登录后的状态清理;
  6. 新增“退出后访问个人中心返回 401”的测试;
  7. 运行相关测试;
  8. 输出改动说明。

这里每一步都用到不同组件。模型负责判断,搜索和读取提供上下文,文件系统承载修改,终端完成验证。

容易被忽略的部分

很多人只关心模型能力,却忽略了 Harness 的细节。

比如搜索工具慢,Agent 就会浪费大量时间;上下文压缩差,长任务会丢关键指令;权限设计粗糙,用户会不敢让它自动执行;测试反馈不清晰,模型会反复修错方向。

因此,Agent Harness 的质量往往体现在小地方:文件搜索是否快、diff 是否清楚、命令输出是否截断合理、错误是否能被模型读懂、上下文是否能被稳定保留。

总结

Agent Harness 不是一个“AI 对话框”,而是一套工程执行系统。

它的核心组成可以归纳为:

模型负责推理
上下文负责提供信息
工具负责行动
文件系统负责落地
终端负责验证
权限负责边界

只有这些部分配合好,AI 编程才会从“生成一段代码”走向“完成一个任务”。

目录
相关文章
|
4月前
|
消息中间件 人工智能 安全
01|什么是 Agent Harness:为什么大模型需要一个“工程外壳”
Agent Harness 是连接大模型与真实工程环境的执行层,解决AI“只会生成文本、无法完成任务”的痛点。它整合上下文管理、工具调用、安全执行、权限控制、结果验证与记忆机制,将自然语言指令转化为可观察、可控制、可验证的工程动作闭环,是AI真正落地开发的关键基础设施。(239字)
628 0
|
4月前
|
人工智能 安全 前端开发
面试官问:什么是 Harness 工程?AI Agent 时代,测试人必须补上的新能力
Harness工程是AI Agent时代的“工作台”,聚焦为其构建稳定、可控、可验证的工程环境。它涵盖上下文管理、工具调用、沙箱权限、测试验证、日志观测与反馈回路,解决Agent在真实项目中因缺上下文、缺工具、缺反馈、缺边界导致的失控问题。本质是让Agent“能做事、做得对、出错可修复”。
|
4月前
|
JSON 人工智能 缓存
Orchestrator 为什么比 Agentic Loop 快:LLM 决策与执行分离的架构解析
Orchestrator模式将LLM角色解耦:仅用两次调用——一次路由决策(定执行策略)、一次结果合成;中间执行由确定性代码完成,支持单Agent、并行扇出、顺序DAG三种模式,成本降70%,延迟减半,更适合高并发生产环境。
224 2
|
14天前
|
API 数据库 UED
网页端实现AutoCAD的多段线功能和API调用
本文详解多段线(Polyline)核心概念与Web端PLINE命令复刻:涵盖顶点、凸度(控制直线/圆弧)、宽度(等宽/渐变)三大要素,基于mxcad实现交互式绘制,支持直线/圆弧混合、实时预览、Ctrl翻转方向、回退闭合等功能,精准对标AutoCAD体验。(239字)
|
7月前
|
IDE 前端开发 开发工具
VS Code 实操笔记:简介、对比与从零配置指南
VS Code是微软推出的免费开源跨平台编辑器,轻量灵活,通过插件可扩展为全功能IDE。支持多语言、IntelliSense智能补全、内置调试与Git集成,界面现代、效率卓越,适用于前端、后端及嵌入式开发,是Keil等传统IDE的理想升级之选。(239字)
1388 7
|
3月前
|
人工智能 数据挖掘 API
Qwen3.8千问新一代旗舰模型上线:在阿里云百炼TokenPlan调用Qwen3.8-Max-Preview体验版
阿里云Qwen3.8-Max-Preview是2.4T参数旗舰预览模型,聚焦Coding与Cowork,支持多模态、长任务与智能体协作,在Token Plan享白天1折、夜间0.2折优惠,个人版39元起/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
3月前
|
自然语言处理 数据可视化 数据挖掘
新版通义千问 Qwen3.8-Max-Preview 功能介绍
Qwen3.8-Max-Preview是通义千问推出的新一代旗舰大模型预览版,以2.4万亿参数规模、原生多模态能力、MoE混合专家架构为核心,在复杂推理、全栈开发、长文档处理、多智能体协作等领域实现跨越式升级,成为面向企业与开发者的全域生产力基座模型。该模型延续通义千问系列技术优势,同时突破前代性能边界,支持文本、图像、视频、文档等多模态输入输出,适配从个人开发到企业级业务的全场景需求,可通过Token Plan、Coding Plan等订阅方案接入使用。
467 0
|
4月前
|
人工智能 IDE 前端开发
04|Claude Code、Codex、Cursor、OpenCode 的 Harness 差异
本文深度解析2026年四大AI编程工具本质差异:Claude Code(终端工程Agent)、Codex(OpenAI生态本地Agent)、Cursor(IDE内嵌Agent Harness)、OpenCode(开源多模型可定制平台),强调选型关键在匹配真实工作流,而非单纯比模型。
2016 3
|
4月前
|
人工智能 安全 Shell
Harness Engineering 被讲烂之后,Agent 工程真正难的是什么?
看 Anthropic、OpenAI、Gemini 的 Harness 都在做啥?
595 0
|
4月前
|
人工智能 Java Shell
AI 不缺智商缺纪律:我的 Harness 工程化实践
核心观点:AI Coding 的瓶颈正从"模型能力"转移到"流程工程"——模型已经足够聪明,但不稳定,而稳定性必须由外部框架供给。 读完你能带走:一套可抄的 harness 分层结构、一个把"流程当被测对象"的评测方法、4 条用代价换来的踩坑教训,以及一个能迁移到任何 AI 工作流的工程化模式。
1296 0