绷不住了,Agent 每次从零烧 token?6.6k Star OpenSpace 把 Skill 变成会进化的资产

简介: OpenSpace 是一个围绕 Skill 自我进化的开源项目,目标是让 AI Agent 从真实任务中学习、修复、沉淀和共享经验。

嗨,我是小华同学,专注解锁高效工作与前沿AI工具!每日精选开源技术、实战技巧,助你省时50%、领先他人一步。👉免费订阅,与10万+技术人共享升级秘籍!

OpenSpace 最值得看的,不是又多了一个 Agent 框架,而是它在解决一个更扎心的问题:Agent 做完任务后,经验到底有没有留下来?

如果你用过 Claude Code、Codex、Cursor、OpenClaw 或 MCP 工具链,大概率见过这种情况:同一个坑,今天踩一次,明天换个会话继续踩。

这篇先用 3 分钟讲清:OpenSpace 想怎么让 Agent 越做越会、越做越省,以及它适不适合放进你的项目里。

场景创作封面:OpenSpace 技能进化工厂

这个项目为什么值得看

OpenSpace 是 HKUDS 开源的一个 Agent 技能进化项目。我今天抓到的数据是:6,660 Star、822 Fork、Python、MIT 协议

README 里的定位非常直接:

让 Agent 更聪明、更低成本、自我进化。

它不是单纯让 Agent 多接几个工具,而是围绕 Skill 做一套生命周期:执行、记录、监控、分析、修复、派生、沉淀、共享。

说人话就是:

不要让 Agent 每次都从零开干,而是把成功经验变成下一次能复用的 Skill。

README 图:OpenSpace Benchmark 核心指标


它解决的不是“会不会调用工具”

现在很多 Agent 已经能调用工具、写代码、查资料、跑脚本。

但真正做复杂任务时,问题往往不是“没有工具”,而是:

常见痛点 真实表现 OpenSpace 的方向
token 白烧 每次都重新推理、重新试错 复用成功流程,减少重复探索
技能会过期 API、页面、依赖一变,旧 Skill 静默失效 监控质量,触发修复
经验困在单个 Agent 一个 Agent 学会了,另一个还要重来 通过 Skill 社区共享演化结果
复杂任务难稳定 工具链很长,中间一步错就崩 把可靠执行模式沉淀成 Skill

这就是 OpenSpace 的切入点:Agent 不该只是一次性执行器,而应该有经验积累。

白板手绘创作图:OpenSpace 技能进化层定位

三个关键词:FIX、DERIVED、CAPTURED

OpenSpace 里最容易被技术读者记住的,是三种 Skill 演化模式。

FIX:修坏掉的 Skill。

当工具、依赖、接口变化导致原来的 Skill 不稳定时,它不是简单报错结束,而是尝试定位问题并修复。

DERIVED:从旧 Skill 派生更强版本。

如果一个任务场景需要更细分的能力,它可以从已有 Skill 演化出更适合的新 Skill,而不是把所有能力都塞进一个大而全文件。

CAPTURED:把成功经验捕获成新 Skill。

如果某次执行里出现了可复用的工作流,它可以被沉淀出来,下次类似任务就不用重新摸索。

这三个词放在一起,OpenSpace 的思路就清楚了:

让 Skill 不再是静态说明书,而是会被真实任务不断打磨的工程资产。

README 图:OpenSpace 框架


README 里最硬的数字

OpenSpace 的 README 里给了一组很适合传播的 benchmark 数字。

它在 GDPVal 上做评估:这个数据集包含真实世界专业任务,覆盖多个职业场景。README 里写到,OpenSpace 使用和 ClawWork 基线相同的骨干 LLM:Qwen 3.5-Plus。

关键数字包括:

  • 50 个专业任务
  • 收入提升 4.2 倍
  • Phase 2 token 用量约为 Phase 1 的 45.9%
  • 50 个 Phase 1 任务中自主进化出 165 项 Skill

我不会把这些数字理解成“所有场景都能 4.2 倍”。更合理的理解是:

当任务有重复模式、工具链较长、交付质量需要验证时,Skill 演化才更容易释放价值。

这也是为什么它对文档生成、合规表单、表格、工程项目、多文件工作流这类任务更有想象力。

工作流可以这样理解

OpenSpace 的接入方式有两条线:

  1. 作为 Agent 的 Skill / MCP 能力接入,比如给 Claude Code、Codex、OpenClaw、nanobot 等使用。
  2. 直接把 OpenSpace 当成 AI co-worker,用它执行编码、搜索、工具调用等任务。

但从产品逻辑看,真正重要的是这条闭环:

任务执行不是终点,执行记录会反过来喂给 Skill 演化系统。

白板板书图:OpenSpace 工作流

这就像给 Agent 加了一个“复盘系统”。

不是今天做完就散,而是把过程、问题、修复、成功路径都变成下一次能用的东西。

程序员为什么该关注

如果你正在做 Agent 产品、自动化工具、MCP 服务、内部研发助手,这个项目值得先收藏。

你的场景 可能获得的启发
做 Agent 平台 Skill 生命周期不能只靠人工维护
做企业自动化 成功流程可以沉淀成可审计、可复用资产
做 Coding Agent 修复工具链、验证输出、复用工作流很关键
做知识/工作流系统 经验共享比单次问答更有长期价值
研究成本优化 降 token 不一定只靠模型路由,也可以靠少重复试错

我最看重的一点是:

OpenSpace 把“Agent 经验如何沉淀”这个问题,从玄学变成了可设计的工程系统。

但它不是万能药

这类项目很容易被标题吹过头,所以边界也要说清楚。

OpenSpace 不是装上就让所有 Agent 自动封神。它更适合有复杂任务、长期使用、重复流程、Skill 维护成本的场景。

如果你的任务本来就是一次性问答,或者流程很短、几乎没有复用价值,那 Skill 演化的收益就没那么明显。

另外,Skill 共享也一定要考虑安全边界:权限、凭证、提示注入、危险操作、团队可见性,都不能靠热情解决。

Agent 越会学习,越需要治理。

我的判断

OpenSpace 的价值,不是告诉我们“Agent 又强了”,而是提醒我们:

下一阶段的 Agent 工程化,可能不只是拼模型、拼工具,而是拼 经验复用能力

模型负责思考,工具负责执行,而 Skill 负责把成功经验留下来。

这篇先作为项目速览。后面如果大家感兴趣,我会继续把它的 MCP 接入方式、host_skills 设计、Skill 演化源码、以及 GDPVal benchmark 怎么看的问题拆开讲。

如果你也关注 AI Agent、MCP、开源项目和 LLM 工程化,可以继续关注我的后续更新。

项目地址

https://github.com/HKUDS/OpenSpace

相关文章
|
1月前
|
缓存 人工智能 监控
Qwen3.8-Max 深度使用实战:从 2.4 万亿参数到生产级智能体落地
Qwen3.8-Max 是阿里云通义千问 2026 年 8 月最新发布的旗舰基座模型,2.4 万亿参数 MoE 架构、1M 上下文窗口、原生多模态(文本+图像+视频),具备"自主编程十数天交付完整项目"的长程闭环能力。本文不是又一篇"怎么调 API"的入门教程,而是一线团队将 Qwen3.8-Max 从 PoC 推向生产的深度实践记录:百炼平台开通与 API Key 管理、OpenAI 兼容协议接入、多模态与 Function Calling 进阶、思考模式与上下文缓存调优、Token Plan 订阅选型、生产环境避坑实录。
|
1月前
|
数据采集 人工智能 算法
为什么你的品牌在AI里查无此人?GEO优化的五个关键动作
本文为技术实践分享,介绍AI搜索时代企业亟需的GEO(生成式引擎优化)——不同于SEO,GEO聚焦让AI“认识、信任并推荐”品牌。文章提炼罗小军提出的五大关键动作:诊断AI可见度、结构化知识资产、建设权威信源、布局场景词矩阵、建立持续监测机制,助力企业抢占AI决策入口。(239字)
|
1月前
|
数据采集 人工智能 数据挖掘
他山科研 Skills 上架 Qoder:18 个 Skills,覆盖从调研到答辩全流程
他山团队推出20项AI科研Skill,覆盖文献检索、实验设计、学术写作到论文审查全流程,已在Qoder CN技能市场上线。含论文检索、深度研究、假设生成、统计分析、科研绘图等高频工具,助力科研提效。
275 0
|
1月前
|
人工智能 自然语言处理 数据可视化
阿里千问办公上线!一句话产出 PPT、数据报表、完整网页,注册送2000积分
千问办公是阿里巴巴推出的AI原生办公平台,基于Qwen3.8大模型,支持一句话交付PPT、文档、视频、网页等成果;深度集成钉钉,打通本地文件与浏览器,覆盖桌面端、网页端及企业协同场景。千问办公官网:https://t.aliyun.com/U/805n7O
376 0
|
1月前
|
存储 人工智能 数据处理
基于 YOLO11 的车辆品牌 Logo 检测:从数据标注到云上训练工程化实践
本文介绍基于YOLO11的车辆品牌Logo检测工程实践:涵盖31类、5697张图像的数据集构建,从Label Studio标注、云上OSS存储与版本管理,到YOLO11训练调优、小目标增强及多维度评估,实现端到端可复现、可迭代的AI落地流程。(239字)
基于 YOLO11 的车辆品牌 Logo 检测:从数据标注到云上训练工程化实践
|
30天前
|
Web App开发 安全 开发者
自动化发布流程验证 2026-08-09 01:28
这是一篇用于验证自动化发布流程的测试文章,覆盖标题、正文、摘要的自动填写与发布提交。
|
1月前
|
安全 算法 测试技术
医院电子病历越权与下载攻防全解析:从水平越权、垂直提权到JWT防线与目录穿越
本文以医院电子病历系统为案例,完整复盘一次安全测试:从水平越权(篡改ID查他人病历)、垂直越权(伪造角色提权)、JWT鉴权原理,到目录穿越与文件名枚举攻击及层层防御演进,揭示越权本质是“客户端身份不可信”的悖论,强调服务端校验、签名防护与随机化命名等关键防御实践。(239字)
98 2
医院电子病历越权与下载攻防全解析:从水平越权、垂直提权到JWT防线与目录穿越
|
1月前
|
JSON 缓存 API
为什么 ACC Core 不能和 OpenAPI、MCP 或 gRPC 绑死?
ACC 提出“Core + Binding”分层治理模型:Core 定义跨协议统一的Agent能力治理语义(如风险、审批、主体等),Binding 负责将语义无损映射到 OpenAPI/gRPC/MCP 等具体协议。避免因传输方式不同导致治理含义漂移,确保同一业务能力(如创建退款)在各系统中治理一致。(239字)
|
1月前
|
缓存 JSON 文字识别
PaDoc:让端到端文档解析不再串行——吞吐翻倍、延迟减半,质量还没掉
PaDoc创新性提出“布局串行+内容并行”解码范式,通过祖先注意机制与vLLM前缀缓存,在保留整页上下文前提下实现区域级并发生成。同骨干模型下吞吐翻倍、P95延迟减半,质量不降反升(OmniDocBench 94.24),为端到端文档解析提供高效落地新路径。(239字)
|
1月前
|
数据采集 人工智能 搜索推荐
4层进阶路径:从Schema到交叉印证的内容重构方法
本文提出AI时代内容可见度提升的4层进阶路径:基础标记、答案前置与信息块化、平台分发适配、数据交叉验证迭代。核心是将内容重构为AI可直接摘录的高密度信息块,而非传统文章。
94 2

热门文章

最新文章