别让你的AI当"差不多先生"——Hermes 0.18+0.19双版本连更,把智能体从"会干活"推到了"能托付"

简介: Hermes 0.18–0.19 版本聚焦“可信AI”,六大升级重塑人机协作:/goal 自我验证+持久化兜底确保任务真完成;/learn 技能蒸馏让AI持续积累经验;MoA多模型协商提升决策质量;冷启动提速80%、渲染优化14倍;Smart Approvals智能审批兼顾安全与效率;/journey记忆时间线+上下文压缩保障长期项目连贯性。真正实现“交办即安心”。

你有没有过这种时刻——

凌晨1点,你给AI安排了一个"明天早上要用的"任务:整理竞品数据、生成对比图、推送到工作群。你设了定时任务,关了电脑,准备睡觉。

但你翻来覆去睡不着。脑子里反复飘过一个念头:"它会不会又漏了什么?图生成了吗?数据全吗?推送成功了吗?"

你打开手机看了一眼——果然,只推送了文字,图丢了。你从被窝里爬起来,打开电脑,补了一轮指令。

这个场景,几乎是所有重度AI Agent用户的共同记忆。在0.17时代,你跟AI的关系像带实习生:每个任务都要盯着、追着、纠正着。它说"做完了"≠"做好了"。

Hermes从0.18"The Judgment Release"到0.19最新版本,没有做"新增50个模型"的花哨更新,而是扎扎实实干了一件事:让你的AI从"你得盯着它干活"变成"你可以放心去睡觉"。

下面从六个你最在意的日常场景出发,逐个看看这两次升级到底改变了什么。


场景一:任务跑完了,但你真的敢信吗?

0.17时代的AI Agent有个致命问题:它说"做完了",但你不信。

不是你不信任它——是它确实经常漏。搜索了5条新闻但图没生成、文件写了一半就停了、推送返回了错误但它没检查。

0.18的答案:/goal 自我验证

当你在对话中用 /goal 设定一个目标,Hermes拿到后做两件事:执行前把目标拆成多个子任务,每个都有明确的完成条件;执行后逐项自检,失败的自动重试。

以前你说"帮我生成今天AI行业简报,包含5条新闻、一张对比图,推送到微信",它跑完告诉你"好了",你得自己去验证。

现在它在说"好了"之前,已经自己验证过了——5条新闻、对比图已生成、微信推送返回HTTP 200。如果哪一步失败了,它会在告诉你之前自己补上。

仙踪问道团队在实际部署中的观察数据是:引入 /goal 后,用户"因AI执行不完整而二次补充指令"的频次下降了约60%。

0.19的加固:结果丢了也能找回

0.18解决了"检查",0.19解决了"兜底"。

Gateway向Telegram、微信等通道发送最终回复前,会把"待投递义务"写入state.db——如果Gateway恰好崩溃或重启,后续启动时会重新投递,避免你花了token但回复消失的情况。

后台子代理(delegate_task)的完成结果也变成了持久化状态。进程在子任务运行期间重启,系统会恢复并按权限校验后交付结果。

说白了:你的任务结果不会因为网络抖动、进程重启而凭空消失。

AI的终极天花板不是能力,是信任。能力不够你可以教,信任不够你得盯着。

场景二:同样的操作重复了20遍,它就不能记住吗?

你一定有过这种体验——每次写营销文案都要手动加载三四个技能、每次生成banner图都要指定模型和比例、每次做数据分析都要叮嘱"用中位数填充异常值"。

在0.17时代,每个对话都相对独立,一套连贯的操作流程很难被完整继承。

0.18的答案:/learn 技能蒸馏

你只需要在完成一套频繁重复的操作后,对Hermes说一句:"帮我把刚才这套流程学习成一个技能。" Hermes会自动分析完整操作链路——加载了哪些技能、调用了哪些工具、设置了哪些参数、你纠正了哪些错误——然后生成一个结构化的技能文件,保存到本地。

下次你说出与这个场景相关的指令时,Hermes自动加载这个技能,所有参数和流程预设全部到位。你不再需要说"先加载X技能,再设定Y参数,注意Z规则"——一句自然语言,整套流程跑通。

一个月后,你的技能库里可能已经积累了十几个个性化技能——不仅覆盖内容生产,还包括数据分析模板、竞品监控流程、邮件回复模板。你的AI不是在每次对话中从零开始的"新员工",而是一个在你的领域持续积累经验的"老手"。


场景三:重要决策只问一个模型,靠谱吗?

做技术方案选型的时候,你是不是也这样——同一个问题问了Claude,又问了GPT,还问了DeepSeek,三个答案各有优劣,你花了15分钟取长补短。

0.18的答案:MoA(Mixture of Agents)多模型协商

把MoA提升为一级可选模型后,你的一个问题可以同时发给多个参考模型,它们各自给出回答,然后由一个"裁判模型"综合所有观点,生成最终答案。

关键是:你可以实时看到每个参考模型是怎么思考的,哪条结论是哪个模型提出的。这不是"黑盒投票",而是一场你可以全程旁听的"专家会诊"。

0.19的补充:推理深度变成精细控制项

0.19进一步把推理深度变成了可单独配置的精细控制项——增加了maxultra推理等级,而且可以针对不同角色单独配置。研究/审查角色用高推理,最终聚合角色用较低推理来控制延迟与成本。

再加上 /model --once 只让下一轮使用指定模型、之后自动回到原模型,非常适合临时用强模型做一次复杂推理。

独断的AI是工具,协商的AI才是顾问。

场景四:打开Hermes要等半天,Desktop卡得像PPT

说实话,0.17时代的Hermes在macOS Desktop上不算快——首次发消息从提交到模型调用约4.3秒,长回复渲染时CPU风扇呼呼转。

0.19的答案:全面提速

冷启动延迟从约4.3秒降至约0.9秒,减少约80%。CLI、Gateway、TUI、Desktop和Cron都受益——你从发送消息到模型开始处理,几乎无感。

Desktop端做了大幅优化:长回复的Markdown流式渲染CPU开销降低约14倍,大Diff采用虚拟化渲染,长会话切换、工具调用流和侧边栏刷新都更顺滑。

对于终端重度用户,TUI的流式Markdown改为按块增量渲染,长输出时的卡顿会明显减少。

另外,推理过程现在默认实时显示。启用display.show_reasoning后,推理模型会实时流式展示思考过程,而不是长时间只显示加载状态——你至少知道它在想什么,不用盯着空白屏幕干等。


场景五:每次确认弹窗都点一遍,能不能聪明一点?

日常使用中,Hermes执行命令前需要你手动批准。安全是安全,但一天几十次要点的确认弹窗,确实烦人。

0.19的答案:Smart Approvals默认启用

Hermes遇到被标记的命令时,会先由独立LLM审查风险,减少你对低风险操作逐条手动确认的频率。每条命令单独判断,不会因一次放行而泛化授权。

但Smart Approvals不是"全自动放行"——你可以定义deny规则,即便启用了YOLO模式也会强制阻止某些命令。使用 /deny <原因> 时,拒绝原因会回传给Agent,让它能换一种实现方式继续做事。

密码管理也升级了

不再需要把密码明文放在.env文件里。新增的SecretSource机制直接支持Bitwarden和1Password(如op://引用),支持多个vault、优先级控制和冲突提醒。


场景六:聊了半年的项目,它还记不记得我们讨论过什么?

长期项目中最大的焦虑:AI到底还记得多少?它是不是已经把三周前我们确定的方案忘了?

0.18的线索:/journey 记忆时间线

在对话中输入 /journey,你能看到AI在每个时间点记住了什么、修正了什么、当前对话中正在使用哪些记忆。对于持续数月的项目来说,这个功能让你能实际验证"它真的还记得",而不是凭感觉相信。

0.19的延伸:上下文压缩更聪明

上下文压缩会更强调保留用户意图和"长期有效的交接信息",减少长任务压缩后目标漂移的问题。你的项目目标不会在AI的"记忆压缩"中逐渐模糊。

此外,0.19还带来了完整的会话导出能力——hermes sessions export支持Markdown、Quarto、HTML、纯Prompt及Hugging Face trace格式,并可按时间、工作区、平台筛选,--redact能在导出时做敏感信息脱敏。你的对话资产终于可以真正导出和复用了。


一张表看懂:这两个版本到底改变了什么

你的痛点 0.17时代的体验 0.18+0.19的改变 用法速记
任务跑完不确定是否完整 跑完就报告,漏了自己发现 /goal自检 + 持久化投递兜底 /goal 任务描述
重复操作每次都要说一遍 每轮对话从头描述流程 /learn蒸馏成技能,触发即跑 /learn 把刚才的存为技能
重要决策只问一个模型 手动切模型对比 MoA多模型协商 + 推理深度精细控制 切换MoA模式直接提问
打开慢、操作卡 冷启动4.3秒,渲染CPU高 冷启动0.9秒,渲染CPU降14倍 直接升级即可
确认弹窗点个不停 每条命令手动批准 Smart Approvals自动判断 + deny规则硬锁 默认启用
长期项目怕AI遗忘 不确定还记得多少 /journey可视化 + 压缩保留意图 + 会话导出 /journey 查看记忆时间线

升级提醒

升级到最新版本后,有几个注意点:

hermes update在Node清单没有变化时会跳过npm install,所以更新比旧版本快很多。如果Desktop前端构建或依赖异常,用hermes desktop --force-build强制重建。

max_async_children已废弃,委派并发控制改为统一并发上限配置。建议运行hermes doctor检查迁移提示。

Smart Approvals虽能减少确认弹窗,但对涉及删除、部署、支付、密钥或生产环境的任务,仍建议保留人工审批或用deny规则锁死高风险命令。


相关文章
|
2月前
|
存储 人工智能 JSON
大模型幻觉治理:从机理到生产级缓解方案
本文深入剖析大模型“幻觉”本质,指出其是架构性问题而非能力不足,并系统提出分层治理方案:从幻觉分类、根因分析(训练目标、知识存储、解码随机性),到评测方法、Prompt约束、受限解码、RAG增强、Guardrail兜底及训练优化,强调多层防御与人机协同。
387 2
|
3月前
|
人工智能 算法 项目管理
Hermes Agent 总记不住你说的话?3 步治好 AI 助手的"健忘症"
Hermes Agent“健忘”源于核心记忆文件MEMORY.md仅2000字符容量,导致跨对话信息无法持久保存。本文详解三步解决方案:①扩容配置(治标);②启用8种外部记忆扩展(如Holographic、Mem0、Supermemory等,治本);③实时查看记忆状态。让AI真正记住你。
997 2
Hermes Agent 总记不住你说的话?3 步治好 AI 助手的"健忘症"
|
存储 NoSQL 关系型数据库
MariaDB 在Linux下的安装部署
MariaDB 在Linux下的安装部署
MariaDB 在Linux下的安装部署
|
2月前
|
人工智能
Qwen3.8-Max发布!在阿里云百炼TokenPlan、Qoder和QoderWork快速体验Qwen3.8-Max
阿里云发布Qwen3.8-Max大模型,参数达2.4万亿!可通过百炼TokenPlan(含个人版)、Qoder智能编程平台、QoderWork桌面AI三大渠道快速体验。现开启限时Preview活动:白天Credits享1折,个人版夜间再折上2折!在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
547 2
|
2月前
|
人工智能 弹性计算 运维
开源可替代 Claude Code 的阿里云 OpenCode 功能与实操介绍
2026年AI开发工具赛道高速迭代,海外Claude Code凭借强大工程理解能力收获大量开发者,但闭源订阅收费、国内网络访问受限、代码数据上传境外、仅支持单一模型等多重短板,让国内技术从业者使用成本与合规风险持续走高。在此背景下,基于MIT开源协议打造的阿里云OpenCode快速崛起,作为完全开源、全模型兼容、深度适配国内云计算生态的终端AI编程Agent,完美补齐海外工具各类痛点,成为个人开发者、企业研发团队可自主掌控的国产替代方案。OpenCode依托Go语言轻量化底层架构,提供终端TUI、IDE插件、桌面程序、API服务四种使用形态,独创Plan规划+Build构建双开发工作流,支持7
669 0
|
2月前
|
安全 Java 数据安全/隐私保护
|
2月前
|
SQL 人工智能 安全
我们为Agent修了一条安全访问数据的路
阿里云AIDBS推出Agent数据网关,专治AI Agent越权访问、误删生产库、敏感数据泄露等安全顽疾。它在Agent与数据间构建统一安全通道,实现语义理解、执行管控、数据防护三位一体,支持分钟级接入,零改造适配主流Agent与数据源。
206 0
|
2月前
|
人工智能 数据可视化 数据挖掘
阿里云百炼 Harness 工具全解:联网 / 代码解释 / 识图,Qwen 内置增强组件使用指南
Harness是阿里云百炼Token Plan为Qwen3.8-Max-Preview等旗舰模型内置的增强工具集,支持联网搜索、代码解释器、网页抓取、文搜图、图搜图等多模态能力,开箱即用、按调用计费,助力AI编程与智能体高效执行复杂任务。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
2月前
|
弹性计算 运维 监控
阿里云国际版注册:全球加速GA延迟高排查教程
不少团队配置完阿里云全球加速GA后,访问延迟依旧不降反升,问题往往出在加速区域选型偏差和终端节点优化遗漏。这篇阿里云全球加速GA延迟高排查教程,不泛泛而谈参数含义,而是从真实故障场景切入,把“用户-加速入口-源站”这条链路上的隐蔽延迟源一个个拆开——你会发现,GA的控制台数据只是起点,真正的根因常常埋在配置细节里。
303 1
|
7月前
|
监控 测试技术 持续交付
大模型测试怎么做?从模型评估、幻觉检测到 RAG 系统测试全指南
本指南系统讲解大模型测试全流程:涵盖多维度评估(私有评测集构建、指标选择)、幻觉检测(事实核查、一致性与对抗测试)、RAG分层验证(检索/生成/端到端),以及持续集成实践与避坑指南,助力团队落地可靠评估体系。