
哈喽,大家好!
我是阿星!
最近想系统学 AI Agent,最容易遇到的问题不是没有资料,而是资料太碎。
今天看提示词,明天看 RAG,后天又冒出 MCP、Agent Skill、Coding Agent、评估、多 Agent。每个词似乎都懂一点,但真要做一个完整项目,还是不知道这些模块为什么存在,又该怎么连起来。
我最近挖到一个很适合补这张“全局地图”的开源项目:
《深入理解 AI Agent:设计原理与工程实践》
GitHub👉🏻 bojieli/ai-agent-book
在线阅读👉🏻://bojieli.github.io/ai-agent-book/
先说结论:这不是一份把热门名词堆在一起的资源清单,而是一套“正文 + 实验 + 在线版 + PDF / EPUB”的完整开源教材。
它值得收藏,但也不是零基础的“一键入门课”。如果你有基本的 Python、Git 和命令行经验,它的价值会更大。

图片来源:项目官方在线阅读页
01 它到底开放了什么?
作者在引言中介绍,这本书源自技术讲座和配套实验,之后继续整理、扩展成书。
截至我核实时,仓库 README 给出的规模是:
10 章正文。
92 个配套实验,其中 70 多个可以独立运行。
中文原版和 7 种社区翻译,共 8 种语言。
在线阅读、PDF、EPUB 三种阅读方式。
主项目采用 Apache License 2.0;部分子项目以各自的许可证说明为准。
写这篇文章时,GitHub 页面显示约 2.39 万 Star、2.4k Fork、811 次提交。更重要的是,仓库当天仍有文档和实验代码更新。它不是上传完就不再维护的静态资料,而是一套仍在迭代的开源教材。

图片来源:项目 GitHub 仓库首页;Star 等数据会继续变化
02 我最喜欢的,是它先给了一张完整地图
很多 Agent 教程的问题,是从某个框架或某个 Demo 开始讲。你能照着跑起来,却不一定知道整个系统还缺什么。
这本书先用一句公式统一全书:
Agent = LLM + 上下文 + 工具
简单说,模型负责理解、思考和决策;上下文决定模型能看到什么;工具决定它能对外部世界做什么。
沿着这条主线,十章内容不是平铺,而是逐层推进:
第一章先建立 Agent 的基本框架;第二到第五章讲上下文、记忆、知识库、工具和 Coding Agent;第六到第八章进入评估、后训练和持续进化;最后两章再扩展到语音、GUI、机器人和多 Agent 协作。

图片来源:项目 README 的“内容速览”
这套结构有一个很实际的好处:以后再看到 RAG、MCP、Skill、Computer Use 或 Agentic RL,你不再只是多记住一个术语,而是知道它属于模型、上下文、工具、评估还是进化链路。
对刚进入这个领域的人来说,这张地图往往比又学一个框架更重要。
03 它不是只教你做一个聊天机器人
真正让我觉得这是“宝藏资源”的地方,是正文和实验基本按章节对应。
比如第五章讲 Coding Agent 与代码生成,配套项目不是只有一个最小聊天 Demo,而是包含了:
用代码辅助数学和逻辑推理。
把论文生成 PPT,再用 Vision 模型检查渲染结果。
从 PPT、讲解词和 TTS 生成带旁白的视频。
用自然语言剪辑视频,并通过抽帧复核结果。
解析新格式日志、诊断故障并生成回归测试。
把自然语言转成 SQL,让 Agent 操作 ERP 数据。
用纯 Python 实现一套综合 Coding Agent。

图片来源:项目第五章配套项目页面
这些实验的意义,不只是“项目很多”。
它们把同一套 Agent 方法放进了内容生产、数据处理、软件工程和自动化场景。你会看到上下文怎么组织、工具怎么设计、结果怎么验证,以及为什么一个 Agent 不能只负责生成,还需要检查和反馈闭环。
对于开发者,这是一组可以拆开研究的工程样例;对于产品经理和内容创作者,它也能帮助你理解,一项 Agent 能力从演示走向真实工作流,中间还需要补哪些环节。
04 不同基础的人,可以走不同路线
项目已经给出一份官方学习建议,把全书分成基础、上下文、工具、评估与进化、拓展与协作五部分,并标注了章节难度。

图片来源:项目官方《学习建议》
如果你时间有限,我建议先读第一章和第二章。
第一章帮你建立全局认知,第二章讲最关键的上下文工程。官方也特别说明,第二章的 KV Cache 原理偏技术,第一次可以先跳过底层细节,只抓住核心结论。
如果你准备真正开发 Agent,可以按第一到第六章顺序推进。前五章负责“怎么构建”,第六章负责“怎么验证”。如果你已经在做模型训练或复杂 Agent,再进入第七、八章的 SFT、RL 和持续进化,最后按需要选读多模态与多 Agent 协作。
阿星不建议第一天就从第七章开始啃强化学习,也不建议一次克隆所有外部项目。先读一章、跑一个实验、改一个变量,再观察结果,学习效率会更高。
05 第一次动手,建议从这 3 个实验开始
如果你不知道从哪个项目入手,可以按下面的顺序选。
第一个:1-1 context
它用消融实验展示上下文各组件的重要性。
所谓消融实验,就是一次去掉或替换一个组件,看结果怎么变化。这个过程能让你直观看到:同一个模型,为什么在上下文不同的情况下,表现会差很多。

第二个:4-2 execution-tools
它把文件操作、代码解释器、虚拟终端和外部系统集成做成执行工具,并加入二次审批机制。
这个实验适合用来理解一个关键问题:Agent 会调用工具还不够,真正进入工作现场以后,还要处理权限、误操作和人工确认。

第三个:5-4 paper-to-ppt
它把“论文转 PPT”设计成一个提议者—审核者循环:一个 Agent 生成 Slidev,另一个环节把页面真实渲染成 PNG,再让 Vision 模型检查并继续修改。
如果你是内容创作者、产品经理或独立开发者,这个实验很容易建立直觉。它展示的不是一次生成,而是“先产出、再渲染、再检查、再迭代”的交付闭环。
想在本地开始,可以先执行:
# 克隆开源书和配套实验
git clone https://github.com/bojieli/ai-agent-book.git
# 进入项目目录
cd ai-agent-book
# 查看第一章实验清单(macOS)
open chapter1/README.md
每个实验的依赖和启动方式不完全相同,进入具体目录后,
应先读对应 README,再配置环境和 API Key。

06 收藏之前,也要知道它的门槛
这套资源很完整,但有三个边界需要提前说明。
第一,它更适合有一点技术基础的读者。
官方列出的基础包括 Python、命令行、Git、JSON、REST API,以及基本的大模型使用经验。只想了解概念,可以直接读在线版;要跑实验,还是需要动手配环境。
第二,不是所有内容都已经装在主仓库里。
出于体积和许可证等原因,第六、七、九、十章涉及的 19 个评测基准、训练框架和机器人平台需要另外克隆;部分实验还需要 API Key、GPU 或真实硬件。仓库已经明确标注“可独立运行”“复现指南”“设计文档”等类型,开始前要先看清楚。
第三,内容仍在快速更新。
中文是原版,社区翻译可能落后;在线站点会随 main 分支更新,PDF 和 EPUB 也有滚动构建。如果你在意最新修订,优先看中文在线版和 GitHub 主仓库。
最后说一句
这个项目真正值得推荐的,不只是“开源”或“实验多”。
它把 AI Agent 学习从零散术语,重新组织成一条可以行动的路线:
先理解模型、上下文和工具,再动手运行实验;做出结果之后,用评估判断系统是否真的进步;最后才进入训练、持续进化、多模态和多 Agent 协作。
这也是我认为更有效的 Agent 学习方式:
不是看完多少教程,而是能不能把一个原理放进代码里运行、比较、修改和验证。
如果你最近正想系统补 AI Agent,这个仓库值得放进收藏夹。但收藏之后,最好马上挑一个最小实验跑起来。
信息来源
