乐于分享
好东西不私藏

把 AI Agent 写成了一本开源书:10 章正文 + 93 个可跑实验,Agent = LLM + 上下文 + 工具

把 AI Agent 写成了一本开源书:10 章正文 + 93 个可跑实验,Agent = LLM + 上下文 + 工具

bojieli/ai-agent-book

GitHub AI 项目日报 · 2026-07-29 · 公众号「AI日课」

项目速览

  • 项目地址:bojieli/ai-agent-book
  • Star/Fork:⭐ 24,545 · 🍴 2,518(2025-09 创建,2026-07 破圈爆发)
  • 主要语言:Python(约 94.8%)+ LaTeX/Lua 出版管线
  • 开源协议:Apache-2.0(可商用)
  • 形态:308 页+ 中文技术书(PDF/EPUB/在线阅读)+ 93 个配套实验项目
  • 翻译:9 种语言(英/日/俄/阿拉伯/越南/泰米尔/土耳其/正体中文等,社区贡献)

今天推荐的不是一个框架,也不是一个工具,而是一本"活的书"——《深入理解 AI Agent:设计原理与工程实践》。作者李博杰是前华为"天才少年"计划成员、中科大与 MSRA 联合培养博士,现任 Pine AI 首席科学家。7 月 20 日这个仓库曾创下一天新增约 1,734 颗星的纪录冲上 GitHub 热榜第一,短短一周多时间 Star 数从 7.2K 飙到如今的 24.5K,还在以肉眼可见的速度增长。

为什么一本书能杀疯 GitHub?因为它做了一件此前没人做到位的事:把 AI Agent 从原理到生产工程的完整知识地图,连正文、配图、PDF、93 个实验代码一起全部开源。你不再需要从几十篇博客、论文和各家厂商互相矛盾的文档里自己拼图。


项目背景:Agent 学习资源的"碎片化困境"

AI Agent 这两年热度极高,但学习资源有个尴尬的通病:不成体系。今天刷到一篇 RAG 教程,明天看到一篇 MCP 协议介绍,后天又来一篇多 Agent 协作科普——每篇单独看都有收获,合在一起却是一盘散沙。更麻烦的是各家官方文档口径不一:OpenAI 强调 function calling,Anthropic 强调 tool use,Google 强调 grounding,跟着一家学完换另一家又要重新理解。

这本书用一个公式把所有碎片焊在了一起:Agent = LLM + 上下文 + 工具。LLM 是大脑(推理引擎),上下文是感知(Agent 能看到什么、记得什么),工具是双手(Agent 能对世界做什么)。最近半年爆火的所有概念——Harness、Context Engineering、Agent Skills、Computer Use、评估驱动开发——都能在这套结构里找到自己的位置。

还有一个耐人寻味的细节:作者在引言中坦承,这本书大部分创作过程没有依赖传统的长时间打字——他先向语音 Agent 口述提纲,让 Agent 调研、整理初稿,再结合课程反馈持续讨论修改。一本讲 Agent 的书,本身就是 Agent 深度参与完成的作品,这大概是对书中方法论最有说服力的实证。


核心功能

1. 十章正文:一条从基础到生产的完整进阶路线

第 1 章讲 Agent 基础与 ReAct 循环;第 2 章上下文工程(KV Cache 优化、提示工程、Agent Skills、上下文压缩);第 3 章用户记忆与知识库(RAG、结构化索引、知识图谱);第 4 章工具与 MCP 协议、事件驱动异步 Agent;第 5 章 Coding Agent 全景(含"OpenClaw"参考实现与 ACI 设计);第 6 章评估(ELO 排行榜、沙箱、统计显著性);第 7 章模型后训练(SFT/RLVR/VLA);第 8 章 Agent 自我进化;第 9 章多模态与实时交互(语音三范式、Computer Use、机器人);第 10 章多 Agent 协作与"Agent 社会"。层层递进,互相引用。

2. 93 个配套实验:不是"讲概念",是"跑代码"

每章配 4~16 个独立 Python 项目(第 7 章最多,16 个),其中 70+ 个可独立运行——配好 API Key 就能跑。项目分三级标注:✅ 可运行 / 📖 复现 / 🚧 设计。从零训练 LLM(MiniMind)、从零训 VLM 投影层、提示注入攻防(3 种攻击 × 4 种防御共 12 组对照实验)、SWE-bench/OSWorld/GAIA 评测复现,甚至 SO-100 机械臂的 Sim2Real 抓取实验都有。

3. 对照实验驱动:用数据说话,不站队

书里到处是消融研究和对照实验:记忆系统用 mem0 和 Memobase 各实现一版对比;检索做稠密/稀疏/混合三版对比;代码辅助用纯思维链和代码执行各做一遍比准确率。作者从不说"某技术最好",而是给出"A 场景下 X 好、B 场景下 Y 好"的 trade-off 数据。讲多 Agent 时甚至直言:大多数场景下多 Agent 并不比单 Agent 好,只是徒增复杂度——这种诚实在 AI 领域相当稀缺。

4. 不依赖框架:直接调 LLM API,拒绝黑盒

所有实验代码直接调用 LLM API 实现核心逻辑,不绑定 LangChain 等重型框架。学习者能看清 ReAct 循环、工具调用、记忆管理的底层实现,理解原理后再选框架,而不是被框架的抽象层困住。

5. 出版管线本身就是工程范本

这本书不只是 Markdown 文件堆:Pandoc + XeLaTeX + ElegantBook 文档类生成专业排版 PDF;自定义 Lua 过滤器(experiment_box.luacrossref.lua)处理实验框和交叉引用;配图用 Python 脚本(gen_*_figs.py)程序化生成 SVG 保证与正文一致;GitHub Actions 每次推送自动重建在线版并更新 Star History。一本书被当成软件产品来持续交付。

6. 九种语言社区翻译 + 在线阅读

社区已贡献英、日、俄、阿拉伯、越南、泰米尔、土耳其、正体中文 8 种翻译(各有独立 book-xx/ 目录),在线阅读站支持多语言切换、章节折叠、全文搜索、实验直达。


技术亮点

1. "Harness 工程"命题:模型之外才是竞争力

全书最核心的工程主张是:**"Model-as-an-Agent"在生产环境远远不够**。裸模型只提供推理能力,真正决定 Agent 可靠性的是模型外围的"马具"(Harness)——约束、验证、记忆、沙箱、回滚。这个视角直接回答了"为什么同样的模型,Claude Code 比自己裸调 API 好用得多",对生产级 Agent 系统设计有直接指导意义。

2. 概念到代码的双向映射

DeepWiki 的架构解析显示,仓库把"Agent = LLM + 上下文 + 工具"公式严格映射到代码实体:LLM 对应第 6/7 章(评估与后训练),上下文对应第 2/3 章(上下文工程与记忆),工具对应第 4/5 章(MCP 与 Coding Agent)。book/ 是正文源码,chapter1-10/ 是可执行项目,cursor-chats/ 甚至公开了用 Cursor AI 辅助开发本仓库的完整对话日志——连"这本书怎么被造出来的"都开源了。

3. 19 个外部仓库的复现基建

第 6/7/9/10 章涉及的评测基准(SWE-bench、OSWorld、GAIA、terminal-bench、tau2-bench)、训练框架(verl、MiniMind、SimpleVLA-RL、tinker-cookbook)、机器人平台(browser-use、斯坦福 AI 小镇 generative_agents)等 19 个外部仓库提供一键克隆脚本,并标注特定 commit 保证复现一致性。这是论文级的可复现性标准。


适用人群

  • 被公司安排"搞 Agent"的后端/全栈工程师:从 0 到生产级系统设计的完整知识地图,前三章就能建立正确心智模型
  • AI 应用开发者:92 个实验覆盖 RAG、记忆、MCP、评估、提示注入攻防等日常刚需场景,可直接改造复用
  • 算法工程师:第 7 章 16 个后训练实验(SFT/RLVR/VLA),含从零训 LLM/VLM 的完整流程
  • 技术管理者/架构师:评估驱动选型、多 Agent 是否值得上等决策类章节用数据给出 trade-off
  • 在校学生与研究者:Apache-2.0 全开源 + 19 个外部基准仓库的复现指南,是入门 Agent 研究的系统教材

快速上手

方式一:直接读书(零门槛)

# 在线阅读(支持全文搜索、多语言切换)
https://bojieli.github.io/ai-agent-book/

# 或下载 PDF / EPUB(始终指向 main 分支最新构建)
https://github.com/bojieli/ai-agent-book/releases

方式二:跑实验

git clone https://github.com/bojieli/ai-agent-book.git
cd ai-agent-book/chapter1   # 每章一个目录,各项目独立 README
# 配置 API Key 后即可运行大部分实验
# 国内可用 Kimi / 智谱 GLM / DeepSeek / SiliconFlow 的 API

方式三:自行编译 PDF

# 需要 pandoc + xelatex + ElegantBook
cd book && bash build_pdf.sh

推荐阅读姿势(作者建议):不要从头读到尾,一边读一边把 demo 跑起来,改参数、改提示词、故意搞破坏看它怎么出错——这才是这本书的正确打开方式。


对比分析

维度
ai-agent-book
Hugging Face Agents Course
LangChain 官方文档
各厂商 Cookbook
体系完整度
10 章从原理到生产,一条主线
课程式,偏入门
围绕自家框架组织
碎片化示例集
正文体量
308 页+,中文原创
在线单元课程
API 文档为主
单篇 notebook
配套代码
93 个项目,70+ 可独立运行
少量 notebook
框架示例
演示级片段
框架依赖
无,直接调 LLM API
smolagents 绑定
LangChain 绑定
绑定自家 API
对照实验
大量消融研究(12 组注入攻防等)
后训练内容
16 个实验(SFT/RLVR/VLA)
基本不涉及
不涉及
不涉及
许可证
Apache-2.0 全开源
Apache-2.0
MIT(文档)
各异
中文友好
中文原版 + 9 语言翻译
英文为主
英文为主
英文为主
热度
⭐24.5K(10 个月)

一句话总结差异:厂商文档教你"怎么用我家的东西",框架文档教你"怎么用框架",而这本书教你"Agent 系统本身应该怎么设计"——供应商中立、原理透明、实验可复现。

也要说清楚局限:中文原版更新快、翻译可能滞后;大量实验需要真实 LLM API Key,初学者有费用门槛;第 6-10 章部分实验依赖外部仓库和 GPU 甚至真实机械臂,不能全部开箱即跑;对 Agent 伦理、合规、商业落地等非技术话题着墨较少。


写在最后

这个项目最有启发的地方有两点。

第一,它验证了"开源一切"依然是最强的传播策略。正文、PDF、配图、代码、甚至写书用的 Cursor 对话日志全部公开,不留任何付费墙——结果是 10 个月 24.5K Star、9 种语言的社区翻译和上百位贡献者。知识产品的护城河不是封闭,而是持续迭代的速度。

第二,"Agent = LLM + 上下文 + 工具"这个公式的价值被严重低估了。它不仅是教学框架,更是工程决策框架:系统出问题时,你可以立刻定位是模型能力不足(换模型/后训练)、上下文缺失(改记忆/检索),还是工具设计不当(改 ACI)。在概念满天飞的 Agent 领域,一个能落地的思维模型比十个新名词都值钱。

如果你今年只打算系统学一次 AI Agent,这本书大概率是当下中文世界的最优解。

项目地址:github.com/bojieli/ai-agent-book

在线阅读:bojieli.github.io/ai-agent-book

DeepWiki:deepwiki.com/bojieli/ai-agent-book