跳至正文
东倒西歪玩AI
东倒西歪玩AI
  • 首页
  • 首页
关

搜索

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
Book

《深入理解 AI Agent》全书开源:不只给 PDF,还把实验代码一起放出来了

作者 ddxw
2026年7月19日 1 分钟阅读
0

https://github.com/bojieli/ai-agent-book

最近看到李博杰的新书《深入理解 AI Agent:设计原理与工程实践》开源了。

这里的“开源”不是只放一份试读章节。仓库里有中文全书正文、编译好的 PDF、配图和十章配套代码,还提供了英文和泰米尔语社区翻译版。想读书可以直接下载 PDF,想改内容可以看 Markdown,想动手则可以进入各章的项目目录。

这本书用一个很简单的公式概括 Agent:

Agent = LLM + 上下文 + 工具

公式很简单,但真正做过 Agent 就会发现,麻烦几乎都藏在后面两项。

模型只是大脑。上下文决定它此刻知道什么、记得什么,工具决定它能不能搜索、读文件、执行代码、操作浏览器和调用外部系统。模型越来越强以后,Agent 之间真正拉开差距的,往往不只是模型名字,而是围绕模型搭建的那套工程系统,也就是书里反复提到的 Harness。

它不是一本只讲概念的书

我觉得这个仓库最有价值的地方,是书和代码基本按章节对应。

前几章从 Agent 基础、上下文工程、用户记忆和知识库开始。这里可以看到上下文消融、KV Cache、上下文压缩、提示工程、提示注入、Agent Skills、用户记忆、稠密与稀疏检索、GraphRAG 和 Agentic RAG 等实验。

继续往后,则进入工具和 Coding Agent。仓库提供了感知、执行和协作三类 MCP 工具,也有事件驱动的异步 Agent,以及一个用纯 Python 实现的 Coding Agent。再往后还有 Agent 评估、模型后训练、自我进化、实时语音、Computer Use 和多 Agent 协作。

这些内容覆盖得很广,但不是简单地罗列名词。很多项目特意安排了对照实验,例如有无上下文、不同压缩策略、纯自然语言推理和代码辅助推理、单 Agent 和多 Agent、级联语音和端到端语音。亲手跑一遍以后,比只看一张架构图更容易理解差别到底在哪里。

小模型也能通过工具做大事

书里有一个我很认同的思路:不要只盯着模型参数。

第二章的本地模型项目演示了 0.6B 小模型的部署和工具调用。它当然不会突然变成顶级大模型,但如果把业务规则写进代码,把计算交给解释器,把事实交给检索工具,小模型也能完成一些原本做不好的任务。

这背后的思路是,把模型不擅长的工作交给确定性系统。需要精确计算就运行代码,需要查事实就检索,需要执行政策就让工具做校验,而不是把所有压力都塞进一段越来越长的提示词。

对普通开发者来说,这可能比“再换一个更贵的模型”更有参考价值。

所谓 28 个可跑项目,需要稍微解释一下

网上介绍这套书时,经常会提到“28 个真实可跑项目”。从仓库当前内容看,项目数量实际上已经更多,覆盖十个章节。

不过,README 也很诚实地把项目分成了三类:

  • 可独立运行:仓库自带完整代码,配置好 API Key 后可以运行;
  • 复现指南:需要另外克隆评测基准、训练框架或机器人项目;
  • 设计文档:主要提供架构和实现方案,代码还在继续完善。

所以不能把它理解成“克隆以后,所有项目一键全部跑通”。第六章的一些评测基准、第七章的训练实验,以及涉及浏览器、机器人和外部平台的项目,都需要额外环境。有些训练项目还需要 GPU。

但这并不影响它的价值。相反,把哪些项目能直接运行、哪些需要外部仓库、哪些依赖真实硬件写清楚,比包装成“零基础一键运行”靠谱得多。

适合怎么学

如果只是想了解 Agent,我觉得没必要从第一页一路读到最后一页,也不用一上来挑战强化学习和多 Agent。

可以先抓住三个部分:

  1. 第一章的上下文消融,看看缺少不同信息时 Agent 会发生什么;
  2. 第二章的 KV Cache、上下文压缩和本地小模型,理解成本、速度与能力之间的关系;
  3. 第四、第五章的工具和 Coding Agent,看看 Agent 怎样真正对外部世界产生作用。

把这几部分跑明白以后,再根据兴趣选择记忆与 RAG、自我进化、实时语音或多 Agent 协作。

这套内容的优点不是保证每个项目都适合生产环境,而是给出了一条从原理到代码的路径。遇到一个概念,可以直接找到对应章节和实验,而不是看完以后仍然不知道从哪里开始写。

免费,但不是完全没有成本

全书正文、PDF 和仓库代码采用 Apache License 2.0 开源。不过运行实验仍可能产生模型 API 费用,部分项目需要安装额外依赖、克隆外部仓库,训练类实验还可能需要 GPU。各子项目如果有单独许可证,也要以子项目说明为准。

即便如此,一本完整中文书加上这么多配套代码同时开放,还是很少见。想系统理解 AI Agent,又不满足于只会调用一次聊天接口的人,这个仓库值得收藏。

至少可以先把 PDF 下载下来,再挑一个最感兴趣的实验亲手跑一遍。很多所谓 Agent 的“工程竞争力”,只有代码真正运行起来以后才能看见。

作者

ddxw

关注我
其他文章
上一个

Voicebox:让 Codex 用你的声音汇报结果

下一个

Things 接上 MCP 很方便,但第三方服务真的安全吗?

暂无评论!成为第一个。

发表回复 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Copyright 2026 — 东倒西歪玩AI. All rights reserved. Blogsy WordPress Theme