持续维护 · v0.18.0
深入浅出 AI Agent
从大模型原理到手写 Coding Agent
从模型、上下文和工具出发,逐步搭建可运行、可验证、可持续改进的 AI Agent 工程体系。
全书已发布 · 18 / 18 章更新于 2026-10-05
开始阅读Roadmap
从模型到完整系统
六个部分,十八章正文均可直接阅读。可从引言开始,也可按需要选择章节。
01
模型是怎样变成 Agent 的
先建立模型、Workflow、Agent 与 Harness 的边界,再进入可执行闭环。
- 第 1 章大模型入门:从 Token 到 Transformer从 Token、自注意力和 Transformer 出发,解释下一步预测如何成为 Agent 的模型基础。已发布
- 第 2 章大模型的训练、对齐与推理拆解预训练、监督微调、偏好优化、推理预算与模型 API 的工程边界。已发布
- 第 3 章AI Agent:从一次生成到闭环执行手写最小 Agent 循环,理解观察、决策、行动与验证如何组成闭环。已发布
- 第 4 章Harness Engineering:模型之外,谁在让 Agent 真正工作拆解提示词、工具、权限、沙箱、状态、审批和可观测性组成的 Agent 运行系统。已发布
02
上下文、记忆与知识
处理 Agent 看见什么、记住什么,以及如何获得可更新的外部知识。
- 第 5 章上下文工程:Agent 真正看到的世界把消息、文件、工具描述、权限和预算装配成可消费、可解释的上下文。已发布
- 第 6 章长任务中的上下文架构用压缩、Artifact、Checkpoint 与 Rehydration 维持长任务的连续性和可恢复性。已发布
- 第 7 章记忆:不是把聊天记录全部塞回去从完整历史的失败出发,实现带 Write Gate、Namespace、版本修正、Tombstone 和可解释 Recall 的记忆模块。已发布
- 第 8 章RAG 与知识库:让 Agent 先查证,再回答以 18 篇受版本、权限和时效约束的知识文档,完成切块、混合召回、重排、证据、引用、拒答和分层评估。已发布
03
工具、MCP 与 Coding Agent
从单次工具调用走向大规模工具系统,并手写一个 Coding Agent。
- 第 9 章工具调用与 MCP:从‘模型想做’到‘系统真的做了’从三份调用合同、输入输出门禁与写操作回执出发,实现确定性 Tool Loop,并用官方 SDK 映射 MCP 的 Tool、Resource 与 Prompt。已发布
- 第 10 章大规模工具集与异步任务从大规模工具发现、按需加载与有限并发出发,建立可恢复的持久异步作业、租约、取消、超时与幂等边界。已发布
- 第 11 章Coding Agent:代码库就是它的环境从一次文档链接修复出发,拆解 Coding Agent 的仓库调查、补丁、验证、项目指令与会话恢复边界。已发布
- 第 12 章手写一个 Mini Coding Agent从确定性 Replay 和最小 Loop 开始,实现工具合同、补丁、审批、恢复、上下文控制、Verifier 与框架适配。已发布
04
评估、可观测与模型选择
用任务、轨迹、评分和生产诊断判断 Agent 是否真正可用。
- 第 13 章Agent 评估:答案正确还不够建立可复现任务集,用 Outcome、Trajectory、多评分器、重复试验与三态门禁同时衡量结果、过程、安全和效率。已发布
- 第 14 章Benchmark、Tracing 与生产诊断从可比 Benchmark、Trace 数据模型、分位数与采样出发,用切片、反证和消融定位生产退化。已发布
05
训练、反馈与持续进化
明确何时需要后训练,并把真实失败转化为持续改进资产。
- 第 15 章Agent 的后训练:什么时候 Prompt 已经不够从故障归因与干预路由出发,审计轨迹数据,通过有限动作 SFT、DPO 与奖励投机实验理解后训练的适用条件。已发布
- 第 16 章从失败中学习:持续改进系统把失败转成可回放样本,比较规则、Skill、记忆和训练数据的干预边界,用新验证约束发布与回滚。已发布
06
多模态、多 Agent 与生产系统
扩展到图像、语音、实时交互、多 Agent 协作和完整生产系统。
- 第 17 章多模态与实时 Agent用图像、文档、语音与屏幕的离线固定案例理解媒体证据、实时事件、取消和安全执行边界。已发布
- 第 18 章Multi-Agent 与最终系统:不是 Agent 越多越好以知识问答和仓库修复双路径,理解委派、子树预算、证据交接、单写者和最终验收如何组成有界协作系统。已发布
A
附录
正文之外的环境准备与参考资料,不计入十八章。
- 附录 APython、TypeScript 与模型 API 快速准备从解释器、独立环境和离线练习开始,辨清 TypeScript 运行与类型检查,再理解模型 API 的请求、返回与密钥边界。已发布
