电子版系列:查看完整目录

Agent Runtime 工程化:从工具调用循环到可恢复执行系统
作者:陈堂会
版权说明
本书为 Agent Runtime 工程化学习与实践读本。书中对开源项目、协议和 SDK 的描述基于截至 2026 年 8 月 12 日可公开访问的官方文档、项目仓库与论文资料。技术生态更新很快,读者在落地生产系统前,应以目标项目和供应商的最新文档为准。
电子版发布地址:https://zeeklog.com
献词
献给那些已经发现'会调用模型'还远远不够的工程师。困难常常不在第一轮回答里,而在第十七轮工具调用之后,在一次中断之后,在一次误删风险之前,在一条 trace 终于把问题说清楚的时候。
前言:为什么要写这本书
过去几年,许多人第一次接触 Agent,是从一个漂亮的演示开始的:输入一句话,模型调用工具,查资料、写代码、跑命令、修改文件,像一个耐心的同事。但工程世界很快会把浪漫磨成问题清单:它为什么重复调用同一个工具?为什么读错文件?为什么一次超时后无法恢复?为什么上下文越跑越乱?为什么工具明明失败了,模型却继续编故事?为什么评测里通过,真实用户一来就翻车?
这些问题靠 prompt 很难补好。它们属于 Runtime。
我更愿意把 Agent Runtime 看成一组工程责任:承接用户意图,组织模型上下文,暴露工具能力,校验工具参数,执行或拒绝危险动作,记录每一步轨迹,保存可恢复状态,处理取消、重试、超时、成本、并发和回归评测。模型会生成下一步;Runtime 决定这一步能不能被安全、稳定、可审计地执行。
本书的目标很明确:帮助读者从'会写 Agent Demo'走到'能设计和二开 Agent Runtime'。读完并完成练习后,你应当能独立实现一个 TypeScript/Node.js 版 mini runtime,并能读懂 Cline、Continue、aider、OpenHands、Codex CLI、LangGraph 这类项目中的运行机制。你也会知道一个 Agent 为什么会卡死、越权、爆 token、丢状态、难以复现,以及怎样把这些风险逐一收束进工程系统。
全书分为四个阶段:
第一阶段是入门。我们先澄清 Agent、Workflow、Tool、Runtime 的边界,再补齐 Node runtime 基础,最后写出最小 Agent Loop。
第二阶段是进阶。我们把工具系统、上下文工程、MCP 和 Provider 抽象接入进来,让 mini-agent 从'能跑'变成'可扩展'。
第三阶段是工程化。我们处理权限、安全、checkpoint、resume、rollback、trace、eval、成本治理和 CI 回归,让它从'可用'走向'可靠'。
第四阶段是精通。我们用统一模板研读主流开源 coding agent,最后完成一个毕业项目:Eval Harness、Context Budget Allocator、MCP 权限层或 Checkpoint/Rollback。
这不是一本只给读者看热闹的书。每章都有能力目标、工程落点和验收标准。你不必在第一天就写出一个完整产品,但你应该在每一章之后都能回答一个更接近生产的问题。
阅读方式
建议按顺序读。Agent Runtime 的知识不是平铺的,它像一个环:工具调用影响上下文,上下文影响模型决策,模型决策触发权限审批,工具执行产生状态变化,状态变化要求 checkpoint,失败又要求 trace 和 eval。跳读当然可以;要把能力练出来,最好沿着这条环走一遍。
书中的代码以 TypeScript/Node.js 为主。原因很务实:今天许多 coding agent、IDE extension、CLI 工具、MCP SDK 与前端工具链都天然靠近 TypeScript 生态。Python、Rust、Go 同样适合写 runtime,但本书需要一条足够统一的主线。


