
书名:《Agent Runtime 工程化:从工具调用循环到可恢复执行系统》
作者:陈堂会
章节:第十章 Eval Harness 与 CI 回归 / 10.6 prompt A/B 与 runtime 策略对比
电子版系列:查看完整目录
第十章 Eval Harness 与 CI 回归:10.6 prompt A/B 与 runtime 策略对比
Eval 不只是测模型,也测 runtime 策略。例如:
maxSteps=10vsmaxSteps=20;- 工具描述短版 vs 长版;
- 旧历史保留 4 轮 vs 8 轮;
- 搜索结果返回 20 条 vs 50 条;
- 写入前是否强制计划;
- 工具失败后是否允许自动重试。
每次对比只改一个关键变量。否则你不知道提升来自哪里。
系列导航
前 5 篇
- 第十章 Eval Harness 与 CI 回归:10.5 flaky eval
- 第十章 Eval Harness 与 CI 回归:10.4 指标:不要只看成功率
- 第十章 Eval Harness 与 CI 回归:10.3 replay:让 trace 进入测试
- 第十章 Eval Harness 与 CI 回归:10.2 deterministic mock model
- 第十章 Eval Harness 与 CI 回归:10.1 golden task

