
书名:《Agent Runtime 工程化:从工具调用循环到可恢复执行系统》
作者:陈堂会
章节:第十章 Eval Harness 与 CI 回归 / 10.5 flaky eval
电子版系列:查看完整目录
第十章 Eval Harness 与 CI 回归:10.5 flaky eval
Agent eval 天生有波动。处理 flaky 的方法:
- runtime 单元测试使用 mock model;
- 真实模型 eval 多跑几次取统计;
- 用行为断言代替字面匹配;
- 把'必须不发生'的危险行为单独作为硬门禁;
- 把人工 judge 与程序化断言分开;
- 对不稳定 case 标记 quarantine,但不能永久忽略。
CI 里建议分层:
| 层级 | 运行频率 | 内容 |
|---|---|---|
| unit | 每次提交 | 工具校验、权限、context builder |
| replay | 每次提交 | mock model trace replay |
| smoke | 每日或合并前 | 小规模真实模型 |
| benchmark | 发布前 | 大规模真实任务集 |

