P522分钟
评估
测试证明代码能跑。评估证明 Agent 行为正确。 本课讲评估闭环——由数据集、指标、运行器、迭代构成的封闭循环, 让你能像衡量延迟或测试覆盖率一样严谨地衡量 Agent 质量。
SDK FocusoutputFormathooks.PostToolUseresult.subtypefallbackModelmodel routing
评估 vs 测试
两者都验证正确性,也可能重叠;实用区别在于它们主要优化哪类信号:
| 测试 | 评估 | |
|---|---|---|
| 问题 | 「代码能跑吗?」 | 「Agent 行为对吗?」 |
| 常见真值 | 确定性断言 | Rubric 或统计聚合 |
| 常见输出 | 单用例通过/失败 | 比率、分布与分组 |
| 输入 | Fixture | 近似真实场景的数据集 |
| 失败形态 | 堆栈跟踪 | 行为漂移、子集回归 |
对 file_read_tool 的单元测试证明工具能用。对 Agent 的评估则证明它 选对了工具、用合理的参数调用、出错时能恢复。两者都需要。
评估闭环
可用的评估系统是一个封闭循环,而不是一次性测试套件。每一轮都改进 Agent 或评估本身:
每一步都有自己的门道,下面按顺序逐一过一遍。