P522分钟

评估

测试证明代码能跑。评估证明 Agent 行为正确。 本课讲评估闭环——由数据集、指标、运行器、迭代构成的封闭循环, 让你能像衡量延迟或测试覆盖率一样严谨地衡量 Agent 质量。

SDK FocusoutputFormathooks.PostToolUseresult.subtypefallbackModelmodel routing

评估 vs 测试

两者都验证正确性,也可能重叠;实用区别在于它们主要优化哪类信号:

测试评估
问题「代码能跑吗?」「Agent 行为对吗?」
常见真值确定性断言Rubric 或统计聚合
常见输出单用例通过/失败比率、分布与分组
输入Fixture近似真实场景的数据集
失败形态堆栈跟踪行为漂移、子集回归

file_read_tool 的单元测试证明工具能用。对 Agent 的评估则证明它 选对了工具用合理的参数调用出错时能恢复。两者都需要。

评估闭环

可用的评估系统是一个封闭循环,而不是一次性测试套件。每一轮都改进 Agent 或评估本身:

评估闭环:数据集、运行器、指标、分析、迭代评估闭环loop1. 数据集2. 运行器3. 指标4. 分析5. 迭代

每一步都有自己的门道,下面按顺序逐一过一遍。

高级课程预览

继续阅读完整内容

这节课会保留在当前 URL 下供预览。完整访问权限会解锁正文、闪卡和相关练习

登录后解锁

一次购买,解锁进阶课程、实战练习以及后续更新