Skip to content

05 / 评估与可观测性

一次成功的演示不能说明 Agent 已经可靠。评估需要把真实任务变成一组可重复运行、可比较结果的测试样本。

一个最小评估集

每条任务至少包含:输入、目标、限制、期望产出、验收标准和允许的误差范围。复杂系统还要记录工具调用是否正确、成本、耗时和人工修改量。

建议观察的信号

信号用来判断什么
任务完成率是否完成了目标
验收通过率结果是否达到标准
工具错误率接口、参数或权限是否有问题
人工修订量结果离可交付还有多远
成本与耗时是否值得在当前场景使用

把评估结果与运行轨迹放在一起,才能知道应该改模型、上下文、工具还是流程。