Appearance
一次成功的演示不能说明 Agent 已经可靠。评估需要把真实任务变成一组可重复运行、可比较结果的测试样本。
每条任务至少包含:输入、目标、限制、期望产出、验收标准和允许的误差范围。复杂系统还要记录工具调用是否正确、成本、耗时和人工修改量。
把评估结果与运行轨迹放在一起,才能知道应该改模型、上下文、工具还是流程。