Agent Evals:用 Task、Trial 与 Grader 证明版本真的变好
AI Agent 工程进阶第 2 篇:在同一个 Agent Reliability Lab 中建立 20 个任务、重复 Trial、五类确定性 Grader、失败台账和发布门禁,用实际代码比较 baseline-v1 与 candidate-v2,而不是凭感觉判断新版本更聪明。
1 篇相关记录
AI Agent 工程进阶第 2 篇:在同一个 Agent Reliability Lab 中建立 20 个任务、重复 Trial、五类确定性 Grader、失败台账和发布门禁,用实际代码比较 baseline-v1 与 candidate-v2,而不是凭感觉判断新版本更聪明。