Agent Evals:用 Task、Trial 与 Grader 证明版本真的变好
AI Agent 工程进阶第 2 篇:在同一个 Agent Reliability Lab 中建立 20 个任务、重复 Trial、五类确定性 Grader、失败台账和发布门禁,用实际代码比较 baseline-v1 与 candidate-v2,而不是凭感觉判断新版本更聪明。
2 篇相关记录
AI Agent 工程进阶第 2 篇:在同一个 Agent Reliability Lab 中建立 20 个任务、重复 Trial、五类确定性 Grader、失败台账和发布门禁,用实际代码比较 baseline-v1 与 candidate-v2,而不是凭感觉判断新版本更聪明。
AI Agent 工程进阶第 1 篇:用一个可运行的知识库工程,把模糊的 Agent 需求拆成 Job、Input、Done、Boundary、Failure、Evidence 与 Baseline,并通过坏契约和阈值实验验证它是否真的需要 Agent。