Agent Production Loop:运行、发布与持续改进
AI Agent 工程进阶第 11 篇:用 Observe、Protect、Improve 串起生产信号、降级策略、Canary 发布与事故回归评估,并通过零依赖 Production Loop Lab 验证 9 个运行窗口。
4 篇相关记录
AI Agent 工程进阶第 11 篇:用 Observe、Protect、Improve 串起生产信号、降级策略、Canary 发布与事故回归评估,并通过零依赖 Production Loop Lab 验证 9 个运行窗口。
AI Agent 工程进阶第 3 篇:区分 Prompt、当前上下文、Session 与 Memory,设计带来源、新鲜度、权限、预算和缺失证据的 Context Packet,并用可运行实验比较“全部塞入”与受控组装。
AI Agent 工程进阶第 2 篇:在同一个 Agent Reliability Lab 中建立 20 个任务、重复 Trial、五类确定性 Grader、失败台账和发布门禁,用实际代码比较 baseline-v1 与 candidate-v2,而不是凭感觉判断新版本更聪明。
Codex 系列第 12 篇:从一个已经能用的 SKILL.md 出发,按真实维护压力逐步加入 references、scripts、evals 和版本记录,并分清目录、脚本、Agent 行为与人工验收各自能证明什么。