Harness Engineering:模型、工具与运行状态怎么组织
AI Agent 工程进阶第 4 篇:区分 Agent loop、Harness、RunState、对话 Session、Sandbox 与 Verifier,并在同一个 GitHub 工程中实现可替换模型接口、审批暂停与恢复、工具超时、步数上限、检查点和事件追踪。
5 篇相关记录
AI Agent 工程进阶第 4 篇:区分 Agent loop、Harness、RunState、对话 Session、Sandbox 与 Verifier,并在同一个 GitHub 工程中实现可替换模型接口、审批暂停与恢复、工具超时、步数上限、检查点和事件追踪。
AI Agent 工程进阶第 5 篇:从名称、描述和 JSON Schema 讲到权限、审批、预演、幂等、结构化错误、分页与工具加载,并在同一个 GitHub 工程中用 11 个边界案例比较宽工具和类型化 Tool Registry。
AI Agent 工程进阶第 3 篇:区分 Prompt、当前上下文、Session 与 Memory,设计带来源、新鲜度、权限、预算和缺失证据的 Context Packet,并用可运行实验比较“全部塞入”与受控组装。
AI Agent 工程进阶第 2 篇:在同一个 Agent Reliability Lab 中建立 20 个任务、重复 Trial、五类确定性 Grader、失败台账和发布门禁,用实际代码比较 baseline-v1 与 candidate-v2,而不是凭感觉判断新版本更聪明。
AI Agent 工程进阶第 1 篇:用一个可运行的知识库工程,把模糊的 Agent 需求拆成 Job、Input、Done、Boundary、Failure、Evidence 与 Baseline,并通过坏契约和阈值实验验证它是否真的需要 Agent。