生产级 AI Agent 架构通过状态与业务分离、持久化检查点、结构化输出、有限重试、可观察性和人工介入保障长流程可靠执行。
问题域
演示型 Agent 通常只展示模型调用和节点跳转,生产系统还必须处理长时间运行、状态增长、失败恢复、人工修改、输出不合法和重复执行等问题。核心不是把 Graph 画得更复杂,而是让执行过程可以恢复、审计和演进。
关键设计
- 状态与业务分离:Graph 保存路由所需的最小状态,业务逻辑放在可独立测试的 Service 中。
- 外置大对象:长文本、文件和中间产物存入数据库或对象存储,State 只保留稳定引用,避免上下文无限增长。
- 单一职责节点:每个节点负责一个明确动作,模型、规则引擎和实现可以独立替换。
- 检查点与恢复:按线程保存执行状态,使失败重试、断点续跑、人工审核和时间旅行式调试成为基础能力。
- 结构化输出与有限修复:对模型输出执行 Schema 校验、错误分类和有上限的修复循环,超过阈值后进入人工处理或熔断。
- 可观察性与幂等:记录节点输入、输出、耗时、错误和外部副作用;实际发送、支付、发布等动作必须有幂等键和审计证据。
边界与反例
- 能用确定性规则解决的步骤,不应为了“Agent 化”强行调用模型。
- Checkpoint 解决状态恢复,不自动解决业务副作用回滚;外部写操作仍需事务、补偿或人工审批。
- Human-in-the-loop 不是在所有节点加确认框,而是在高风险、不可逆或低置信度节点设置可恢复的中断点。
- 无限 Review/Fix 循环会放大成本并掩盖系统性错误,必须限制次数并记录失败类型。
相关概念与实体
当前结论
Prompt 只能影响一次模型决策,生产可靠性来自运行时对状态、错误、副作用和人工边界的系统性管理。评审 Agent 架构时,应先检查恢复和审计能力,再讨论节点数量或 Prompt 技巧。