Agent Reliability
面向长任务执行、检查点与失败恢复的 Agent 可靠性概念。

可靠性不只是成功率
Agent 在长任务中可能遇到工具失败、状态漂移、上下文丢失或外部依赖变化。一个可用系统需要知道当前执行到了哪里,也需要让失败可以被定位和恢复。
Demo 架构
plan ├─ checkpoint ├─ tool call → evidence ├─ verifier └─ recover / continue / stop 设计问题:当结果看似正确时,系统能否说明它依据了什么;当结果失败时,能否从最小安全位置继续?
未来真实项目应呈现
评测集合、失败分类、恢复策略、成本边界,以及可以由他人重复的验证命令。