AI Agent可靠性成为生产门槛
今天最值得追踪的不是又多了几个 Agent 功能,而是失败分类、资源预算、幂等回执、恢复历史和副作用控制开始进入正式产品合同。
RISC 机器说明
RISC = 生产级 Agent / 机器人身体的四个系统
一个真正能上生产的 Agent,不能只有大脑。它还要持续行动、扛住故障、抵御越权,并进入真实组织协作。
ALUX 今日雷达
把委派回执与恢复状态做成统一协议
Temporal 的去重与完成回调、LangGraph 的历史重建和 Deep Agents 的副作用防重,为 ALUX 统一委派、恢复与效果收据提供了直接对照。
恢复路径也可能重新触发副作用
checkpoint 完整不代表外部效果安全;若 post-tool 事件、下载资源与取消语义没有幂等和预算边界,恢复会放大错误。
Delegation Receipt & Idempotency Schema v0
建议字段:request_id、operation_token、capability_scope、resource_budget、cancel_policy、checkpoint_ref、effect_cursor、completion_receipt。
重点信号
Temporal 1.22 让 Nexus 委派带上去重标识与完成回执
发生了什么:Temporal TypeScript SDK 1.22 为 UpdateWorkflow-backed Nexus operation 加入 request ID 去重、请求链接、操作令牌和完成回调,并明确取消处理仍需应用自定义。
对 ALUX 的关系:这接近跨服务长交易最需要的责任字段:谁发起、如何去重、如何回传完成;但它仍运行在 Temporal 体系内,不是跨公司的中立能力网络。
可行动建议与产出物:建议形成委派去重与完成回执 schema,将请求链接、能力范围、取消处理和最终结果绑定。可沉淀为:Delegation Receipt & Idempotency Schema v0。
主要动到机器人的强韧/机体:跨工作流请求可以去重并可靠回传完成;连接/社会是辅层,因为 Nexus 把调用交接到另一服务边界。
Pydantic AI 用 50 MiB 默认上限封住远程内容内存耗尽
发生了什么:Pydantic AI 修复 web_fetch 与 FileUrl 下载未设上限导致进程内存耗尽的可用性漏洞;1.107.2 与 2.24.0 起默认限制远程响应体为 50 MiB。
对 ALUX 的关系:这是 Agent 工具面安全与机体可用性的直接信号:外部内容不仅可能注入提示,也能通过资源消耗拖垮 worker。
可行动建议与产出物:建议沉淀工具资源预算清单,将下载字节、解压比、超时和内存上限绑定到能力对象。可沉淀为:Capability Resource Budget Checklist v0。
主要动到机器人的安全/免疫:远程内容入口必须阻断资源耗尽;强韧/机体是辅层,因为修复直接避免 worker 崩溃。
Gemini CLI caretaker 把问题分诊、评测与人工接管串成闭环
发生了什么:Gemini CLI nightly 为 caretaker 加入 Cloud Run 分诊作业、judge runner、golden issue 集合、可重分诊工作流,并在 NEEDS_HUMAN 转移时清锁;容量耗尽被重新分类为终止错误。
对 ALUX 的关系:这展示了面向真实软件维护的 Agent loop 正在把评测、锁、失败分类和人工接管并入同一生产流程。
可行动建议与产出物:建议整理生产型 Agent 状态机,把可重试、终止、需人工和锁释放条件写成显式枚举。可沉淀为:Agent Failure & Handoff State Machine v0。
主要动到机器人的强韧/机体:失败分类、锁释放和人工接管决定流程能否收敛;智能/大脑通过分诊评测与 judge runner 提供辅层。
Claude Code 2.1.225 把预算上限、工作区信任与消息过期前移
发生了什么:Claude Code 增加网关 spend-limit 告警与未信任目录提示,修复 headless 会话消息无通知、无过期、OAuth 短令牌替换和自托管 runner 启动校验等问题。
对 ALUX 的关系:生产 Agent 的安全不再只是是否允许工具调用,也包括预算、目录信任、凭据寿命和跨会话消息到期。
可行动建议与产出物:建议形成会话启动前置条件表,统一预算、目录信任、凭据状态和消息 TTL。可沉淀为:Session Admission Policy Matrix v0。
主要动到机器人的安全/免疫:预算、信任与凭据状态决定能否安全启动;连接/社会是辅层,因为跨会话消息开始需要过期与通知。
Kimi Code 0.33 将 Computer Use 与 WebBridge 纳入官方插件入口
发生了什么:Kimi Code 0.33 把 Computer Use 和 WebBridge 作为 v2 CLI 内置 marketplace 项,并默认切换到 agent-core-v2;安装流程可报告未完成步骤并重试,启动时新增目录信任确认。
对 ALUX 的关系:中国 Agent 产品正在把浏览器与计算机操作从外接技巧升级为官方能力入口,插件安装、运行时版本和目录信任随之成为产品合同。
可行动建议与产出物:建议形成能力市场条目 schema,明确运行时版本、安装状态、权限范围、信任域和撤销入口。可沉淀为:Capability Marketplace Entry Schema v0。
主要动到机器人的连接/社会:Computer Use 与 WebBridge 进入官方能力市场;安全/免疫是辅层,因为目录信任和安装权限决定能力能否被安全接入。
LangGraph Checkpoint 4.2 修复增量历史写入并支持跳过过期状态
发生了什么:LangGraph Checkpoint 4.2 修复 delta channel history 从普通值 seed 回溯时的写入收集,并在 Postgres checkpointer 增加可选 omit_expired 读取策略。
对 ALUX 的关系:生产 Agent 的恢复质量取决于历史增量能否完整重建,也取决于过期状态是否仍进入恢复路径。
可行动建议与产出物:建议补一组增量状态重建测试,覆盖普通 seed、过期状态、重复写入和恢复后外部效果。可沉淀为:Replay State Reconstruction Test Set v0。
主要动到机器人的强韧/机体:增量历史正确性与过期状态策略直接决定恢复是否可信。
Phoenix Evals 3.4 新增幻觉评估器
发生了什么:Arize Phoenix Evals 3.4 增加 hallucination evaluator,为生成内容是否脱离依据提供专门评测组件。
对 ALUX 的关系:行业继续补强大脑质量判断,但单一评估器不能替代运行时责任链;ALUX 产品层需要把评测结果与输入、模型、工具证据和执行版本绑定。
可行动建议与产出物:建议形成评测证据封套,将 evaluator 版本、阈值、依据集合和被评运行绑定。可沉淀为:Evaluation Evidence Envelope v0。
主要动到机器人的智能/大脑:新增评估器判断生成内容是否偏离依据;安全/免疫是辅层,因为结果可用于风险门禁,但来源未证明强制策略。
Deep Agents Code 0.1.54 阻止工具后置钩子被重复回放
发生了什么:Deep Agents Code 0.1.54 修复 post-tool hook replay,同时改善恢复线程启动提示和更新日志落位。
对 ALUX 的关系:工具效果后的钩子若重复执行,可能造成通知、写入或后处理副作用二次发生;这是 Agent 恢复路径中常被忽略的幂等风险。
可行动建议与产出物:建议增加工具后置事件回放测试,区分纯计算钩子与有副作用钩子。可沉淀为:Post-Tool Effect Replay Test v0。
主要动到机器人的强韧/机体:恢复或重放时必须避免工具后置副作用重复发生;安全/免疫是辅层,因为重复效果也会越过原审批边界。
融资 / 合作窗口
技术 / 产品启发
风险边界
ALUX 仍不能被描述为已经完整交付的智能体平台。底层 TVM 已具备原生并发、持久执行、能力安全、运行记录与逐比特重放审计等关键基础;智能体产品层、可观测性、仪表盘、追踪和评估工具仍待构建与融资。TVM 不会让 LLM 本身确定性;它记录模型输出与环境输入,使编排、权限、状态转移和审计可重放、可验证。Nexus request ID、50 MiB 下载上限、caretaker 状态机、checkpoint 历史、幻觉评估器和 post-tool 防重,都不能单独证明跨步骤原子回滚、不可伪造能力、完整效果幂等或中立跨公司协作。
来源
- temporalio/sdk-typescript:Temporal 1.22 让 Nexus 委派带上去重标识与完成回执 官方发布
- pydantic/pydantic-ai:Pydantic AI 用 50 MiB 默认上限封住远程内容内存耗尽 官方发布
- google-gemini/gemini-cli:Gemini CLI caretaker 把问题分诊、评测与人工接管串成闭环 官方发布
- anthropics/claude-code:Claude Code 2.1.225 把预算上限、工作区信任与消息过期前移 官方发布
- MoonshotAI/kimi-code:Kimi Code 0.33 将 Computer Use 与 WebBridge 纳入官方插件入口 官方发布
- langchain-ai/langgraph:LangGraph Checkpoint 4.2 修复增量历史写入并支持跳过过期状态 官方发布
- Arize-ai/phoenix:Phoenix Evals 3.4 新增幻觉评估器 官方发布
- langchain-ai/deepagents:Deep Agents Code 0.1.54 阻止工具后置钩子被重复回放 官方发布
