AI Agent恢复必须带着证据
今天九条变化把同一问题推到台前:Agent要真正可用,恢复、授权、证据和执行环境必须一起成立。
RISC机器说明
RISC = 生产级 Agent / 机器人身体的四个系统
一个真正能上生产的 Agent,不能只有大脑。它还要持续行动、扛住故障、抵御越权,并进入真实组织协作。
AI Agent雷达
可继续执行之前,系统要先证明状态和事件没有分叉
Cline 用 drain 与事件去重守住 Hub 重启,Ollama 保存可信预填充点,Qwen Code 则补上模型选择与事故回放。
环境变量、MCP token 和自动审批都进入访问控制面
Deep Agents 阻断 dotenv 注入,Agno 强制工作区排除规则,LiteLLM 再把网关 token 绑定到具体资源。
统一训练接口、源码证据与分布式调度决定能否复查
CUA-Lite 统一操作 Agent 的轨迹与环境,源码精读 Skill 绑定版本和行号,Ray 则把隔离、缓存路由和硬件调度放进底座。
值得关注的新功能
Cline CLI 让 Hub 升级先排空任务再恢复会话
发生了什么:Cline CLI 3.0.57 新增 hub drain 与 upgrade:先停止接收新的变更任务,等在途工作结束后再重启;客户端重连时按事件 ID 补放断线期间的事件并去重,同时修复自定义 OpenAI 兼容模型被错误关闭工具调用的问题。
为什么值得关注:安全升级不只是重启服务,还要明确何时停止接单、怎样收尾在途工作,以及重连后如何避免漏事件或重复执行。
适合谁看:维护长驻编程 Agent、共享 Hub 与自定义模型网关的团队。
Qwen Code 新增事件回放审查与修复测试见证
发生了什么:Qwen Code 8 月 23 日 nightly 在 0.22 稳定版之后加入 temporal-reachability 与 incident-replay 两种审查视角,要求每项修复说明对应测试并裁决不收敛;守护进程会话恢复上次选择的模型,Goal 也开始记录 token 消耗。
为什么值得关注:代码审查开始从静态挑错走向事件路径、复现证据和修复验证,恢复会话时连模型选择与成本状态也要一起回来。
适合谁看:使用 Qwen Code、自动评审、后台会话或成本治理的开发团队。
Ollama 让被取消的长预填充从可信缓存点续跑
发生了什么:Ollama 0.33 rc2 为 Claude Desktop 增加模型开关和应用集成视图,并重做预填充恢复:长预填充被取消后保留已越过的恢复点,重试可从中途继续;系统也不再记录覆盖范围不实的恢复点,避免接近完成的请求从零重算。
为什么值得关注:本地长上下文推理的体验不只取决于速度;取消、重试和缓存证据是否一致,直接决定时间、能耗与交互连续性。
适合谁看:运行本地模型、Claude Desktop、长上下文与 MLX 工作负载的用户。
LiteLLM 1.98 把 MCP 资源绑定与长流存活写进网关
发生了什么:LiteLLM 1.98 为 MCP 客户端请求增加读取超时,并让 Gateway bearer token 绑定 RFC 8707 resource;同时加入 SSE 心跳、每部署失败策略、虚拟路由模型,以及 session_id 与 trace_id 日志关联,镜像提供 Cosign 签名。
为什么值得关注:模型网关正在承担 Agent 连接层职责:令牌要绑定资源,长流要能存活,故障与费用也要落回具体部署和会话。
适合谁看:管理模型路由、MCP 网关、长流请求、审计与成本的团队。
GitHub开源发现
Deep Agents Code 同时收紧环境变量与自动审批边界
发生了什么:Deep Agents Code 0.1.60 新增可编辑 trace 元数据、命令高亮和统一通知中心,并允许配置项目 .env 加载;安全修复会阻止 dotenv 注入 Git 配置键,Auto 审批模式则可以跨会话保持,同时修正进行中 trace 消息识别。
为什么值得关注:开发 Agent 的配置、审批与追踪不是三个孤立开关;一旦跨会话保存,它们就共同决定下一次启动能读什么、做什么。
适合谁看:使用 Deep Agents、项目级环境变量、自动审批和追踪系统的开发者。
Agno 3.0 alpha 把工作区排除规则变成访问边界
发生了什么:Agno 3.0.0a4 让 SQLite 默认使用 WAL 日志模式,并把此前未真正运行的数据库测试门禁纳入 CI;Workspace exclude_patterns 现在会被强制执行为访问边界,同时新增 MiniMax 视频生成工具,并将遥测调用改为异步触发。
为什么值得关注:Agent 框架进入大版本前,最有价值的变化往往不是新工具,而是数据库门禁真的运行、排除规则真的阻止访问。
适合谁看:评估 Agno 3.0、工作区隔离、SQLite 持久化与多媒体工具的团队。
CUA-Lite 统一桌面、浏览器与手机 Agent 的训练和评测
发生了什么:新开源的 CUA-Lite 用一套 schema、接口和命令统一桌面、浏览器与移动端 Computer-Use Agent,内置 10 多种 Agent、30,000 多个可验证任务,并把 SFT 数据、基准评测、沙箱与强化学习环境接进同一框架。
为什么值得关注:计算机操作 Agent 长期缺少可交换的轨迹与环境接口;统一格式能减少每换模型、设备或基准就重写适配层的成本。
适合谁看:训练、评测或部署桌面、网页和移动端操作 Agent 的团队。
一个中文 Skill 要求每条源码判断都能跳回具体行
发生了什么:新项目 source-reading-methodology 将大型仓库精读拆成语料准备、大纲、章节书稿和成书四阶段,要求先锁 commit,再为代码论断记录真实文件与行号,并在批量写作前建立逐字节校验器;它可安装到 Cursor、Claude Code 或通用 Skills 目录。
为什么值得关注:这把“让 AI 读源码”从一次聊天变成可复查的出版流程:模型的解释必须绑定版本、路径、行号和机器校验。
适合谁看:做源码研究、技术课程、代码审计、文档出版或 Agent Skills 的读者。
全球技术与市场观察
Ray 2.58 把缓存感知路由、gVisor 沙箱与 TPU 调度放进同一底座
发生了什么:Ray 2.58 完成 KV cache 与 token 感知请求路由:入口进程完成分词并广播缓存生命周期,CPU 卸载块也计入命中;同时新增实验性 gVisor Ray Sandbox、TPU 子切片群调度,并将任务事件移出 GCS 热路径。
为什么值得关注:分布式 AI 底座正把推理效率、隔离、硬件调度和观测解耦同时推进,避免所有压力都集中到单一控制面。
适合谁看:运行分布式推理、Ray Serve、TPU 集群、沙箱任务和观测平台的团队。
来源
- Cline CLI:Cline CLI 让 Hub 升级先排空任务再恢复会话 官方发布
- Qwen Code:Qwen Code 新增事件回放审查与修复测试见证 官方预发布
- Ollama:Ollama 让被取消的长预填充从可信缓存点续跑 官方预发布
- LiteLLM:LiteLLM 1.98 把 MCP 资源绑定与长流存活写进网关 官方发布
- Deep Agents Code:Deep Agents Code 同时收紧环境变量与自动审批边界 官方发布
- Agno:Agno 3.0 alpha 把工作区排除规则变成访问边界 官方 Alpha 发布
- CUA-Lite:CUA-Lite 统一桌面、浏览器与手机 Agent 的训练和评测 官方新仓库
- 源码精读方法论 Skill:一个中文 Skill 要求每条源码判断都能跳回具体行 官方新仓库
- Ray:Ray 2.58 把缓存感知路由、gVisor 沙箱与 TPU 调度放进同一底座 官方发布
