AI Agent可靠性来到用户面前
今天的八条变化都在追问同一件事:Agent如何更稳地等待、恢复、安装、升级和操作真实界面。
RISC机器说明
RISC = 生产级 Agent / 机器人身体的四个系统
一个真正能上生产的 Agent,不能只有大脑。它还要持续行动、扛住故障、抵御越权,并进入真实组织协作。
AI Agent雷达
恢复点正在同时绑定输入、审批与缓存
Microsoft 保留检查点与审批状态,Kimi 先读后写,Ollama 则让取消后的前缀缓存继续可用。
Skill来源和 SDK 版本都会改变运行结果
OpenHands 给脚本包补模板来源,Pydantic AI 修复宽松依赖断裂,Claude Code 还提供 SDK 升级 Skill。
同一模型的表现越来越取决于它拿到什么操作面
ComponentBench 量化观察与动作空间差距,Microsoft 的 A2UI 和 E2B 的重试边界则在重塑这个操作面。
值得关注的新功能
Claude Code 把美国本地推理的 10% 溢价写进成本面板
发生了什么:Claude Code 2.1.239 让 /cost、状态栏和预算上限计入美国境内推理的 1.1 倍数据驻留溢价;同版还修复 Bedrock 流经丢失 Content-Type 的代理时,每轮被非流式重跑而悄悄产生双倍 API 调用的问题。
为什么值得关注:数据驻留第一次以清晰的 10% 价格出现在开发者日常界面,合规与网络配置都开始直接进入 Agent 成本。
适合谁看:受数据驻留约束的企业开发者、FinOps、云平台与采购团队。
Pydantic AI 2.33 修补 Anthropic 1.0 升级造成的运行时断裂
发生了什么:Anthropic Python SDK 1.0 改用 httpx2 并移除旧 httpx 支持后,旧版 Pydantic AI 的宽松依赖可在全新安装中解析到不兼容组合并运行失败;2.33 改为支持并要求 anthropic 1.0,旧版需暂时固定 anthropic<1。
为什么值得关注:Agent 框架与模型 SDK 的版本边界会在没有代码改动时破坏生产环境,宽松依赖本身也是运行风险。
适合谁看:使用 Pydantic AI 接 Anthropic 或依赖自动升级的 Python 团队。
E2B 2.45.1 不再为流式文件写入复制一整份内存镜像
发生了什么:E2B Python SDK 2.45.1 将共享重试传输改为 UNBUFFERED,避免 streamed files.write 或 volume.write_file 在发送时为了可重放而复制完整请求体;连接建立前仍可重试,一旦开始读取流就不再重放。
为什么值得关注:大文件上传不应让 Agent 沙箱客户端的峰值内存随文件大小再翻一份,重试边界也因此更明确。
适合谁看:向 Agent 沙箱上传大数据集、模型产物、构建目录或卷文件的 Python 团队。
GitHub开源发现
Microsoft Agent Framework 1.15 把恢复、审批和界面生成接成一条工作流
发生了什么:Python 1.15 新增 A2UI 生成式界面、Cosmos 工作流检查点类型注册、Foundry Hosted Agents 的 steering、retry 与 recovery,并持久化审批状态;同时保留工具消息 ID、恢复载荷和 fan-in trace 上下文。
为什么值得关注:Agent 生成界面之后,审批、检查点、恢复与追踪不能各自丢状态;这个版本开始把它们当成同一条运行链。
适合谁看:构建长时工作流、企业审批、A2A 或生成式界面的 Python 团队。
Kimi Code 0.38 让父 Agent 在当前回合等待后台任务
发生了什么:Kimi Code 0.38 新增 WaitFor,父 Agent 可在当前回合等待后台任务完成;子 Agent 默认不能继续生成子 Agent,编辑已有文件前必须先读取,磁盘内容变化时拒绝写入,官方数据源插件还新增 13 个国内外数据源。
为什么值得关注:等待、并发层级和先读后写从提示习惯变成明确工具规则,能减少后台任务失联和覆盖他人修改。
适合谁看:使用多 Agent 编程、后台委派、Skills 或数据插件的中国与全球开发者。
OpenHands 1.15 让自动化目录能携带脚本包和版本来源
发生了什么:OpenHands 1.15 允许从自动化目录安装随条目分发的脚本包,发送版本化 setup 条目的模板来源,并强化 Add/Import 流程;同版修复 Agent profile 静默降级、模型选择漂移和事件连接挂死。
为什么值得关注:自动化目录开始像可安装的 Skill 供应链:不仅分发说明,还分发脚本,并需要知道模板来自哪里、用了哪个版本。
适合谁看:维护 OpenHands 自动化、企业模板目录、Skills 市场或内部开发平台的团队。
Ollama 0.33 RC 让 MLX 前缀缓存跨取消与恢复继续有效
发生了什么:Ollama 0.33.0 RC 更新 MLX runner,让前缀缓存恢复点在 prefill 被取消后仍可用于恢复;同版新增 Claude 桌面应用入口、连接应用体验和 Claude 模型管理,并为 DeepSeek Harness 增加 npx 回退。
为什么值得关注:长上下文预填充被取消不必从零开始,本地推理的恢复体验开始进入缓存架构,而不只是界面层重试。
适合谁看:在 Apple Silicon 上运行本地模型、长上下文助手或桌面 Agent 的用户。
全球技术与市场观察
ComponentBench 显示同一模型只因操作界面不同就相差 30 个百分点
发生了什么:ComponentBench 用 97 类网页组件构造 2910 个可程序验证任务,并在统一 harness 中评测七个模型。仅改变观察与动作空间,同一 GPT-5 mini 的成功率就从 accessibility tree 的 83.1% 降到纯坐标控制的 48.9%。
为什么值得关注:电脑 Agent 的成绩不只由模型决定,DOM、无障碍树、坐标和动作接口本身就能制造超过 30 个百分点的差距。
适合谁看:评测或采购电脑 Agent、浏览器自动化、GUI harness 与模型路由的团队。
来源
- Anthropic Claude Code:Claude Code 把美国本地推理的 10% 溢价写进成本面板 官方发布
- Pydantic AI:Pydantic AI 2.33 修补 Anthropic 1.0 升级造成的运行时断裂 官方发布
- E2B Python SDK:E2B 2.45.1 不再为流式文件写入复制一整份内存镜像 官方发布
- Microsoft Agent Framework:Microsoft Agent Framework 1.15 把恢复、审批和界面生成接成一条工作流 官方发布
- Moonshot AI Kimi Code:Kimi Code 0.38 让父 Agent 在当前回合等待后台任务 官方发布
- OpenHands:OpenHands 1.15 让自动化目录能携带脚本包和版本来源 官方发布
- Ollama:Ollama 0.33 RC 让 MLX 前缀缓存跨取消与恢复继续有效 官方预发布
- ComponentBench Research:ComponentBench 显示同一模型只因操作界面不同就相差 30 个百分点 一手研究
