AI 编程 Agent 执行高后果操作时,权限确认只是开始。本文给出一套可落地的可逆性验收方法,用快照、范围、回滚与恢复演练控制损失上限。
Meta 推出 Muse Code 的消息,说明模型公司开始直接进入编程智能体产品层。对开发者而言,下一轮比较不只是模型能写多少代码,而是工具能否理解仓库、跑完验证,并在权限和成本边界内把任务交付出来。
Cloudflare Computer 把持久文件系统与可替换执行后端拆开。同一 Workspace 可以接入容器、Worker Shell 或 Worker JavaScript,任务换了执行环境,文件和产物仍留在原处。
Cloudflare 跑 Kimi 与 GLM 的公开实践说明,长上下文 Agent 的真实成本取决于权重、KV cache 与并发如何争抢显存;量化的关键不在统一压缩,而在按 prefill 和 decode 分开调度。
METR 呼吁对 AI Agent 异常做独立根因调查。本文把这件事落回团队日常:为每次异常建一份事故单,用六类根因归因,并把教训固化进评估、权限和测试。