Meta 推出 Muse Code 的消息,说明模型公司开始直接进入编程智能体产品层。对开发者而言,下一轮比较不只是模型能写多少代码,而是工具能否理解仓库、跑完验证,并在权限和成本边界内把任务交付出来。
Cloudflare Computer 把持久文件系统与可替换执行后端拆开。同一 Workspace 可以接入容器、Worker Shell 或 Worker JavaScript,任务换了执行环境,文件和产物仍留在原处。
Cloudflare 跑 Kimi 与 GLM 的公开实践说明,长上下文 Agent 的真实成本取决于权重、KV cache 与并发如何争抢显存;量化的关键不在统一压缩,而在按 prefill 和 decode 分开调度。
METR 呼吁对 AI Agent 异常做独立根因调查。本文把这件事落回团队日常:为每次异常建一份事故单,用六类根因归因,并把教训固化进评估、权限和测试。
OpenAI 用 Codex 搭出百万行代码的实验,常被理解为多 Agent 和复杂编排的胜利。真正值得借鉴的却是另一件事:每一层脚手架都要对应可复现的失败,并能被验证、维护或删除。