AI 每日新知
Daily Field Notes
今日
归档
RSS
主题
2026 年 6 月 12 日 · 周五
AI 每日新知
今天不是单纯的“新模型更强”,而是长任务 agent 进入真实使用后的第一轮压力测试:限额、安全降级、桌面登录、热键误触、成本控制,全都是产品能力。
3
条精选
1
个分组
约
1
分钟读完
全部归档 →
第 78 期
2026-06-12
今日重点
3 条
Claude Fable 5 把“长任务能力”推到前台,但真实使用开始暴露限额、安全降级和桌面端摩擦。
Codex 继续从“代码工具”变成工作流执行层。
Agent Harness 正在成为模型之后的新岗位与新评测层。
← 更新一期
Fable 5 的临时禁用说明,长任务 agent 一旦进入真实生产,它依赖的不只是模型能力,还有出口管制、身份合规、权限隔离和可替代供应链
更早一期 →
今天的分水岭不在“哪个模型更聪明”,而在三套控制面同时成形:政府如何管前沿模型,团队如何让 agent 自验长跑,平台如何把 Codex/C