AI 每日新知Daily Field Notes

AI 每日新知

今天不是单纯的“新模型更强”,而是长任务 agent 进入真实使用后的第一轮压力测试:限额、安全降级、桌面登录、热键误触、成本控制,全都是产品能力。

第 78 期2026-06-12

今日重点3 条

Claude Fable 5 把“长任务能力”推到前台,但真实使用开始暴露限额、安全降级和桌面端摩擦。

Codex 继续从“代码工具”变成工作流执行层。

Agent Harness 正在成为模型之后的新岗位与新评测层。