Opus 4.7 一夜点燃开发圈,关注点从“更强”迅速转向“怎么用稳、怎么控住”
Boris 直说 Opus 4.7 比 4.6 更聪明、更 agentic,也更精确,但需要几天才能摸到正确用法;Theo 紧跟着吐槽新版系统提示把模型“管得太死”,Lawrence 也把“经典洗车问题”拿出来点名。这波热度说明市场已经不只看模型分数,而是在盯真实工作流里的可控性、限额和回退策略。
本轮最清楚的趋势,是模型升级已经从“榜单竞赛”切到“工作流竞赛”,谁能把能力、护栏、配额和可控性一起兜住,谁才吃得到真实采用。
Boris 直说 Opus 4.7 比 4.6 更聪明、更 agentic,也更精确,但需要几天才能摸到正确用法;Theo 紧跟着吐槽新版系统提示把模型“管得太死”,Lawrence 也把“经典洗车问题”拿出来点名。这波热度说明市场已经不只看模型分数,而是在盯真实工作流里的可控性、限额和回退策略。
Anthropic 发布与外部合著论文,研究大模型如何通过数据里的隐藏信号继承偏好甚至失配倾向。翻成中文,就是模型不只学“答案”,还可能把训练语料里那些不该传递的性格和偏向一并学进去,数据治理与可解释性因此更难回避。
Nick 展示了 Codex computer use 叠加 Mac 的 iPhone Mirror,已经能间接操作手机 App;中文圈的宝玉也快速跟进,强调 Codex 现在更像能干活的 Cowork,而不只是编辑器补全。这条线很关键,说明 coding agent 的竞争面已经从 IDE 内生成,扩到浏览器、桌面和跨设备执行。