今日重点5 条
Codex / ChatGPT Work 的用量修正,把长任务的真实成本摆到了台面上
OpenAI 产品团队成员 Tibo Sottiaux 说明,GPT-5.6 Sol 的上下文上限曾由 272k 调至 372k,造成用量扣减高于预期,现已回退;高推理档的多代理用量也在修复。所有 Codex 与 ChatGPT Work 用户获得一次可储存的用量重置。对重度用户,这不是促销消息:上下文长度、推理档位、子代理数与失败重跑会共同决定一个订阅周期里实际能交付多少工作。 修复后的节省比例和各档位的稳定计费口径尚未公开。团队应把“任务完成数 / 配额消耗”纳入长任务基准,而不只比较单次 token。 出处:Tibo Sottiaux|用量修正 · Tibo Sottiaux|banked reset
Claude Tag 给协作式 agent 一个官方入口,重点转到工件与权限
Anthropic 已把 Claude Tag 定义为在协作工具中调用 Claude 的产品入口;当天出现的多人 Artifacts 加 Slack Tag 使用信号,说明“聊天里的结论”开始被组织成多人可继续修改的共享工件。对团队而言,真正要先验证的不是演示速度,而是工件归属、成员权限、版本回退与审计记录是否完整。 多人组合的普遍可用性仍只有单一现场信号,不能据此推断全部权限能力已经完备。 出处:Anthropic|Introducing Claude Tag · Nick Dobos|现场使用
Agent 基础设施的重心正在从“流程硬编码”移到“协作与评估设计”
Anthropic 平台团队在近期公开对谈中提出,随着模型的推理和工具调用能力增强,传统的分支编排代码会变薄;更高一层的工作变成让多个 agent 提案、互相挑错、在卡住时升级,并以具体人的提速作为早期 ROI 指标。这个变化不等于不需要工程:流程变少后,目标边界、权限、评测和责任划分反而更重要。 这是一组团队经验,不是通用性能结论。落地时应先挑一个可测岗位,记录质量、返工和人工复核,再扩大范围。 出处:Anthropic 平台团队对谈 · Dotey|要点整理
CI 里跑 `uvx` 的缓存配方,给 AI 项目的工具链留出了一个可量化的优化点
Simon Willison 给出了一种在 GitHub Actions 中运行 uvx tool-name、避免每次重新下载工具包的缓存做法。它不是模型新闻,但对频繁运行评测、代码生成或数据处理任务的仓库很实际:把依赖安装从每次 job 的隐性固定成本,变成可以量化和回归检查的构建指标。 缓存键和失效策略必须跟项目的 Python/依赖锁文件匹配;不能把这条经验当成所有 Actions 工作流的通用最优配置。 出处:Simon Willison|缓存配方 · 原帖
个人模型训练开始需要“构建系统级”的可观测性,但这仍是早期现场信号
Replit CEO Amjad Masad 展示了个人模型训练过程的实时进度更新,并把这种体验比作早期 vibe coding。可取的不是“个人训练已经成熟”的结论,而是工作流正在从一次性提交,转向像软件构建一样看队列、阶段、失败与产出。对自己跑微调或长期实验的人,先补齐运行状态、日志、成本和可复现配置,比盯最终模型名更有用。 这只是单一使用者展示,未提供系统规模、成本、成功率或产品可用范围,不能据此外推。 出处:Amjad Masad|现场展示