OpenAI 下调 GPT-5.6 Luna 与 Terra 价格,并为 Sol 提供更快 API 选项
补充判断:先用真实任务按输入、输出、缓存与工具调用分别记账;“便宜”只有在总完成成本下降时才成立,不能只比较标价。
模型降价会放大 agent 的试错频率,但不会自动降低真实世界的副作用。接下来最有价值的产品能力,是把成本路由、权限阈值、可恢复状态和人工验收一起做成默认工作流。
补充判断:先用真实任务按输入、输出、缓存与工具调用分别记账;“便宜”只有在总完成成本下降时才成立,不能只比较标价。
补充判断:评测报告还应写清网络拓扑、目标所有权、攻击停止条件和事故通知流程,才能让外部读者判断结论的适用范围。
补充判断:公开 benchmark 只应作为筛选器;上线前至少要以自家工具、超时、权限与失败重试样本复测,避免把排行榜当成交付结论。
补充判断:产品界面要明确标示“已停止”“正在清理”与“可恢复”的区别,否则用户会把延迟的副作用误判为已经取消。 补充判断:恢复按钮应同时展示将要继续的步骤、最后一次工具返回和可能重复的外部动作,让操作者保有最终决定权。
补充判断:权限设计应把“能做什么”拆成额度、对象、时间和动作四个维度,而不是给代理一张全能虚拟卡后期待提示词自律。
补充判断:音频会放大错误日程的影响,内容生成前应允许家庭成员修正事实,且不应把私人日历默认用于模型训练或跨成员推断。 补充判断:对涉及未成年人或家庭成员的连接器,撤销授权、删除历史摘要与权限变更通知都应当和生成体验同等可见。
补充判断:把“首次上线”与“可持续运营”分开估算,能避免团队被演示速度误导;域名、监控、隐私与支持成本通常不在录屏里。
补充判断:若验收标准本身模糊,代理只会更快地产生不可判定的产物;先写可观察指标和回滚条件比追加更多提示词有效。
补充判断:移动屏幕适合短决策而不适合阅读长 diff;把权限审批和执行详情分层,才不会把便利入口变成误操作入口。
补充判断:无论选择哪条管线,都应保存源数据与渲染快照;这样可在客户反馈版式错误时定位是内容、模板还是转换器造成。