OpenAI 把生物安全红队从一次活动变成长期外部测试
OpenAI 宣布将 Bio Bug Bounty 升级为长期、私有的研究计划,单项奖金最高 5 万美元,寻找能够绕过预设生物安全挑战的通用越狱方法。重点不在奖金数字,而在于公司开始把外部对抗测试纳入持续机制:不是模型发布前做一轮演示,而是持续验证防线会不会被新提示、工具链或模型行为绕开。
今天的主线不是又一轮模型排名,而是前沿模型同时被装进两类现实系统:一类是 Microsoft 365 这样的默认生产力入口,另一类是生物安全、浏览器身份和硬件研发这样的高风险边界。午间真正该补的,不是和晨报错开,而是把“能力变强”拆回权限、成本、测试、责任和信息隔离这几件能落地的事。
OpenAI 宣布将 Bio Bug Bounty 升级为长期、私有的研究计划,单项奖金最高 5 万美元,寻找能够绕过预设生物安全挑战的通用越狱方法。重点不在奖金数字,而在于公司开始把外部对抗测试纳入持续机制:不是模型发布前做一轮演示,而是持续验证防线会不会被新提示、工具链或模型行为绕开。
OpenAI 称 GPT-5.6 Luna 在其健康智能任务上,以更低成本超过 GPT-5.5 的最高推理档;Sam Altman 还转述医生评审中,GPT-5.6 的回答缺陷少于医生撰写的回答。这是值得跟进的能力与成本信号,因为健康任务同时考验知识、推理、表达和风险控制;但它离“可用于临床”仍隔着数据集、任务定义、盲评设计和责任边界。
Sam Altman 表示 GPT-5.6 已被设为 Microsoft 365 Copilot 的首选模型。它的意义不是多一个可选模型,而是更强推理能力开始嵌进邮件、文档、会议和企业知识入口的默认路径:用户是否会用,越来越由产品默认值、权限和数据连接决定,而不只是模型榜单。
Simon Willison 注意到 Atlas 正被 ChatGPT 应用内置浏览器替代,并指出 AI 增强浏览器仍有难解的隐私与安全问题。他的主张很具体:让 agent 使用独立浏览器上下文,而不要进入自己日常浏览器。此前一线用户称 Claude 桌面端也出现内置浏览器与可选会话持久化,虽然尚未获官方说明,但两件事共同把“独立执行环境”推到产品层面。
Vista8 观察到 GPT-5.6 Sol 在高速或 Ultra 档可能在数十分钟内消耗大量额度,只好切回正常速度和 Medium 档换取持续运行;另一位开发者则展示了一个反差:模型能完成复杂 voxel engine,却在鼠标输入的相机方向这类基础交互上出错。两条都不是基准测试,却说明长任务的体验不能由一次漂亮演示代表。
多家媒体报道 Apple 已在加州北区联邦法院起诉 OpenAI、其硬件负责人 Tang Tan、前 Apple 工程师 Chang Liu 与 io Products,主张 AI 硬件研发相关商业秘密被不当获取。Jony Ive 并未被列为被告。这个案子尚未有裁判结论,但它把 AI 公司向硬件、端侧和新入口扩张时的另一条主线摆出来:人才流动与产品速度之外,研发资料的边界和可证明的隔离同样重要。