模型与研究3 条
Sonnet 5.5 打响中档模型性价比之战,安全评估首次直接叫停一款大模型发布。

Anthropic 发布 Claude Sonnet 5.5:快 30% 以上、最多省 30%,Terminal-Bench 4.0 得分 70.6%
Anthropic 上线新中档模型 Sonnet 5.5,速度与成本双降,并成为 claude.ai 免费层默认模型。
官方称该模型比 Sonnet 5 运行快 30% 以上,多数工作成本最多低 30%,定价与 Sonnet 5 保持一致。Anthropic 开发者账号同步发布了开发使用指南。Simon Willison 评测称其定价不变却在各项基准上全面领先前代;社区流传的测试显示其在 Terminal-Bench 4.0 上拿到 70.6%。
研判 · 与事实分开中档模型在不涨价的前提下提速降本,将直接抬高行业性价比基准线;『每项基准都超越』与 70.6% 跑分来自评测者与社交媒体,待核实。

OpenAI 因安全问题取消一款新模型发布:据报该模型不擅长服从指令
华尔街日报报道,OpenAI 砍掉一款新模型的发布计划,原因是安全评估未过关。
OpenAI 一位高管向华尔街日报表示,涉事模型在遵循指令方面表现不佳,因此决定不对外发布,TechCrunch 等媒体同日跟进。训练完成却不发布,在头部实验室中较为罕见。安全与可控性评估正在成为发布流程中的硬约束。
研判 · 与事实分开这是安全评估实际否决一次发布的公开案例,对整个行业的模型上线流程有参照意义;被取消模型的具体版本与能力范围未披露,待核实。

Jack Clark《Import AI》474 期:柏拉图心智空间、太空 TPU 与智谱的『外层 RSI 循环』
Anthropic 联合创始人 Jack Clark 的周报本期聚焦 LLM 能力边界、太空算力与智谱的递归自我改进动向。
本期以『你会在哪里超越 LLM 的能力』为引展开,标题列出三大话题:platonic mindspace(柏拉图式心智空间)、把 TPU 送入太空,以及智谱(Zhipu)开启一个『外层 RSI 循环』。该刊属观点与研究综述性质,具体论证需读原文。
研判 · 与事实分开『外层 RSI 循环』涉及对智谱研究方向的判断,含义与证据待核实;表征收敛与太空算力均是前沿圈热议的长期议题。
产品与公司6 条
并购、IPO 与融资齐发,智能体从演示走向结账与安全防护的商业闭环。

AMD 以 82 亿美元全股票收购 World Labs,李飞飞转任 AMD 执行副总裁兼首席科学家
AMD 宣布收购李飞飞联合创办的世界模型公司 World Labs,交易价值约 82 亿美元。
AMD 公告此次为全股票交易,金额约 82 亿美元,World Labs 创始人李飞飞将出任 AMD 执行副总裁兼首席科学家。World Labs 官方博客与李飞飞本人账号同步确认并入 AMD。该公司此前主攻空间智能与世界模型方向。
研判 · 与事实分开GPU 厂商直接买下世界模型头部团队,意味着算力厂商开始向模型与应用层纵向整合;收购后研究路线如何保持独立,待观察。
Anthropic IPO 招股书:2025 年净亏损 420 亿美元,估值有望冲击 2 万亿美元
Anthropic 的 IPO 招股书显示其 AI 蓝图宏大,但成本同步飙升。
路透社报道,招股书展现了 Anthropic 涵盖广泛业务的 AI 愿景,同时披露成本急速攀升。中文媒体援引的数据称其 2025 年净亏损达 420 亿美元,市场预期上市后估值有望突破 2 万亿美元。巨额亏损叠加超高估值,是本轮 AI 资本热潮的标志性样本。
研判 · 与事实分开检验市场对前沿模型公司的耐心与定价逻辑;亏损口径与摊薄细节需以招股书原文为准,待核实。

Modal Labs 接近完成 7.5 亿美元融资,估值 157.5 亿美元,四个月翻逾三倍
推理基础设施提供商 Modal Labs 的新一轮融资估值较四个月前增长超过三倍。
据 TechCrunch 援引知情人士报道,Modal Labs 正在敲定 7.5 亿美元新融资,投后估值 157.5 亿美元。新融资将使其估值较四个月前增长逾三倍。该公司主营 AI 推理云服务,直接受益于模型调用量激增。
研判 · 与事实分开推理侧是本轮基础设施投资中离收入最近的环节,估值跳涨反映供需失衡仍在持续;交易尚未正式官宣,金额与估值待核实。

Shopify 将 WebMCP 结账能力开放给浏览器 AI 代理
浏览器里的 AI 代理现在可以在买家授权下直接在 Shopify 完成下单。
Shopify 宣布把 WebMCP 支持扩展到结账环节,允许基于浏览器的 AI 代理在获得买家授权后更新订单详情并完成购买。这是主流电商平台首次把交易闭环正式开放给外部智能体。代理式购物从商品浏览走到了支付环节。
研判 · 与事实分开电商为代理开放支付通道,可能重塑流量与转化格局,也会带来盗刷与误购等新风险;授权机制的具体粒度待验证。

Nvidia 发布 AI 安全平台,专治智能体『失控』
Nvidia 推出面向 AI 智能体的安全防护平台,试图在系统层阻止智能体越权行为。
据 AP 与 The Verge 报道,Nvidia 发布了一套安全平台,目标是阻止 AI 智能体『go rogue』,即越权或失控运行。报道中产品细节着墨不多,但定位直指智能体部署中的权限与行为管控。智能体安全正从论文议题变成独立产品品类。
研判 · 与事实分开芯片巨头入场会加速智能体安全基础设施的标准化;平台的具体技术方案与覆盖范围待核实。

The Verge 分析:DevDay 2026 将至,OpenAI 在持续运行的消费级 AI 代理上落后
OpenAI 发明了现代 AI 聊天机器人,但在最热门的常驻消费级代理品类上已被对手甩开。
The Verge 在 OpenAI 2026 DevDay 前发表分析称,行业最热的方向之一是持续运行、面向消费者的 AI 代理,而 OpenAI 在该品类上明显落后,文中提及 Aeon AI 代理。OpenAI 需要在今年的 DevDay 上证明自己没有缺席下一轮交互变革。
研判 · 与事实分开聊天框之后的下一代入口归属未定,OpenAI 的应对将决定其护城河宽度;Aeon 与 OpenAI 的具体关系仍需确认,待核实。
开源与工具3 条
开源安全智能体、模型秒开工具与免费教科书,开发者的工具箱继续变厚。

GitHub 用开源 AI 安全 Agent 找出 24 个 Android 漏洞
GitHub 安全团队公开了自研开源 AI 安全智能体的实战战绩。
GitHub 在官方博客介绍,其开源 AI 安全 Agent 被用于安全审计,成功找出 24 个 Android 漏洞。团队分享了智能体在代码分析中的工作方式与流程。这是开源安全智能体在真实漏洞挖掘中规模化的公开案例之一。
研判 · 与事实分开AI 辅助漏洞挖掘一旦可复现,安全审计的成本结构会被改写;漏洞细节与误报率尚待更多披露。
Range:3 秒打开 1 TB 级模型,无需完整下载
新工具 Range 宣称可在不下载模型的情况下 3 秒内打开 1 TB 大小的模型。
Range 在 Hacker News 上发布,主打按需读取远端模型权重,省去动辄数百 GB 的下载等待。对本地显存吃紧、多模型切换频繁的开发者,这类按需加载工具直接影响工作流效率。
研判 · 与事实分开若延迟真稳定在秒级,模型权重托管与分发的使用习惯可能被改写;实际带宽条件下的表现待验证。

《Neuroevolution》教科书正式付印,在线版免费开放
hardmaru(David Ha)等人的神经进化教科书出版,提供免费在线版。
David Ha 在 Bluesky 宣布,与 Sebastian Risi 等人合著的神经进化(Neuroevolution)教科书正式出版,读者可在 neuroevolutionbook.com 免费阅读在线版,纸质版已开放预订。神经进化是演化计算与神经网络的交叉领域,长期缺乏系统性教材。
研判 · 与事实分开免费教材有助于演化方法在主流深度学习之外被重新审视;配套代码与练习的完整度待验证。
政策与观点8 条
从佛州法院到美国国会再到北京,围绕 AI 的管控工具正在增多。

佛州总检察长寻求禁止 ChatGPT『扮人』,特别指向未成年人场景
佛罗里达州要求法院阻止 OpenAI 给 ChatGPT 赋予虚假的人类属性。
佛州总检察长 James Uthmeier 提请法官禁止 OpenAI 让 ChatGPT 表现得像一个真人,数月前佛州曾以安全问题起诉该公司。报道指该动议与保护儿童相关。若获支持,将对拟人化 AI 产品的设计形成直接法律约束。
研判 · 与事实分开拟人化设计与成瘾、误导风险之间的法律边界可能由此案划定;动议结果待法院裁决。

中国将出行限制扩大到顶尖 AI 人才家属
据报道,中国对顶尖 AI 人才的出境管控措施扩展至其家庭成员。
Business Standard 转发报道称,中国正在把针对顶尖 AI 人才的出行限制扩大到其家人。此类限制被解读为在人才争夺与技术保密之间继续加码。具体适用范围与涉及人数未见披露。
研判 · 与事实分开人才流动限制会影响国际 AI 合作与个人职业选择;措施细节与执行力度待核实。
美国国会酝酿一揽子 AI 安全提案
联邦层面正在集中出现一批针对 AI 安全的立法设想。
Federal News Network 报道称,美国国会正在审视一系列 AI 安全相关提案,聚焦政府系统与关键基础设施中的 AI 应用。这与 Spanberger 等政治人物呼吁联邦监管的表态相互呼应。联邦立法走向将直接影响全行业合规成本。
研判 · 与事实分开若安全提案进入立法程序,模型厂商与联邦供应商都要提前对齐合规框架;具体条文尚在酝酿,待核实。
Spanberger 呼吁对 AI 实施联邦层面监管
美国政治人物 Spanberger 公开呼吁建立联邦 AI 监督机制。
据 WWBT 报道,Spanberger 呼吁对人工智能实施联邦层面的监督。在美国州级立法碎片化的背景下,联邦统一监管的呼声正在升高。该表态与其安全议程相关。
研判 · 与事实分开联邦与州权在 AI 监管上的拉锯将决定美国合规版图;具体政策方案待其进一步公布。
特朗普反对『AI 减速』,『大空头』称经济承受不起 AI 降温的代价
财联社报道,围绕要不要给 AI 热潮降温,白宫与市场空头的分歧公开化。
财联社报道称,特朗普反对让 AI 发展减速;被称为『大空头』的 Michael Burry 则认为他承受不起 AI 减速随之而来的经济崩溃。AI 资本开支是否构成泡沫,正在从市场话题上升为政治议题。
研判 · 与事实分开当 AI 投资规模大到影响宏观稳定,政策与市场的博弈会直接影响行业节奏;双方言论均属立场表达,待事实检验。

STAT:AI 正在瓦解生物武器难以获得的天然屏障
STAT 发文警告,AI 大幅降低了获取病原体相关知识的门槛,现有防护规则面临失守。
STAT 的报道指出,过去让生物武器难以普及的技术与知识壁垒正被 AI 工具侵蚀,而现有防护栏与政策未能跟上。文章呼吁在基因合成与模型访问层面重建防线。生物安全由此成为 AI 政策议程的前置议题。
研判 · 与事实分开模型能力外溢到高风险知识领域,是安全研究最难平衡的部分;文中警示属政策分析而非已发生事件,待事实佐证。
蓝十字保险商称 AI 工具带来近 10 亿美元额外成本
路透报道,Blue Cross 系保险商表示 AI 工具的使用产生了近 10 亿美元的额外成本。
路透社报道,Blue Cross 旗下保险商称,AI 工具的使用给他们带来接近 10 亿美元的额外成本,相关争议已进入法律程序。企业大规模引入 AI 后的隐性成本开始被量化并摆上台面。
研判 · 与事实分开首批 AI 落地成本诉讼的结果,会影响企业采购与部署 AI 的风险评估方式;成本归因是否成立待法院认定。
国家 AI 应用中试基地(文化旅游)园区启用:发布 5 个模型、4 个数据集、5 大应用场景
文旅方向的国家 AI 中试基地正式开园,一次发布多组模型与数据集。
据智慧城市行业分析,国家人工智能应用中试基地(文化旅游)园区正式启用,现场发布 5 个模型、4 个数据集和 5 大应用场景。中试基地的定位是把 AI 技术在文旅场景中做规模化验证。
研判 · 与事实分开国家级中试平台意味着 AI 应用推广进入场景化、工程化阶段;模型与数据集的具体内容与技术指标待核实。
专家观点3 条
教皇、调查报道与社区讨论,从不同角度追问 AI 的失控风险与责任归属。
教皇良十四世:AI 安全担忧不是『假新闻』,与特朗普立场相左
教皇就 AI 安全公开发声,反驳对安全关切不屑一顾的说法。
据 AP 报道,教皇良十四世表示,人工智能的安全担忧并非『假新闻』,与特朗普的轻视态度形成对照。宗教领袖介入 AI 议题,说明这场讨论已超出技术与商业范畴,进入社会伦理层面。
研判 · 与事实分开伦理与信仰权威入场,会放大对 AI 安全立法的社会压力;发言的完整语境待核实。

The Intercept 长文:AI 差点引发美中战争,却少有人在意
调查媒体回顾 AI 卷入的军事危机,批评各方对军事 AI 风险无动于衷。
The Intercept 发文称,AI 曾差点引发美国与中国的战争,但公众与决策层的关注明显不足。文章把军事与核指挥链路中的 AI 应用比作『末日机器』式的隐患。该文属观点性深度报道,事件细节需读原文。
研判 · 与事实分开军事 AI 是监管最薄弱的领域之一,公众关注度与实际风险严重不匹配;『差点开战』的具体经过待核实。

AI Agent 无意中作恶,谁来担责?Hacker News 社区热议
一篇讨论 AI 智能体责任归属的博客在 Hacker News 引起大量讨论。
博客文章提问:当一个 AI Agent 意外表现出恶意行为时,应该由谁负责。帖子在 Hacker News 获得 31 个赞与 56 条评论,开发者围绕开发者、平台与用户的责任切分展开争论。随着代理获得真实权限,责任框架的空白愈发刺眼。
研判 · 与事实分开责任分配将决定保险、审计与法律如何适配智能体经济;文中观点为个人分析,并非法律结论。