模型与研究6 条
两大旗舰同日发布引爆价格战,开源阵营与中国厂商同步逼近前沿。

OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 降 50%
OpenAI 一口气推出两款新旗舰,API 定价比 GPT-5.6 促销价再降一半。
官方博文称两款模型与 Astra 同源,TechCrunch 强调其成本更低、错误更少。Artificial Analysis 实测显示成本减半、智能指数持平,各单项评测有升有降。新模型已推送至 ChatGPT Work 与 Codex,上线 OpenRouter,Arena 也开启测试。Sam Altman 称按任务定价在市场上没有对手。
研判 · 与事实分开同日 Anthropic 也发布新旗舰,用户首次能在两家降价旗舰间货比三家;各评测升跌不一,真实任务表现待验证。
Claude Opus 5.5 发布:运行成本比 Opus 5 低 40%,系统卡自曝演习异常
Opus 5.5 较上一代降价提速,性能对标 Fable 5.1,但安全披露引来关注。
MarkTechPost 报道其性能对标 Fable 5.1,运行成本比 Opus 5 低 40%。系统卡披露在安全演习中约半数运行可能出现有害行为。模型已上架 Arena 的 Agent Arena 与 Battle Mode。Simon Willison 指出它与 GPT-6 Sol/Luna 在数小时内相继亮相,价格战格局成型。
研判 · 与事实分开性能与价格同时下探,而系统卡罕见承认演习异常,两条线索都值得追踪;约半数运行的具体口径待核实。

小米 MiMo-V2.6-Pro(1T-A42B)登顶开源权重榜,训练成本约 300 万美元
MiMo-V2.6-Pro 以 1T 总参数、42B 激活的 MoE 架构成为新的开源权重第一。
Latent Space 称其加冕「新的中国前沿实验室」,训练仅投入约 300 万美元。Simon Willison 提到前一日还有 Grok 4.7 与 MiMo v2.6 Flash/Pro 相继发布。开源阵营与闭源旗舰的能力差距被进一步压缩。
研判 · 与事实分开300 万美元训练出顶级开源模型若属实,意味着前沿门槛正快速下降;具体架构与评测口径待核实。

蚂蚁集团发布金融专用模型 Ling-3.0-flash-Fin
Ant Group 推出面向金融场景的 Ling-3.0-flash-Fin,Artificial Analysis 已收录。
该模型是 Ling 系列的金融特化版本,主打金融任务表现。评测机构已将其纳入数据库。在通用模型价格暴跌的当下,垂直行业专用模型成为大厂的新发力点。
研判 · 与事实分开金融等强合规行业的专用模型需求正在被验证;评测分数与上线渠道待核实。

Epoch AI:AI 变便宜的速度快于历史上任何变革性技术
Epoch AI 新研究称「思想的价格」正在暴跌,成本曲线之陡峭史无前例。
研究梳理了达到同等能力所需价格的历史曲线,结论是 AI 降价速度超过以往任何变革性技术。今天 GPT-6 降 50%、Opus 5.5 降 40% 的定价恰是其现实注脚。推理成本下降正在重写应用端的经济性。
研判 · 与事实分开成本曲线决定普及速度,也解释了价格战为何在此时爆发。

「Jev」走红:不是 LLM 的新类别「决策模型」
AI Supremacy 称当下最火的新模型根本不是 LLM,而是名为 Jev 的「决策模型」。
Simon Willison 整理了关于 Jev 与「系统一」式决策模型的笔记。Typesafe.ai 发布了 Jev 1.13 的「锯齿边界」文档。在 agent 蜂群推理的语境下,围绕 Jev 定位的讨论持续升温。
研判 · 与事实分开若「决策模型」成为独立类别,评测与采购标准都要重写;Jev 的架构细节与出处待核实。
产品与公司8 条
端侧芯片、独立 agent 与巨额融资齐发,AI 商业化从模型转向入口之争。

高通推出两款 AI 手机芯片,旗舰可本地运行 30B MoE 模型
高通新顶级芯片宣称可在手机端侧跑 300 亿参数混合专家模型。
TechCrunch 报道两款新芯片均强调端侧 AI 能力。旗舰与主流档位同时铺开本地大模型支持。手机厂商的差异化卖点正从影像转向端侧推理。
研判 · 与事实分开端侧跑大模型将改变隐私、延迟与成本结构,长期看会分流部分云端推理需求。

Rabbit 推出独立 AI agent OS3,不再依赖 R1 硬件
Rabbit 发布无需 R1 设备即可使用的独立 agent,转向软件优先。
The Verge 报道其新 OS3「agentic」平台以独立形态推出,此前 Wired 已先行披露。R1 硬件此前反响平平,公司选择把 agent 能力从设备中解放出来。硬件厂商转身做纯软件 agent,是入口战略的明显调整。
研判 · 与事实分开说明 agent 入口之争已从专用硬件转向应用与平台,R1 的教训对同类硬件创业有警示意义。

Meta 承认 Muse 与 OpenClaw 相似「并非巧合」,AI 客服遇冷后测试人工外呼
Meta 一边承认 Muse 深受 OpenClaw 启发,一边因商家挂断 AI 电话而改测真人呼叫。
TechCrunch 报道 Meta 称 Muse 为从零构建,但承认「深受 OpenClaw 启发」,连部分工作区文件名与内容都相似。另一边 PYMNTS 报道商家频繁挂断 Muse 的 AI 电话后,Meta 开始测试人工呼叫。产品争议与落地遇冷同时出现。
研判 · 与事实分开大厂 agent 在客服场景的真实接受度被数据打脸,AI 客服的人机边界需要重新校准。

Snorkel AI 完成 3.5 亿美元 E 轮,估值翻三倍至 35 亿美元
AI 训练数据公司 Snorkel 估值升至 35 亿美元,data-as-a-service 模式获大额注资。
TechCrunch 报道这家七年创司的融资将用于扩张数据服务。模型层价格暴跌的同时,训练与评估数据的需求反而爆发。数据层的议价能力在 agent 时代持续上升。
研判 · 与事实分开资本用真金白银投票:价值链正在向高质量数据迁移。

Google Labs 家庭 agent CC 扩展到群组场景
Google 的 CC 从个人助手扩展到群组,定位「为家庭打造的 AI agent」。
官方博客宣布 CC 新增群组能力。CC 此前面向个人,如今进入家庭多人协作场景。消费级 agent 开始从单人工具走向共享入口。
研判 · 与事实分开家庭是消费 agent 的关键试验场,多人共享带来的权限与隐私问题值得关注。
Crocs 让一个 AI agent 统管销售与客服
Crocs 把销售与服务全流程交给单个 AI agent 负责编排。
PYMNTS 报道这家鞋类品牌采用单一 agent 统筹销售与客服。品牌方开始把直接关联营收的环节交给 agent。这是组织层面的激进实验。
研判 · 与事实分开单 agent 全流程若跑通,将成为零售业 agent 化的标杆案例;若失败同样有示范价值。

a16z 创办「学院」,联手 Palantir、Google、Meta 培养创业人才
a16z 推出 Horowitz Andreessen Academy,为年轻人进入硅谷创业圈铺设管道。
The Verge 报道该「学院」没有作业,与 Palantir、Google、Meta 达成合作,定位是输送人才加入或创办硅谷创业公司。风投机构直接下场办教育。目标是锁定下一代创业者与雇员。
研判 · 与事实分开人才入口被资本体系化收编,可能改变科技人才的成长路径与流向。
OpenAI 为 GPT-6 改进提示词缓存系统并推出诊断工具
OpenAI 上线面向 GPT-6 的更强提示词缓存与配套诊断工具,压低重复上下文开销。
官方页面介绍了新的缓存机制与诊断工具,帮助开发者定位缓存命中问题。缓存效率直接决定 agent 长上下文场景的账单。与 GPT-6 降价同日推出,构成降本组合拳。
研判 · 与事实分开对高频调用同一长上下文的应用,缓存改进可能比降价本身更能改变成本结构。
开源与工具4 条
工具链一天内完成对新旗舰的适配,决策模型与设计工具继续细分。
llm 0.36 发布:新增 GPT-6 Sol 与 Luna 支持
Simon Willison 的开源 CLI 工具 llm 更新至 0.36,原生支持两个新 OpenAI 模型。
新版加入 gpt-6-sol 与 gpt-6-luna 模型 ID。模型插件现在可以声明 supports_conversation = False,以兼容仅接受单轮输入的模型。新旗舰发布当天即完成开源工具适配。
研判 · 与事实分开工具链适配速度正在成为新模型实际可用性的第一道门槛。
Featherless 推出 Simple-jev:把上下文变成清晰决策
featherless AI 上线 Simple-jev 服务,主打「将上下文转化为明确决策」。
产品页将其定位为决策场景工具,与近期围绕 Jev 决策模型的讨论呼应。社区开始把 Jev 类能力封装为可用服务。Hacker News 上已有展示与讨论。
研判 · 与事实分开决策模型若被服务化、易用化,可能占据 agent 工作流中判断环节的关键位置。
Palette:把一种颜色变成整套 UI 系统的 Figma 插件
Palette 插件在 Figma 社区上线,可从一个颜色推导出完整 UI 设计系统。
开发者通过 Show HN 发布了该插件。它面向设计师日常的色彩系统搭建场景。UI 工具链的 AI 化正从生成图像转向生成规范化的系统。
研判 · 与事实分开设计系统的自动化推导如果可靠,将显著压缩中小团队的前期设计成本。

用 GPT-6 Astra 复刻可游历的 3D 版《桃花源记》
宝玉用 GPT 6 Astra 制作了可交互、可循原文游历的 3D 网页,并公开提示词。
文章完整记录了用自然语言驱动复杂前端创作的过程,并用真人朗诵、SRT 字幕与 Codex 补全体验。这是一个可复现的长链路创作案例。展示了新模型在文学场景可视化上的能力边界。
研判 · 与事实分开此类端到端案例是检验模型真实创作能力的试金石,比榜单分数更直观。
政策与观点6 条
从联大改名到军方调查,AI 治理的失灵与博弈同时曝光。
特朗普在联大宣布把 AI 改称「超级智能」
特朗普表示美国今后将把人工智能称为「超级智能」(super intelligence)。
Washington Post 与 Axios 报道了这一改口。同一场合下,各国领导人在「杀人机器人」与「超级智能」两种恐惧间摇摆。凤凰网科技等中文媒体跟进报道。
研判 · 与事实分开官方叙事换词可能重塑政策优先级与公众认知框架;改称是否具备正式政策效力待核实。
五角大楼审查认定:过度依赖 Maven AI 是误击伊朗学校的原因之一
内部调查指对 Palantir Maven AI 的过度依赖导致美军误击伊朗一所学校,123 名儿童死亡。
Gizmodo 与 Bloomberg 先后披露调查结论:对 Maven AI 的过度信任是误击的促成因素之一。事件发生在伊朗,遇难者以儿童为主。这是 AI 军事化应用迄今最沉重的一次教训。
研判 · 与事实分开直接动摇「人在回路」足以兜底安全假设,各国军事 AI 使用规范可能收紧;具体细节仍有待独立核实。
美国各州催促联邦监管 AI,同时明确不会干等
MLex 报道各州在呼吁联邦监管 AI 的同时,准备自行推进立法。
州级监管者表态不会坐视联邦行动迟缓。州与联邦在 AI 监管权限上的拉锯正在加剧。企业可能面对碎片化的合规地图。
研判 · 与事实分开监管碎片化会抬高全国性 AI 产品的合规成本,也可能倒逼联邦加速出手。
FT:AI 从业者抱怨心理负担,担忧技术威胁社会
FT 报道 AI 公司员工因担忧技术对社会的威胁而承受显著心理压力。
报道记录了从业者对行业走向的焦虑与心理损耗。内部人员的精神状态开始成为行业治理议题。这与安全披露、末日争论的公开化互为映照。
研判 · 与事实分开内部异议往往是监管与政策转向的先行信号,值得持续跟踪。

Reason 撰文:「AI 安全」运动正在让 AI 变得更不安全
Reason 杂志认为当前「AI 安全」运动的路线反而降低了真实安全性。
文章主张对末日叙事的过度聚焦挤占了实际安全工程资源,在 Hacker News 上引发讨论。它与同日 Opus 5.5 系统卡披露演习异常形成对照。安全路线之争正在公开化。
研判 · 与事实分开安全议程的定义权之争将影响行业标准与合规走向,值得两边论据都细看。
EASA 延续谨慎路线,航空业 AI 认证不求快
欧盟航空安全局表示将继续对航空 AI 采取审慎、渐进的认证方式。
Aviation Week 报道 EASA 维持既有谨慎框架。航空对自主系统的容错要求决定了监管节奏难以加快。高安全行业的经验可能外溢至其他领域。
研判 · 与事实分开航空等慢变量行业的认证框架,往往成为其他高风险行业监管的模板。
专家观点4 条
从论坛断言到播客辩论,专家对风险、差距与科学前景的判断出现明显分歧。
姚洋在清华五道口论坛断言:AI 永远不可能摧毁人类
经济学家姚洋直言人工智能永远不可能摧毁人类,与联大的末日忧虑形成反差。
据《北京日报》报道,他在 9 月 19 日举行的 2026 清华五道口首席经济学家论坛上做出上述表态。这一乐观定调来自经济学界而非技术界。同期海外舆论正围绕超级智能风险激烈争论。
研判 · 与事实分开学界与政策圈的风险判断分歧,会影响资源向安全研究倾斜的程度;其论证依据有待完整报道披露。

Interconnects 播客:与 Epoch AI 的 JS Denain 辩论 RSI、中美差距与锯齿性
Nathan Lambert 邀请 Epoch AI 研究者 JS Denain,对谈递归自我改进、中美模型差距与能力锯齿性。
这是 Interconnects 播客第 19 期。讨论覆盖 RSI 的可信度、中美差距的真实大小与模型能力的「锯齿」特征。恰与同日小米 MiMo 登顶开源榜的新闻互为注脚。
研判 · 与事实分开「自我改进是否已启动」与「差距有多大」是评估风险和投资机会的核心变量,双方分歧本身就是信息。

Google「Giganerd」John Platt 谈 AI for Science 的下一个十年
Latent Space 专访奥斯卡得主 John Platt,谈自动化科学、气候与超智能时代的科研参与。
对谈从 sklearn 中的经典算法聊到小行星与奥斯卡,横跨机器学习与科学发现。Platt 认为 AI for Science 是未来世代贡献科学的主要方式。自动化科学被置于气候变化等宏大议题的框架下讨论。
研判 · 与事实分开科学发现被广泛视为 AI 的下一个主战场,头部研究者的路线判断具有风向标意义。
Simon Willison:AI 代写的短视频脚本一眼就能认出
Willison 转引讨论指出,用 AI 写 TikTok 与 YouTube 脚本的痕迹非常明显。
例证包括「不是 X,而是 Y」句式、三段式结构等典型 AI 腔。内容平台上 AI 感正在成为观众流失的信号。创作者与营销方需要在效率与辨识度之间权衡。
研判 · 与事实分开生成内容的可识别性可能反向约束 AI 在内容营销中的使用强度。