模型与研究6 条
非 LLM 新架构与医疗 AI 是本组两条主线,自动化研究与物理 AI 热度同步升温。
ChatGPT 发明者推出新型模型 Jev:不是 LLM,却让开发者兴奋 来自 TypeSafe AI 的新模型 Jev 号称以更便宜、更快的路径提供「软件智能」,而且并非传统大语言模型。
TechCrunch 报道,Jev 由一位 ChatGPT 发明者参与打造,正在开发者社区引发热烈讨论,被认为展示了通往软件智能的另一条路。Forkast News 的分析进一步指出,「Jev 不是 LLM」这一点可能正是它的卖点。其架构细节与基准成绩 RAW 均未展开,待核实。
研判 · 与事实分开 如果非 LLM 架构真能在成本与速度上形成差异化,将动摇「大力出奇迹」的单一叙事;关键技术信息尚未公开,待核实。
阿里巴巴开源医疗 AI 模型:可检测癌症及近 150 种疾病 阿里开源了一款能检测癌症与近 150 种病症的医疗 AI 模型。
据《南华早报》报道,该模型以开源形式发布,覆盖癌症及接近 150 种疾病的检测。开源意味着医院与研究者可以本地部署、二次开发,有望加速辅助诊断的普及。具体基准成绩与临床验证情况 RAW 未提及,待核实。
研判 · 与事实分开 医疗是 AI 落地最看重可信度的场景,中国头部公司选择开源而非闭源 SaaS,可能改变全球医疗 AI 的分发方式。
全球首例:AI 实时辅助脑部手术成功切除肿瘤 BBC 报道,全球首例接受 AI 实时辅助脑部手术的患者已成功切除肿瘤。
手术过程中由 AI 提供实时辅助,患者肿瘤被成功切除,为「术中 AI」提供了首个公开真实病例。此前 AI 多用于术前影像与规划,进入实时术中环节意味着对延迟与可靠性的要求达到了新门槛。技术细节与术后随访数据 RAW 未展开,待核实。
研判 · 与事实分开 从影像诊断走向术中实时辅助,是医疗 AI 从「建议者」变成「参与者」的关键一步。
论文:递归扩展自动研究循环,让 Agent Harness 更高效 新论文(arXiv 2609.20519)提出用递归扩展的自动研究循环来提升 Agent 运行框架的效率。
该工作经 DAIR Academy 的 SOL-Pi 系列推荐,核心思路是让自动研究循环自我递归扩展,以更少资源产出有效改进,与当下「AI 做 AI 研究」的自动化趋势直接相关。论文实测效果与适用范围需读原文确认,待核实。
研判 · 与事实分开 若自动研究循环可规模化递归,实验迭代成本会进一步下降,但也会加剧对「自动加速失控」的担忧。
世界模型公司集体保密:手握巨额资金却不愿透露在造什么 TechCrunch 观察到,世界模型赛道融资与声量俱佳,但从创始人到数据供应商都不愿透露具体在做什么。
报道称这一赛道的公司普遍「坐在一堆现金和热度上」,但对外几乎零信息披露,连自家数据供应商也三缄其口,行业热度与透明度形成鲜明反差。各家具体技术路线与数据来源 RAW 未给出细节。
研判 · 与事实分开 高度保密往往意味着差异化数据或路线的竞争已白热化;对押注该方向的开发者和投资人,尽调难度显著上升。
具身智能的「GPT-3 时刻」?AI Supremacy 聚焦 Skild S1 AI Supremacy 专栏提出:2026 年具身智能与机器人可能正处在类似 GPT-3 的里程碑节点,并以 Skild S1 为例。
专栏认为具身 AI 在 2026 年出现了可与当年语言模型相类比的跨越信号,文章指向 Skild 的「S1」。这与 UP.Labs 更名 Vantora 押注物理 AI 等消息相互呼应。Skild S1 的具体规格与实测表现 RAW 未说明,待核实。
研判 · 与事实分开 如果物理 AI 真在复现语言模型的「涌现前夜」,机器人基础模型将成为下一个平台级竞争。
产品与公司7 条
Anthropic 一天三件事:建实验室、推迟 IPO、请外部裁判;消费与娱乐巨头则把 AI 人才和 Agent 推向前台。
Anthropic 悄然设立生物学实验室,加速 AI 药物研发 据独家报道,Anthropic 已建立一间开展真实生物学实验的实验室,为其 AI 药物项目加码。
TechCrunch 与路透(经 Yahoo Finance 转载)均证实,这家以「AI 可能毁灭人类」论著称的公司,同时运营着做湿实验的生物实验室。AI 领袖长期宣称 AI 是攻克疾病的关键,Anthropic 正在把这句话变成内部项目。实验室规模、研究方向与安全边界 RAW 未详述,待核实。
研判 · 与事实分开 能力扩张(湿实验室)与安全承诺(外部评估、限速)同时推进,Anthropic 在「边加速边刹车」,两条线是否自洽值得持续观察。
Anthropic 将 IPO 推迟至 11 月 《华尔街日报》消息,Anthropic 的上市时间表较此前预期推迟约一个月,定于 11 月。
多个渠道转引 WSJ 报道称 IPO 将在 11 月进行,比原计划晚一个月。这发生在其密集公布安全与业务动作(生物实验室、外部评估方)的同一周,时机选择引人猜测。推迟原因 RAW 未说明,待核实。
研判 · 与事实分开 作为头部 AI 实验室中最早的直接上市标的之一,其最终定价将为整个 AI 板块树立估值锚。
Anthropic 首个「嵌入式评估方」是埃森哲,并承诺投入 10 亿美元 Anthropic 选择埃森哲作为首个外部嵌入式评估机构,并承诺投入 10 亿美元用于 AI 安全监测。
《华盛顿邮报》报道 Anthropic 聘请咨询公司监测 AI 安全并承诺 10 亿美元投入;TechCrunch 随后确认这家公司是埃森哲,并称这将是该咨询公司史上风险最高的咨询项目。嵌入式评估意味着第三方将直接进入开发流程实施监督。具体评估范围与权限 RAW 未详述,待核实。
研判 · 与事实分开 用商业咨询巨头而非学术机构当「裁判」,独立性与专业能力如何平衡,是这一模式的第一个待检验点。
Google 推出家庭 AI Agent「CC」:帮全家管日程、填表、列购物单 Google 将其 CC 智能体重新聚焦于家庭协作,统一管理全家人的邮件、日程与任务。
据 TechCrunch,CC 可以帮家庭管理日历、填写表单、生成购物清单、计划餐食等,定位是全家共用的管家式 Agent。这是大厂少见的把多用户家庭场景作为 Agent 主战场的尝试。隐私设计与家庭成员权限方案 RAW 未展开,待核实。
研判 · 与事实分开 消费级 Agent 一直缺少杀手级场景,「家庭操作系统」可能比个人助理更高频,也是获取全家数据的入口。
迪士尼任命首任 CTO:人选来自曾被迪士尼发函指控抄袭的 Character.AI Character.AI 前 CEO 将出任迪士尼历史上首位首席技术官。
TechCrunch 报道,迪士尼此前曾向 Character.AI 发出停止侵权函,指控其抄袭迪士尼角色;如今该公司前 CEO 却成为迪士尼首任 CTO。这被解读为传统娱乐巨头对 AI 人才与技术的全面转向。其具体职责范围 RAW 未详述。
研判 · 与事实分开 版权原告把被告公司的 CEO 招进最高技术岗位,说明好莱坞对 AI 的态度正从对抗转向收编。
Manus 寻求以 40 亿美元估值融资 5 亿美元,恢复独立运营 Manus 正洽谈以 40 亿美元估值募集 5 亿美元,此前它与 Meta 的合并已告吹。
TechCrunch 报道,Manus 今年早些时候被迫中断与 Meta 的合并,如今作为独立公司重启融资谈判,Agent 赛道的资本热度由此再获注脚。投资方与资金用途 RAW 未披露,待核实。
研判 · 与事实分开 合并失败后仍能以 40 亿美元估值融资,说明资本市场对通用 Agent 的热情并未因并购市场降温而减退。
UP.Labs 更名 Vantora:融资 1 亿美元,全面押注物理 AI 专为产业公司「孵化初创」的 UP.Labs 以新名字 Vantora 完成 1 亿美元融资,all-in 物理 AI。
TechCrunch 报道,UP.Labs 现以 Vantora 名义运营,模式是为工业巨头从零创建初创公司,本轮募集 1 亿美元,资金将投向物理 AI 方向,与本周具身智能升温同步。具体投建对象 RAW 未点名。
研判 · 与事实分开 「为传统产业定制 AI 初创」是介于风投与咨询之间的新模式,若跑通可能被各工业集团批量复制。
开源与工具4 条
Agent 基础设施继续补齐:配置标准、代码托管、代码评审各进一步。
Claude Code 2.1.277 开始支持 AGENTS.md Claude Code 在 2.1.277 版本中加入 AGENTS.md 支持:目录里没有 CLAUDE.md 时会自动查找并使用 AGENTS.md。
Thariq Shihipar 宣布该功能,Simon Willison 转述。AGENTS.md 是面向各类编码 Agent 的通用配置规范,此举意味着项目指令文件可以在不同工具间复用,减少每个工具各维护一份说明的负担。官方称其实现基于 CLAUDE.md 的既有能力。
研判 · 与事实分开 配置文件标准化是 Agent 生态走向互操作的信号,「写一份 AGENTS.md 走天下」正在成为现实。
Agentgit:给 AI Agent 用的 Git 托管,免账号、免 token、免密钥 Show HN 项目 Agentgit 提供面向 AI Agent 的 Git 托管服务,无需注册账号或配置令牌。
作者将其定位为 AI Agent 专用 Git 托管,主打零摩擦接入:无账号、无 token、无密钥,在多 Agent 并发读写代码仓库的场景下可降低编排成本。其安全模型与滥用防护机制 RAW 未说明,待核实。
研判 · 与事实分开 Agent 的版本控制正从「凑合用人用的工具」转向专用基础设施,免密钥设计的权限边界尤其值得观察。
CRT:面向 Agentic 开发的本地代码评审工具开源 开发者开源了 CRT,一款在本地运行、专为 agentic 开发流程设计的代码评审工具。
项目托管在 GitHub(imron/crt),用于在 Agent 大量产出代码的工作流中做结构化评审。它回应的是当下真实痛点:AI 写码速度远超人类评审速度,需要专门的工具链承接。功能细节与支持的语言范围见仓库说明。
研判 · 与事实分开 当「生成」不再稀缺,「评审」成为新瓶颈,本地化评审工具可能是 AI 原生开发闭环的最后一块拼图。
Warp 的一线经验:用人类反馈让 Agent 建立自我进化循环 宝玉撰文拆解 Warp 如何用人类反馈持续改进 Skill,为 Agent 搭建低摩擦的自我进化机制。
文章介绍 Warp 把用户对 Agent 输出的反馈沉淀为 Skill 的持续改进,使同一套 Agent 越用越贴合团队习惯,为「Agent 产品如何建立数据飞轮」提供了可参考的工程范式。具体实现细节以原文为准。
研判 · 与事实分开 自我进化循环是 Agent 产品拉开长期差距的关键,反馈到 Skill 的闭环设计值得所有 Agent 团队借鉴。
政策与观点8 条
美国两州一法院同日出手,监管从模型行为蔓延到数据中心与就业市场。
加州州长签署行政令,推动为前沿 AI 设「kill switch」 加州州长 Gavin Newsom 发布行政命令,欲让该州在 AI 监管上领跑,包括可能强制前沿模型配备「kill switch」。
The Verge 报道,行政命令于周五发布,州长同时动员专家小组强化 AI 安全法律。加州作为多数前沿实验室所在地,其立法风向直接影响全国。「kill switch」的具体技术要求与生效路径尚未明确,待核实。
研判 · 与事实分开 若「kill switch」写进州法,将成为全球首个对前沿模型的强制性熔断要求,实验室的部署与发布策略或被迫调整。
弗吉尼亚州长设立 AI 工作组,并着手为数据中心热降温 州长 Abigail Spanberger 下令让地方社区对数据中心建设拥有更大发言权,并放缓审批。
The Verge 报道,弗吉尼亚作为数据中心重镇,新政府同时设立 AI 工作组并调整数据中心开发的审批节奏,让地方社区话语权变大。这与加州从「模型安全」切入不同,是从算力基建侧下手。具体行政令条款见原文。
研判 · 与事实分开 AI 监管正从模型行为扩展到电力、土地与社区利益,数据中心选址将成为地方政治的新战场。
联邦法院叫停蒙大拿州 AI 竞选广告法 一家联邦法院阻止了蒙大拿州 AI 竞选广告法的实施。
Montana Free Press 报道,这部原本要求对 AI 竞选广告进行约束的法律被联邦法院叫停,与眼下不断升温的政治深度伪造监管形成拉锯。判决理由与适用范围 RAW 未展开,待核实。
研判 · 与事实分开 在选举周期内,司法系统对 AI 选举内容监管的态度将直接决定各州类似立法的可行性。
NPR 调查:Google 正在多州参与起草 AI 聊天机器人法律 NPR 报道,Google 深度参与了美国多州 AI 聊天机器人安全法案的起草过程。
报道揭示了科技巨头如何把监管变成对己有利的合规框架:影响条款设计而非单纯抵制立法,这与Google 在加州和联邦层面的游说布局相呼应。具体涉及哪些州与条款 RAW 摘要未列出,待核实。
研判 · 与事实分开 「由被监管者参与起草监管」若坐实,将加剧公众对州级 AI 立法独立性的质疑。
AI 幻觉险些触发美军行动:关于中国船只的错误情报 美军一度接近基于 AI 生成的错误情报对一艘中国船只采取行动,事后被证伪。
qz 与 TechCrunch 均报道此事,GovAI 研究学者提醒:军人必须理解 LLM 内在的不确定性。事件暴露了 LLM 进入高决策链路的致命风险:幻觉在民用场景是笑话,在军事场景几乎等于一次行动。涉事系统与环节 RAW 未详述,待核实。
研判 · 与事实分开 这可能是首例被公开披露的「AI 幻觉险些触发军事行动」案例,将直接推动军方对 LLM 使用的硬性约束。
AI 基建潮加剧美企隐性债务风险 中国经济网分析指出,美国 AI 基础设施投资潮正通过隐性方式累积债务风险。
文章认为,算力与数据中心的巨额开支背后,风险正在被低估,与「大空头」原型 Eisman 称公司在制造危机的言论形成共振。具体数据与案例见原文。
研判 · 与事实分开 若隐性债务规模确实可观,AI 资本开支周期可能比股价暗示的更脆弱,值得所有从业者关注融资环境变化。
The Register:AI 让计算机专业毕业生面临「类衰退」就业市场 报道指出,计算机专业应届生的就业前景已接近经济衰退时期的水平。
The Register 汇总了入门级编程岗位收缩的证据,指向 AI 对初级开发工作的替代与压缩。这对「学计算机等于好就业」的长期共识是又一次冲击,也与国内「AI 时代还要不要学英语」的讨论同构:基础技能的价值正在被重新定价。具体数据见原文。
研判 · 与事实分开 入门岗位是行业人才管道的入口,若持续萎缩,数年后的中高级工程师断层将难以弥补。
AI 时代,中国越来越多人重新掂量「学英语值不值」 《纽约时报》报道,随着 AI 翻译普及,中国部分家长与学习者开始质疑英语教育的必要性。
报道称这一讨论正在影响英语学习市场与教育规划,Hacker News 上也引发热议。语言能力长期是职业溢价的来源,AI 实时翻译正在侵蚀这一溢价的基础。原文基于个案与访谈,代表性有限,待核实。
研判 · 与事实分开 语言只是开始,凡是 AI 已接近可用的技能(翻译、初级编码、基础设计)都面临同样的价值重估。
专家观点5 条
限速还是全速,是今天最尖锐的分歧。
踩刹车还是踩油门:Amodei 提「Pace the Frontier」,黄仁勋喊「越快越好」 Anthropic 研究员末日警告余波未平,Amodei 给出「给前沿限速」的方案;黄仁勋则呼吁以最快速度发展 AI。
TechCrunch 指出,Amodei 的「pace the frontier」计划在其研究员末日警告引发震动一周后出炉,但具体如何执行仍不清楚。The Verge 以「超级智能减速」概括这一转变:在失控 AI Agent 已成现实的这个夏天之后,「快速行动、打破常规」不再是默认选项。黄仁勋则在 CBS 采访中呼吁 AI 发展「as fast as we can」,两大阵营的分歧公开化。
研判 · 与事实分开 「限速」由谁执行、如何验证是核心难题;而算力供应方的明确反对意味着这场争论远未收敛。
Ethan Mollick:真正的问题不是被取代,而是「The Overhang」能力积压 沃顿教授 Mollick 提出当下关键词「overhang」:模型已具备、但组织与个人尚未消化的能力落差。
文章主旨是让人动用深度知识、广度、品味与能动性去消化这段能力积压。言下之意:当下最大的机会不在于等待更强的模型,而在于把现有模型能力用满。完整论述见原文。
研判 · 与事实分开 在模型迭代放缓、监管收紧的背景下,「消化存量能力」可能比「追逐新模型」更具现实回报。
Simon Willison:拒绝研究 LLM 的计算机科学家,就像拒绝研究侏罗纪公园的遗传学家 Willison 用侏罗纪公园作比,回应「LLM 没什么意思」的论调。
他在 9 月 18 日的随笔中写道:在这个领域刚刚「开园」的时点拒绝研究,是从业者对时代的失职,该比喻在社交网络上被广泛转发。这也是对本周年度级安全事件频发的最佳注脚:研究对象正在主动制造新闻。
研判 · 与事实分开 当「不感兴趣」成为一部分学者的姿态,谁来系统性研究这些系统出问题的方式就成了真空。
Nathan Lambert:封闭模型才是 AI 风险的冰山一角,而非开源 针对 OpenAI 被 Claude 辅助攻破一事,Lambert 重申判断:外部攻击风险集中在闭源模型身上。
他在 Bluesky 上给出理由:封闭模型即开即用、更易上手且难以审计,开源模型反而因透明与可控长期被高估了风险。此番评论与 The Verge 的 OpenAI 被黑报道相互印证。完整论点见原帖。
研判 · 与事实分开 若安全社区接受「闭源意味着更大外部风险」的排序,现行的开源恐慌叙事与监管重点都需要重排。
「大空头」原型 Eisman:AI 危机是公司们制造出来的 因做空次贷成名的 Steve Eisman 称,当前围绕 AI 的危机叙事很大程度上是企业刻意制造的。
在 YouTube 访谈中,他认为企业有动机夸大 AI 的危机感与紧迫感,以服务融资与估值叙事,这与 AI 基建隐性债务的担忧形成跨市场呼应。完整语境见视频。
研判 · 与事实分开 当「泡沫怀疑派」与「末日警告派」同时在场,说明市场对 AI 定价已失去共识锚点,波动只会更大。