AI 每日新知Daily Field Notes

AI 每日新知

今天最清晰的共同信号不是某一个模型“胜出”,而是评估单位正在变成完整工作流:价格和并发、首次可用产物、工具入口、订阅打包与人工验收,缺一项都会让单点体验失真。

第 138 期2026-08-13

今日重点10 条

DeepSeek-V4-Pro-0813 的价格与并发信号

证据类型:C 级一线观察。8 月 12 日,@vista8 记录 DeepSeek-V4-Pro-0813 已可使用,并列出其当时所见的百万 Token 计费:缓存命中输入 0.025 元、未命中输入 3 元、输出 6 元;同时称并发上限为 500,并提醒价格可能调整。这是一次可追溯的产品侧观察,而不是厂商价格页或 SLA,因此不应把数字当作长期承诺。发生了什么:一款以日期命名的新版本进入开发者讨论,成本与容量成为首要比较维度。为什么重要:模型采购不只比较能力,缓存命中率、输出长度和并发限制会直接改写总成本。实际影响:团队应在控制台复核地区、套餐与生效时间,并用自己的提示集测首 token、长输出和限流。边界:未独立验证,且帖文明确提示价格可能上涨;不推导模型能力结论。原始出处:https://x.com/vista8/status/2087565229224034521 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

DeepSeek 的三类端到端任务展示

证据类型:C 级可操作体验。同日 @vista8 用 DeepSeek V4 Pro 0813 描述了三个小任务:调用三个 Skill 完成网站开发、子域名解析与上线;生成 60 种 Bento 风格展示;用 Three.js 做 3D 打砖块游戏。发生了什么:测试没有停留在单轮问答,而是把工具调用、视觉生成与浏览器交互放进同一组演示。为什么重要:这类任务更接近代理式开发的真实摩擦点:权限、工具失败、部署回滚与产物可维护性。实际影响:可把三个任务拆成内部验收集,分别记录人工介入次数、代码可运行性、部署权限和视觉一致性,避免只凭截图采购。边界:个人帖子未给出完整提示词、运行日志、模型参数或重复次数;只能视为候选工作流,不能证明稳定成功率。原始出处:https://x.com/vista8/status/2087577905081823559 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

Grok 4.6 与 DeepSeek 的主观对比

证据类型:C 级观察。@vista8 以相近提示词做了 Grok 4.6 与 DeepSeek V4 Pro 的对照,并称 Grok 在一次成功率上感觉更好、DeepSeek 在价格上占优;作者同时明确测试主观、生成具有随机性,生产口碑仍更重要。发生了什么:模型比较从跑分转向“首次是否交付可用产物”的体验指标。为什么重要:一次成功率对非技术用户和高频原型工作影响大,却又最容易被样本选择误导。实际影响:评估时应固定提示词、温度、工具权限与验收标准,至少多轮重复,并将失败类型分为事实、代码、UI 和执行权限。边界:没有独立基准、样本量和费用明细;结论不得外推至所有任务或版本。原始出处:https://x.com/vista8/status/2087594418534859050 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

Grok 4.6 的创意代码产物案例

证据类型:C 级体验展示。@vista8 报告用类似提示词生成打砖块游戏和 60 种 Bento 样式;其主观印象是游戏出现了熔炉叙事与音效,部分视觉样式优于 DeepSeek 对照。发生了什么:一个模型被用于将前端创意、交互和视听细节合并生成。为什么重要:视觉原型的可用性不只取决于代码能否运行,也取决于设计变体、素材版权、性能和后续可编辑性。实际影响:设计与工程团队可以将“变体数量”变成快速探索工具,但应让人工挑选方向、检查依赖来源并在真机验证。边界:帖子含演示链接但没有可复现仓库、性能数据或人类盲测;不构成能力排行。原始出处:https://x.com/vista8/status/2087590765354701133 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

非思考模式下的 SVG 动画尝试

证据类型:C 级单例实验。@vista8 特别注明未开启思考模式,使用“鹈鹕骑自行车 SVG、撞上大象、循环播放”的提示观察 DeepSeek V4 Pro 产物。发生了什么:测试把矢量图、时间线与循环动画压缩为一个小型生成任务。为什么重要:这类任务能暴露模型对 SVG 结构、关键帧、DOM 兼容性以及语义指令组合的掌握程度。实际影响:开发者可用它建立廉价 smoke test:将输出存为文件后用浏览器、linter 和无障碍检查器验收,再决定是否进入产品代码。边界:单个提示词和展示媒体无法说明跨浏览器兼容、复杂动画可靠性或思考模式差异;应视为待复现实验。原始出处:https://x.com/vista8/status/2087566666477744620 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

Claude 研究版本推进黎曼假设相关下界

证据类型:A 级官方研究声明。Anthropic 8 月 12 日表示,一个未发布的 Claude 研究版本没有解决黎曼假设,但在相关问题上将满足该假设的黎曼 ζ 函数零点比例下界从 41.6% 提升至 67.2%。发生了什么:厂商把模型用于数学研究中的具体中间命题,而非宣称解决开放难题。为什么重要:这是对“模型参与形式化或半形式化研究”价值的更谨慎表述:可产生可审查的推进,而不是替代同行验证。实际影响:研究团队可关注问题分解、证明检查、反例搜索和专家复核的协作链路。边界:声明所涉模型未发布,帖文本身不是论文全文或独立复核;结果的证明状态、方法与可复现材料仍须以官方后续材料为准。原始出处:https://x.com/AnthropicAI/status/2086867246073401655 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

用模型防御系统的安全倡议

证据类型:A 级官方账号声明,但信息量有限。OpenAI CEO Sam Altman 在 8 月 12 日发文建议组织考虑使用其模型帮助防御系统。发生了什么:模型提供方将生成式 AI 的安全用途直接置于公共讨论中。为什么重要:安全团队正在评估把模型接入告警归因、日志摘要、漏洞修复建议和钓鱼分析,但这些用途有数据泄露与错误自动化风险。实际影响:企业若试点,应从只读、可审计、低权限场景起步,保留人工批准和数据脱敏,并按攻击链环节评估误报漏报。边界:原帖没有给出产品名称、能力范围、基准或部署政策,不能据此推断新功能已经发布。原始出处:https://x.com/sama/status/2086881528282587524 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

Grok Build + Grok 4.6 的重度使用建议

证据类型:C 级从业者推荐。@Khazix0918 表示其计划把 Grok Build 与 Grok 4.6 作为一段时间内的 Vibe Coding 主力,并描述了 4 小时编码、300 美元周额度消耗约 2%以及会员捆绑 Cursor Ultra 的个人体验。发生了什么:订阅额度、速度和工具入口被打包成开发者迁移理由。为什么重要:模型选择越来越是工作流、配额和集成选择,而非单纯模型 API 选择。实际影响:个人开发者可记录真实消耗、排队时间、项目复杂度和迁出成本,再比较不同订阅;团队要先审查账户、数据与第三方条款。边界:这是个人账户与任务组合下的观察,未独立验证,也不能代表所有地区、套餐或企业负载。原始出处:https://x.com/Khazix0918/status/2087668888117129637 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

朋友圈“AI 帮写”的灰度入口观察

证据类型:C 级产品入口观察。@vista8 称其看到微信朋友圈灰度“AI 帮写”:上传天气截图后,默认提示可生成三条朋友圈文案并允许选择写入输入框。发生了什么:多模态识图与文案生成被放入高频社交发布路径,而不是单独聊天页。为什么重要:AI 的采用常由入口位置而非模型品牌决定;默认提示、可见性和误触风险会影响用户行为。实际影响:产品团队可关注是否有明确 AI 标识、可编辑性、上传数据告知与年龄/内容保护;用户应在发布前人工复读。边界:灰度范围、版本、地区与正式上线计划未获官方文档验证,不能称为全面发布。原始出处:https://x.com/vista8/status/2087357417923506231 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。

/ljg-classic:文言文逐字解读 Skill

证据类型:C 级转引的可操作工作流。@dotey 转引李继刚的更新:新增 /ljg-classic,用途是把文言文做逐字解读与章节释义,并给出以《金刚经》第一品为例的调用方式。发生了什么:一个提示/Skill 被封装为面向具体文本学习任务的固定入口。为什么重要:可复用的任务模板比泛化聊天更容易降低入门门槛,也方便教学者统一输出格式。实际影响:读者可将其作为练习脚手架,同时要求模型标注原文、断句依据、不同释义与无法确定处,避免把流畅解释误当权威注释。边界:这是转引帖,尚未独立检查其完整提示、许可证、模型版本或学术准确度;只适用于辅助学习,不替代可靠版本和教师判断。原始出处:https://x.com/dotey/status/2087681687136121206 补充核对:发布前应把这条线索与所用账户、模型版本、访问日期和实际任务绑定保存;若后续出现官方文档、代码仓库、价格页或可复现实验,应以新证据更新而非倒推本条结论。对读者而言,当前最稳妥的用法是把它作为下一轮检索与小规模验证的起点,并明确记录与自身环境不一致的部分。