AI 每日新知Daily Field Notes

AI 每日新知

今天值得留意的 AI 进展,拆开事实、限制与真正的影响。

第 110 期2026-07-16

今日重点10 条

Seedance 视频生成:少写花哨提示词,先把四个输入钉死

发生了什么:帖中把可复用提示拆为主体、场景、音效、镜头四项:人物先以图生图做参考再复用,场景图交代人与环境比例;只要音效、不生成 BGM;镜头只写景别和动作。其反向建议是不要塞分镜故事板、不要用冗长情绪描写、不要给镜头写 0–3 秒式时间戳;该团队认为当前对提示响应较好的档位是 720p,最终成片再放大。 为什么重要:这把“提示词玄学”拆成可逐项替换的输入,尤其适合短片、广告样片和角色一致性任务。把音乐与画面分离,也给后期剪辑留出了可控空间。

x.com

BaoCut 的开发 loop:原型、同会话实现、测试、发布各用合适模型

发生了什么:他描述的循环是:先用设计 skill 和内置浏览器打磨原型;原型满意后,在同一会话让编码 Agent 按新 UI 实现;测试通过后再用发布 skill 发新版。他的主观分工是 Opus 4.8 用于原型已足够,UI 高保真修改更偏好 Fable 5 或 Opus;不涉及 UI 的部分则认为 GPT-5.6 Sol 表现好。关键并非“某模型全能”,而是把上下文从设计决定连续传给实现与验证。 为什么重要:许多 vibe coding 流程在设计稿与代码之间断档,下一轮 Agent 又重新猜需求。这个 loop 给出一个低成本做法:把原型、实现和测试绑定在同一任务上下文,再把发布动作固化。

x.com

Live Voice 到 Codex task:先边走边说,再把对话附到任务

发生了什么:他的做法是先在 iOS 打开新版 Live Voice,必要时放到后台,同时看着应用或网站口述想法;想清楚后,在 Codex/ChatGPT 桌面端用 @ 附加那条语音对话,或从左上角 Chat 历史中选中该线程,再点 “add to task”。这样语音里形成的计划会作为编码 Agent 的任务上下文,而不是再靠手抄成 prompt。 为什么重要:需求最容易在散步、看产品、做现场观察时出现,但传统编码流程要求先回到电脑整理。该技巧把“发散表达”和“有状态的执行任务”接起来,减少二次转述造成的遗漏。

x.com

Codex 删除文件报告:full access 与 `$HOME` 临时目录是高危组合

发生了什么:Tibo 表示团队调查了少量 GPT-5.6 意外删除文件的报告,常见条件包括:启用 full access、没有 sandbox 保护且未开 auto review;模型尝试改写 $HOME 来定义临时目录,却误把 $HOME 本身删除。他明确称这不应发生,即便用户选择了无保护的 full-access 模式;团队称会改开发者消息、引导更安全权限,并增加 harness 防护,详细 post-mortem 尚待发布。 为什么重要:这不是抽象的“Agent 可能有风险”,而是路径、环境变量和权限共同触发的可操作事故模型。对把编码 Agent 接到真实仓库、个人目录或 CI 主机的人,默认权限设计比提示词更能限制爆炸半径。

x.com

让 Codex 读仓库后用内置 imagegen 换主题:先限定视觉边界

发生了什么:他的提示是“读取这个库,给我们当前 codex 换个主题,用 Codex 内置 imagen 生成”。它把仓库理解与图像生成放在一次任务里:Agent 先拿到现有组件和样式语境,再用图像能力给主题寻找视觉素材或方向。帖子的趣味判断是这种用法像早年换 QQ 皮肤,但真正可借鉴之处是先让工具读取代码基线。 为什么重要:仅说“做个酷炫主题”常会让生成模型忽略现有 token、布局和品牌约束;先读库至少能让任务从已有设计系统出发,而不是从空白画布出发。

x.com

ChatCut:低门槛不是替代剪辑,风格与配音仍需要选择

发生了什么:他认为 ChatCut 可自定义风格、画面比例、配音和 BGM,并可与 Codex 中的 GPT Image 生图能力组合;结论是它降低了新手剪辑门槛,但不替代剪辑。他给出的启动方式是让 Codex 阅读项目链接、安装 ChatCut 插件并开始新任务。与其把工具说成“一键出片”,这条反馈更接近把它定位为从素材到可编辑初稿的入口。 为什么重要:生成式剪辑的价值常被夸大为完全自动化;作者主动保留“不是替代剪辑”的边界,提醒创作者仍要决定节奏、素材取舍、品牌语气和版权。

x.com

Grok Build 开源 harness:先读代码,再判断“最强”是否成立

发生了什么:Yanhua 称 X 算法开源后,Grok Build 也开源,并建议收藏学习,称其为最强开源 harness;同日向阳乔木也表示会交给 Codex 阅读,看看能否挖到有趣实现。这里的信息增量不在排名,而在于开发者把 harness 当作可直接拆解的工程对象:任务编排、工具接口、评估和失败处理都可以从源码中找线索。 为什么重要:很多 Agent 框架讨论停在模型分数,公开 harness 则把“怎样把模型放进循环”暴露出来。对于自建 coding agent、浏览器自动化或评测系统的人,代码比营销截图更接近可迁移资产。

x.com

Agent + Skill + GUI:把自动纠错、命令接口与人工校对拆开

发生了什么:他称纯 LLM 路径先整体翻译、句子配对再拆分,效果不稳定,且 API key 对普通用户不友好;以 Gemini 3.5 Flash 为例,较长视频成本可到数美元。替代设计是:让 Agent 负责翻译时纠错;把 App 能力封装成 CLI;用 Skill 固化转录、润色、翻译、对齐、剪辑等最佳实践;GUI 留给预览、校对和二次编辑。 为什么重要:这不是“让 Agent 全自动做完”的叙事,而是清楚划分机器擅长的批量处理、Skill 擅长的流程约束、GUI 擅长的人类判断。字幕、合同、表格等长流程任务都可能借鉴这种分层。

x.com

模型分工的实战信号:把 UI、复杂并行与日常对话分开评估

发生了什么:该帖子建议主开发和创意工作用 Sol medium,复杂任务开 Ultra 并让多个 subagent 在后台处理,日常对话用 Luna xhigh;同时声称 Sol 给参考后 UI 表现更好、Terra 更容易被提示引导,而 Luna 在模糊任务定义下容易失焦。即使这些名称和套餐随版本变化,方法层面是按任务不确定性与并发需求来选,而不是固定一个“最佳模型”。 为什么重要:模型选择的真实成本包含返工、上下文管理和等待时间。将视觉还原、确定性脚本、研究发散、并行后台任务分开试,通常比看总榜分数更接近团队实际吞吐。

x.com

Claude reset 的反向信号:百分比重置不等于计时器重置

发生了什么:他明确区分了 UI 中的百分比恢复与实际额度计时:这次 reset 没有影响 timer,只改变了百分比显示,因此既有 weekly reset 仍按原计划抵达。这个小信号与当日大量“额度重置”的热闹相反,提醒使用者不要把一次余额补充解读成计费周期、限额窗口或速率限制全面改变。 为什么重要:依赖 Agent 跑日常任务的人,若只看剩余百分比来排期,可能在关键任务中撞上周度窗口。产品额度是工作流约束,应像外部 API 的配额一样被监控和留余量。

x.com