AI 每日新知Daily Field Notes

AI 每日新知

Agent 的瓶颈转向状态管理:eval、handoff、compact、远程执行和失败回路,都是同一个问题的不同侧面:任务跑起来之后,状态必须能被保存、审查和接续。

第 61 期2026-05-26

今日重点3 条

AI agent 评测开始从“凭感觉”变成可运行流程

Aakash Gupta 讨论 PM agent 评测:过去很多团队不做 eval,不是技术做不到,而是手工读 trace、分类失败、写评分规则的启动成本太高。现在用 skill 接入、让 Claude 建议 eval、再把失败样本喂回循环任务,评测开始进入日常工程流水线。

fixupx.com

PM agent 把用户反馈整理压缩成“周一早晨报告”

一个现场演示的 PM agent 连接 GitHub repo,读取 40 条 discussion、60 个 issue 和 8 个 release,自动排序痛点、提炼需求主题并给出当天计划。重点不是替代 PM,而是把“翻反馈、找主题、排优先级”的低杠杆劳动交给 agent。

fixupx.com

OpenAI 团队示例:PM 写 PRD,代码由 agent 生成 PR

Ryan Lopopolo 描述 OpenAI 内部团队的工作方式:PM 周一写 PRD,周五合出 pull request,工程师更多维护 harness、评估与约束,而不是直接敲业务代码。这条延续了今早已报的 AI 编程主线,作为今日主线延展。

fixupx.com