乐于分享
好东西不私藏

AI 越来越强后,最值钱的能力变成了“定义合格”

AI 越来越强后,最值钱的能力变成了“定义合格”

饼饼情报雷达 · 2026.07.26

PRD 没死,但 AI 产品先要写“验收标准”

当模型越来越强,真正稀缺的不是再多一条提示词,而是你能不能说清楚:什么才算交付合格。

“以前我们把需求写成文档;现在还要把失败写成测试。” 

00 · BRIEF

先用 4 个问题看懂今天

资讯 01

Anthropic 产品负责人提出“Evals are the new PRDs”。

原始来源 Lenny’s Podcast 完整访谈

新能力

把模糊反馈转成可复现、可持续运行的验收样例。

加速环节

发现问题 → 复现问题 → 判断改进是否有效。

资讯 02

Claude 团队为新模型删掉超过 80% 的系统提示词,编码评测未见可测损失。

原始来源 Claude Blog 上下文工程文章

新能力

让 Skill 和工具按需加载,替代长期上下文里的规则堆叠。

加速环节

找到相关规则 → 装载上下文 → 开始执行。

资讯 03

斯坦福研究者认为总体就业冲击目前有限,但年轻白领与初级岗位可能先承压。

原始来源 Stanford SIEPR 就业简报

新能力

用数据区分总体趋势、局部冲击与企业裁员叙事。

加速环节

看到热点 → 查证数据 → 形成谨慎结论。

01 · SIGNAL

今天最值得看的一句话

Anthropic 产品负责人 Diane Penn 在当天发布的长访谈里说,团队内部有一句话:Evals are the new PRDs

翻成大白话就是:不要只写“希望 AI 更聪明、更懂用户”,而要收集真实失败,把它们整理成一组可以反复运行、能够判断通过与否的样例

这不是产品经理的专属方法。写公众号、做课程、整理资料、生成视频脚本,都可以先问一句:我准备如何验收这次 AI 交付

AI 产品的分水岭,正在从“会不会提问”变成“会不会定义合格”。

02 · EVAL

把“感觉不好”改成三类验收

最小可用的 eval,不需要搭平台。举个人人都能看懂的例子:你让 AI 做一张小红书封面,结果出来后只觉得“不够高级”。

问题是,AI 并不知道“不够高级”究竟指什么。你需要把这种模糊感觉,改成下面三类可以逐项打勾的验收条件。

第一类:事实是否守住

产品名称、价格和活动日期不能写错,也不能凭空增加卖点。先保证封面上的信息都是真的

第二类:结构是否完成

把图片缩小以后,用户仍能在三秒内看清标题;标题不超过两行;产品必须是画面主角。这些都是可以直接检查的结构条件

第三类:风格是否像你

只使用黑、白和一个品牌色;不使用发光字、复杂渐变和无关装饰;整体要和账号以前发布的内容放在一起不突兀。

这样,“感觉不好”就变成了一张能逐项打勾的检查表。AI 不再靠猜,你也能准确指出它究竟错在哪里。

最小练习

从最近三次不满意的 AI 结果里,各摘出一个具体失败点。把它们改成“出现什么就不通过”“满足什么才通过”。这就是你的第一组 eval。

03 · CONTEXT

上下文不是越多越好

Claude 团队在 7 月 24 日的官方文章里披露:针对新一代模型,他们删除了 Claude Code 超过 80% 的系统提示词,编码评测没有出现可测损失。

关键不是“提示词越短越神”,而是模型能力上升后,过多固定规则会互相打架。更好的做法是:长期说明保持轻量,专业规则按需加载,最后用验收标准兜底

固定规则负责边界,Skill 负责专业流程,eval 负责判断交付是否合格。

04 · WORK

真正的护城河是亲自交付

访谈里另一个很硬的判断是:无论职位多高,做 AI 产品的人都要保留亲自构建和交付的时间。只看演示、只听汇报,很难形成对模型边界的真实判断。

这也解释了为什么许多人用了很久 AI,仍然觉得它“好像没改变什么”。问题常常不是工具不够强,而是我们没有把它放进一个从输入到验收都闭环的真实任务

斯坦福当天被 Hacker News 推上热榜的一份就业简报,也提供了一个必要的冷静视角:目前总体数据还不能证明 AI 已经造成大规模失业,但年轻白领和初级岗位可能先承受局部冲击。

所以,比“哪个职业明天消失”更有用的问题是:我能不能把自己的判断、流程和验收标准,变成 AI 可以重复执行的工作系统

05 · ACTION

今晚就能做的三步

01 选一个每周至少重复三次的真实任务,不要从“学习 AI”这种空目标开始。

02 把最近三次失败结果改写成可以打勾的验收条件。

03 把专业规则做成按需调用的 Skill,长期说明只保留边界和项目特有坑点。

别再问 AI 能做什么。先决定,你准备怎样判断它做对了。

06 · SOURCES

一手信源

① Lenny’s Podcast:Anthropic 首位技术产品经理访谈

② Claude Blog:上下文工程新规则

③ Stanford SIEPR:AI 与就业数据简报

07 · GITHUB

GitHub 热门新增 10 项

已排除昨天日报出现过的项目,热度随时间变化。

01 permissionlesstech/bitchat:蓝牙 Mesh 去中心化聊天。

02 citrolabs/ego-lite:Agent 浏览器自动化运行时。

03 block/buzz:蜂群式协作通信平台。

04 pingdotgg/t3code:TypeScript AI 编码工作台。

05 CoreBunch/Instatic:Agent 驱动的自托管可视化 CMS。

06 yorukot/superfile:现代终端文件管理器。

07 pbakaus/impeccable:改善 AI 生成界面设计质量。

08 shiyu-coder/Kronos:金融市场语言基础模型。

09 Pumpkin-MC/Pumpkin:Rust 高性能 Minecraft 服务端。

10 permissionlesstech/bitchat-android:bitchat 的 Android 实现。

08 · SKILLS

今天推荐的 10 个具体 Skill

按大众创作者的真实工作流推荐,已避开昨天列过的项目。

01 ai-news-digest:公开 AI 信源抓取、去重、日报和视觉长图。

02 bingbing-ai-gzh-workflow:日报转公众号 HTML、预览、配图和清单。

03 gzh-design:Markdown 转公众号后台可复制 HTML。

04 home-cat-content-illustrator:固定宠物 IP 的封面和章节节奏图。

05 douyin-carousel-note:长文改抖音图文轮播与口播要点。

06 content-repurposer-sms:一篇主内容拆成多平台版本。

07 dbs-ai-check:发布前诊断 AI 写作痕迹。

08 dbs-resonate:检查文稿共鸣点和传播风险。

09 dbs-script-flow:检查口播逻辑衔接与流失点。

10 short-video-reader:读取短视频并提取可分析结构。

如果今天只做一件事,就给你的 AI 工作流补一条验收标准。

我是千金(豹豹),分享一线AI信息。欢迎点赞、在看、转发,我们下篇见。