AI 建 造 者 日 报
2026年8月24日 星期一
Follow builders, not influencers · 只看真正在造东西的人说什么
今日导读:OpenAI Codex 承认用量统计异常,宣布修复并对所有付费订阅做全额重置;Box CEO Aaron Levie 提出 evals 才是 AI 落地的真正瓶颈;Meta AI 高管连载讲解如何构建高质量 evals;微软 CTO Kevin Scott 畅谈 Agent 网络蓝图:MCP 之于 AI,就像 HTTP 之于互联网;Replit CEO 放话一周 7 连发。
· · ·
OpenAI Codex 团队回应用量争议:明日修复,付费用量全额重置
OpenAI Codex 与 ChatGPT 团队的 Thibault Sottiaux 公开说明了近期用户抱怨的用量异常问题,排查发现三类原因:长会话多次压缩(compaction)场景下图片处理低效、Computer History 功能的高 p95 用量、以及一个用于生成会话标题的功能消耗了远超预期的用量。他表示已组建专项小组(tiger team),明天开始陆续发布修复,届时还会对所有付费订阅用户的用量做一次全额重置。另外团队还发现了一个能显著提升效率的新优化方向,下周启动。
🔗 https://x.com/thsottiaux/status/2091407991736332689
Box CEO:AI 落地的隐形瓶颈不是模型,而是 evals
Box CEO Aaron Levie 提出一个被大多数人低估的判断:AI 扩散的速度瓶颈在于缺少好的评估体系(evals)。每次模型发布会上的那些评测分数固然有用,但只反映通用能力的轮廓;更大的空间在于针对企业各大工作流、乃至每家具体公司业务细节构建的专属 evals。他的核心逻辑是:无法衡量进展的事情,就无法自动化,企业不可能凭感觉推进。
🔗 https://x.com/levie/status/2091359223368315050
Meta AI 高管手把手教你做 evals:爬山法的正确用法
Meta AI 高级总监 Madhu Guru(此前在 Google 曾主导 Gemini、Veo、Nano Banana)更新了《如何构建优秀的 evals》系列第 6 篇。他说所谓"爬山法"调优并不神秘:挑一个真正重要的维度持续优化即可,比如基于最新生产数据打磨高价值用户旅程的质量、向相邻用例扩张、或者压低成本与延迟。他给了一个典型反例:往上下文里塞 20 个工具,而任务其实只需要 3 到 5 个,此时该做的是用 context engineering 让模型在对的阶段拿到对的工具。关于降本,他再次强调自己的建议:首发就用最强的模型把质量拉满,确认用户真的喜欢这套体验后,再用同一套 harness 把它迁移到更小、更便宜、更快的模型上。
🔗 https://x.com/realmadhuguru/status/2091278653435072523
人才为什么离开大厂:AI 让个体杠杆差出 10 倍
建造者 Zara Zhang(哈佛'17)分享了一个正在发生的现象:同一个有才华的人,做自己的项目时借助 AI 能发挥出 10 倍潜力;而被放进大型组织后,潜力提升最多只有 20%,有时甚至不升反降。她认为这正是越来越多顶尖人才离开大公司的原因,唯一的例外可能只有 OpenAI、Anthropic 这样的头部 AI 实验室。她的另一条观察同样扎心:"所有在 AI 使用上领先的人,都觉得自己落后了。"
🔗 https://x.com/zarazhangrui/status/2091379220257603593
🔗 https://x.com/zarazhangrui/status/2091338374447763481
实用技巧:让 Codex 或 Claude Code 当你的隐私清洁工
AI 实用教程作者 Peter Yang 分享了一个隐私自查方法:在 Chrome 里打开 Google 账号的第三方数据连接管理页面,然后在 Codex 或 Claude Code 里运行提示词,告诉它浏览器里开着一个标签页,让它列出接入你 Google 数据的所有应用,挑出想移除的那些再让 AI 代为操作。他照此执行,一口气断开了 half 数以上早已不需要其 Google 信息的应用。此前他曾公开批评过相关产品的隐私默认设置,如今官方团队快速跟进上线了一键删除外部数据的功能,他也大方点赞。
🔗 https://x.com/petergyang/status/2091331251211059468
Replit CEO:一周 7 天,就该 7 次发布
Replit CEO Amjad Masad 用一句话展示了公司的发版文化:"一周有 7 天,那就意味着 7 次 ships。"配图是他连续一周的产品发布记录。
🔗 https://x.com/amasad/status/2091346778746757204
· · ·
微软 CTO Kevin Scott:Agent 网络的下一段主线(AI & I by Every 精选)
一句话核心:模型的推理能力已经跑到了产品前面,真正的瓶颈变成了"连接":谁先把 agent 接入万物,谁就吃到大平台时代的下一波红利。
Kevin Scott 写了 41 年代码,业余还是个老木匠。在他看来,眼下关于"AI 写代码还算不算手艺"的争论一点都不新鲜:木工圈几十年前就吵过"用电锯算不算真木匠",现在吵的是"用 CNC 算不算"。他的态度是:看重过程还是看重结果都没有错,但在工具变革的关口要保持好奇。他自嘲当年迟迟不愿学 3D 打印机,后来后悔不已,"它对我做的几乎每件事都太有用了"。
作为微软 CTO,他把今年的主题定义为 agentic web(代理网络)。他的判断很直接:「像 MCP 这样简单的开放协议,正在这个代理网络里扮演 HTTP 之于互联网的角色;而 NL Web 这类东西,作用相当于 HTML。」scaling law 依然有效,但他认为行业的集体功课是填平"能力悬置"(capability overhang):模型的推理能力已经超过了我们交付给用户的能力,差距不在模型而在产品。
对"封闭才安全、开放难做好安全"的经典质疑,他认为是个伪命题。agent 身份、权限申请、管理员审批这些机制完全可以在开放协议之上实现,而且他正在微软内部力推一件事:所有内部系统都用标准协议与 agent 对话,免得"把你的组织架构图原样交付出去"(Conway 定律)。他还讲了一个当早发生的细节:登台前收到妻子账号两步验证异常的一串告警邮件,他的第一反应是发短信而非回邮件核验,因为邮箱本身可能已被攻破。在他看来,这种跨渠道交叉验证正是未来安全 agent 该干的事。
一年后的预判:还在拿"技术不够成熟、成本略高"当借口观望的人会大幅落后,因为一切每年都会更便宜、更能干。交互模式将从同步走向异步:你只需说一句"去把这事搞定",agent 会花很长时间调用一整套系统、迭代多轮,然后再回来交给你拍板。
▶ 收看:https://www.youtube.com/playlist?list=PLuMcoKK9mKgHtW_o9h5sGO2vXrffKHwJL
· · ·
"无法衡量进展的事情,就无法自动化。企业不可能凭感觉推进。"
—— Box CEO Aaron Levie
夜雨聆风