他在凌晨发了一条帖子,建议还在OpenAI的同事们,趁还能卖,赶紧把股票变成现金。
发帖者是刚从OpenAI离职的研究员。他在公开的X平台上使用真名,向前东家抛出了尖锐批评。
2026年7月29日,Andrew Ho宣布当天是他在OpenAI的最后一天。入职仅八个月他没有去另一家大厂,而是要创业,做一家专门给AI模型生产训练数据的公司。
这听起来平平无奇但接下来48小时内发生的事,让整个AI圈都坐不住了。
一个从内部走出来的人,说了大实话
Andrew Ho的履历横跨生物医药、金融和AI。他在基因组学公司BioAge待了五年,做过蛋白质组学和药物发现的机器学习,后来辗转金融和生物科技,最终在2025年加入OpenAI。
在OpenAI的八个月里,他参与了GeneBench-Pro,一个用来测试AI在真实科学研究中到底行不行的基准测试。结论写在OpenAI自己的研究页上:最强模型在最高推理设置下,通过率约31.5%。
三道题,只能做对一道这还是最好的情况

▲ OpenAI官网的GeneBench-Pro介绍页,强调科学数据"很少自带说明书"
他在离职帖里用的一个词很快成了讨论焦点:deslop。
"Deslop":2026年程序员最心酸的新动词
Slop,在英文互联网语境里,指的是那些注水、低质量、AI痕迹过重的生成物。Andrew Ho把它变成了一个动词:deslop,也就是清理AI生成代码。
他的原话是这样的:模型可以刷Codeforces竞赛题,可以把C++移植成Rust,速度比他本人还快。他每天依然要亲手给模型提交的pull request做"deslop",删冗余,改风格,修边界条件,把仅能勉强运行的代码整理成可以合并进主分支的工程代码。
这句话像一根针,精准地扎进了所有用过AI写代码的开发者的痛处。
社区讨论很快涌现有人说"deslop悄然成了技术术语,这是今年最搞笑的事";也有人概括为:"Generation got cheap, verification didn't"(生成成本降低了,验证成本依旧)。

▲ "deslop变成技术术语是最搞笑的结果"

▲ "deslop完美描述了当前AI代码的状态"
这个词格外有分量,因为说话者来自地球上拥有最强AI的公司内部。如果在OpenAI内部,用着最新的模型,写代码仍然需要人类善后,那其他人呢?
能力是"尖刺状"的:排行榜上的神,工位上的废
Andrew Ho用了一个精准的比喻:spiky capabilities,尖刺状能力。
AI能力的分布像一片参差不齐的山脉,某些峰值高耸入云(竞赛编程、数学证明、特定格式翻译),相邻的山谷却深不见底(审查复杂代码、在不确定数据上做科学判断、处理真实世界的模糊性)。
为什么会这样?答案藏在训练数据的结构里
编程竞赛有自动判分器数学证明有形式化验证这些领域天然提供免费的奖励信号,模型做对了就加分,做错了就扣分。 于是强化学习在这些领域效果拔群,排行榜上的数字一路飙升。
保险理赔、实验记录解读、临床决策支持和企业审批流程等高价值工作,恰恰缺少干净的奖励信号。 你没办法写一个单元测试来判断"这份分析报告的判断是否合理"。
这就是Andrew所说的核心矛盾:结果可以被机器检查的领域进步最快;大量高经济价值工作却缺少这种条件。

▲ GeneBench论文揭示了一个关键失败模式:模型能完成局部步骤,却在"根据诊断信号调整决策"的闭环上断裂
70万美元的纸上财富,和一句"So I'm just stuck"
离职帖发出后不到24小时,Andrew Ho又公开评论了前沿实验室的估值。
他的逻辑链条很紧:前沿实验室高度不盈利。即便毛利率高,要支撑万亿美元估值,年收入也需要达到1000亿到2000亿美元量级。
实验室还必须持续训练新模型如果OpenAI暂停一年,更便宜的Qwen或Kimi就可能吸引用户。追赶者通过蒸馏等手段缩小差距,领先者被迫在训练上继续加码。Fortune将此比作"红皇后竞赛":拼命跑,只是为了留在原地。
高估值还隐含了"能力会通用到AI agent自己开公司"的假设。如果能力增长更慢、更尖刺、更受数据限制,这个假设就站不住。



▲ Andrew Ho的估值看空长帖,引发了严肃的产业讨论
然后他甚至直接建议还在OpenAI的同事接受tender offer套现,"IPO后再涨一倍不现实,跌50%倒是说得通。"
Fortune的记者找到了他他说自己手上大约有70万美元的OpenAI股份,但在IPO和锁定期结束前不能卖。"So I'm just stuck,"(我被套住了。)他自嘲这是在"talking against my own book",唱空自己持仓的股票。

▲ Fortune官方账号转发:$700K股份被锁定
有人在评论区说:"这帖子是召唤VC支票的完美咒语。"

▲ "完美的VC召唤术"
1000亿美元的数据军备竞赛
这些估值判断背后,还有一个产业级的结构性判断:
Scaling不再免费赠送经济上有用的能力了。前沿实验室未来将花费超过1000亿美元,去采购精准的、可进入训练流程的专业数据。
这个数字听起来惊人,但看看它的逻辑:过去十年,预训练数据的竞争被简化为"谁爬到更多网页"。那些数据几乎零边际成本但当模型进入后训练与agent阶段,有用的训练样本需要领域专家设计任务、构造反事实场景、编写评分器、做泄漏审计,GeneBench-Pro官方材料显示,人工专家完成单道题目可能需要20到40小时。
算力军备竞赛之外,"可验证任务"军备竞赛正在成为故事的另一半。

▲ AI博主Wes Roth的摘要引用帖帮助观点大范围扩散
Andrew的新公司首批产品切入生物学与统计推理,正是他在OpenAI做GeneBench-Pro时最熟悉的领域。他的目标简单粗暴:把AI在科学任务上的可靠性从30%拉到90%以上。
与此同时,播客主Dwarkesh Patel在同一周发文论证算力可能贵10倍以上。他设想能力曲线足够陡峭,收入与算力需求会一起爆发。Andrew Ho则认为能力更尖刺、更受数据限制。两人对同一行业给出了截然不同的判断。

▲ Dwarkesh同期发文看多算力需求,与Andrew Ho的数据瓶颈判断形成对照
历史上的规律:生成越容易,验证越昂贵
回头看,每一次*"生成变容易",都会重新定价"验证"*。桌面出版让排版成本归零,编辑和事实核查反而更贵了;合成图像让生图成本归零,鉴伪和溯源反而更贵了。现在,AI让代码生成成本趋近于零,设计审查、集成测试和"deslop"正在变成新的稀缺品。
Andrew Ho相信这条古老的经济规律会再次生效:当生成的洪水淹没一切,能建造堤坝的人最值钱。
至于他那70万美元的纸上财富,在IPO和锁定期到来之前,它就像薛定谔的猫,既存在又不存在。
"So I'm just stuck."

▲ RuntimeWire报道标题:Andrew Ho离开OpenAI,为科学AI构建强化学习数据集
夜雨聆风