夜雨聆风学习资料网

ARTICLE · 1103120

聪明的软件,而不是更快的代码

聪明的软件,而不是更快的代码

学习笔记 · The a16z Show

a16z 对谈 TypeSafe 创始人迪奥戈·阿尔梅达(Diogo Almeida):AI 如此聪明,自动化却迟迟不来。Jev 想做的,是给软件一块会判断的新积木。

本文的核心命题:把 AI 做进软件里——Jev 用自然语言、状态机与置信度,把‘会判断’嵌进软件,让软件第一次能‘做我所指’。

先听一句劈头的问题:“自动化都去哪儿了?”这是 TypeSafe 创始人迪奥戈·阿尔梅达(Diogo Almeida)最喜欢的电梯演讲。本期 The a16z Show 的官方标题是《How Jev Turns AI Into Software That Gets Things Done》(Jev 如何把 AI 变成能干成事的软件):对谈的一方是 a16z 的两位主持人,另一方是这位主持人口中“站在这些早期 GPT 背后”的工程师——他自述当年在 OpenAI“为发布那个模型出力甚多”,如今出来做自己的东西。

他做的东西叫 TypeSafe,产品叫 Jev:把 AI 做成软件的一部分,而不只是给人类加一个聊天窗口。Jev 是这个方向上的第一个模型——一块可以嵌进代码的智能原语:你用自然语言描述目标,给它一个状态机,它带着置信度替你在状态之间做选择。

本文按主题重组这场约四十二分钟的对谈:从“自动化都去哪儿了”这个悲愤的开场出发,经过 Jev 的原语定位、“聪明的软件”与“更快的代码”之别、分类器之辩,进入人物经历与“我们造产品,不造神”的立场,再落回自动化的北极星、可靠性、SaaS 的反转与新能力,最后抵达系统内脏与“做我所指”。全文依据视频的英语字幕整理,引语为中文转译;自动字幕里无法还原的名称(Jev、Claude Code、SVM 等)按检索核实后的写法书写,存疑处均以编者注标明。

01

自动化都去哪儿了?

迪奥戈最喜欢的电梯演讲,就是那句劈头的问题:“自动化都去哪儿了?”AI 聪明得难以置信,却只在两件事上真正有用:聊天机器人和编码智能体。他并不讨厌这两者——他自己就爱用——真正的悲剧在于其余的一切:我们手里握着大量“未经打磨的钻石”,却没有把它们用于真正的工作。

更扎心的对照是:AI 这几年突飞猛进,软件本身却十年未变。我们最多能在旁边挂一个小聊天机器人,让它执行一些动作——但不是所有动作,因为有些动作现在还不可靠。他说,没人能把这两件事在脑子里摆到一起。

这笔账还有财务的一面:自动化的经济激励如此巨大,现实中真正被自动化的东西却如此之少。世界与现实的这种失谐让他痛苦——也正因为 AI 的潜力如此之大,迟迟不发布才显得格外可惜。顺带一提:OpenAI 从 2020 年起就在试图自动化客服,至今没有完全成功——这句话后面还会回来两次。

AI 聪明得难以置信,而软件十年未变——没人能把这两件事摆到一起。

02

Jev:嵌进软件的智能原语

TypeSafe 在做的事,一句话说是“做给软件的 AI”:不只是让人类在回路里用 AI,而是让 AI 真正参与构建软件、成为软件的一部分。Jev 是他们在这个方向上的第一个模型,目标是让自动化“好得多”。

它的形态更像一个库:你用自然语言描述你想要什么,再给它一个状态机(state machine),它带着置信度(confidence levels)替你在状态之间做选择。这种无处不在的置信度,此前的软件栈里基本没有过。

市场反应佐证了稀缺性:发布之后,用主持人的话说,它“在软件圈烧了起来”——他认识的每个开发者都打来电话说“这玩意太牛了、太快了、一切都变好了”。主持人的问题随之而来:我们不是已经有 Claude Code 和 Codex 了吗?差别在哪?又怎么通向真正的自动化?这就要回到“聪明的软件”这个词。

你用自然语言描述你想要什么,再给它一个状态机——它带着置信度替你做选择。

03

聪明的软件,而不是更快的代码

两种路线:上方是“即时软件”——更快地写出同样的代码;下方是 Jev 想做的“聪明的软件”——给软件增加新能力。“即时软件”一说出自加里·坦。

先把编码智能体的好话说足。迪奥戈喜欢加里·坦(Gary Tan)给 Claude Code 和 Codex 的评语:即时软件(just-in-time software)——即场把软件做出来,你可以用自然语言编程,而表达力与软件相同。这是一个了不起的描述。

但他要的不是这个。他要的是聪明的软件(smart software):不是把软件工程自动化,而是扩展软件本身能做的事,让那些“本该可自动化的事”终于可自动化。说得抒情一点:他想表达意图(intent),想扩充我们有能力去做的事情的词表。

在他眼里,编程本来就是“把有价值的东西超规格地写清楚,然后无限复制”——这酷得不得了,他想把这件事放大。

许多人都错过了那个微妙而重要的区别:Claude Code、Codex、Cursor 写的是代码,但那基本还是人类会写的代码——也许更好,也许更坏,总之还是十年前的代码的模样。Jev 的不同在于:无论你是 Claude Code 还是一个人类,你手里都多了一块可以嵌进代码的新原语,它直接扩展软件的力量。

主持人替他把结论说破:所以这不是“用一个更快、甚至不一定更好的工程师去替换工程师”,而是给我们已有的工程师超能力,让他们写出好得多、有意思得多的东西。

不是自动化软件工程,而是扩展软件本身能做的事。

04

“它就是个分类器”——这是夸奖

迪奥戈在入职培训时画的文氏图:AI 擅长的与代码里有价值的,交集才是 Jev 的落点;不碰外推浮点数,保留概率与置信度。

这块原语的另一个不同之处,是把概率带进了软件内部——一层内嵌的智能。迪奥戈承认,“机器原生”的表示不必与比特完全对齐,把两者接起来正是他们想做的手艺:入职第一天的培训里,他会画一张文氏图——一边是 AI 擅长的,一边是代码里有价值的,而他们做的是中间的交集。

交集有边界:他们不输出外推浮点数(extrapolated floats),因为 AI 就是不擅长这个;而概率这种东西并不新鲜。这正是“Jev 不就是个分类器吗”这句质疑的来处。

他的回应毫不遮掩:Jev 绝对是个分类器——“分类器很酷,分类器生来就是有用的”。这些机器学习概念本来就来自一群想把系统真正做出来的实用主义者,接口也是相通的。他甚至给出一个估计:与其雇一支 2019 年水准的机器学习工程师(MLE)团队来做这些事,Jev 大概率更强,而且可以随写随用。要知道,当年有足够好的 MLE 团队、能收集数据集、能做测量的公司本就不多——谁知道本来能造出什么。而这只是开始。

主持人追问设计空间:一端是今天的“语言进、语言出”,另一端是既有的命令式程序,中间是不是一根可以滑动的滑杆?还是说“语言进、状态机出”会固化成程序员的通用工具?他分两层作答。心里那层:它是一根滑杆。接口里把输入叫作“状态”(state)是有意为之——这是程序的内部;他如今的大量工作,是让更复杂、更精巧的程序内部状态也能装进智能。而他的北极星是每美元智能(intelligence per dollar)——他坦承这可能是个错误的选择:短期内,每秒智能(intelligence per second)也许更值钱。

务实的那层:在毫秒级的延迟上做 AI 更容易,所以一段时间里它会更像一个数据库,而不是标准库里随手可用的东西——但他当然希望它最终也进标准库。把更多内部状态交给智能,会是一场长期存在的拉锯战。

Jev 绝对是个分类器。分类器生来就是有用的。

05

从数学竞赛到 OpenAI

八站路线,按对谈中提到的顺序排列(间距不表示时长):从数学竞赛到 TypeSafe。

主持人好奇:能同时像 AI 研究者、系统人和程序员一样说话的“炼金术”是怎么来的?他自评履历“不太正统”:拿过奖的数学竞赛选手(mathlete),还开了个自嘲的玩笑——数学好到“能靠它交到女朋友”。但他其实从没真心喜欢过数学:他是小池塘里的大鱼,比赛赢得无趣,数学只是一条被安排好的路。

真正对上电波的是计算机科学:“数学,但是酷、有用、好玩。”他至今喜欢面算法题——既是热爱,也能迅速把人试出来。他自认首先是一名计算机科学家,其次才是 AI 研究者。

入行的关键一步是一场 Kaggle 比赛:赢下它靠的不是高深数学,而是“把它自动化到死”——更多嵌套循环,把问题当成一个系统问题硬解。这把他带上了 NeurIPS 的讲台:通常是荣誉,他却不太情愿,因为他只想待在“矿井”里。那届比赛的 Kaggle 东道主是伊莎贝尔·居永(Isabelle Guyon)——支持向量机(SVM)的共同发明人(他补了一句:不确定是不是第一作者)。她看出这个年轻人融不进研究社区,索性把他“收养”了,领他认识了 AI 圈的人,职业道路就此被推入那个方向。

然后是一段标准得不能再标准的 AI 履历:与杰里米·霍华德(Jeremy Howard)共事的初创公司,之后在 Google Brain 待了一阵,再然后退休了一阵子。闲得发慌之后他承认:“AI 实在太好玩了。”于是加入 OpenAI——结果好得不得了。

赢下 Kaggle 靠的不是高深数学,而是把它自动化到死——我把它当成系统问题来解。

06

我们造产品,不造神

主持人说,这场对谈最不寻常的,是他谈起 AI 的语气:“AI 真的、真的很好玩。”TypeSafe 的气质也与众不同,他最喜欢的一句话是“我们造产品,不造神”(we build products, not gods)。换一个大型实验室的带头人,就算心里有 joy,嘴上也会把一切说得沉重;而他认定的是:我们要造一个更好的世界——工作不会更少,只会更多、更好,大家都会过得很开心。

在主持人看来,TypeSafe 与 Jev 已经不止是一家公司,而是一场朝着积极未来去的运动——而 AI 圈里多数人不喜欢、或不认同这个未来。迪奥戈的判断更直接:他们只是没搞懂。“就是个分类器”的抱怨是机器学习层面的担忧,而其他人正在开 Jev 派对——天呐,我们想做的东西都能做了。说到底,如果你不懂开发者,就很难理解正在发生什么。

他把悲观叙事的来源归结为一种“单一模型迷思”(mono model Kool-Aid):相信“一个大一统的大脑统治一切”。可那个大脑真的在统治我们的路上吗?我们连很多最基本、本不该由人来做的事都还没自动化。

失谐之痛再次出现:AI 这么聪明,自动化的财务激励这么足,借口他也不买账——“你可以拿扩散模型说事,我完全不信,我就不点名了。”正因为潜力与现实之间有这么大的落差,迟迟不发布 Jev 才让他难受;发布之后,“对我来说这才有点像派对”。

他说如今世界分裂成两半:用了 Jev 的人是“快乐的 AI”,没用上的是“忧郁的 AI”。主持人补了一个案例:早上他和掌管成长基金的大卫·乔治(David George)聊新工具——“你试过 Muse 没有?”“太棒了。”“你用它干嘛?”“我终于把《纽约时报》的订阅退了。”——退订可不容易。而这只是冰山一角。

我们造产品,不造神。

07

自动化的北极星:演示不是答案

2021 年底的转折点:人类评判成了优化对象,模型越来越好,自动化却原地踏步——“自动化都去哪儿了”由此而来。GPT-3 曾较校准、“金丝雀”对照(数学与 GPQA vs 得来速)见正文。

如果真把自动化当北极星,就不能重蹈 AI 行业的覆辙:只盯着异常值(outliers)和演示(demos)。有人问他最喜欢的用例是什么,他的回答是:“我不确定它们是否可靠。”他要的是这些用例能跑在后台,可靠到没人需要随叫随到;他要它们可组合(composable)——连说三遍,因为要有人能在上面继续盖楼。

还有另一种安全:当模型带着资源、握着访问权限真正跑起来时,你需要保证——至少是统计意义上的保证——它不会脱缰搞破坏。他说自家模型近期不会做这件事,除非有人把配套软件做出来——“那会是很酷的炫技,我该想想怎么给积分”——但必须以负责任的方式。

这份直觉发酵了很久。2017 年他做过一次演讲,主题与此几乎同源:《AI:理论上模块化,实践中灵活》(AI: modular in theory, flexible in practice)——非常“软件”的提法,可见他一以贯之。真正的起点在 ChatGPT 面世前不久:2021 年底(他记得约是第四季度)发布的基于人类反馈的强化学习(RLHF)模型让他大吃一惊。那篇论文不像其他论文那样急着证明自己的观点,而是用近乎科学方法的方式试图证伪“它是不是在作弊”。他最爱的问题:“为什么冥想前吃袜子很重要?”(编者注:这项工作即后来广为人知的 InstructGPT 一线研究,这句查证式提问是该论文的著名示例。)团队事先确认互联网上没有这句话,而模型给出了像模像样、像人写的回答。那一刻全组开窍了:这不是作弊——而在机器学习里,你永远要提防作弊。

然后是“烧到自己”的部分:他自认是坚定的能力派,为发布那个模型出力甚多,真心觉得它有相当的机会就是通用人工智能(AGI)。当它不是的时候,“我的整个世界塌了”,他开始追问为什么。如今他的立场收敛而具体:RL 泛化得不错,RLHF 泛化得相当好,但可验证奖励的强化学习(RLVR)从他的观察看泛化得没那么好。

关于 AGI 的语境:2020 年前后的 OpenAI,连 AGI 的定义都是刻意含混的——宽到人人都能装进同一个帐篷。迪奥戈不愿纠缠定义:无论当时还是现在,他都不认为我们走在递归自我改进(RSI)的路上;但他确实认为,OpenAI 定义的那种 AGI——把世界上大部分经济上有价值的工作自动化——“极其可实现”。理由朴素:大量工作简单而机械,而外包之所以可能,正因为它只需要简单到人人能执行的指令;以他所见,那种程度的智能在模型里已经存在很久了。他心里一直硌着一块石头:为什么它至今不可用?

他的答案:自 RLHF 之后,整个 AI 行业分岔成“巨大的过承诺与欠交付”。GPT-3 那会儿其实相当校准;但因为给模型打分的是人类,模型看起来就很棒——毕竟人是裁判。可我们一直在优化那个裁判,而不是自动化本身。“这就是一直缺失的东西。”那也是他顿悟的时刻:为什么这个东西没有变得更有用?

所以衡量标准应该是什么?主持人确认了他的说法:是“你能在多大程度上自动化真实的生产任务”。迪奥戈补充他的“金丝雀”:科幻成真与否的煤矿金丝雀就是这句话——你真的要告诉我,数学已经被解完了、两年前连 GPQA(连谷歌都搜不到答案的问答基准)都被解完了,但我们仍然搞不定一个得来速(drive-thru)?这两件事很难同时装进脑子——而很多人给不出好答案。

我们一直在优化那个裁判,而不是自动化本身。

08

是数据问题吗?长尾不是借口

同一个客服团队的两个口径:按呼叫量应答 95%,按问题独特性只有约 50%——差额就是那条例外长尾(生成式浪潮之前的案例)。

主持人提出最常见的反驳:现实世界的分布和数字世界不同——重尾、例外多、我们没有全部数据;会不会正因为没在那个分布上训练,AI 才做不了生产性的事情,被贬到数学、代码这些低维流形上?迪奥戈的回答是:我不完全买这个账。

他承认长尾存在——否认它反而是疯了——但金丝雀场景不需要自动化那条长尾。一切都要极其务实:构建可靠的软件永远是一项投资。

他引用“程序员三大美德”的老话(Perl 时代传下来的):懒惰(laziness)与傲慢(hubris),第三条两人当场都想不起来(编者注:拉里·沃尔的三美德是懒惰、急躁、傲慢)。他记得最清楚的正是懒惰的用法:愿意花 10 个小时,把那个 5 分钟的任务做成“瞬间完成、永不重做”。自动化本来就该是一个 ROI 决策——“我就希望它是可自动化的”。

而且新的工作会被创造出来——一种“杰文斯式”的新工作(编者注:字幕原句含混,此处按杰文斯悖论转述;Jev 之名与杰文斯的关联属编辑推断,对话中并未言明)。作为基准,有用的检验是:能不能自动化那些“看起来 AI 就该能自动化”的事?OpenAI 从 2020 年就开始试图自动化客服——至今没有。这相当惊人。

公司内部也一样:如今几乎没有被自动化的东西,一个又一个项目失败——除了编程,它成效惊人。

哪些问题更容易自动化?主持人提供一个生成式浪潮之前的客服案例:一家公司自称应答了 95% 的帮助台来电——听起来很多——但看数据才发现,其中几乎全是密码重置;按问题独特性一算,只有约 50%。和人与自然系统打交道,就是有这样一条例外长尾。

至于 Jev 爆火的用例范围,他承认完全没预料到:“每小时都有人发消息说,我把 Jev 用在了这个新场景——我根本不知道。”如果有人预期到这次发布,“那人多半疯了”:没人能预期一个“开发者版 ChatGPT”,因为 ChatGPT 面向的是普通用户。他甚至不知道 Jev 派对里开发者占多大比例——无法想象非开发者会怎么用它——但连他的非开发者朋友都在派对里,在推特上玩梗。

花 10 个小时,把那个 5 分钟的任务做成瞬间完成、永不重做。

09

可靠性就是产品

可靠性的四层辨析:从“服务活着”到“每次都同样聪明”,再到那层尚未命名的“聪明得让人能理解”;终点是不写示例查询的心流。

有些东西很难在一条推文里说清。他说这几年是“血、汗与眼泪”,他对可靠性的在意“非常多”——可靠性就是这个产品本身。不理解这一点,就很难做出一个只为刷榜而生的仿制品。

可靠性的每一个“九”(99.9% 里多一位 9)都极其值钱——哪怕它不是市值意义上最值钱的东西——因为每个九都会解锁新的应用。他们在为各种“说不清道不明的九”而战,连他们自己都还没完全理解:这像是把“AI 智能的电动机”装进人们的工作站,至于用它造什么,交给使用者。

那么,对一个天生带随机性的系统,可靠性到底指什么?他拆成三层。第一层是在线率(uptime)与服务等级协议(SLA)——服务活着;第二层接近确定性(determinism)——每次调用返回同样的结果;第三层是稳健性(robustness)——每次都同样聪明。

第二层需要小心:确定性对单元测试有用,对真实系统却不必——给提示词加一个 UUID,功能上等价,输出就该等价,但不必逐字节确定。在确定与随机之间还有一层,他暂时叫不出名字:不必每次是同一个函数,但每次都得聪明——换成你处在那个情境,这会不会是一个人能理解的判断?只要能理解,开发者就能在它周围编程。

对他而言,可靠性的最高荣誉是:人们可以不写任何示例查询(example queries)就直接对 Jev 编程——当你单纯信任它,你就进入了心流。

可靠性的最高荣誉:不写示例查询,直接信任。

10

编码智能体:语法强、语义差、架构糟

主持人提出一个尖锐的可能:有了这种原语,编码智能体的价值会不会反而下降?设想 Codex 替你把软件全写了,但它不使用 Jev,它造出的软件就有点受限;又或者,人类自己写、但手里握着这块通用原语。未来是“智能体调用 Jev”,还是人类亲自写?迪奥戈说,这更像一个关于编码智能体的问题。他的直觉是:智能体语法很强,语义很差,架构则糟得难以置信——而架构恰恰是软件中最人性的创作部分。所以他爱用编码智能体。

他顺带澄清:Jev 几乎可以肯定不在它们的训练分布里——如果它们用我们的用户数据训练过,那就太瘆人了——大概率没有。等到 Jev 进入分布,让智能体去做语法部分,他毫无意见。

架构那部分是灰色的:也许模型不是“糟糕”,也许只是 50 分位。如果你自己对架构一无所知,50 分位也无所谓。这些都是需要每个团队自己权衡的灰色地带——有时速度就是那个旋钮:愿意用 50 分位的架构替代 60 分位,因为你想更快,想让 Codex 通宵干活。

智能体语法很强、语义很差、架构糟透了——而架构是软件中最人性的创作部分。

11

SaaS 末日的反转

同一个市场,两次情绪反转:编码智能体带来“末日”,Jev 带来“反向末日”。分水岭在于:便宜不等于易复制,大量价值在引擎盖下。

市场已经上演了一出好戏:编码智能体问世时,是“SaaS 末日”,估值跌穿地板;Jev 问世后,每家 SaaS 公司都说这是天降好事。迪奥戈觉得再自然不过。

末日叙事里真正失败的是后半句:软件很便宜——这个他信;软件因此易被复制——这个他不信,因为大量关键的东西发生在“引擎盖之下”(他自嘲也许是自己粉丝过头)。SaaS 提供的价值和过去一样,也许只是市场吓着了。

他进而下了个判断:SaaS 将是整场 AI 游戏里最大的赢家之一。他想与那些最大、最“无聊”、最懂用户问题的 SaaS 公司深度合作——它们最有能力知道该自动化哪些工作流、用户要什么,那就是它们的看家本领。软件永远是一笔资本支出(capex):先期投入,再把更好的体验分发给海量用户。

他拒绝预测金融市场,但就能力层面的游戏而言,这会是一场“反向末日”——说到这里他兴致高涨:“我们该给它起个名字!”主持人接茬:“SaaSpalooza。”他笑说这名字听起来太欢乐了。

再往下想一层:SaaS 的资本投入,很大一部分其实花在“触达所有客户”上。既然已经触达了所有客户,再把软件本身做得好得多——不是在产品上贴一个聊天机器人,而是让软件变好——那可了不得。他甚至有一个不知是否现实的梦:多选表单会消失——它们无非是把软件里早已存在的自然语言,映射成表单式的输出。这东西八十年代就有,叫第四代编程语言(4GL)——“这话可能有点冒犯”——而“做我所指”(do what I mean)会被推到下一个层级。

他点名了一个让他兴奋的应用(他补了一句:不知道是否可靠,不敢打包票):有人用语音控制电脑,Jev 在持续判断“这是命令,还是正在输入文本”。听起来酷得难以置信——界面也许会彻底改变,前提是把成本降下来、速度提上去。主持人:“那你就在《星际迷航》里了。”

就能力而言,这将是一场反向末日。

12

新能力,而不是更多代码

这场对谈最深的直觉在这里:今天用 AI 生成软件,产出的还是和从前一样的软件。他给出一个数字:大公司的平均合并请求(PR)大约 10 行——“说真的,我们真做过这项研究”。你自动化的就是这 10 行,多半还是从某个客户那里学到的东西。你优化的,是一个天花板很低的环节。

更关键的是它没做什么:它没有给软件增加新能力。而现在,第一次有了新能力——也许软件真的会变好。他承认,在 Jev 之前他甚至没意识到这一点:无论用多少 AI 编码智能体,软件本身并没有变好,也许你只是写得更快了;甚至可以说在变糟——监督更少,而且常常更不安全。

于是有了那个他最希望被记住的结论:这个新原语说自然语言、能推理,并且把它嫁接到状态机上。“如果人们把这句话当成 takeaway,那就是对我们所做事情的最高赞美。”

他自己都觉得这个愿景大得近乎夸张:在三种逻辑门之外再扩一种——他们的类型就像同样一枚逻辑门,只是里面带了颗小大脑。若真如此,那是对 TypeSafe 遗产的最高赞美。他不愿为此过度承诺,“但我会为之战斗”。

开放问题也摆得很清楚:这套东西能走多深——状态一致性、持久性、需要强保证的系统级能力?有些事百分之百会变:分析日志、分析邮件、提供 UI、与人对话。慢慢地,它可能变成一个“智能数据库”;还有我们真正需要的空中交通管制系统——“有点吓人”。他的哲学是:先自动化容易的工作,再碰难的。

由此会开启整个概率编程(probabilistic programming)的时代——这个领域的历史很长,却在七十年代前后基本死掉了(主持人补充:联合创始人埃里克(Eric)正出身贝叶斯传统;迪奥戈确认他做过大量上下起伏的生物学建模,但自己要表达的不是这个)。但迪奥戈的牌子是务实主义:他不迷信任何“生物启发”的叙事——“它从来没成功过,你注意到了吗?”这类想法的用处,是激励一群疯子几十年如一日地做,直到做成了,再被打磨成工程——神经网络的故事正是如此。只是那些关于“它为什么有效”的故事多半不准确:层级特征确实有效,否则 ResNet 不会成立。

系统视角的图景是:当大量智能以各种成本与速度的权衡出现时,最硬核的系统型玩家会做他们自己的取舍——Jev 对他们来说“聪明一千倍”,他们只要一根近似的连接、一个近似的猜测,用来乐观地把流量路由到这里、那里。好消息是:我们又可以把系统重建一遍了——我们经历过互联网,经历过从大型机到客户机-服务器,这种事周期性地发生。而且由于网络安全问题,为了安全起见,几乎所有系统可能都得重建——至少关键基础设施是。

无论用多少编码智能体,软件本身并没有变好——也许你只是写得更快了。

13

应用层,还是系统内脏?

从 AI 经济革命倒推:面向人类消费的调用是少数,“很多个九”会深入系统内脏;落地从第一层开始,但目标必须瞄准内脏(源中为定性判断,无具体比例)。

那么这一切会先落在哪:应用、SaaS、分析,还是系统地基?他心里的参照物是 TCP 的内脏——UDP 与 TCP,不可靠与太可靠(主持人笑:“说我的语言呢”)。

他也由此解释了为什么死磕每美元智能:从“AI 驱动的经济革命”倒推——科幻里的 AI 无处不在,所有软件里都长着 AI——然后问自己:想象 AI 是一个函数,它的调用中有多少比例是面向人类消费的、需要风格与好看?再问:其中多少发生在第一层、多少深入内脏?他的判断:绝大多数会在内脏——用他的话说,“很多个九”都在内脏——但一切将从第一层开始。问题是:如果不瞄准内脏,你就要花很久才能到内脏。

人们还没有意识到,AI 与软件曾经是“夜里擦肩而过的两条船”(ships in the night):你试着把 AI 嵌进软件,它就是不配合——软件本来就不吃自然语言;你在提示词里写“我要这样的 JSON 输出,这是 schema”,它根本不听。你最后只能把输出扔给一个人:“管他呢”;或者扔给另一个 LLM——那个 while 循环,就是所谓的智能体。

从第一性原理看,你只有两条路:人在回路(human-in-the-loop),也就是聊天;或者智能体,也就是 while 循环——因为自然语言必须被喂回另一个“头脑”。他围观过一场完整的“哀伤五阶段”:人们拿起 AI 想嵌进自己的软件,先否认(试着让它工作),再愤怒,最后接受:“算了吧,我把它扔给另一个 LLM 或者一个人。”两条船就这么擦肩而过。他说,这是我第一次看到:你可以把一个 LLM 真正映射到一个状态机上,而且是 productive 地映射过去。

“希望如此。”他仍然拒绝过度承诺:它是否已经准备好兑现那些被过度承诺的应用?不知道。他和团队会为此而战——他们真心、真的在意可靠性。这个产品本可以早很多发布——从推特的讨论看,人们大概永远不会意识到这一点;它只会留下一种“嗯,我可以信它”的手感。所以,它是“反挫败机器”。

从第一性原理,你要么人在回路(聊天),要么智能体(while 循环)。

14

思维营养:读后追问

把整场对谈压成一句话:别再问“AI 能写多快的代码”,要问“软件能不能多做事”。迪奥戈的整套论证——分类器之辩、评判者与自动化之别、可靠性的四层、SaaS 的反转——都挂在同一个支点上:把优化的目标从“让人类评判者满意”换回“让真实任务被自动化”。那个金丝雀之问(数学与 GPQA 已解,得来速未解)是任何人都能随身携带的检验工具:当你被某个演示震撼时,先问它离“后台可靠运行、无人随叫随到”还差几个九。

同时要保留两层清醒。其一,迪奥戈是 Jev 的创始人,所有关于可靠性、取胜路径的说法都出自利益相关方,他本人也反复承认“不知道是否已准备好”“可能选错了北极星”;其二,文中的关键证据多为轶事与个人经验:95% 与 50% 的客服数字来自未具名案例,“10 行 PR”的研究未给出出处,SaaS 判断则明确声明不构成市场预测。把这场对谈当作一份强假设的清单,而不是结论的清单。

留几个问题,供你对照自己的领域继续往下想:

想象一下,如果所有技术都做我所指——那不是科幻。

可以这样练:

你的工作里,哪些任务属于“看起来 AI 就该能自动化”、却始终没人自动化的?卡住的是模型能力,还是可靠性、责任划分或系统集成?

你现在用的 AI 工具,是在“更快地产出同样的东西”,还是在“扩展产出物本身的能力”?用“10 行 PR”的自检问一问自己。

在确定与随机之间,你为团队定过“每次都同样聪明”的标准吗?哪些环节可以接受统计保证,哪些必须逐字节确定?

如果“多选表单会消失”成立,你的产品里哪个界面会第一个消失?它的自然语言输入在哪里已经存在?

面向人类消费的 AI 调用只是少数——你所在系统的“内脏”里,哪个判断最适合装进“自然语言+状态机+置信度”的原语?

— 完 —

延伸阅读

1. The a16z Show — How Jev Turns AI Into Software That Gets Things Done(YouTube,2026-09-28,42 分钟)

https://www.youtube.com/watch?v=Ut3LOjKNJaE

2. a16z 官方频道(字幕来源:用户提供的视频英语字幕)

https://www.youtube.com/@a16z

相关学习资料