乐于分享
好东西不私藏

Karpathy:App理论上不该存在,别追大模型逃逸速度,去造你自己的RL环境

Karpathy:App理论上不该存在,别追大模型逃逸速度,去造你自己的RL环境
程序员慌了?Karpathy说他去年12月就"跟不上时代"了,但他兴奋得睡不着。
如果你在过去半年还觉得AI只是"更好的编程助手",那你可能已经错过了最关键的转折点。
前OpenAI核心创始成员、Tesla Autopilot前负责人Andrej Karpathy,最近在访谈中爆出了一系列令人瞠目的观点:
"那个App理论上根本不不应该存在。""LLM本身就是一种新的计算机。""人类必须负责Plan——我甚至不喜欢所谓的Plan Mode。"
这些不是标题党。这是一个深度参与了AI每一个关键节点的人,在他亲眼看到范式转换之后说出的判断。
下面,我们把这场访谈中最炸裂的几段话,掰开揉碎了讲清楚。
01.
"12月开始,规则变了"
Karpathy坦言,他从去年12月就开始感受到一种剧烈的变化——作为程序员的"落后感"。
不是那种"有点跟不上"的焦虑,而是一种陡峭的认知转折。
"去年大部分时间,我用Cursor、Lovable这些工具写代码,它们能生成一大块代码,但偶尔会出错,你得手动改改。那会儿我觉得它们算'有帮助'。""但12月我休假的时候,突然发现:最新一代模型生成的代码块,开始变得直接可用了。我让它继续写,它是对的;再写多一点,还是对的。我甚至想不起来上一次认真修改它生成的代码是什么时候了。"
这种体验直接把他推进了一个"巨大的兔子洞"——他的side project文件夹里塞满了各种实验,他几乎一直在"vibe coding"。
此刻,你可能觉得自己还在用ChatGPT辅助工作,但底层已经发生了根本变化。
02.
编程这件事被彻底重写了
Karpathy提出了一个三层框架来解释我们现在经历的变化:
  1. Software 1.0:亲手写if-else,全部靠人类精确表达
  2. Software 2.0:通过整理数据集、设计目标函数来"间接编程"——训练神经网络
  3. Software 3.0:编程动作变成了Prompting。你往上下文窗口里塞什么,就相当于你在操控LLM这个"解释器"
这个框架意味着什么?
Karpathy举了一个特别生动的例子:OpenClaw的安装方式。
"正常情况下,安装一个软件无非是跑一段shell脚本。但问题是,你要兼容大量不同平台、不同电脑环境,shell脚本最后会膨胀得极其复杂。""而OpenClaw的安装方式根本不是一段脚本——而是一大段说明文字,告诉你'复制这段内容,丢给你的AI agent'。Agent会自己读取环境、自己判断、自己执行、自己debug。"
你不再需要把环境配置的每一个细节都精确写死。
Agent自己带着智能,它会读取你的电脑环境,自己做判断,自己执行必要动作,自己在循环里debug,让整个过程跑通。
现在你真正要思考的问题已经不是"脚本怎么写",而是"我该给agent哪一段文字"。
这才是新的编程范式。
03.
"App理论上根本不应该存在"
Karpathy讲了一个让他自己都震撼的例子:
他做了一个叫Menu Gen的应用——你拍下菜单照片,它自动识别菜名并生成每道菜长什么样的图片。听起来挺完整的对吧?
然后他看到了一个真正的Software 3.0版本:
"你只需要把菜单照片丢给Google Gemini,然后告诉它'用Nanobanana把菜品图像直接覆盖渲染到菜单上'。结果Nanobanana返回的,就是我拍的那张原始菜单图,但它直接在像素层面把每道菜长什么样渲染进去了。"
那一刻他意识到:自己做的整个Menu Gen,都已经过时了。
那个App理论上根本不该存在。
因为在Software 3.0里,整个流程变得极度直接:输入一张图,输出还是一张图,中间根本不需要夹着那一层层传统应用逻辑。
如果这件事也让你后背发凉,恭喜你,你终于开始理解Karpathy说的"规则变了"是什么意思。
04.
编程更快了是其次,更关键的是这个
Karpathy特别强调了一个很多人忽略的点:
这件事已经不光是"编程更快了"——它指向的是更广义的信息处理正在变得可自动化。
举个例子:他最近做了一个LLM Knowledge Base项目,本质上是让大模型自动为一个组织生成一套知识Wiki。
"这严格来说都不能算一个传统程序。因为过去,根本不存在一种代码可以根据一堆事实自动生成知识库。但现在你可以把一批文档丢进去,让模型重新'编译'这些信息,以不同方式重组、重新排序,最后产出一个全新的知识结构。"
所以真正的问题不是"以前那些事,现在能不能更快完成"——而是"现在有哪些事,是以前根本不可能存在的"。
05.
"别去追大模型逃逸速度,去造你自己的RL环境"
主持人问了一个尖锐的问题:如果大模型在数学、编程这些最显眼的方向上已经快冲到逃逸速度了,创业者还能做什么?
Karpathy的回答非常直白:
"别去追LLM的逃逸速度,去造你自己的强化学习环境。"
他的逻辑是这样的:
可验证性之所以重要,是因为它意味着这个问题"可以被攻克"——因为你可以往里面持续砸巨量强化学习。即便大模型实验室没有直接盯着你的领域,只要你的任务本身是可验证的,只要你能构建出对应的RL环境,你就有机会吃到大红利。
"有一些价值极高的强化学习环境还没有被真正开发出来,而这里面存在非常肥的创业机会。"
那么为什么现在AI的能力这么"锯齿状"?问它strawberry有几个r它会犯错,但同一个模型能帮你重构10万行代码库。
Karpathy把这归结为两个原因:训练方法和实验室关注什么。
两者叠加的结果是:模型在某些高度可验证的领域(数学、代码)能力出现尖峰,但在其他领域显得粗糙。如果你要做的事正好落在它强化学习训练覆盖的"电路"里,你会飞起来;如果不在,你会非常挣扎。
所以,搞清楚你自己的应用到底属于哪一条能力电路——这才是今天最现实的策略。
06.
Vibe Coding vs Agentic Engineering
Karpathy自己提出的Vibe Coding,和他现在讨论的Agentic Engineering,是两个完全不同的层次:
  • Vibe Coding是抬高所有人的能力下限——几乎每个人都能靠它做点东西出来。
  • Agentic Engineering讨论的是另一件事:在不牺牲专业软件质量的前提下,如何利用agent把速度提起来。
"你面对的是一群能力尖锐但不稳定的agent——它们有点脆弱、有点随机,但又极其强大。你要解决的问题是:如何协调这些agent,让整体开发速度暴涨,同时又不牺牲质量标准。"
所以Karpathy认为,"10x工程师"的说法已经过时了。真正会用这套体系的人,效率峰值远远超过10倍。
07.
招聘还在用旧方法?过时了
Karpathy直言不讳:很多公司在招聘这件事上完全没跟上。
"大家嘴上说要招agentic engineer,但还让候选人刷算法题、解puzzle——这基本是在筛选上一代工程能力。"
那么应该怎么招?
Karpathy的建议是:给他一个足够大的真实项目,看他能不能借助agent做出来。
比如直接让他做一个类似Twitter的clone,要求功能完整、安全性高,然后让agent模拟大量用户活动,用最强的Codex或Claude实例去疯狂攻击他部署的网站,试着打崩、打穿、打出漏洞。
"如果在这种环境下他依然能把系统撑住,那你才真正看到了他的agentic engineering水平。"
08.
人类干什么?Karpathy的答案是这几个字
当agent做得越来越多,人类的位置在哪里?
Karpathy的回答干脆利落:
"人类必须负责specification,必须负责plan。"
甚至他说了一句值得细品的话:
"我个人都不算特别喜欢那些所谓的'plan mode'——虽然它们当然有用。但更本质的是,你得和agent一起把一份非常细的spec设计出来,某种程度上应该接近完整文档,然后让agent去填充实现。"
你负责顶层监督和大类结构,agent负责底层执行。
具体来说:
  • API细节可以外包:PyTorch/Numpy/Pandas里那堆参数命名差异——keepdims还是keepdim,dim还是axis——他承认自己已经完全记不住了,因为没必要记
  • 但基础原理不能丢:比如tensor的storage和view是怎么回事,同一块存储上的视图操作和重新复制在性能上差别很大——你仍然需要理解这些
人类真正负责的是品味、工程判断、设计决策。你知道要什么,知道哪些要求必须被写死。
"你可以外包思考,但不能外包理解"
访谈的最后有一个问题特别打动人:当智能变得廉价之后,什么东西仍然值得被深度学习?
Karpathy引用了一条他"每隔两天就会想起一次"的推文:
"你可以外包思考,但你不能外包理解。""信息最终还是要进入我的脑子里。真正的瓶颈变成了:我是否足够理解我们到底在建什么、为什么值得建、该如何指挥这些agent。"
所以他特别喜欢LLM knowledge base这类项目——每读一篇文章,就同步让自己的个人Wiki从文章里生长出来。
"这些工具的真正价值是增强理解,而不是替代理解。而理解这件事目前依然是一个瓶颈——如果你自己都没有形成理解,你就不可能成为一个好的导演。"
这一点,暂时还没有被任何AI取代。
09.
一切都要重写
当被问到"agent世界会是什么样子"时,Karpathy的答案很诚实但也令人震颤:
"一切都要重写。"
我们现在几乎所有系统仍然是为人类写的——文档、API接口、配置流程,全都是写给人看的。
"每次看到文档里还在写'请访问这个URL''请点击这里完成配置',我内心都会冒出一句:啊,怎么又是我自己来?"
他期待的未来是:所有流程都优先描述给agent,而不是描述给人。
到那时候,你的agent和我的agent先把会议细节谈妥,时间安排、准备事项、资料同步——很多琐碎沟通都由它们先完成。
10.
写在最后
通篇读下来,Karpathy想传递的信息其实很清晰:
  1. 规则已经变了——从去年12月开始,不是慢慢变,是陡峭地转折
  2. 别追着LLM跑——去造你自己的RL环境,那里有创业者的机会
  3. 人类负责plan——agent再强,spec和plan仍然是你的责任
  4. 理解比思考更稀缺——你可以外包思考,但不能外包理解
所以,与其焦虑"AI会不会替代我",不如问问自己:
我有没有在构建自己的"理解力"?我能不能设计出agent实现不了的顶层框架?
这或许就是2026年留给每个技术人的问题。