ARTICLE · 1136754
当软件变成“日抛工具”:OpenAI创始成员Karpathy 教你榨干AI 的 4 个提效技能
当软件变成“日抛工具”:OpenAI创始成员Karpathy 教你榨干AI 的 4 个提效技能


如果有一天,AI真的可以替你完成90%的工作,人类最后还需要做什么? 这个问题可能比“AI会不会取代人”更值得思考。 因为真正正在发生的变化,并不是AI单纯变得更聪明了,而是它正在逐渐接管过去属于人的一整套“执行过程”。 以前,我们使用软件。 你要做报表,就打开Excel;要修图,就打开Photoshop;要做动画,就学动画软件;要开发一个网页,就找程序员。 现在,你只需要告诉AI: “帮我把这个东西做出来。” 
AI可以写代码、画图、生成网页、制作动画,甚至把不同工具串起来完成一个完整任务。 于是,人和软件之间的关系开始发生变化。 过去是: 现在越来越像: 这会带来一个问题: 当AI替你完成越来越多的事情之后,你有没有能力真正看懂它交付给你的东西? (Andrej Karpathy:斯坦福 PhD、李飞飞门生、OpenAI 创始成员、前特斯拉 AI 总监。 顶级技术专家,也是最懂“怎么把技术讲明白”的 AI 教育者; 一个既站在 AI 最前线,又最懂“人类如何吸收知识”的技术狂人突然提醒你:纯文字解释不够用了,软件正变成一次性认知工具。) 2026年10月2日,Andrej Karpathy发了一条很值得一读的帖子。 他的判断并不只是“以后AI会更强”,他关注的是一个更加具体的问题: 我们以后会花越来越多时间,去理解语言模型生成出来的东西。 而理解AI输出的方法,正在发生变化。 你可以让AI用一种更严格的语言解释; 可以让它画图; 可以让它做成一个可以操作的网页; 甚至可以让它临时给你制作一部解释视频。 表面看,这是输出格式的变化。 往深处看,这是人类理解知识的方式正在发生变化。 
当AI越来越会“做”,人类越来越需要“看懂” 01 过去,人和电脑之间有一道很清楚的分工。 电脑负责计算、存储和执行,人负责理解、判断和决策。 所以软件设计的核心问题是:怎样让人使用电脑完成任务? AI出现以后,这个关系正在倒过来。 你告诉AI目标,它开始替你完成大量执行工作。 写代码、整理资料、分析数据、生成图表、做网页、写报告…… 而且随着模型能力提高,AI承担的执行比例还会继续增加。 于是人的工作会逐渐从“亲自完成每一步”,转向三个更高层次的问题: 最后两个问题尤其重要。 因为“生成出来”和“理解清楚”完全是两回事。 
AI可以在几秒钟里给你一篇5000字的解释。 但如果你读完以后,脑子里仍然只有一堆文字,你并不一定真正理解了这个问题。 这正是Karpathy这条帖子的切入口,他的思路非常简单,却很有冲击力: 当一种表达形式不够用时,不要继续让AI把同一种形式做得更长;直接换一种表达形式。 
这就出现了四种完全不同的理解方式。 文字:先让语言减少歧义 Karpathy提到的第一个方法,看起来最普通,却非常值得研究。 让AI使用ASD-STE100的方式解释复杂内容。 ASD-STE100是一套“受控语言”(Controlled Language)规范。 它最初服务于航空航天、技术维护等专业技术文档。 为什么飞机维修手册需要专门规定语言? 因为在这种场景里,“大概能看懂”远远不够。 一句话如果存在两种解释,执行人员就可能采取两种不同的操作。 所以它试图解决的问题是: 怎样让技术语言尽可能少产生歧义? 它会对词汇、句子结构、语法和表达方式施加约束。 例如,在适当情况下使用更明确、更具体的词;避免一个词承担太多不同含义;尽量减少复杂的句子结构;让一句话承担清晰、单一的任务。 
这里最值得理解的,不是记住某几条写作规则。 而是理解一个原则: 自然语言越自由,表达空间越大;表达空间越大,歧义也可能越多。 所以在某些任务里,限制语言,反而能够提高信息的可靠传递。 这对AI尤其重要。 因为人对AI说: “请把这个讲得简单一点。” 其实是一个非常模糊的要求。什么叫简单?短一点?少用术语?像小学生一样?还是把复杂概念拆开? AI只能猜。 而当你告诉它: “请用80%接近ASD-STE100规范的方式解释这个问题。” 
你实际上给了AI一套更明确的语言约束,这就是Karpathy真正看中的地方。 大模型很擅长遵守明确的约束。 因此,当你面对一篇特别复杂的论文、一份技术报告、一段代码,或者一个自己完全陌生的概念时,可以尝试要求AI: 请使用接近ASD-STE100的受控语言解释。每句话尽量只表达一个核心意思。避免不必要的修辞和模糊表达。第一次出现专业术语时给出定义,不要为了“简单”而删除必要的限定条件。 
最后一句非常重要。 因为“简单”并不等于“准确”。 科学、医学、法律领域尤其如此。 如果为了让文章好懂,把“可能”“在某些条件下”“与……相关”等必要限定全部删掉,文章确实会变得更流畅,却可能同时变得不准确。 所以ASD-STE100真正值得借鉴的地方,是: 减少语言噪音,而不是牺牲事实精度。 图:把藏在文字里的关系直接拿出来 但有些东西,即使语言已经足够清楚,依然很难理解。 因为问题可能根本不在于“概念”。 而在于:关系太多。 比如你想理解睡眠、代谢和大脑之间的关系。 文字可能这样告诉你: 睡眠不足会影响激素调节,激素变化又会影响代谢状态,而代谢状态与炎症、神经系统功能存在复杂联系。 每一句都对,但读完之后,你仍然需要自己在脑子里完成一个工作: 把这些关系重新拼起来。 谁影响谁? 方向是什么? 有没有反馈? 哪些是直接关系? 哪些只是间接关系? 这时候,一张图可能比1000字更有价值。 因为图可以把隐藏在文字中的结构直接暴露出来。 例如: 如果还有反馈环路,再把反馈箭头画回来。 原本需要在脑子里完成的工作,现在被外化到了纸面上。 所以可以把两者简单理解成: 文字擅长解释“它是什么”。 图擅长解释“它们怎么连接”。 这也是为什么面对复杂问题时,一个非常有效的提示方式是: 不要只解释这个问题,请先找出其中最重要的变量、关系、因果链和反馈回路,再画成一张结构图。 
这里还有一个很容易被忽视的风险。 图非常有力量,也非常容易制造错觉。 因为一根箭头,就可能悄悄表达一种因果关系。 读者很容易理解成“A导致B”。 但原始研究可能只证明了:A和B相关;或者A发生在B之前。 甚至只是理论上存在一种可能机制。 所以面对AI生成的图,不能因为它看起来比文字更清楚,就默认它更正确。 图的优势是把结构显现出来;它的风险也是把未经验证的结构显现得过于确定。 这也是AI时代越来越重要的一条原则: 表达形式越有说服力,事实核查越不能省略。 网页:从“阅读”进入“实验” 真正让这件事情发生质变的,是第三种形式:交互式网页。 这里最值得注意的并不是“AI可以做漂亮网页”。 网页漂亮,其实没有那么重要。 真正重要的是: AI可以给你临时制造一个可以操作的模型。 假设你想理解复利,传统方法是看一篇文章。 文章告诉你: 本金是多少,利率是多少,时间是多少,最终会得到多少。 你阅读后,再理解公式,然后想象。 但如果AI直接给你做一个网页呢? 左边三个滑块: 本金、年利率、投资年限。 右边一条不断变化的曲线。 你拖动利率、曲线发生变化、再把时间拉长、曲线再次变化。 这时候你获得的已经不是一段解释。 而是一次实验。 你从:“阅读一个结论” 进入了:“亲手观察变量如何产生结果”。 这就是交互式输出真正重要的地方。 HTML本身只是网页的基础技术。 真正产生认知价值的是HTML、JavaScript以及可视化组件组合之后形成的交互环境。 它允许你:改变变量、观察结果、比较不同情况、提出新的假设、再马上验证。 所以,一个由AI临时生成的网页,可以成为一个非常小型的“思想实验室”。 更重要的变化:软件开始可以“用完就扔” 这里才进入Karpathy这条帖子的真正核心。 想象一下。 如果十年前,你想弄明白一个复杂概念,你会不会找程序员专门给自己开发一个网页? 大概率不会、因为成本太高。 你需要产品设计、需要程序员、需要测试、可能还需要服务器、后面还有维护。 为了理解一个问题,根本不值得。 所以过去的软件有一个隐含前提: 既然开发这么贵,它就必须长期存在。 软件因此成为一种资产。 值得开发、值得维护、值得升级、值得扩大用户规模。 但AI正在改变这个经济逻辑。 如果你只需要告诉AI: “帮我做一个网页,让我理解这个概念。” 它可以直接写出代码。 一个人、一个问题、一个下午、甚至十分钟,用完以后,删除。 不需要维护、不需要上线、不需要商业化。 这就是Karpathy所说的: Discardable software artifacts——可丢弃的软件制品。 
这几个词的重要性,远远超过“AI可以做网页”。 因为它改变的是我们对软件的定义。 过去我们问:这个软件值得开发吗? 现在越来越可以问:这个软件能不能帮我把眼前这个问题想明白? 如果答案是可以,那么即使它只存在一个小时,也可能值得生成。 这就是一个非常大的变化。 软件开始从长期资产,变成一次性的认知工具。 
以前一个程序员需要花几天做出来的东西,现在AI可能几分钟就能生成。 于是软件第一次可以变得:极其私人、极其具体、极其短命。 只服务于你、只解决一个问题、只存在一段时间,然后消失。 这件事情真正颠覆的,并不是软件行业本身。 它改变的是:知识工作的成本结构。 过去因为制作工具昂贵,我们不得不适应现有工具。 以后因为生成工具便宜,工具可以开始适应人的问题。 视频:AI为什么突然可以“临时拍一部科普片”? 第四种形式,是Karpathy最看好的:解释视频。 他举的例子非常有意思: 让AI制作一部类似3Blue1Brown风格的解释视频。 很多人看到这里,会理解成: “AI现在就可以生成视频了。” 但真正值得注意的是:AI可以生成制作视频的代码。 3Blue1Brown(频道名字“3 蓝 1 棕”),也就是格兰特·桑德森Grant Sanderson(知名数学科普大佬,斯坦福大学数学系毕业)的数学可视化频道,长期使用程序化动画的方式解释数学。 其中一个重要工具就是他开发了开源动画引擎 Manim 它本质上是一套可以用代码描述数学动画的工具。 于是整个过程发生了变化: 你提出一个问题。 ↓ AI理解问题。 ↓ AI编写动画代码。 ↓ 代码运行。 ↓ 生成数学图形和动态过程。 ↓ 再配上AI语音。 ↓ 形成一部针对这个问题临时制作的解释视频。 这背后的关键并非“AI会剪视频”。 而是:语言模型可以把知识转换成代码,再由代码生成视觉世界。 
这就是为什么“视频”会突然变得便宜。 过去,一部定制科普视频可能需要:编剧、导演、分镜、设计、动画师、配音、剪辑。 现在,其中相当一部分工作可以由AI完成。 于是,一个过去完全不值得制作的视频,也可能变得值得制作。 比如: “请解释神经网络为什么需要反向传播。” 过去你可能找一篇文章。 现在可以让AI制作一部两分钟动画: 输入数据进入网络。 预测结果出现。 误差产生。 误差沿网络反向传播。 权重调整。 再次计算。 误差下降。 整个学习过程随着时间展开。 这时候,视频的价值就非常明确了。 它把需要脑补的推演,变成了眼见为实的画面。 文字适合描述、图适合展示结构、交互网页适合让你改变变量、视频则特别适合展示:一个过程究竟是怎样一步一步发生的。 
所以视频并不天然“高级”。 它只是解决了另一种理解难题:动态过程。 
四种形式,其实对应四种认知任务 02 到这里,我们可以重新看Karpathy提到的四种输出方式。 它们并不是简单的: 也不存在一个绝对的“最高级”。 真正重要的是:你到底想理解什么? 
所以以后向AI提问时,一个非常重要的变化是: 不要只问: “请详细解释。” 可以先问: “这个问题最适合用什么形式让我理解?” 甚至可以直接要求AI: 请先判断这个问题最适合用文字、结构图、交互模型还是动态视频解释,然后选择最合适的形式。 
这一步看起来只是提示词变化,实际上,它改变的是人与AI的关系。 
AI时代,一个很重要的学习原则:看不懂时,先换表示法 03 我们过去遇到一个复杂问题,看不懂,通常会怎么办? 再读一遍、再找一本书、再搜一篇文章、再让别人解释一遍。 本质上,我们一直在做同一件事:增加文字。 但很多时候,问题并非信息不足。而是表示方式不适合你的大脑。 一个复杂的空间关系,用文字解释十遍都很痛苦。 画出来,可能马上明白。 一个动态过程,用静态文字很难想象。 做成动画,可能几秒钟就清楚。 一个参数之间的关系,看公式很抽象。 做成交互模型,自己拖一下就知道了。 所以AI时代,一个非常重要的学习原则可能变成: 理解失败时,先换表示法,而不是继续堆信息。 文字不懂,就画图。 图不懂,就做模型。 模型仍然抽象,就做动画。 这相当于给自己的大脑不断更换“认知接口”。 
但这里有一个必须保留的刹车 04 AI把复杂内容变成图、网页、动画以后,理解会变得更容易。 同时,另一个风险也会越来越大: 错误也会变得更容易理解。 一篇AI写得很流畅的文章,可能有事实错误。 一张结构清晰的图,可能把相关性画成因果关系。 一个可以操作的模型,可能隐藏了错误的假设。 一部动画甚至可以把一个错误的科学机制解释得极其生动。 于是我们会遇到一个以前没有这么明显的问题: 表达质量和事实质量,正在逐渐脱钩。 越漂亮,不等于越正确。 越流畅,不等于越可靠。 越容易理解,也不等于越接近事实。 所以真正成熟的AI工作流应该是: 而不是: 尤其涉及医学、科学、法律、金融等高风险领域时,这一点更加重要。 AI负责把复杂内容转换成更适合人理解的形式。 人负责检查: 事实有没有错? 证据够不够? 有没有遗漏关键条件? 图中的箭头是否真的代表因果? 模型是不是偷偷加入了没有证据的假设? 这可能就是未来人与AI之间最重要的一种分工。 
我们真正进入的,可能是“认知工具按需生成”的时代 05 回头再看Karpathy这条帖子,会发现它讨论的其实远远超过了几个提示词。 它指向的是一个更大的变化。 过去:人适应软件。 现在:AI开始根据人的问题生成软件。 过去,一个软件需要服务很多人,才能覆盖昂贵的开发成本。 现在,一个软件甚至可以只服务一个人。 只解决一个问题,只存在几个小时,用完即扔。 这就是“可丢弃的软件制品”真正令人震动的地方。 而它和文字、图、网页、视频其实是一条线上的不同表现。 AI不再只是给你一个答案。 它可以根据你的问题,临时制造: 一个解释器。 一个:图解器。 一个:模拟器。 一个:动画老师。 甚至一个只属于你自己的小型软件。 过去我们需要花大量时间学习工具,才能创造这些东西。 未来可能反过来: 你只需要知道自己想弄明白什么,AI替你制造理解它的工具。 这会改变学习、改变研究、改变知识工作、也会改变“软件”的含义。 
最后真正值得带走的,是这件事 06 未来,AI的竞争可能越来越少发生在“谁能写出一段更漂亮的文字”上。 因为文字已经足够便宜、代码也越来越便宜。 图表、网页、动画、视频,都会越来越便宜。 真正稀缺的东西,可能重新回到了人身上: 你究竟想弄明白什么? 你知道什么样的表示方式最适合这个问题吗? 你能判断AI给你的解释是否正确吗? 这意味着,AI时代的高手,未必是最会写提示词的人。 更可能是那些能够把问题拆清楚、选择正确表示方式,并且能够验证结果的人。 过去我们使用软件完成工作。 现在AI可以替我们制造软件,用完以后,它甚至不需要留下来。 因为它存在的意义,从来不是成为一款产品。 而是: 在你需要理解的那一刻,帮你把一个原本想不明白的问题,变成真正看得见、摸得着、可以验证的东西。 AI正在从“回答机器”,变成“理解工具的制造机器”。 
而当智能和代码都越来越便宜以后,我们真正需要重新学习的,也许只有一件事: 当执行彻底不再稀缺,理解的深度与监督的精度,将成为人类最后的护城河。 
END




人 → 软件 → 结果人 → AI → 软件/图表/网页/视频 → 结果
我到底想解决什么问题? AI到底替我做了什么? 它做得对不对?





睡眠↓ → 激素调节↓ → 代谢环境↓ → 抗炎能力↓ → 脑功能↓
A → B




文字 < 图 < 网页 < 视频如果你想知道一个概念是什么意思:用受控文字。 如果你想知道几个变量之间是什么关系:用图。 如果你想知道“改变这个变量以后会发生什么”:用交互网页。 如果你想知道一个复杂过程怎样随时间展开:用动画或视频。




生成 → 理解 → 验证 → 修正生成 → 看起来很漂亮 → 相信


