夜雨聆风学习资料网

ARTICLE · 1136754

当软件变成“日抛工具”:OpenAI创始成员Karpathy 教你榨干AI 的 4 个提效技能

当软件变成“日抛工具”:OpenAI创始成员Karpathy 教你榨干AI 的 4 个提效技能
如果有一天,AI真的可以替你完成90%的工作,人类最后还需要做什么?
这个问题可能比“AI会不会取代人”更值得思考。
因为真正正在发生的变化,并不是AI单纯变得更聪明了,而是它正在逐渐接管过去属于人的一整套“执行过程”。
以前,我们使用软件。
你要做报表,就打开Excel;要修图,就打开Photoshop;要做动画,就学动画软件;要开发一个网页,就找程序员。
现在,你只需要告诉AI:
“帮我把这个东西做出来。”
AI可以写代码、画图、生成网页、制作动画,甚至把不同工具串起来完成一个完整任务。
于是,人和软件之间的关系开始发生变化。
过去是:
人 → 软件 → 结果
现在越来越像:
人 → AI → 软件/图表/网页/视频 → 结果
这会带来一个问题:
当AI替你完成越来越多的事情之后,你有没有能力真正看懂它交付给你的东西?
(Andrej Karpathy:斯坦福 PhD、李飞飞门生、OpenAI 创始成员、前特斯拉 AI 总监。 顶级技术专家,也是最懂“怎么把技术讲明白”的 AI 教育者; 一个既站在 AI 最前线,又最懂“人类如何吸收知识”的技术狂人突然提醒你:纯文字解释不够用了,软件正变成一次性认知工具。)
2026年10月2日,Andrej Karpathy发了一条很值得一读的帖子。
他的判断并不只是“以后AI会更强”,他关注的是一个更加具体的问题:
我们以后会花越来越多时间,去理解语言模型生成出来的东西。
而理解AI输出的方法,正在发生变化。
你可以让AI用一种更严格的语言解释;
可以让它画图;
可以让它做成一个可以操作的网页;
甚至可以让它临时给你制作一部解释视频。
表面看,这是输出格式的变化。
往深处看,这是人类理解知识的方式正在发生变化。
当AI越来越会“做”,人类越来越需要“看懂”
01
过去,人和电脑之间有一道很清楚的分工。
电脑负责计算、存储和执行,人负责理解、判断和决策。
所以软件设计的核心问题是:怎样让人使用电脑完成任务?
AI出现以后,这个关系正在倒过来。
你告诉AI目标,它开始替你完成大量执行工作。
写代码、整理资料、分析数据、生成图表、做网页、写报告……
而且随着模型能力提高,AI承担的执行比例还会继续增加。
于是人的工作会逐渐从“亲自完成每一步”,转向三个更高层次的问题:
  1. 我到底想解决什么问题?
  2. AI到底替我做了什么?
  3. 它做得对不对?
最后两个问题尤其重要。
因为“生成出来”和“理解清楚”完全是两回事。
AI可以在几秒钟里给你一篇5000字的解释。
但如果你读完以后,脑子里仍然只有一堆文字,你并不一定真正理解了这个问题。
这正是Karpathy这条帖子的切入口,他的思路非常简单,却很有冲击力:
当一种表达形式不够用时,不要继续让AI把同一种形式做得更长;直接换一种表达形式。
这就出现了四种完全不同的理解方式。
文字:先让语言减少歧义
Karpathy提到的第一个方法,看起来最普通,却非常值得研究。
让AI使用ASD-STE100的方式解释复杂内容。
ASD-STE100是一套“受控语言”(Controlled Language)规范。
它最初服务于航空航天、技术维护等专业技术文档。
为什么飞机维修手册需要专门规定语言?
因为在这种场景里,“大概能看懂”远远不够。
一句话如果存在两种解释,执行人员就可能采取两种不同的操作。
所以它试图解决的问题是:
怎样让技术语言尽可能少产生歧义?
它会对词汇、句子结构、语法和表达方式施加约束。
例如,在适当情况下使用更明确、更具体的词;避免一个词承担太多不同含义;尽量减少复杂的句子结构;让一句话承担清晰、单一的任务。
这里最值得理解的,不是记住某几条写作规则。
而是理解一个原则:
自然语言越自由,表达空间越大;表达空间越大,歧义也可能越多。
所以在某些任务里,限制语言,反而能够提高信息的可靠传递。
这对AI尤其重要。
因为人对AI说:
“请把这个讲得简单一点。”
其实是一个非常模糊的要求。什么叫简单?短一点?少用术语?像小学生一样?还是把复杂概念拆开?
AI只能猜。
而当你告诉它:
“请用80%接近ASD-STE100规范的方式解释这个问题。”
你实际上给了AI一套更明确的语言约束,这就是Karpathy真正看中的地方。
大模型很擅长遵守明确的约束。
因此,当你面对一篇特别复杂的论文、一份技术报告、一段代码,或者一个自己完全陌生的概念时,可以尝试要求AI:
请使用接近ASD-STE100的受控语言解释。每句话尽量只表达一个核心意思。避免不必要的修辞和模糊表达。第一次出现专业术语时给出定义,不要为了“简单”而删除必要的限定条件。
最后一句非常重要。
因为“简单”并不等于“准确”。
科学、医学、法律领域尤其如此。
如果为了让文章好懂,把“可能”“在某些条件下”“与……相关”等必要限定全部删掉,文章确实会变得更流畅,却可能同时变得不准确。
所以ASD-STE100真正值得借鉴的地方,是:
减少语言噪音,而不是牺牲事实精度。
图:把藏在文字里的关系直接拿出来
但有些东西,即使语言已经足够清楚,依然很难理解。
因为问题可能根本不在于“概念”。
而在于:关系太多。
比如你想理解睡眠、代谢和大脑之间的关系。
文字可能这样告诉你:
睡眠不足会影响激素调节,激素变化又会影响代谢状态,而代谢状态与炎症、神经系统功能存在复杂联系。
每一句都对,但读完之后,你仍然需要自己在脑子里完成一个工作:
把这些关系重新拼起来。
谁影响谁?
方向是什么?
有没有反馈?
哪些是直接关系?
哪些只是间接关系?
这时候,一张图可能比1000字更有价值。
因为图可以把隐藏在文字中的结构直接暴露出来。
例如:
睡眠↓ → 激素调节↓ → 代谢环境↓ → 抗炎能力↓ → 脑功能↓
如果还有反馈环路,再把反馈箭头画回来。
原本需要在脑子里完成的工作,现在被外化到了纸面上。
所以可以把两者简单理解成:
文字擅长解释“它是什么”。
图擅长解释“它们怎么连接”。
这也是为什么面对复杂问题时,一个非常有效的提示方式是:
不要只解释这个问题,请先找出其中最重要的变量、关系、因果链和反馈回路,再画成一张结构图。
这里还有一个很容易被忽视的风险。
图非常有力量,也非常容易制造错觉。
因为一根箭头,就可能悄悄表达一种因果关系。
A → B
读者很容易理解成“A导致B”。
但原始研究可能只证明了:A和B相关;或者A发生在B之前。
甚至只是理论上存在一种可能机制。
所以面对AI生成的图,不能因为它看起来比文字更清楚,就默认它更正确。
图的优势是把结构显现出来;它的风险也是把未经验证的结构显现得过于确定。
这也是AI时代越来越重要的一条原则:
表达形式越有说服力,事实核查越不能省略。
网页:从“阅读”进入“实验”
真正让这件事情发生质变的,是第三种形式:交互式网页。
这里最值得注意的并不是“AI可以做漂亮网页”。
网页漂亮,其实没有那么重要。
真正重要的是:
AI可以给你临时制造一个可以操作的模型。
假设你想理解复利,传统方法是看一篇文章。
文章告诉你:
本金是多少,利率是多少,时间是多少,最终会得到多少。
你阅读后,再理解公式,然后想象。
但如果AI直接给你做一个网页呢?
左边三个滑块:
本金、年利率、投资年限。
右边一条不断变化的曲线。
你拖动利率、曲线发生变化、再把时间拉长、曲线再次变化。
这时候你获得的已经不是一段解释。
而是一次实验。
你从:“阅读一个结论”
进入了:“亲手观察变量如何产生结果”。
这就是交互式输出真正重要的地方。
HTML本身只是网页的基础技术。
真正产生认知价值的是HTML、JavaScript以及可视化组件组合之后形成的交互环境。
它允许你:改变变量、观察结果、比较不同情况、提出新的假设、再马上验证。
所以,一个由AI临时生成的网页,可以成为一个非常小型的“思想实验室”。
更重要的变化:软件开始可以“用完就扔”
这里才进入Karpathy这条帖子的真正核心。
想象一下。
如果十年前,你想弄明白一个复杂概念,你会不会找程序员专门给自己开发一个网页?
大概率不会、因为成本太高。
你需要产品设计、需要程序员、需要测试、可能还需要服务器、后面还有维护。
为了理解一个问题,根本不值得。
所以过去的软件有一个隐含前提:
既然开发这么贵,它就必须长期存在。
软件因此成为一种资产。
值得开发、值得维护、值得升级、值得扩大用户规模。
但AI正在改变这个经济逻辑。
如果你只需要告诉AI:
“帮我做一个网页,让我理解这个概念。”
它可以直接写出代码。
一个人、一个问题、一个下午、甚至十分钟,用完以后,删除。
不需要维护、不需要上线、不需要商业化。
这就是Karpathy所说的:
Discardable software artifacts——可丢弃的软件制品。
这几个词的重要性,远远超过“AI可以做网页”。
因为它改变的是我们对软件的定义。
过去我们问:这个软件值得开发吗?
现在越来越可以问:这个软件能不能帮我把眼前这个问题想明白?
如果答案是可以,那么即使它只存在一个小时,也可能值得生成。
这就是一个非常大的变化。
软件开始从长期资产,变成一次性的认知工具。
以前一个程序员需要花几天做出来的东西,现在AI可能几分钟就能生成。
于是软件第一次可以变得:极其私人、极其具体、极其短命。
只服务于你、只解决一个问题、只存在一段时间,然后消失。
这件事情真正颠覆的,并不是软件行业本身。
它改变的是:知识工作的成本结构。
过去因为制作工具昂贵,我们不得不适应现有工具。
以后因为生成工具便宜,工具可以开始适应人的问题。
视频:AI为什么突然可以“临时拍一部科普片”?
第四种形式,是Karpathy最看好的:解释视频。
他举的例子非常有意思:
让AI制作一部类似3Blue1Brown风格的解释视频。
很多人看到这里,会理解成:
“AI现在就可以生成视频了。”
但真正值得注意的是:AI可以生成制作视频的代码。
3Blue1Brown(频道名字“3 蓝 1 棕”),也就是格兰特·桑德森Grant Sanderson(知名数学科普大佬,斯坦福大学数学系毕业)的数学可视化频道,长期使用程序化动画的方式解释数学。
其中一个重要工具就是他开发了开源动画引擎 Manim
它本质上是一套可以用代码描述数学动画的工具。
于是整个过程发生了变化:
你提出一个问题。
↓
AI理解问题。
↓
AI编写动画代码。
↓
代码运行。
↓
生成数学图形和动态过程。
↓
再配上AI语音。
↓
形成一部针对这个问题临时制作的解释视频。
这背后的关键并非“AI会剪视频”。
而是:语言模型可以把知识转换成代码,再由代码生成视觉世界。
这就是为什么“视频”会突然变得便宜。
过去,一部定制科普视频可能需要:编剧、导演、分镜、设计、动画师、配音、剪辑。
现在,其中相当一部分工作可以由AI完成。
于是,一个过去完全不值得制作的视频,也可能变得值得制作。
比如:
“请解释神经网络为什么需要反向传播。”
过去你可能找一篇文章。
现在可以让AI制作一部两分钟动画:
输入数据进入网络。
预测结果出现。
误差产生。
误差沿网络反向传播。
权重调整。
再次计算。
误差下降。
整个学习过程随着时间展开。
这时候,视频的价值就非常明确了。
它把需要脑补的推演,变成了眼见为实的画面。
文字适合描述、图适合展示结构、交互网页适合让你改变变量、视频则特别适合展示:一个过程究竟是怎样一步一步发生的。
所以视频并不天然“高级”。
它只是解决了另一种理解难题:动态过程。
四种形式,其实对应四种认知任务
02
到这里,我们可以重新看Karpathy提到的四种输出方式。
它们并不是简单的:
文字 < 图 < 网页 < 视频
也不存在一个绝对的“最高级”。
真正重要的是:你到底想理解什么?
  • 如果你想知道一个概念是什么意思:用受控文字。
  • 如果你想知道几个变量之间是什么关系:用图。
  • 如果你想知道“改变这个变量以后会发生什么”:用交互网页。
  • 如果你想知道一个复杂过程怎样随时间展开:用动画或视频。
所以以后向AI提问时,一个非常重要的变化是:
不要只问:
“请详细解释。”
可以先问:
“这个问题最适合用什么形式让我理解?”
甚至可以直接要求AI:
请先判断这个问题最适合用文字、结构图、交互模型还是动态视频解释,然后选择最合适的形式。
这一步看起来只是提示词变化,实际上,它改变的是人与AI的关系。
AI时代,一个很重要的学习原则:看不懂时,先换表示法
03
我们过去遇到一个复杂问题,看不懂,通常会怎么办?
再读一遍、再找一本书、再搜一篇文章、再让别人解释一遍。
本质上,我们一直在做同一件事:增加文字。
但很多时候,问题并非信息不足。而是表示方式不适合你的大脑。
一个复杂的空间关系,用文字解释十遍都很痛苦。
画出来,可能马上明白。
一个动态过程,用静态文字很难想象。
做成动画,可能几秒钟就清楚。
一个参数之间的关系,看公式很抽象。
做成交互模型,自己拖一下就知道了。
所以AI时代,一个非常重要的学习原则可能变成:
理解失败时,先换表示法,而不是继续堆信息。
文字不懂,就画图。
图不懂,就做模型。
模型仍然抽象,就做动画。
这相当于给自己的大脑不断更换“认知接口”。
但这里有一个必须保留的刹车
04
AI把复杂内容变成图、网页、动画以后,理解会变得更容易。
同时,另一个风险也会越来越大:
错误也会变得更容易理解。
一篇AI写得很流畅的文章,可能有事实错误。
一张结构清晰的图,可能把相关性画成因果关系。
一个可以操作的模型,可能隐藏了错误的假设。
一部动画甚至可以把一个错误的科学机制解释得极其生动。
于是我们会遇到一个以前没有这么明显的问题:
表达质量和事实质量,正在逐渐脱钩。
越漂亮,不等于越正确。
越流畅,不等于越可靠。
越容易理解,也不等于越接近事实。
所以真正成熟的AI工作流应该是:
生成 → 理解 → 验证 → 修正
而不是:
生成 → 看起来很漂亮 → 相信
尤其涉及医学、科学、法律、金融等高风险领域时,这一点更加重要。
AI负责把复杂内容转换成更适合人理解的形式。
人负责检查:
事实有没有错?
证据够不够?
有没有遗漏关键条件?
图中的箭头是否真的代表因果?
模型是不是偷偷加入了没有证据的假设?
这可能就是未来人与AI之间最重要的一种分工。
我们真正进入的,可能是“认知工具按需生成”的时代
05
回头再看Karpathy这条帖子,会发现它讨论的其实远远超过了几个提示词。
它指向的是一个更大的变化。
过去:人适应软件。
现在:AI开始根据人的问题生成软件。
过去,一个软件需要服务很多人,才能覆盖昂贵的开发成本。
现在,一个软件甚至可以只服务一个人。
只解决一个问题,只存在几个小时,用完即扔。
这就是“可丢弃的软件制品”真正令人震动的地方。
而它和文字、图、网页、视频其实是一条线上的不同表现。
AI不再只是给你一个答案。
它可以根据你的问题,临时制造:
一个解释器。
一个:图解器。
一个:模拟器。
一个:动画老师。
甚至一个只属于你自己的小型软件。
过去我们需要花大量时间学习工具,才能创造这些东西。
未来可能反过来:
你只需要知道自己想弄明白什么,AI替你制造理解它的工具。
这会改变学习、改变研究、改变知识工作、也会改变“软件”的含义。
最后真正值得带走的,是这件事
06
未来,AI的竞争可能越来越少发生在“谁能写出一段更漂亮的文字”上。
因为文字已经足够便宜、代码也越来越便宜。
图表、网页、动画、视频,都会越来越便宜。
真正稀缺的东西,可能重新回到了人身上:
你究竟想弄明白什么?
你知道什么样的表示方式最适合这个问题吗?
你能判断AI给你的解释是否正确吗?
这意味着,AI时代的高手,未必是最会写提示词的人。
更可能是那些能够把问题拆清楚、选择正确表示方式,并且能够验证结果的人。
过去我们使用软件完成工作。
现在AI可以替我们制造软件,用完以后,它甚至不需要留下来。
因为它存在的意义,从来不是成为一款产品。
而是:
在你需要理解的那一刻,帮你把一个原本想不明白的问题,变成真正看得见、摸得着、可以验证的东西。
AI正在从“回答机器”,变成“理解工具的制造机器”。
而当智能和代码都越来越便宜以后,我们真正需要重新学习的,也许只有一件事:
当执行彻底不再稀缺,理解的深度与监督的精度,将成为人类最后的护城河。
END

相关学习资料