夜雨聆风学习资料网

ARTICLE · 1095526

AI还需要十年:Karpathy的七个反直觉判断

AI还需要十年:Karpathy的七个反直觉判断

 🤖 为什么是"十年"而非"今年" 

当主持人提到业内常说"今年是AI代理之年",Karpathy立刻表示被"触发"了。他说这种过度预测在行业内很普遍,而他更愿意用"十年"来描述这个阶段。

为什么是十年?在他近十五年的从业经验里,他见过太多预测失败。"问题是可以解决的,是可以克服的,但仍然很困难。平均下来,感觉就像是十年。"这不是精确计算,而是来自工业界和研究一线的直觉。

他用"雇佣一个实习生"来描述理想中的AI代理:当你把一项工作交给Claude或Codex时,它们现在还做不到。原因很直接——它们还不够智能、不够多模态、无法持续学习、认知存在缺陷。解决这些问题需要漫长时间。

 🧠 认知架构:预训练的"糟糕进化"与工作记忆 

Karpathy提出了一个独特框架:我们不是在构建"动物",而是在构建"幽灵"。动物通过数十亿年进化而来,拥有大量内置的"硬件"——比如斑马出生几分钟就能奔跑,这不是强化学习的结果,而是进化直接"烘焙"进神经网络的权重。

预训练的本质是什么?他称之为"糟糕的进化"——用互联网文本模仿人类,是我们技术条件下最接近进化的实际可行方案。它让模型获得了大量知识,但也让模型过于依赖记忆。

一个惊人的数据对比:Llama 3训练了15万亿token,但70B模型每个token仅存储0.07比特信息。而上下文学习的KV缓存每增加一个token就增长320KB——相差3500万倍。这就是为什么他说:"权重里的是对去年读过内容的模糊记忆,而上下文窗口里的就是工作记忆。"

 💬 "权重里的知识是对互联网文档的模糊记忆。上下文窗口里的知识是直接可访问的工作记忆。"——Karpathy 

关于强化学习,他提出了最尖锐的批评——"通过吸管吸取监督信号"。当你用强化学习解数学题时,模型会并行尝试数百种方法,最终只有一个正确答案。但强化学习会把整条路径——包括那些走错的分支——全部加权提升,仿佛每个中间步骤都是对的。这太"愚蠢"了。

更棘手的是模型崩溃问题。他指出:模型输出的分布是"沉默崩溃"的。你问ChatGPT讲个笑话,它只会讲三四个笑话——它们都"看起来正确",但缺乏人类思维的丰富性与多样性。如果持续用模型生成的数据训练模型,质量会持续下降。这不只是工程问题,它可能是根本性的。

 ⚡ 代码助手的真相:自动补全才是甜点 

作为亲手编写nanoGPT和nanochat的人,Karpathy对AI编程工具的评价很直接:自动补全才是他的最佳使用场景,AI代理在复杂项目上帮不上忙。

他说自己构建nanochat仓库时,几乎不依赖AI代理。原因很实际:nanochat不是模板代码,它的结构非常独特,每行代码都需要精确安排。模型们不断误解他的意图——它们太习惯互联网上的"典型写法",无法理解他抛弃DDP容器、自己写同步routine的逻辑。

模型有两个强项:样板代码(互联网上有大量示例)和初学者不熟悉的语言(他用Rust重写tokenizer时就借助了AI)。但对于"从未写过的架构代码",它们还差得很远。

 🎓 教育革命:构建通往知识的阶梯 

离开AI前沿实验室后,Karpathy选择了一条不同的路——Eureka,一个他形容为"星际舰队学院"的教育项目。他的愿景是:构建一个真正理解学生当前状态、永远提供"恰到好处"挑战的超级导师。

他用自己学韩语的经历说明这个目标:一位优秀的一对一导师能在简短对话后精确判断你的水平,探测你的认知世界模型,然后只给你当前能力范围内最需要的内容。"我不能面对太难或太简单的东西,导师总是给我完美的信息。我只是唯一的限制。"

他认为当前的AI能力还不足以实现这个愿景,但技术会进步。他把这个过程比作健身:"前AGI时代的学习是有用的,后AGI时代的学习是娱乐"——就像今天人们去健身房不是必须,而是因为它有趣、健康、能带来满足感。

 AI的真正瓶颈不是算力,而是我们还没搞清楚认知的哪些部分值得保留 

 💎 金句一:我们不是在构建动物,我们是在构建幽灵——通过模仿互联网文档诞生的数字灵魂 

 💎 金句二:强化学习是从整条轨迹末端"通过吸管吸取监督信号"——太愚蠢了,人类永远不会这样做 

 💎 金句三:前AGI时代的学习是有用的,后AGI时代的学习是娱乐——就像人们去健身房不是为了搬重物 

  欢迎关注丰渡篇篇,我们一起用科技摆渡成长。 

相关学习资料