乐于分享
好东西不私藏

解锁智能——当 AI 学会用工具

解锁智能——当 AI 学会用工具

本文是「态势感知:未来的十年」系列第 4 篇。基于 Leopold Aschenbrenner 著《Situational Awareness》(2024年6月)。


想象你雇了一个天才员工,但你给 TA 的规矩是:
每句话只能说一个词
不能上网查资料
不能做笔记,每次对话从零开始
被问到难题必须立刻回答,不许思考
不能使用计算器、日历、邮件
这个人再聪明,实际能干的事也非常有限。
Aschenbrenner 说:这就是现在 GPT-4 的状态。它的智能已经存在于模型权重中——但被刻意限制在一个狭窄的交互模式里。

五重枷锁

枷锁
锁住了什么
🧠 无长期记忆
每次对话从零开始,无法积累经验
🔧 无工具使用
不能上网、不能运行代码、不能发邮件
⏱️ 无思考时间
逐字生成,不能在内部反复推演
🎯 无主动性
被动等待输入,不会自己设定目标
👁️ 单模态
主要是文本,不能看图听声
关键认知:这些不是能力的缺失——是能力的封锁。模型在训练时学到了大量知识,但 chatbot 的交互方式把它们压进了一个极窄的出口。

解锁 = 阶跃式的能力提升

去枷锁和算力增长有一个本质区别:
算力增长
去枷锁
每 +1 OOM,能力平滑提升一点
解锁一个枷锁,能力跳一个台阶
举个例子。同一个 GPT-4:

没有代码执行工具 → 凭记忆判断代码,可能对可能错有代码执行工具 → 运行代码 → 看到报错 → 分析 → 修改 → 再运行 → 确认修复

模型还是那个模型。但加了一个工具,表现完全不同。

Chatbot vs Agent:一次质变

这是最重要的解锁方向——从被动问答自主行动

Chatbot:你问 → 它答 → 结束Agent:你给目标 → 它规划步骤 → 调用工具 → 自我检查 → 修正 → 完成 → 汇报

给你安排明天下午的户外活动,Agent 会自己查天气、翻日历、找路线、发邀请、设提醒——一整条链,不需要你一步一步问。

两个效应的叠加

最精彩的部分在最后:
2023:GPT-4 基础智能 + 轻度去枷锁 = 聪明高中生的聊天工具2027(预期):  比 GPT-4 再聪明一个质的飞跃的基础模型      ← 来自 +4 OOMs  + 深度去枷锁(Agent + 工具 + 记忆 + 多模态) ← 阶跃式释放  = 能自主完成复杂任务、在工作中替代人类的 Agent
不是加法,是乘法。

下一篇:当 AI 开始自我进化——智能爆炸


本系列共 8 篇,基于 Aschenbrenner《Situational Awareness: The Decade Ahead》设计。