AI PROJECT / BUILD LOG ● ONLINE
AI 为什么还在变强,而且越来越快?看懂三条加速路径
前两篇,我们讲了 AI 的三次浪潮,也讲了它怎样从“能写字”走到“能做事”。
接下来很自然会冒出一个问题:
“
AI 已经这么强了,后面还能靠什么继续进步?
很多人会回答:“把模型继续做大。”
这句话只说对了一部分。今天的 AI 其实沿着三条路线同时向前:训练时投入更多资源、回答时让模型多算一会儿、做任务时给它更好的工具和工作流程。
你可以把它们理解成三个升级位置:
训练阶段:让学生学得更多
回答阶段:让学生多想一会儿
执行阶段:给学生配上电脑和工具
三条路叠在一起,才形成了我们感受到的加速。
01第一条路:训练时扩展,投入资源通常还能换来进步
2020 年,OpenAI 的 Kaplan 等人发表论文《Scaling Laws for Neural Language Models》。
他们训练并分析了不同大小的语言模型,发现一个很有用的现象:随着参数量、训练数据和计算量增加,模型的平均训练损失会按照相对稳定的曲线下降。
这种规律叫 Scaling Laws(缩放定律:描述模型表现如何随规模变化的经验规律)。
这里的“缩放”,就是把训练规模往上加。参数量可以先理解成模型容纳和调整语言规律的空间;训练数据是它读过的材料;算力则是完成这些学习所用的计算资源。
打个比方,一个学生最后学得怎么样,既取决于脑子里能装下多少东西,也取决于读了多少资料、做了多少练习。
只给他一本更厚的笔记本,却没增加教材,很多页面会空着。资料堆满桌子,却只给十分钟学习,也消化不了。
参数、数据和算力需要一起考虑。
缩放定律最吸引人的地方,是研究团队可以先训练一批较小模型,再根据实验曲线估算:如果多投入一些计算,平均损失大概还能下降多少。
但“有规律”不等于“有数学保证”。
这些曲线是从实验中总结出来的 经验规律,不是保证模型越大就必然更聪明的定理。训练损失下降,也不等于写代码、做数学题和判断事实会按照同一比例提高。
它更像天气预报。能帮助你判断趋势,却不能精确承诺下午 3 点 17 分一定落下第一滴雨。
02Chinchilla 提醒大家:模型不是越大越好
早期的规模竞赛很容易变成一件事:继续堆参数。
2022 年,DeepMind 的 Chinchilla 论文给行业提了个醒。
研究团队用相近的训练计算量,训练了一个 700 亿参数的 Chinchilla。它的参数只有 Gopher 的四分之一,却使用了更多训练数据,最终在多项评测中超过了 2800 亿参数的 Gopher。
问题不在于 Gopher 的模型太大,而在于相对于它的参数量,训练数据不够多。
Chinchilla 的核心结论是:在固定算力预算下,模型参数和训练词元应该更均衡地增长。论文中的计算最优配置大约对应每个参数使用 20 个训练词元。
词元(token:模型读取文字时使用的小单位)可能是一个字、一个词,也可能只是词的一部分。
“20 比 1”不是永远适用的配方。数据质量、模型结构、训练目标和使用成本改变后,最合适的比例也可能改变。
真正值得记住的是:模型强不强,不能只看参数表。一个体型更小、资料读得更充分的模型,可能胜过一个训练不足的大模型。
03一个很迷人的问题:能力会不会突然“涌现”?
模型扩大以后,有些评测会出现奇怪的图形。
小模型无论怎么做都接近瞎猜。模型增加到某个规模后,成绩忽然跳了上去。
2022 年,Google 研究者 Jason Wei 等人把这类现象称为 涌现能力(小模型中没有明显表现、在大模型中出现的能力)。作者后来整理了 137 项被观察为涌现的任务或能力。
最常见的类比是烧水:从 99°C 到 100°C 只差一度,水的状态却变了。
这个说法很抓人,但学界并没有完全达成一致。
2023 年,斯坦福研究者发表论文《Are Emergent Abilities of Large Language Models a Mirage?》。他们指出,一些“突然出现”可能和评分方式有关。
假设一道数学题只有答案完全正确才得 1 分,差一个数字也是 0 分。模型也许一直在慢慢进步,只是直到某个规模才开始答对整道题。
图表上看,它像突然学会了;如果改用能记录部分进步的连续评分,曲线可能平滑得多。
所以,更稳妥的理解是:
“
扩大规模可能让模型跨过“实际可用”的门槛,但能力究竟突然出现,还是逐渐进步后被评分规则看见,仍有争论。
我们确实无法准确列出下一代模型会在哪些任务上明显变好。不过,这不等于模型会随机觉醒任何能力。
04第二条路:推理时扩展,让模型在回答时多算一会儿
训练一个新模型很贵,而且要花很长时间。
有没有办法不重新训练整个底座,也让现有模型在难题上表现更好?
2024 年的 OpenAI o1 展示了第二条路线:推理时扩展(在生成答案的阶段投入更多计算)。
普通模型很像考试铃一响就开始写。它顺着第一个思路往下走,前面算错一步,后面可能全跟着错。
推理模型更像先在草稿纸上尝试几种方法,检查中间步骤,再交最终答案。有些系统还会生成多个候选答案,然后比较或投票。
OpenAI 公布的实验显示,在部分数学、科学和编程评测上,o1 使用更多测试时计算,表现会继续提高。
这相当于为同一个学生增加考试时间,但类比到这里就该停了。
o1 不是普通模型简单“等得更久”。它经过了专门的强化学习训练,学会怎样使用额外计算。更多思考也会增加费用和等待时间,而且不保证每道题都变好。
如果题目缺少资料,或者模型一开始理解错了问题,让它关起门多想十分钟,可能只是更认真地走错路。
推理时扩展提供的是第二个调节旋钮:除了在训练阶段加资源,还可以在回答阶段根据题目难度分配计算。
05第三条路:Agent 系统扩展,模型没换也能做更多
前两条路主要改变模型本身或模型的计算过程。
第三条路发生在模型外面。
给模型接上搜索、代码执行、文件读写和浏览器,再加入记忆、任务规划、报错恢复和结果验证,它就组成了一个更完整的 Agent(智能体)系统。
比如,同一个模型只能聊天时,你问它:“这个项目的测试为什么失败?”
它只能根据你贴出来的报错猜。
接入工具后,它可以读取项目文件、搜索相关函数、运行测试、修改代码,再根据新的测试结果继续调整。底层模型即使没有换,任务完成率也可能提高。
这就是 系统扩展:不是只升级“大脑”,还升级工具箱、工作台和检查流程。
06两个 benchmark,说明 Agent 进步有多快
观察 Agent 进展,经常会看到两个测试。
SWE-bench Verified 是一个软件工程基准。它从真实开源项目中挑选问题,让 AI 阅读代码并生成修复方案。
它的成绩近几年上涨很快,但“已经接近 100%”并不准确。2026 年公开报道的领先成绩大约为 79%,离全部解决仍有明显距离。
另一个是 OSWorld,它让 AI 操作浏览器、表格、文档和代码编辑器等电脑应用。
2024 年 OSWorld 刚发布时,论文中的最佳模型只能完成约 12% 的任务。到 2026 年,使用 GPT-5 和专门智能体框架的系统,在旧版 OSWorld 上已经接近 70%。
看起来马上要通关了?
研究者随后推出了更难的 OSWorld 2.0。任务变得更长,也更接近真实工作流。最佳系统的完整任务完成率又降到约 21%。
这组反差很重要。
成绩上涨说明系统真的在进步。但一个基准快刷满时,也可能说明模型熟悉了题型,或者测试已经不够难。换一张更接近真实工作的试卷,缺点又会冒出来。
所以 benchmark(基准测试)像考试成绩。它能帮助比较,却不能直接等同于“AI 已经能稳定替人工作”。
07MCP 为什么也会让 Agent 生态加速?
Agent 想做事,必须连接外部工具。
以前每个 AI 应用连接文件、数据库和办公软件,都可能使用不同的接口。开发者要反复写适配代码。
MCP(模型上下文协议)提供了一套开放标准,让 AI 应用用较统一的方式发现和调用外部工具。
它常被比作 AI 工具的 USB-C 接口。换了模型,不一定要把每个工具连接全部重做;新工具也更容易接入支持 MCP 的应用。
标准化会减少重复工作,但 MCP 不是安全魔法。
工具有没有权限删除文件?外部网页会不会藏着恶意提示?执行以后谁来确认结果?这些问题仍要由应用的沙盒、审批机制和人工检查解决。
接口统一,只代表更容易连接,不代表可以放心全自动运行。
08为什么我们感觉更新速度从“年”变成了“月”?
模型、推理方法和 Agent 工具会互相借力。
一个更强的模型发布后,可以立刻接入已有的搜索和代码工具;一种新的智能体框架,也可以同时服务多个模型;真实用户产生的失败案例,又会进入下一轮评测和改进。
所以,产品层面的变化确实越来越密集。
不过,大模型代际发布并没有简单地从“几年一次”缩短成“几个月一次”。GPT-3 在 2020 年 5 月发布,GPT-4 是 2023 年 3 月,GPT-5 则是 2025 年 8 月,两个间隔都超过两年。
我们每个月感受到的新功能,很多来自后训练、模型快照、推理强度、工具和产品界面更新,不一定是从头训练了一个全新基础模型。
全球竞争也在压缩跟进时间。斯坦福 2026 AI Index 显示,在它采用的模型排名口径下,2026 年 3 月领先的美国模型与中国模型只相差约 2.7%。
但这个数字只说明特定榜单上的模型表现接近。芯片供应、资本投入、研究人才、论文数量和产业应用不能被一个百分比概括。
09加速仍在继续,但没有人拿到永远有效的保证书
现在可以回到开头的问题。
AI 还在变强,是因为行业不只剩“继续堆参数”这一条路。
训练时扩展提高底座能力;推理时扩展让模型在难题上投入更多计算;Agent 系统扩展则用工具、记忆和验证,把模型能力转化成真实动作。
三条路线可以同时推进,也会互相放大。
但加速不是自然定律。高质量数据可能变少,芯片和能源有成本,推理时间不能无限增加,Agent 的可靠性与安全边界也还远没解决。
因此,比较准确的结论不是“AI 一定会永远指数增长”,而是:
“
目前仍有多条清楚可见的改进路线,而且这些路线还没有走到尽头。
下一篇,我们可以继续追问一个更现实的问题:当 AI 能力持续提高,人应该怎样判断哪些工作可以交给它,哪些决定必须留在自己手里?
注:本文主要框架来自于TRAE 团队的《AI 通识课》,在课程基础上增加了更多针对小白的解释说明。感谢TRAE 团队制作的精品公开课,希望能帮到每一位想要用好 AI 的朋友。
夜雨聆风