夜雨聆风学习资料网

ARTICLE · 1049323

AI不再比谁大了:小模型开始替大模型分担

AI不再比谁大了:小模型开始替大模型分担

这两天我一直在盯一个不那么热闹的方向。

过去两年,AI的新闻几乎都长一个样:谁的参数更大、谁的榜单更高、谁的集群更多卡。大家都在往"更大"这个方向使劲。

但让我觉得真正有意思的事,发生在另一头——那些"更小"的模型,忽然被派上了主力岗。

本期导读

  • 一件小模型干活的真事
  • 被忽略的那笔账:搬运
  • 我的判断:主线从"更大"转向"更省"
  • 一手推理:分工是怎么发生的
  • 一个新角度:算力之争,掺进了物流味
  • 对普通人和企业意味着什么
  • 留个问题给你

一件小模型干活的真事

据公开报道(2026年9月),一个由菲尔兹奖得主参与的创业团队,做了一件挺取巧的事:他们没去训练一个更大的模型,而是把手机端的4B小模型(Qwen-3.5)和云端的753B大模型(GLM-5.2)配成一对用。

据这家团队的说法,这个组合小模型补上了和大模型之间约一半的性能差距,而推理成本被压到大约二十分之一。

同期,端侧芯片这条线也在往前走。据2026年9月的公开报道,有嵌入式芯片用多颗联合带动6710亿参数级模型、16B模型运行功耗不到5瓦;有车规芯片做到5nm、650TOPS,端侧大模型预处理速度约为Mac Mini(M4 Pro)的2.4倍;还有存算一体路线,本地算力190TOPS、最高支持1220亿参数本地部署,无网环境每秒约50 tokens、功耗约30瓦。

这几条单看都像产品新闻,且均为厂商自述口径、第三方尚未跟进核验。但把它们摆在一起看,是一件事:小模型开始有底气接活了。

💡 我的判断:AI竞争的下一条主线,可能不是"谁更大",而是"谁分工更省"。大模型包打天下的时代,正在悄悄松动。

被忽略的那笔账:搬运

让我把这件真事里最有意思的一段单独拎出来。

这个团队解决的问题,不是算得不够快,而是"模型之间说话"太不划算。有个说法我看了好几遍才转过弯:大模型每生成1个token,内部会产生约2MB的状态,而它真正输出的有效信息,只有17比特。

2MB 换来 17 比特。 这意味着,真正的负担往往不在"算",而在"搬"——把一大堆内部状态从这儿挪到那儿。

(上述数字均转引自2026年9月的公开报道与厂商公开表述,属说明性的量级示意,非精确统计。)

顺着这个思路,很多事一下子说得通了:为什么端云协同会比"什么都丢给云端"更划算,为什么"把简单活留在本地"能省下大笔开销。

⚠️ 提醒:这里容易搞反。省下来的不是计算能力,而是通信与搬运那一环。计算依旧贵,只是很多计算压根不必跑到大模型那边去做。

我的判断:主线从"更大"转向"更省"

我自己的看法是,行业的胜负手正在换挡。

前两年的大模型公司,逻辑是"更大=更强=更贵=更有壁垒",谁的参数大谁就站在台上。现在,这条逻辑开始被算账打断——当通信和搬运的成本被摆上台面,"更省"比"更大"更容易被买单。

做法
谁在干
一笔账
大模型独干
云端重活
搬运多
小模型打杂
端侧常活
省得下
端云分工
两边接力
成本塌

一句话概括:不是小模型变强了,是"把活分下去"这件事终于划算了。

一手推理:分工是怎么发生的

我试着把这个变化推下去,大概是这么一条链:

第一步,通信/搬运成为瓶颈——模型越强,内部状态越大,挪一次越贵。

第二步,既然搬运贵,最省的办法就是"让活留在原地":能在端上做的(回消息、认图、清数据、跑小批任务),就别上云。

第三步,出端的量骤降,响应变快,数据也不必全往外走——顺带把隐私顾虑压下去一截。

第四步,大家发现"大模型包打天下"并不经济,模型开始走向分工:大模型管难题,小模型管日常。

四步走下来,结论挺朴素:这是"分工省下来的钱,最后落到用的人头上"。 和大厂砍AI预算的逻辑是一回事,只是这次省的不是模型选型的钱,而是"搬运"的钱。

一个新角度:算力之争,掺进了物流味

媒体常见的解读是"端侧芯片更强了""手机也能跑大模型了"。我觉得这说得没错,但没说到点上。

更本质的变化,是边界被重划了——哪些活必须出端、哪些活不必出端,正在被重新定义。过去因为端上跑不动,什么都往上送;现在很多活就地解决,"出端"从默认选项变成了需要论证的选择。

有意思的是,这跟物流挺像。同样的货,有人比"谁的车更能装",有人比"谁的仓库放得近"。当搬运本身成了大头,比"谁更大"就会输给比"谁更近"。

🚨 红线:话说回来,"本地跑"三个字现在被用得很泛。真要落到复杂长任务、专业判断、严谨复核,端侧小模型还差得远。分工不等于小模型能独立顶大梁,把它当主力会翻车。

对普通人和企业意味着什么

说回实在的。

对普通人:你手里的AI会更便宜、更快、更私密。离线也能用上的能力会变多,响应会更利索,很多东西不必再"上传了才能用"。这些变化不会敲锣打鼓,但会一点点渗进日常。

对企业:选型的逻辑要改。过去是"能上最强就上最强",现在是"哪层活配哪层模型"。会用大模型的团队多,会给模型"派活分工"的团队少——这道题的难度,不比当年学Prompt低。

生成能力越来越不稀罕之后,真正拉开差距的,是你能不能把活拆开、派对、再验收。 模型再小也一样,得有人安排它干什么。


换个角度想:这两年我们盯着"模型能长多大",可能不如盯着"模型能分多细"。

因为"更大"是厂商的比赛,"更省"才是你的红利。

最后留个问题:你手上那些每天都在重复的活,有没有哪些其实根本不必动用最强的大模型?

说明:本文由AI辅助创作并经过人工审核修改,数据均标注来源。

关注「拙勤守新」· 用AI认知提升工作效率!

相关学习资料