乐于分享
好东西不私藏

AI芯片新赌局:一颗芯片只跑一个模型

AI芯片新赌局:一颗芯片只跑一个模型
「固化不是落后,灵活也不是先进。决定胜负的从来是那个比值:你要印多少本,和你多久改一次版。」

——《AI时代漫游指南》第 191 章·雕版与活字

8 月 6 日,AMD 宣布收购一家叫 Taalas 的多伦多芯片公司。金额没披露,预计四季度交割。
这家公司干的事,一句话能说清,但这句话第一次听会觉得是胡闹:
它把 AI 模型的权重,直接刻进硅片里。
不是存在内存里,是刻进去
芯片造出来那一刻,模型就焊死在上面了,一个参数都改不了。
第一反应通常是:模型半年一换代,你把它焊死在芯片上?
但这门生意不但成立,还刚被 AMD 买走了。
这篇拆两件事:这门生意的钱从哪来,以及国内谁在做同一件事
编者注:遇到"看起来明显荒谬"的商业模式,通常不是提出者疯了,是你和他假设的前提不一样。找到那个前提差异,比评判对错有意思得多。

一、先搞懂它到底省了什么

GPU 的钱花在了搬运上

跑一次大模型推理,芯片在干嘛?
大部分时间不是在算,是在
模型权重存在高带宽内存(HBM)里,每算一层,就得把对应的那批权重从内存搬到计算单元。算完,搬下一批。反反复复。
这就是为什么现代 AI 芯片长成那个样子:
部件为什么需要代价
HBM 内存权重要有地方放,还得搬得快单颗 GPU 光内存就数千美元
3D 堆叠内存要离计算单元足够近先进封装是全行业瓶颈
液冷搬运产生大量热数据中心要重新设计
这三样加起来是今天 AI 算力成本的大头。而它们服务的是同一件事:搬数据。

Taalas 的思路:不搬了

做法简单粗暴——既然权重要用,那就刻死在芯片上,用的时候不用搬。
具体是把权重固化进 Mask ROM(掩膜只读存储),做出来的东西业内叫模型专用集成电路
创始人 Ljubisa Bajic 说得很直接:这样一来,不需要 HBM、不需要 3D 堆叠、不需要液冷。
上面那张表里的三笔钱,一次性全省了。
代价也很直接:这颗芯片这辈子只能跑这一个模型。
编者注:顺便说一句,这位创始人不是新手。Ljubisa Bajic 是 Tenstorrent 的创始人兼首任 CEO,再往前在 AMD 和英伟达都干过。也就是说——他先在两家 GPU 巨头里待过,然后创了一家做通用 AI 芯片的公司,最后创了一家专门反对通用的公司。这个履历本身就是一份判断。

快到什么程度

官方数字:跑 Meta 的 Llama 3.1 8B,单用户每秒 16,960 个 token
今年 2 月发布时的对比口径是:比英伟达 GPU 快 48 倍,比 Cerebras 快 8.5 倍
这是公司自己的数据,不是第三方实测,看的时候心里有个数。
不过 16,960 tokens/秒是什么概念值得感受一下:一个人正常阅读速度大约每秒 5–8 个字。
这个速度是人类阅读的两千倍以上——已经不是"生成得比你读得快",是"生成得比你翻页快三个数量级"。

二、这门生意怎么赚钱

现在回答核心问题。

它的成本结构是"雕版印刷"

把它翻译成一个所有人都懂的模型:
通用 GPUTaalas
类比活字印刷雕版印刷
前期投入买卡就行为这个模型专门流片,很贵
单次成本每次都付电费和搬运成本极低
换内容换个模型直接跑版废了,重刻
雕版的经济学只有一条:制版贵,印得越多越便宜。
所以 Taalas 的盈亏平衡点是一道很朴素的算术题:
一次流片的固定成本
vs
这个模型未来的总推理量 × 每次省下的钱
推理量够大,就赚;不够大,血亏。

所以它的客户只有一类

海外报道里有句话,把这门生意的约束说得特别到位:
"你最好是真的很爱那个模型。"
谁会"真的很爱"某个模型,爱到愿意为它专门开一次模?
只有两种人:大模型实验室,和推理服务商。
他们的共同特征是——手里有一个已经稳定、且跑量巨大的模型。
跑量大到,省下的每一分钱乘以调用次数之后,能盖过流片成本。
这是一门只有巨头做得起、也只有巨头用得上的生意。
中小公司既没有那么大的单模型调用量,也承受不起模型一换硅片就报废。
编者注:所以这笔收购的真实买家画像很清晰:AMD 不是买了一个能卖给所有人的产品,是买了一张能敲开少数几个超级客户大门的门票。这类客户一共也没几家,但每家的单子都大得吓人。

那个致命问题:模型换代怎么办

这是所有人第一个想到的质疑,Taalas 也确实给了答案。
换模型不用整颗重做,只需重新设计两层金属层。 周期从六个月压缩到大约两个月
两个月是个关键数字。它把"焊死"从"永久"变成了"一个季度"——刚好卡在主流模型的迭代节奏边缘。
但要诚实:官方也承认这套方案用了激进的压缩,会影响输出质量。速度和精度之间,它选了速度。
编者注:"从六个月降到两个月"这个说法,值得放在心里存疑。芯片行业所有"周期缩短"的承诺,都要等到真的量产过三五轮才算数。在那之前它是路线图,不是产品。

三、AMD 为什么买它

把这笔交易放回 AMD 最近的动作序列里看,逻辑就很清楚了。
7 月 22 日 —— AMD 宣布向 Anthropic 投资最多 50 亿美元股权,Anthropic 承诺采购数百亿美元的 MI450 Helios 系统,规模 2 吉瓦,2027 年上半年开始出货。 7 月 23 日 —— AMD 与 Cerebras 达成技术合作:AMD 的 Helios 负责处理提示词和长上下文,Cerebras 负责生成 token,2026 下半年通过 Cerebras Cloud 上线。 8 月 6 日 —— 收购 Taalas。
(顺带纠正一个流传的说法:AMD 和 Cerebras 是合作,不是收购。 这两件事经常被混着说。)
三步连起来,是一套完整的推理产品线:
层次方案适合
通用Instinct GPU + EPYC什么都能跑
半专用与 Cerebras 分工超低延迟场景
全固化Taalas单一模型、超大跑量
AMD 在攒的不是一颗更强的芯片,是一个覆盖不同"印量"的货架。
这个方向选得很准:训练市场英伟达的护城河深不见底,但推理市场刚刚开始,而且规则不一样——推理拼的是每一块钱能买多少 token,不是绝对性能。
这也解释了同期的另一件事:2025 年 12 月 24 日,英伟达花 200 亿美元拿下 Groq 的推理技术授权和核心团队。
连英伟达自己都在补推理,说明这块的规则确实变了。
编者注:一个行业开始密集并购的时候,通常意味着技术路线已经收敛、剩下的是卡位。推理芯片这波并购潮的潜台词是:大家都同意推理会很大,但没人确定该用哪种架构,所以先把各条路线都买一条在手里。

四、它不是唯一一条固化路线

"把模型刻进硅"这件事,有不同的激进程度:
方案固化到什么程度灵活性
通用 GPU什么都不固化最高
Etched Sohu固化 Transformer 架构任何 Transformer 都能跑
Taalas固化具体模型的权重只跑那一个模型
Etched 的思路是赌"Transformer 这个架构不会变",比 Taalas 保守一档。
它公布的数据是:8 颗 Sohu 组成的服务器,在 Llama-70B 推理上可替代 160 张 H100
这两家赌的是同一个方向的不同刻度:一个赌架构稳定,一个赌具体模型稳定。
哪个对,取决于未来三年模型换代有多快。

五、国内对标:路径不同,方向一致

先说清楚:国内没有和 Taalas 完全对位的公司——把特定模型权重刻进硅片这条路,目前是海外独有的激进玩法。
但"减少数据搬运"这个核心命题,国内是从另一条路上攻的:存算一体

存算一体:让计算发生在存储里

思路同源、手法不同:既然搬数据最贵,那就别搬——直接在存储单元里做计算。
Taalas 是"把权重刻死在计算旁边",存算一体是"让存储自己会算"。
目标一致:干掉冯·诺依曼架构里那条来回搬运的总线。
知存科技 —— 商业化跑得最靠前。WTM2101 芯片量产超过 1000 万颗,已经装进华为和小米的可穿戴设备。2023–2025 累计流片十余次、服务 30 多家客户,计划到 2027 年把大模型芯片的营收占比提到 80%亿铸科技 —— 2023 年 7 月完成存算一体 AI 芯片原型流片,计划 2026 年推出国产 AI 加速卡。 
产学研 —— ISSCC 2026 上,清华大学、华为、字节跳动的联合团队发表 28nm 混合存算一体芯片论文,在推荐系统场景把 QPS 提升 66 倍、能效比提升 181 倍
编者注:知存那 1000 万颗的量产数字,比任何 PPT 都有说服力。它走的是"先在耳机手表这种小场景把良率和成本跑通,再往大模型爬"——和硅谷"上来就对着最大的靶子开枪"是两种完全不同的活法。

顺带看一眼国产算力的基本盘

2026 年一季度的成绩单(上市公司财报数字):
公司2026 Q1 营收
海光信息40.34 亿元
寒武纪28.85 亿元
摩尔线程首次扭亏为盈
国产 AI 芯片已经过了"能不能造出来"的阶段,进入"能不能卖得动"的阶段。
而推理芯片这波,正好是国内最有机会的一段——因为推理不像训练那样极度依赖单卡绝对性能和成熟的软件生态,它更看重能效比和总拥有成本。

六、给不买芯片的人:三条能用的

第一,"专用 vs 通用"不是先进落后之争,是一道除法题。
判断标准只有一个:印量 ÷ 改版频率
量大且很少改 → 固化划算。量小或者常改 → 保持灵活。
这条对你选工具、定流程、要不要把某件事自动化,完全通用。
别人的最优解不是你的最优解,因为你们的印量不一样。 第二,灵活性是有月租的,只是这笔钱从不单独开票。
GPU 贵在哪?贵在它随时准备跑任何模型——为了这份"随时可以",它得配 HBM、配液冷、配先进封装。
你的工作里也有这种月租:为了"以后可能要改"而保留的各种余地、可配置项、待定方案。
它们每一天都在收费,只是账单不写在明面上。
第三,把稳定的部分焊死,把易变的部分留活口。
这是这篇里最值钱的一条。
真正的高手不做全固化或全灵活的选择题,而是找到那条分界线
分不清哪部分稳定、哪部分易变的人,只能把所有东西都做成灵活的——那看起来像深思熟虑,其实是不敢下判断。

写在最后

这件事一千年前有人算过。
《梦溪笔谈》里,沈括记毕昇的活字印刷,写下了一句判断标准:
若止印三二本,未为简易;若印数十百千本,则极为神速。
只印两三本,不见得省事;印成百上千本,就快得惊人。
沈括没有说活字更先进,也没有说雕版更可靠。
他做的事朴素得多——给出一个可以算的标准,然后把选择权交还给具体的场景。
顺便说个容易被忽略的历史事实:活字发明之后,中国的主流印刷方式依然是雕版,一直到近代。
不是古人守旧,是因为汉字字数太多、活字排版成本太高,而印得最多的《论语》《史记》几百年不改一个字——
在"内容永不改变、印量趋近无穷"的场景里,雕版就是最优解。
Taalas 赌的正是这个:某些模型会稳定到值得为它专门刻一块版。
它赌得对不对,不取决于芯片做得多好,取决于未来三年模型换代有多快。
这不是技术问题,是时代节奏问题。
Don't Panic. 版可以重刻,账不能算错。

资料来源:The Register、The Next Web、CNBC、Axios、BetaKit、Silicon Republic、Spheron、新华网、澎湃/36氪《谁在死磕,存算一体?》、搜狐财经与新浪财经国产 AI 芯片一季报汇总
如果这篇对你有用,转发给关心芯片和 AI 成本的朋友——比收藏更有价值。
关注「AI时代漫游指南」,我们继续拆解 AI 时代那些看起来遥远、其实和你有关的事。
作者:漫游君