当前时间: 2026-08-11 00:31:20
分类:办公文件
评论(0)
AI芯片新赌局:一颗芯片只跑一个模型「固化不是落后,灵活也不是先进。决定胜负的从来是那个比值:你要印多少本,和你多久改一次版。」 ——《AI时代漫游指南》第 191 章·雕版与活字
8 月 6 日,AMD 宣布收购一家叫 Taalas 的多伦多芯片公司。金额没披露,预计四季度交割。
这家公司干的事,一句话能说清,但这句话第一次听会觉得是胡闹:
它把 AI 模型的权重,直接刻进硅片里。
芯片造出来那一刻,模型就焊死在上面了,一个参数都改不了。
第一反应通常是:模型半年一换代,你把它焊死在芯片上?
这篇拆两件事:这门生意的钱从哪来 ,以及国内谁在做同一件事 。
编者注 :遇到"看起来明显荒谬"的商业模式,通常不是提出者疯了,是你和他假设的前提不一样。找到那个前提差异,比评判对错有意思得多。
一、先搞懂它到底省了什么
GPU 的钱花在了搬运上
模型权重存在高带宽内存(HBM)里,每算一层,就得把对应的那批权重从内存搬到计算单元。算完,搬下一批。反反复复。
部件 为什么需要 代价 HBM 内存 权重要有地方放,还得搬得快 单颗 GPU 光内存就数千美元 3D 堆叠 内存要离计算单元足够近 先进封装是全行业瓶颈 液冷 搬运产生大量热 数据中心要重新设计
这三样加起来是今天 AI 算力成本的大头。而它们服务的是同一件事:搬数据。
Taalas 的思路:不搬了
做法简单粗暴——既然权重要用,那就刻死在芯片上,用的时候不用搬。
具体是把权重固化进 Mask ROM(掩膜只读存储),做出来的东西业内叫模型专用集成电路 。
创始人 Ljubisa Bajic 说得很直接:这样一来,不需要 HBM、不需要 3D 堆叠、不需要液冷。
编者注 :顺便说一句,这位创始人不是新手。Ljubisa Bajic 是 Tenstorrent 的创始人兼首任 CEO,再往前在 AMD 和英伟达都干过。也就是说——他先在两家 GPU 巨头里待过,然后创了一家做通用 AI 芯片的公司,最后创了一家专门反对通用的公司。这个履历本身就是一份判断。
快到什么程度
官方数字:跑 Meta 的 Llama 3.1 8B,单用户每秒 16,960 个 token 。
今年 2 月发布时的对比口径是:比英伟达 GPU 快 48 倍 ,比 Cerebras 快 8.5 倍 。
这是公司自己的数据,不是第三方实测 ,看的时候心里有个数。
不过 16,960 tokens/秒是什么概念值得感受一下:一个人正常阅读速度大约每秒 5–8 个字。
这个速度是人类阅读的两千倍以上——已经不是"生成得比你读得快",是"生成得比你翻页快三个数量级"。
二、这门生意怎么赚钱
它的成本结构是"雕版印刷"
通用 GPU Taalas 类比 活字印刷 雕版印刷 前期投入 买卡就行 为这个模型专门流片,很贵 单次成本 每次都付电费和搬运成本 极低 换内容 换个模型直接跑 版废了,重刻
所以 Taalas 的盈亏平衡点是一道很朴素的算术题:
一次流片的固定成本vs 这个模型未来的总推理量 × 每次省下的钱
所以它的客户只有一类
谁会"真的很爱"某个模型,爱到愿意为它专门开一次模?
他们的共同特征是——手里有一个已经稳定、且跑量巨大 的模型。
跑量大到,省下的每一分钱乘以调用次数之后,能盖过流片成本。
这是一门只有巨头做得起、也只有巨头用得上的生意。
中小公司既没有那么大的单模型调用量,也承受不起模型一换硅片就报废。
编者注 :所以这笔收购的真实买家画像很清晰:AMD 不是买了一个能卖给所有人的产品,是买了一张能敲开少数几个超级客户大门的门票。这类客户一共也没几家,但每家的单子都大得吓人。
那个致命问题:模型换代怎么办
这是所有人第一个想到的质疑,Taalas 也确实给了答案。
换模型不用整颗重做,只需重新设计两层金属层。 周期从六个月压缩到大约两个月 。
两个月是个关键数字。它把"焊死"从"永久"变成了"一个季度"——刚好卡在主流模型的迭代节奏边缘。
但要诚实:官方也承认这套方案用了激进的压缩,会影响输出质量 。速度和精度之间,它选了速度。
编者注 :"从六个月降到两个月"这个说法,值得放在心里存疑。芯片行业所有"周期缩短"的承诺,都要等到真的量产过三五轮才算数。在那之前它是路线图,不是产品。
三、AMD 为什么买它
把这笔交易放回 AMD 最近的动作序列里看,逻辑就很清楚了。
7 月 22 日 —— AMD 宣布向 Anthropic 投资最多 50 亿美元 股权,Anthropic 承诺采购数百亿美元的 MI450 Helios 系统,规模 2 吉瓦 ,2027 年上半年开始出货。
7 月 23 日 —— AMD 与 Cerebras 达成技术合作:AMD 的 Helios 负责处理提示词和长上下文,Cerebras 负责生成 token,2026 下半年通过 Cerebras Cloud 上线。
8 月 6 日 —— 收购 Taalas。
(顺带纠正一个流传的说法:AMD 和 Cerebras 是合作,不是收购。 这两件事经常被混着说。)
层次 方案 适合 通用 Instinct GPU + EPYC 什么都能跑 半专用 与 Cerebras 分工 超低延迟场景 全固化 Taalas 单一模型、超大跑量
AMD 在攒的不是一颗更强的芯片,是一个覆盖不同"印量"的货架。
这个方向选得很准:训练市场英伟达的护城河深不见底,但推理市场刚刚开始,而且规则不一样 ——推理拼的是每一块钱能买多少 token,不是绝对性能。
这也解释了同期的另一件事:2025 年 12 月 24 日,英伟达花 200 亿美元拿下 Groq 的推理技术授权和核心团队。
编者注 :一个行业开始密集并购的时候,通常意味着技术路线已经收敛、剩下的是卡位。推理芯片这波并购潮的潜台词是:大家都同意推理会很大,但没人确定该用哪种架构,所以先把各条路线都买一条在手里。
四、它不是唯一一条固化路线
方案 固化到什么程度 灵活性 通用 GPU 什么都不固化 最高 Etched Sohu 固化 Transformer 架构 任何 Transformer 都能跑 Taalas 固化具体模型的权重 只跑那一个模型
Etched 的思路是赌"Transformer 这个架构不会变",比 Taalas 保守一档。
它公布的数据是:8 颗 Sohu 组成的服务器,在 Llama-70B 推理上可替代 160 张 H100 。
这两家赌的是同一个方向的不同刻度 :一个赌架构稳定,一个赌具体模型稳定。
五、国内对标:路径不同,方向一致
先说清楚:国内没有和 Taalas 完全对位的公司——把特定模型权重刻进硅片这条路,目前是海外独有的激进玩法。
但"减少数据搬运"这个核心命题,国内是从另一条路上攻的:存算一体 。
存算一体:让计算发生在存储里
思路同源、手法不同:既然搬数据最贵,那就别搬——直接在存储单元里做计算。
Taalas 是"把权重刻死在计算旁边",存算一体是"让存储自己会算"。
目标一致:干掉冯·诺依曼架构里那条来回搬运的总线。
知存科技 —— 商业化跑得最靠前。WTM2101 芯片量产超过 1000 万颗 ,已经装进华为和小米的可穿戴设备。2023–2025 累计流片十余次、服务 30 多家客户,计划到 2027 年把大模型芯片的营收占比提到 80% 。
亿铸科技 —— 2023 年 7 月完成存算一体 AI 芯片原型流片,计划 2026 年推出国产 AI 加速卡。 产学研 —— ISSCC 2026 上,清华大学、华为、字节跳动的联合团队发表 28nm 混合存算一体芯片论文,在推荐系统场景把 QPS 提升 66 倍 、能效比提升 181 倍 。
编者注 :知存那 1000 万颗的量产数字,比任何 PPT 都有说服力。它走的是"先在耳机手表这种小场景把良率和成本跑通,再往大模型爬"——和硅谷"上来就对着最大的靶子开枪"是两种完全不同的活法。
顺带看一眼国产算力的基本盘
公司 2026 Q1 营收 海光信息 40.34 亿元 寒武纪 28.85 亿元 摩尔线程 首次扭亏为盈
国产 AI 芯片已经过了"能不能造出来"的阶段,进入"能不能卖得动"的阶段。
而推理芯片这波,正好是国内最有机会的一段——因为推理不像训练那样极度依赖单卡绝对性能和成熟的软件生态,它更看重能效比和总拥有成本。
六、给不买芯片的人:三条能用的
第一,"专用 vs 通用"不是先进落后之争,是一道除法题。
量大且很少改 → 固化划算。量小或者常改 → 保持灵活。
这条对你选工具、定流程、要不要把某件事自动化,完全通用。
别人的最优解不是你的最优解,因为你们的印量不一样。
第二,灵活性是有月租的,只是这笔钱从不单独开票。
GPU 贵在哪?贵在它随时准备跑任何模型——为了这份"随时可以",它得配 HBM、配液冷、配先进封装。
你的工作里也有这种月租:为了"以后可能要改"而保留的各种余地、可配置项、待定方案。
第三,把稳定的部分焊死,把易变的部分留活口。
真正的高手不做全固化或全灵活的选择题,而是找到那条分界线 。
分不清哪部分稳定、哪部分易变的人,只能把所有东西都做成灵活的——那看起来像深思熟虑,其实是不敢下判断。
写在最后
《梦溪笔谈》里,沈括记毕昇的活字印刷,写下了一句判断标准:
若止印三二本,未为简易;若印数十百千本,则极为神速。
只印两三本,不见得省事;印成百上千本,就快得惊人。
他做的事朴素得多——给出一个可以算的标准,然后把选择权交还给具体的场景。
顺便说个容易被忽略的历史事实:活字发明之后,中国的主流印刷方式依然是雕版 ,一直到近代。
不是古人守旧,是因为汉字字数太多、活字排版成本太高,而印得最多的《论语》《史记》几百年不改一个字——
在"内容永不改变、印量趋近无穷"的场景里,雕版就是最优解。
Taalas 赌的正是这个:某些模型会稳定到值得为它专门刻一块版。
它赌得对不对,不取决于芯片做得多好,取决于未来三年模型换代有多快。
Don't Panic. 版可以重刻,账不能算错。
资料来源 :The Register、The Next Web、CNBC、Axios、BetaKit、Silicon Republic、Spheron、新华网、澎湃/36氪《谁在死磕,存算一体?》、搜狐财经与新浪财经国产 AI 芯片一季报汇总
如果这篇对你有用,转发给关心芯片和 AI 成本的朋友 ——比收藏更有价值。
关注「AI时代漫游指南 」,我们继续拆解 AI 时代那些看起来遥远、其实和你有关的事。
作者:漫游君
上一篇用了半年AI助手,我想说几句实话
下一篇【听“何”讲】课后习题教学的两大实用技巧