夜雨聆风学习资料网

ARTICLE · 1137137

脸谱|国产AI突破算力瓶颈的关键路径:小两个数量级,最适合AI的架构来了

脸谱|国产AI突破算力瓶颈的关键路径:小两个数量级,最适合AI的架构来了

大部分人还在靠堆参数换效果,但HBM的紧缺已经成了最贵、也最买不到的那一环。在统一的视频生成评测条件下,参数不变、只把计算量翻 4 倍投在隐状态循环上,脸谱的94M的Loop视频类世界生成式模型有7项指标反超5B的BWM,这代表着同一台8卡H100服务器,并发路数从57路提升到至少336路。可能是解决国产算力瓶颈的关键技术。

⚠️ 本文指标数值为本地统一管线实测。



01 HBM 正在成为最贵的那一环

产能被预订到了 2027 年。
SK 海力士 2026 年 HBM 产能已提前售罄;三星、SK 海力士、美光的 DRAM 与 HBM 2027 年产能也已全数分配完毕。
缺口没有收窄。
2026 年全球 HBM 市场规模预计增长 58% 至 546 亿美元,产能缺口仍维持在 50%–60%。
价格还在往上走。
集邦咨询上调预期,2027 年 HBM 混合平均售价同比增幅可达 121%。
成本已经传导到硬件。
英伟达 AI 服务器价格普遍上涨逾 15%,其中存储成本是主要推手。

算力可以排队等,HBM 等不到。在这样一个年份,模型的评价标准必须多一条,不是"谁更强",而是"每 GB HBM 能换来多少效果"。


02 同一个思路,前沿实验室也在走

就在上个月,这条路被端到了最前面。

9月,The Information 报道称 OpenAI 即将发布的模型 Astra 使用了一项叫「循环深度」(recurrent depth)的技术—— looped transformer(循环 Transformer):不是增加参数,而是把同一段层堆栈重复跑多次,用循环把网络"展开"到更深的等效深度。

同月,OpenAI 正式发布GPT-6 Astra,官方口径是"全球最智能、最对齐的模型",在计算机操作、编程、网络安全、科学研究上全面刷新纪录;在 OSWorld 2.0 的延迟模拟中,它用约 47% 更少的时间完成比上一代更强的计算机操作表现。

这套机制的原理,一句话能说清

重复使用层堆栈,而不是复制权重。效果上相当于把网络加深,但存储和内存占用不变,增加的是计算量。


03 脸谱心智Loop模型对比口径

对比对象是5B参数的动作条件视频生成模型(BWM 开源版,BLM-Lab/Boundless-World-Model,骨干 Wan2.2-TI2V-5B)。
为公平对比,两边统一到 128×128、57 帧、batch=1、fp16(官方设定 480×640、81 帧)。我们主动降低了分辨率,因为这是唯一能保证两边输入条件完全一致的评测方式。
Action Following 在所有被测模型上都接近 0,不具备区分度,不计入本文结论。
本文的主张只有两条:一是循环隐状态传递在受控条件下有效;二是这条路径能显著降低 HBM 需求。

04 为什么把主线放在显存上

讨论生成式模型时,大家习惯比"谁更强"。但真到部署环节,先卡住你的通常不是算力,是显存:

权重本身就要占显存。按 fp16 计算,5B 参数的权重占 10.00 GB,94M 主模型只占 0.188 GB,光这一项就差 53 倍。
视频生成还要吃额外显存:文本编码器、VAE解码缓冲、激活值、注意力工作区,都会随分辨率和序列长度增长。
结果就是:很多视频模型"能跑起来"和"能跑得起"是两回事。

在HBM 缺口50%–60%的年份,这个差别不再只是工程细节,而是能不能把服务开起来的差别。


05 我们的做法:参数不变,把计算量花在循环上

设了两组对照,把"参数量"和"计算量"两个变量拆开(本文的拆解当中采用固定循环次数,不让模型自主决定循环次数):

组别
参数量
计算量
设计目的
loop0
= loop3
< loop3
隐状态只迭代一次
loop3
~94M
loop0 的 4 倍
额外循环三次

取舍方向:我们加的是计算量,加的不是参数量。参数不变意味着权重 HBM 占用不变,多出来的开销只落在计算上,而计算可以排队,HBM 买不到。且一般来讲,循环模型即使循环的更少,仍然有效。


06 Loop结构正在替换传统的AI架构

6.1 效果侧:16 项指标,7 项反超

结果
指标
✅ 显著优于 BWM(7 项)
JEPA Similarity
Motion Smoothness
Trajectory Accuracy
Depth Accuracy
Perspectivity
Instruction Following
Semantic Alignment
➖ 略逊(3 项)
Aesthetic Quality
Flow Score
Interaction Quality
❌ 仍有差距(5 项)
Image Quality
Dynamic Degree
Subject Consistency
Background Consistency
Photometric Consistency

Loop3又小又好,甚至超越或接近榜单中比Loop3大50倍左右的模型。并且,Loop3不仅节省内存,在计算上也显著节省。

6.2 显存侧:权重(确定性计算,无假设)

权重显存 = 参数量 × 精度字节数,fp16 即 ×2:

模型
模块
参数量
权重显存
BWM
DiT 主干
5B
10.00 GB
VAE(Wan2.2 高压缩 3D VAE)
≈150M
0.30 GB
Action Encoder
≈20M
0.04 GB
文本编码器 UMT5-XXL
≈5.5B
11.00 GB
小计(不含文本编码器)
10.34 GB
小计(含文本编码器)
21.34 GB
loop3
主模型(DiT)
94M
0.188 GB
VQ tokenizer + decoder
≈50M
0.10 GB
Action Encoder
≈10M
0.02 GB
小计
0.31 GB
仅主模型:10.00 / 0.188 = 53.2 倍
6.3 目前HBM花销对比,瓶颈以及接下来的提升
目前已达到非常可观的HBM花销减少,甚至在多项指标上反超大模型

未来优化方向:Wan2.2 那个 VAE 压缩得太狠(16×16×4),而我们的 VQ tokenizer 只压 8×、且不做时间压缩。直接指向下一步的优化方向。


07 Loop架构正在解决国产AI算力瓶颈

如图例,根据公网信息估算,当使用脸谱Loop3类型架构,HBM的内存供需会随渗透率逐渐迫近并且超越100%。且如果Loop3架构渗透率更快,将更快超越100%,预计27年即可全面覆盖内存需求。权重轻量化对国产链的相对价值更大,可能是解决国产算力瓶颈的关键技术。

附 A:完整指标数值

Available on Request


附 B:引用目录文章

HBM 供需与价格

  • 〈全球抢"芯" 产业链"涨"声不断〉— 21世纪经济报道
  • 〈"存储三巨头"2027 产能已售罄?消息人士:一些 AI 公司已在"跪…〉— 财联社   
  • 〈报道:存储三大原厂"2027 年产能已提前售罄"〉— 华尔街见闻 

GPT-6 Astra 与循环深度(Looped Transformer)

  • 〈GPT-6 Astra: A new generation of intelligence〉— OpenAI 官方
  • 〈OpenAI Technique in 'Astra' Model Sparks Security Concerns〉— The Information
  • 〈OpenAI Astra and Looped Transformers〉— Sebastian Raschka

对照模型与硬件口径

  • 〈万相|领先的 AI 视频与图像生成模型〉(Wan2.2 开源说明,含 16×16×4 压缩比)— 阿里云万相
  • 〈通义万相 2.2 开源!可一键生成电影感视频〉(22GB 显存口径)— 知乎
  • 〈AutoDL 算力云|GPU 算力零售价格〉(¥1.88/小时 RTX 4090 口径)— AutoDL

评测基准与对照模型出处

  • 〈WorldArena: A Unified Benchmark for Evaluating Perception and Functionality of Embodied World Models〉— arXiv:2602.08971
  • WorldArena 官方榜单与评分数据 — WorldArena 团队
  • 〈BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning〉(本文对照模型 BWM 的来源)— arXiv:2607.29302

说明:文中 16 项指标的评测口径与 BWM 的模型信息分别来自第 13–15 条。本文所有指标数值为本地统一管线(128×128 / 57 帧)下的测量值,与上述榜单在 480×640 协议下公布的分数不可直接比较。

相关学习资料