夜雨聆风学习资料网

ARTICLE · 1057345

KV池化回到集中式阵列 卸载改拼预测器

KV池化回到集中式阵列 卸载改拼预测器

2026年9月22日 · 观天下

今天三条线索,指向同一件事:KV缓存这把椅子,正在被"池化"重新搬回集中式存储的桌上;而卸载这条赛道,比拼的已经从"介质快不快"换成了"预测准不准"。第一条来自中科曙光——在 CCF 全国信息存储技术学术会议上,它把 AI 推理原生存储 FN Neo 全新迭代升级,一句话就否掉了行业里流传多年的印象:"集中式存储不适合 AI 推理"。第二条来自华为——数据存储产品线总裁袁远给出的三个攻坚方向里,最硬的一个数字是把 KV 加载的 I/O 时延从 350 微秒压到 55 微秒。第三条是日程——云栖大会今天上午开幕,GMIF 2026 同周在深圳举行,两份议程把"阶段解耦"和"Token 经济"摆进了主线。论文侧今天选两篇,都来自端侧:一篇用 Prefill 阶段的预测,替代 Decode 阶段的反应式驱逐;另一篇用提前一个 token 的路由预测,把 35B 专家模型的权重留在 SSD 上。三条线索收在同一个判断上:内存池化正在被两条互不相同的路线同时推进,而卸载系统的标配件,正在从"更快的介质"变成"更准的预测器"。

一、行业动态

1. 中科曙光 FN Neo:集中式存储把"池化"这项老本事,拿回来当推理的入场券

9月21日,在 2026 年 CCF 全国信息存储技术学术会议(第 32 届 CCF 大会)上,中科曙光正式发布全新迭代升级的 AI 推理原生存储 FN Neo。会后,集中式存储产品部总经理郭照斌围绕"智能体时代 KV Cache 的落地"与媒体做了沟通。

先把硬指标摆上:单阵列带宽可达 160GB/s、亚毫秒级时延,延迟表现、吞吐量和多请求并发数相比传统本地 NVMe 方案均有约 2 倍提升;实现模型首 Token 响应时间缩减 73%,整体 Token 吞吐能力提升 150%;通过全局镜像缓存与 RAID-OC 技术把系统可靠性做到 99.999%,尾延迟控制能力较本地盘提升 10 倍。

但这一条真正的看点,是它把 KV Cache 放进了 KV Cache 分层体系的 L3 层,并且做到了原生 KV 语义直出——官方口径是把 KV 的定位操作压缩到 300 纳秒内完成。配套的是曙光自研的 ParaCache 组件。产品层面还有几个值得记的设计:

· 一台存储直出 SAN / NAS / KV 三类协议,块、文件、键值三类数据接口原生直出,不走协议转换的绕路;针对 GPU 直通存储场景专门优化了 GDR 访问路径;组网侧支持 RoCE / IB / FC,并基于 IB 协议自研了原生 RDMA 与 RoCE 协议。

· "超级隧道"架构:靠硬件资源编排消除木桶效应,采用无锁原生语义与三级负载均衡,25 盘位阵列可输出 300 万 IOPS 的综合业务处理能力。基础款为 2U、25 盘位双控阵列,搭载两颗国产高主频 CPU。

· 生态侧:可无缝对接 vLLM、SGLang 等主流推理框架,以及 LMCache、Mooncake 等缓存卸载层;通过纯用户态客户端组件,企业无需改造现有推理环境。

落到账本上,最值得抄下来的是两个对比。

第一个是对"本地盘更快"这个直觉的反驳。在传统部署里,KV Cache 是计算节点的私有资源,会话之间无法互通,大量缓存被闲置。FN Neo 的实测场景是:10 个计算节点共享一份模型与共享存储池,模型数据存储空间节省 90%,单卷 NAS 带宽达到 70GB/s;而本地盘的典型值是 7GB/s 左右。单盘看着快,但整个集群一直在重复存、重复算。另一组口径是单台 2U 双控阵列即可支撑 40 卡规模的推理集群,硬件成本较分布式方案降低 40% 以上

第二个是卸载后算力配置的收敛。现场给出的测试是单节点 8 卡跑 DeepSeek-R1,通过 KV Cache 卸载,不同上下文下的性能提升可达 7-12 倍;在 AI Coding 这类上下文持续增长、轮数多的场景,Token 输出效率相比完全不卸载提升 83%,简单事务性智能体场景也有 50% 提升;在千问 2.5 模型测试中实现 6-10 倍性能提升。郭照斌另外给出了两个更直观的场景对比口径:若持续依赖 GPU 计算而不卸载 KV Cache,AI Coding 这类场景的算力利用率会骤降 70% 以上;而配合 ParaCache,Token 输出效率较完全不卸载方案提升 6 倍以上

这里需要做一次事实之问:同一天里出现了"6 倍以上"(ParaCache 口径)、"7-12 倍"(单节点 8 卡不同上下文口径)、"83%"与"50%"(分场景口径)四组数字,它们并不在同一个坐标系里——分母分别是"完全不卸载""传统方案""特定场景基线"。这四组数放在一起时,读者要盯的不是最大的那个,而是每个数字后面跟的定语。这个习惯在本系列已经用了一个月:口径不清时并列呈现,比单向引用更接近真相。

为什么值得关注:这条新闻真正的分量不在参数,而在于它把"路线"这件事摆到了台面上。就在前一天(9月20日),ODCC 在 ODX 大会上发出的第一批 KV Cache 推理存储专项测评成绩里,拿头名口径的是泛联 UbiPower 18000——一条典型的"分布式存储 + GPU Direct RDMA 零拷贝 + 绕过宿主机 CPU 调度链路"的路线。今天晨曦给出的则是另一条:集中式全闪 + 池化共享 + 三协议原生直出 + 原生 KV 语义。两条路线在 48 小时内,面对面摆在了同一个话题上。

这背后有一个容易被忽略的历史事实:池化共享、故障隔离、稳定的低延迟——这三样能力,本来就是集中式存储在金融、通信这些"不能停"的业务里练了十几年的看家本领。过去两年,AI 推理圈先入为主地认为"本地 NVMe 才够快",把这些能力默认为"传统业务的遗产"。 KV Cache 一来,情况反转了:因为 KV Cache 天生要跨会话、跨节点复用,单机私有反而是它的先天缺陷。郭照斌那句回应值得记下来:"服务器也好,双控阵列也好,在当前 AI 数据中心和 AI 存储里都占有一定比重,本来就是并行存在的,并不需要去纠正用户的使用习惯。"翻译一下就是:架构叫什么名字并不重要,内存池化 的关键落在一个很朴素的问题上——能不能在不增加节点数的前提下,把 KV池做大。

2. 华为把 KV 加载的时延账拆到了微秒级:350 微秒 → 55 微秒

第二条在 9月17日的华为全联接大会 2026"华为数据存储峰会"上就已落定,9月21日随中文财经媒体的细节复盘稿完整流出。华为公司副总裁、数据存储产品线总裁袁远提出了 AI 数据平台的三大创新方向,三个方向各配了一组可验证的数字:

· 构建"数据本体"——让 AI 真正理解任务语义,把智能体任务正确率提升到 90% 以上

· 原生 KV 语义直通——单框提供 TB 级存储带宽把 I/O 时延从 350 微秒降至 55 微秒,KV Cache 加载速度提升 2 倍

· 打造"智能体数据韧性"——用意图识别引擎实现秒级风险拦截、分钟级一致性恢复,高风险操作拦截率 99%、勒索软件检测率 99%。

其中第二条是本条的核心。350 微秒降到 55 微秒,等于把同一条 KV 通道的时延预算砍到了原来的约六分之一。这个数字之所以重要,是因为前面一个月本系列反复在算同一笔账:介质从 HBM 换到 DRAM、再换到 SSD,损失的是几十到几百微秒量级;真正能再往下抠的空间,已经不在盘上,而在协议栈和软件路径里。"原生 KV 语义直通"想解决的正是这一段——让 KV 这种对象在存储侧被原生识别、原生定位,而不是被当成普通文件去层层查元数据。

配套的客户账本也给得很实。华为首创的"3+1"AI 数据平台方案,基于 OceanStor AI 语义存储,集成知识库、KV Cache 库与记忆库三大组件,依托 UCM(统一缓存管理)技术,已在 AI 辅助诊疗、AI 编程等 20 余个关键业务场景中落地。数据存储产品线副总裁吴俊杰举了两个例子:

· 医疗:某三甲医院把海量医学文献、疾病编码与患者病史转化为高精度知识库后,AI 辅助诊断报告采纳率从 50% 提升至 90%,智能体每日调用次数从 2000 次跃升至 16000 次。吴俊杰点出的痛点是:部分医疗客户做辅助诊疗时,知识获取准确率只有百分之五六十,数据语料根本进不了临床。

· AI 编程:某企业基于 KV Cache 库与 UCM,走"以查代算"的路径,把首 Token 时延降低 80% 至 10 秒以内,Token 吞吐率提升 2.2 倍

值得注意的是"以查代算"这四个字——它不是一句营销话术,而是 KV卸载 的经济学本质:把重复计算换成一次读取,只要读取比计算便宜,账就成立。而"首 Token 压进 10 秒"这个口径,恰恰对应了本系列 9月13日算过的那笔账(AI Coding 类负载输出极短、上下文极长,PD分离 之后 KV 传输时长能占到端到端延迟的四到五成)。

另外两件配套动作也值得记下:华为云在大会上发布了新版 AICS(AI 集群服务),采用五级恢复机制与全链路可观测,已支撑超过 40 天的模型训练运行、故障 10 分钟内恢复,调度、缓存与算法优化带来 Token 吞吐较上一代提升 20%,将于 9月30日面向中国客户商用、11月30日面向海外;同时发布面向 Agent 的 CMS 记忆存储。而 OceanStor M900 面向超大规模数据中心,OceanStor M800 则用标准网络与硬件适配多种异构算力,用于非昇腾卡、非超节点场景——这一点常被忽略:华为把 KV 记忆层做成了一条产品线,而不是一套只服务于自家超节点的专属件。

这里还有一个必须提示的口径差异:9月17日发布 M900 时,官方给的数字是"访问时延由毫秒级降至 60 微秒、缩短 90%";今天这条"原生 KV 语义直通"给的是"从 350 微秒降至 55 微秒"。两者不是同一把尺子——前者是 NPU 经灵衢"一跳直通"到 SSD 的访问时延,后者是原生 KV 语义路径上的 I/O 时延。把不同定义的微秒数直接比大小,是这一轮厂商口径里最常见的误读方式。

为什么值得关注:过去三周,KV 层的竞争指标换了三次尺子——先是容量(单集群 64PB、单 NPU 从 GB 到 TB),然后是层级编号(L3.5、G3.5),今天换成了微秒。尺子越换越细,说明这个层次的工程竞争已经从"有没有"进入了"抠不抠得动"。更有价值的是那个客户账本:采纳率 50%→90% 与调用量 2000→16000 次,是"记忆层建好之后业务量才敢放开"的直接证据。它解释了一个很多人没想通的问题——为什么存储厂商突然成了 Agentic AI 的主角。

3. 云栖大会今天上午开幕,GMIF 同周登场:议程就是行业待办清单

第三条是日程。9月22日上午 9:30,2026 云栖大会在杭州国际博览中心开幕,主题"智以致用",会期 9月22-24日,设三大主论坛与 120 余场分论坛,参展企业超 1000 家,主线是 Agentic AI 与从模型到 Agentic Cloud 的"五层全栈"。同周,第五届 GMIF 全球存储器行业创新峰会将于 9月22-23日在深圳湾万丽酒店举行,由深圳市存储器行业协会与北京大学集成电路学院联合主办,主题"AI 存储,驱动未来",明确以"Token 经济"为关键视角,登台方包括摩根士丹利、三星半导体、Sandisk、Solidigm、慧荣科技、Arm、佰维存储、联想等 18 家以上机构,展区汇聚 39 家以上企业的 300 多项创新成果。

会议本身不是新闻,但会议的议程结构是新闻,因为它等于一份被产业共识排过序的待办清单。今天这两份议程里,有四个点直接落在本系列的主线上:

· 阿里云智能集团资深技术专家卢晓伟的题目是《重塑推理范式:从阶段解耦迈向系统级最优》。"阶段解耦"就是 PD分离 的另一种说法——云厂开始把这件事讲成"范式重塑",而不是"部署优化"。

· 阿里云数据库产品事业部与 NVIDIA 联合的题目是《数据库走向 Agentic AI:阿里云 Tair KVCache × NVIDIA 推理协同优化实践》。KV Cache 出现在数据库产品的议题里,说明它已经被当作一类需要独立管理的数据对象,而不是推理引擎的内部张量。

· NVIDIA 侧的《Dynamo:全面加速智能体推理部署》与"Token Performance Network"论坛,把网络也拉进了 Token 效率的账本里。

· 训练侧,阿里云将在云栖期间正式推出新一代全栈自研 CPFS(并行文件存储),面向下一代 AI 训练集群设计,可支撑百万卡级模型训练。

而 GMIF 那边更直接:把存储产业的年度讨论统一到"Token 经济"这个尺度下。这个变化值得单独说一句——一年前,存储行业的会议主题还是容量、带宽、层数和价格;现在主办方直接把"每 Token 成本"当作核心视角。这意味着存储从一个成本项,正在变成一个可以被写进单位经济模型的产出项。

为什么值得关注:昨天的观察清单里,第 3 条问的是"KVCacheStore 给不给容量与命中的口径",第 4 条问的是"GMIF 会不会给出 HBF 与 CXL 内存模块的量产时间表"。今天这两件事同时进入窗口期。对做架构选型的人来说,这一周的价值不在于听发布,而在于看这些指标会不会被写进公开的、可比较的规格里——写进去了,才是可采购的。

二、论文分析:卸载系统的标配件,正在变成"预测器"

论文一:TierKV——把分层边界从"配置"变成"一次求解"(arXiv:2609.21172)

第一篇来自美国多所高校的合作团队(Zhihao Shu、Md Musfiqur Rahman Sanim、Jie Hu、Kun Yuan、Minghai Qin、Gagan Agrawal、Wei Niu),9月18日提交,题目是《TierKV: Long-Context On-Device LLMs via Predictive Multi-Tier KV Caching》。场景是手机等移动设备上的长上下文推理。

它先把前人的三条路都摆出来,然后逐条指出代价:低秩压缩(low-rank compression)的代价是重建开销;token 驱逐(token eviction)的代价是不可逆的信息丢失;闪存卸载(flash offloading)的代价是 I/O 停顿。三种办法都在省内存,但省下来的内存往往又被这些代价抵消掉了。这是一个很干净的诊断。

TierKV 的做法叫 PMCO(Predictive Multi-Tier Cache Optimization,预测式多级缓存优化),关键设计有三点:

· 预测点放在 Decode 之前。在 Decode 开始前,PMCO 直接从 Prefill 阶段的隐藏状态预测未来的缓存需求——也就是说,这个预测用的输入是模型本来就要算出来的东西,不额外增加开销。

· 联合分配,而不是逐级淘汰。在设备内存与精度的双重预算下,它把 token 同时分配到三个层级:精确保留(exact)、低秩近似(low-rank)、闪存卸载(flash-offloaded)。这个表述很像内存池化里的"分级存储",只是把池子缩到了一台手机里。

· 闭式解在线求解。论文强调它保留了完整上下文的可访问性、去掉了反应式驱逐的循环依赖(因为反应式驱逐必须等"发现不够用了"才能动作),并且存在一个闭式解,可以在运行时选定层级边界与每层的秩(rank)

实测覆盖 8 个文本、视觉、音频模型,跑在 3 款移动 SoC 上Prefill 吞吐最高提升 17.6 倍,RAM 常驻的 KV缓存 降低 12.5%-34%,从而在同样的内存预算下支持明显更长的上下文,而精度损失很小。

这篇论文最值得记的一句判断是:分层不是一种配置,而是一次求解。过去做 KV 分层卸载,层级边界往往是人工设定、静态不变的(比如"前 4K 留在显存,其余下沉");TierKV 把这件事变成了"在 Prefill 结束时,用一次闭式求解算出这一次请求该怎么分"。对照 9月17日那篇《Where Should the KV Cache Live》的结论——收益主要来自容量比(1:8:64)而不是放置策略,batch=1 时放置甚至不影响吞吐——TierKV 恰好补充了另一半:当所有层级都塞在同一台设备里、容量比被硬件锁死时,剩下的唯一变量就是"哪些 token 值得精确保留、哪些可以低秩、哪些可以下闪存"。这不是矛盾,而是两个尺度的答案:集群尺度看容量比,单机尺度看分配解。

论文二:Edge0——先问"下一层要读什么",再决定读不读得到(arXiv:2609.18063)

第二篇题目很直白:《The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction》(内存墙的另一半:用训练出来的路由预测,从 SSD 上服务 35B 专家模型),作者是 Yu Lin、Yiming Wang、Runyuan Cai、Hanze Liu、Xiaodong Zeng,9月16日提交、9月17日修订到第二版

它先算了一笔很朴素的账:消费级硬件上的 MoE 推理,卡在"权重内存"上——一个 35B 级模型 4-bit 量化后仍是 19.5GB;稀疏性减少的是每个 token 的计算量,而不是必须驻留在内存里的字节数。然后它点破了"天真卸载"为什么没用:

"第 N+1 层的专家,必须在第 N 层的输出存在之前就选好。所以这些读取无法启动得足够早,也就藏不到计算后面。"

这是一句非常锋利的诊断。它说明 MoE 专家卸载的瓶颈不是 SSD 不够快,而是信息来得太晚——你不可能去读一个还不知道要读哪几块的东西。

Edge0 的解法是给系统装一个"提前量":

· prerouter(预路由):每层有一个小 head,提前一个 token 预测下一层的路由。

· 预测被当作路由本身来消费,而不是"预测 + 校验 + 回退"。这一条是整个设计的枢纽:因为预测就是路由,被预取的专家集合恰好等于被激活的专家集合,因此不会丢专家、也不需要回退路径

· 一个未合并的恢复型 LoRA(unmerged recovery LoRA),在 student 路径上训练,用来补回 int4 量化与路由替换带来的质量损失。

结果相当克制也相当有说服力:在一台 24GB 显存的机器上,35B MoE 跑到 20 tok/s,峰值活跃内存控制在 3GiB 以内,在五个公开基准上平均只落后其 fp16 教师模型几个点。同一套框架向下覆盖 8B 档,框架、checkpoint 与适配器全部开源

把这篇和第一篇并起来读,会看到一个共同的新角色:预测器(predictor)TierKV 预测的是"要读什么状态",Edge0 预测的是"要读哪块权重";前者把预测点放在 Prefill 结束,后者把预测点提前一个 token。两者都在做同一件事——把"读取"的决策时间点,从"已经需要了"提前到"还没需要"。

这件事和本系列最近三条同源证据正好接上:9月7日的 Random Attention 说,驱逐的选择信号几乎没用;9月8日的 KVMem 说,KV卸载正从"驱逐/压缩"升级为可寻址换页,语义从热度变成检索;9月19日的《Contiguity, Not Importance》说,连重要性都不必判断,只需判断连续性四条放在一起,结论是一句话:判断"哪个重要"这件老活儿,正在被"预测哪个会被用到"替代。前者是打分,后者是预报——打分要算,预报只要猜得准。

顺带说一句 AF分离:Edge0 其实是 AF分离 在存储侧的变体。AF分离 的本意是把注意力(查字典)与前馈网络(做算术)拆到两类算力上;Edge0 没有拆芯片,但它把 FFN 的专家权重整块留在了 SSD 上,只把注意力与调度所需要的状态留在内存里——从"谁来算"退到了"谁住在内存里"。按本系列的判据,它仍然不算 AF分离 的产品级落地,但它给出了一条更容易被验证的路径:先证明专家路由可以被预测,再谈专家算力可以被拆开。

三、结语:三条判断

判断一:内存池化 的路线之争,在过去 48 小时里被正式摆上了桌面。9月20日 ODCC 的首批 KV Cache 测评成绩,代表的是"分布式存储 + GPU Direct RDMA 零拷贝 + 绕开宿主机 CPU 调度链路"这一路;9月21日中科曙光 FN Neo 代表的是"集中式全闪 + 集群级池化 + SAN/NAS/KV 三协议原生直出"这一路。两家的收益口径惊人地接近(一个说 TTFT 最大降 98%、TPS 最大提升 65 倍,一个说首 Token 缩减 73%、Token 吞吐提升 150%),但技术路径几乎相反。这恰好说明一件事:在 KV Cache 卸载这个场景里,胜负手不在"分布式还是集中式",而在两个能不能——能不能把 KV池的容量做得比插槽数更大,能不能让 KV 这类对象在协议栈里被原生识别。谁能把这两件事同时做到,谁就不必在意自己的架构叫什么名字。

判断二:卸载系统的标配件,正在从"更快的介质"换成"更准的预测"。把今天的几个微秒级数字排一排:华为原生 KV 语义直通 55 微秒、M900 一跳直通 60 微秒、曙光 KV 定位操作 300 纳秒。当介质换成 SSD、通路换成 RDMA 之后,剩下的时延预算主要落在协议栈里,而软件层还能继续往下抠的空间只剩一个方向——提前知道要读什么。今天两篇论文正好一左一右:TierKV 在 Prefill 阶段预测缓存需求,Edge0 在上一层预测下一层的专家路由。它们的共同前提是:在 KV缓存 与专家权重都已经大到装不下的今天,"读得早"比"读得快"更能决定端到端指标。

判断三:AF分离 仍然只有架构主张,但它的存储侧变体已经先一步出现了。本系列的判据没有变——出现一个把 Attention 与 FFN 拆到两类芯片上、并给出端到端吞吐与时延对比的方案,才算产品级落地;到今天为止,还没有。但 Edge0 提示了一条绕行的路:把 FFN 的专家权重留在 SSD,用预测器保证"要读的那几块总能提前到"。这条路不需要新的芯片,只需要一个足够准的路由预测和一个足够小的恢复适配器。如果这条路被验证,AF分离 的未来形态可能不是"两类芯片",而是"一块被证明可用的路由预测 + 一个分层明确的权重池"。硬件分离是最难的一步,也是最容易被绕过的一步。

观察清单

1. FN Neo 四组收益数字的口径对齐。要盯的是:"6 倍以上"(ParaCache 对比完全不卸载)、"7-12 倍"(单节点 8 卡不同上下文)、"83%/50%"(分场景)分别对应哪些模型、序列长度与并发数;以及"单台 2U 支撑 40 卡"是单卷口径还是双控全配口径。"硬件成本较分布式方案降低 40% 以上"——对照方案的具体配置,是这条最需要补的定语。

2. 集中式与分布式两条 KV池路线的同台可比。泛联 UbiPower 18000 与曙光 FN Neo 目前各说各话。真正有信息量的是同一批负载下的对照:GDR 零拷贝路径与三协议原生直出路径,在长上下文、高并发、跨节点复用三种情形下的退化曲线各是什么样。

3. 云栖大会今天开幕的三个必看项。一是 KVCacheStore 给不给容量与命中率口径(每 TB 对应多少 token、跨节点访问时延分布、弹性扩容时间尺度);二是《重塑推理范式:从阶段解耦迈向系统级最优》里的目标函数到底是什么——tokens/$ 还是 tokens/W;三是新一代 CPFS 的"可支撑百万卡级"是单文件系统挂载规模,还是集群可寻址总量。

4. GMIF 2026(9月22-23日,深圳)的介质侧时间表。三星半导体、Sandisk、Solidigm、Arm、慧荣科技都会登台,重点看 HBF(高带宽闪存)、CXL 内存模块与高速 NAND 有没有新的量产时点——它们是 KV池第三、第四层的成本基础。既然这届的主题是"Token 经济",也值得看主办方会不会给出一套把存储折算成 Token 成本的算法。

5. 华为 55 微秒的可复现性。要问清三件事:这是单框 TB 级带宽下的常态时延还是峰值口径;350 微秒的起点是哪种配置;以及它和 M900 的"60 微秒一跳直通"是不是同一把尺子。把不同定义的微秒数直接比大小,是这一轮厂商口径里最常见的误读方式。

6. TierKV 的预测窗口在真实 Agent 负载下会不会失准。论文的预测点定在"Decode 开始前",用的输入是 Prefill 隐藏状态。而 Agent 会话的上下文是不断追加的——第二轮之后,"Decode 开始前的 Prefill"本身就要依赖上一轮的缓存。预测的输入一旦来自被预测过的对象,误差会不会累积,是这套方法能否从端侧走到服务端的关键。

7. Edge0 的"预测即路由"会不会破坏专家负载均衡。因为预测值被直接当作路由值使用,预测器天然倾向于预测高频专家——这是 MoE 稀疏化里的老问题(路由塌缩)。论文用了恢复型 LoRA 来补质量,但负载均衡与长尾专家利用率这两个指标还需要独立验证。

8. AF分离 的产品级证据,判据不变。出现一个把 Attention 与 FFN 拆到两类芯片上、并给出端到端吞吐与时延对比的方案——不管是芯片、整机还是系统。在那之前,它仍然是架构主张;而 Edge0 这类"把 FFN 权重留在 SSD"的工作,是它目前最容易走通的一条绕行路。

免责声明:本文所涉信息均来自公开渠道,仅代表作者个人观点,不构成任何投资建议。市场有风险,决策需谨慎。

相关学习资料