夜雨聆风学习资料网

ARTICLE · 1088029

智能体AI重写算力分工 英特尔将CPU重新放回系统中心

智能体AI重写算力分工 英特尔将CPU重新放回系统中心

9月22日,2026英特尔技术创新与产业生态大会在苏州举行。英特尔中国区董事长王稚聪在开场时介绍,本届大会设置了超过1.5万平方米的展区,集中展示1400多个技术应用,合作伙伴超过300家。比展区规模更值得关注的是,三场主题演讲反复讨论了同一个变化:当AI从生成答案走向执行任务,产业竞争正在从模型和加速卡进一步延伸到CPU、存储、网络、端侧设备以及系统软件。

这为英特尔提供了一个重新解释自身价值的机会。过去几年,AI基础设施的讨论主要围绕GPU和大模型展开。智能体AI则需要持续调用模型、读取上下文、规划步骤、使用工具、启动执行环境,并对结果进行检查。英特尔数据中心集团副总裁、中国区总经理陈葆立据此提出,衡量AI基础设施的标准应从“生产多少Token”扩展到“在既定资源条件下完成多少有效任务”。

英特尔希望借此把CPU重新放到AI系统的中心。这里的“中心”并不意味着CPU取代GPU,而是强调CPU在任务编排、并发管理、数据预处理、存储访问和安全控制中的作用。智能体越多,工作流越长,系统对这些能力的需求也越高。

从生成答案走向完成任务

陈葆立把智能体软件的演进概括为几层不断叠加的机制。上下文工程让模型利用长上下文和多轮对话理解用户背景;Harness为模型连接搜索、邮件、代码执行等工具;Loop Engineering则让系统反复验证和修正结果。对用户来说,AI从对话框变成了能够接手部分工作的执行系统。对基础设施而言,一次任务也由单次模型推理变成一条包含规划、检索、工具调用、执行和反馈的长链路。

这条链路改变了数据中心内部的分工。陈葆立将未来AI数据中心概括为三类相互连接的资源:CPU服务器或CPU集群负责智能体执行和工作编排;GPU服务器承担大模型推理,继续充当“Token工厂”;高性能存储保存上下文、工作结果和不断增长的KV Cache。三类资源各有分工,但数据调度、预处理和系统协同都离不开CPU。

英特尔在大会上给出的至强6+测试结果,体现了这种产品逻辑。至强6+采用Intel 18A制程,最高配置288个内核。按照英特尔实验室数据,单颗处理器可以稳定部署超过1000个智能体;在满足200毫秒启动时延要求的情况下,可以支持350个沙箱并发创建,约为某款192核竞品的1.46倍。这些数字来自英特尔指定配置下的测试,不能直接等同于所有实际应用,但它们说明英特尔正在同时优化智能体密度和单个智能体的响应性能。

单颗芯片之外,英特尔还与合作伙伴发布了开放Agent整机柜平台规范,把计算、内存、网络、供电和散热放在同一个设计框架内。英特尔讨论的对象由处理器扩大到机柜,表明智能体AI的竞争正在进入系统工程阶段。芯片性能仍然重要,但客户最终购买的是一套能在电力、空间和成本约束下稳定完成任务的基础设施。

存储和数据搬运成为新的约束

智能体对长上下文和持续记忆的需求,也让存储从后台资源变成AI系统性能的一部分。上下文长度和并发量增加后,KV Cache很容易超出GPU显存容量,需要在系统内存和SSD之间分层存放。如果搬运速度跟不上,昂贵的GPU就会等待数据,算力利用率随之下降。

英特尔的应对方式,是同时利用处理器内置加速器和存储伙伴的系统能力。陈葆立介绍,英特尔正在利用QAT对KV Cache进行无损压缩,并通过DSA加速数据搬运。英特尔官方披露的客户验证结果显示,其KV Cache智能加速套件可将特定场景下的数据传输速率最高提升9.66倍,首字时延最高改善15倍;这些同样属于特定测试条件下的公司数据。

存储系统本身也在参与这场调整。英特尔与焱融科技基于至强6和MRDIMM开发的全闪存储系统,在MLPerf Storage v3.0的Llama 3 70B检查点读写测试中取得读写带宽第一,并在3D U-Net训练场景实现584GB/s的聚合带宽。它所反映的产业问题很直接:AI系统的瓶颈不再只在计算芯片,内存容量、数据路径和存储软件会共同决定系统能否把算力真正用起来。

英特尔计划推出的Crescent Island数据中心GPU也沿着这一逻辑设计。该产品面向AI推理和智能体负载,基于Xe 3P架构,使用LPDDR5x,最高支持480GB内存。与单纯追求峰值算力相比,大容量内存更强调长上下文、KV Cache和高Token工作负载下的容量与成本平衡。

同一套计算平台延伸到端侧和物理世界

如果说陈葆立的演讲解释了数据中心为何需要重新分工,英特尔首席营销与传播官Annie Shea Weckesser则给出了更完整的公司框架。她把英特尔的AI战略归纳为三部分:覆盖PC、边缘和数据中心的开放计算平台;围绕具体工作负载设计的定制化芯片;支撑复杂系统集成的先进制程和封装技术。

这套框架的重点,是让智能体在最合适的位置运行。在PC上,第三代酷睿Ultra把CPU、GPU和NPU放入同一平台,由软件根据任务选择计算引擎。英特尔称,该平台可以在本地运行350亿参数级模型,并通过模型路由决定哪些任务留在端侧,哪些任务调用云端资源。端侧处理可以降低时延并减少敏感数据外传,云端则继续承担更大模型和更复杂任务,二者形成混合部署。

到了工业边缘,任务从处理文档转向感知和控制真实设备。Annie以节卡机器人为例介绍,节卡基于酷睿Ultra和KVM虚拟化,把实时运动控制、环境感知、自主规划和执行整合到统一的边缘架构。英特尔在大会期间还发布了具身智能开发套件,希望把处理器、实时控制和软件工具组合成开发者可以直接验证的参考平台。

PC、机器人和数据中心的产品形态差异很大,但英特尔试图建立共同的技术路径:用x86承担通用计算和控制,以GPU、NPU等加速器处理适合并行计算的负载,再通过开放软件和合作伙伴完成具体应用。对英特尔而言,智能体AI的价值正在于,它同时扩大了端侧计算、边缘控制和数据中心编排的需求。

制程与封装决定这套战略能否兑现

平台和系统策略最终仍要落到芯片交付。Annie在演讲中确认,Intel 18A已经进入量产阶段,高性能版本Intel 18A-P已进入风险试产;Intel 14A面向内部产品的风险试产计划于2027年下半年启动,并以2028年实现大规模量产爬坡为目标。英特尔还在通过EMIB和EMIB-T等先进封装技术,把不同计算引擎和IP集成到同一封装中。

这些进展对英特尔有双重意义。一方面,至强6+和第三代酷睿产品需要先进制程提供性能与能效基础;另一方面,英特尔希望向客户提供定制化芯片和系统代工能力,制程节点能否按期推进,直接影响外部客户对路线图的信任。

18A进入量产、18A-P开始风险试产,为英特尔的产品计划提供了阶段性支撑,但这并不等同于代工业务已经完成转折。14A的良率、客户设计导入和2028年的量产爬坡,仍将决定英特尔能否把内部产品验证转化为更广泛的外部订单。先进封装同样需要通过真实产品证明性能、成本和交付能力。

中国生态承担应用验证和规模化任务

王稚聪在开场中把本届大会定义为一次围绕智能体的产业协作。超过300家合作伙伴和1400多个应用集中出现,说明英特尔在中国市场的重点不只是销售标准芯片,也包括与本地云厂商、软件公司、设备制造商和系统集成商共同完成方案开发。

这种合作已经出现在不同层级。阿里云推出了117种基于至强6的云实例,其中超过50种应用于智能体AI场景;在端侧,英特尔与百度搭子、千问办公、TRAE、WorkBuddy等软件伙伴推进混合智能体适配;在数据中心,英特尔与国内厂商共同制定Agent整机柜规范、优化高性能存储;在工业边缘,则通过机器人和具身智能开发套件连接真实设备。

这些案例还处在不同成熟阶段,不能简单相加为智能体AI的商业规模。但它们揭示了英特尔在中国生态中的角色变化:标准处理器仍是基础,竞争重点却越来越多地落在参考设计、软件优化、系统整合和应用验证上。合作伙伴能否把这些能力转化为可复制的产品,将影响英特尔平台的实际覆盖面。

智能体AI不会削弱GPU在模型训练和推理中的重要性,却把竞争边界从加速器扩大到了整个计算系统。CPU负责协调任务,GPU和NPU承担专用计算,内存与存储保存上下文,网络连接不同资源,制程和封装则决定这些能力能以怎样的性能和成本交付。

英特尔在苏州给出的答案,是利用x86生态、端边云产品组合和制造能力重新进入这场系统竞争。真正需要验证的不是“CPU是否回到中心”这句判断,而是客户能否用这套架构在相同电力和成本下完成更多实际任务。随着智能体从演示走向生产环境,任务完成率、响应速度、系统利用率和总体拥有成本,才会决定这次算力分工能否成立。

相关学习资料