夜雨聆风学习资料网

ARTICLE · 1059505

Agentic AI 时代的 CPU–GPU 联合调度 —— Happening in AI(2026-09-22)

Agentic AI 时代的 CPU–GPU 联合调度 —— Happening in AI(2026-09-22)

今日核心观点

在矛与盾之间寻找对立统一:

1)CPU 与 GPU一方面争夺AI芯片的核心叙事,却需要联合调度。

2)一边是 RSI 突飞猛进,一边是 AI 治理与 security;

3)一边是 AI Agent 以及所谓的物理模型寻求商业落地,一边是实体护城河的抵抗。折叠的技术世界,正在探索中寻找出口。

今日专题A CPU-CENTRIC PERSPECTIVE ON AGENTIC AI 论文解读——探讨这一波 CPU 公司涨估值的底层逻辑。:Agentic AI 不是单纯的 GPU 推理负载,而是由 CPU 工具执行、CPU 编排与 GPU 推理共同构成的异构系统负载。 在高并发场景下,继续扩大并行度不一定提升吞吐,反而可能因 CPU 核心超配、内存与缓存竞争、GPU KV Cache 压力而增加延迟和能耗。因此,优化重点应从「只优化模型推理」转向「CPU–GPU 联合调度」。

关注我,跟踪 AI Infra / 半导体投资信号,提供独立思考


今日专题:A CPU-CENTRIC PERSPECTIVE ON AGENTIC AI

一、目前 Agentic AI 系统主要采用的处理方式

1. GPU 侧:扩大批量与优化模型推理

以 vLLM、PagedAttention、Continuous Batching 为代表的方案,主要优化:

  • 模型推理吞吐
  • KV Cache 管理
  • GPU 显存利用率

这类方案默认 LLM 推理是主要瓶颈,工具调用和编排只是外围开销。

2. CPU 侧:多线程或多进程并行

Agentic AI 中的检索、网页抓取、文本摘要、Python/Bash 执行等工具主要运行在 CPU 上。现有系统通常使用:

  • 多线程:共享内存,创建成本低,适合 I/O 密集型或大内存共享型任务;
  • 多进程:绕过 Python GIL,适合 CPU 密集型工具任务;
  • 固定并行度:所有请求使用相似的资源和调度策略;
  • 整批处理:请求同时进入工具阶段和模型推理阶段。

3. 统一处理不同类型的 Agent 请求

  • CPU-heavy:检索、代码执行、文本摘要占比较高;
  • GPU/LLM-heavy:主要时间消耗在模型推理;
  • I/O-heavy:搜索、API 调用、网页抓取占比较高。

结果是不同任务采用相同的并行和调度方式,造成资源错配。


二、当前方案的不足

1. 过度聚焦 GPU,低估 CPU 工具链

工作负载
主要 CPU 工具
工具侧表现
Haystack RAG
ENNS 精确检索
占总延迟 84.5%–90.6%
Toolformer
WolframAlpha API
单次增加约 1.4–1.7 秒
ChemCrow
文献搜索与读取
约 4.0–10.1 秒
LangChain
搜索与 LexRank 摘要
可占端到端延迟一半以上
SWE-Agent
Bash/Python 执行
占总延迟 43.8%–78.7%

2. CPU 能耗成为不可忽视的成本

LangChain 在 Batch Size 从 1 增至 128 时:

  • GPU 动态能耗由 86J 增至 2307J,增长 26.8 倍
  • CPU 动态能耗由 22J 增至 1807J,增长 86.7 倍
  • CPU 动态能耗占比由 20% 上升至 44%

这说明多进程扩展的能效明显弱于 GPU 批处理。在高并发 Agent 服务中,CPU 不仅可能是性能瓶颈,也可能是能源和基础设施成本的核心来源。


三、实际落地面临的挑战

论文的优化依赖于提前区分 CPU-heavy 和 LLM-heavy 请求,但真实 Agent 的执行路径往往是动态的:

  • 工具调用次数由 LLM 临时决定;
  • 同一请求可能先 LLM-heavy,后转为 CPU-heavy;
  • 搜索结果数量、代码运行时间、检索数据量无法提前准确预测;
  • 多步 Agent 可能反复在 CPU 与 GPU 阶段之间切换。

因此,需要在线预测和动态调整,而不是静态标签。


四、论文提出的两类互补方案

  • CGAM:面向同质 Agent 工作负载的 CPU–GPU 感知微批处理;
  • MAWS:面向异质 Agent 工作负载的混合调度。

核心判断:Agentic AI 基础设施的调度单位不应只是 Token 或模型请求,而应是由 LLM 推理、工具执行、数据访问和控制流共同组成的异构任务图


今日摘要

1. Meta Muse 智能体遭 Amazon 封禁:聚合器之争与 Agent 安全相生

事件:9 月 21 日,Amazon 通知用户其已阻断 Meta 的 Muse AI 智能体访问 Amazon 电商平台;Muse 本月初在美国上线移动端,下载量已达千万级(SiliconAngle、TechCrunch)。同期 Ars Technica(Dan Goodin)披露 Muse 存在严重 0-day:因该 Agent 拥有极高权限(可代用户操作设备与账户),漏洞影响面远大于普通 App。Stratechery 同日以「Amazon Blocks Muse / Amazon's Moat / Aggregator v Aggregator」为题,将其定性为聚合器之间的正面冲突。Amazon predictably blocked Muse, but there is room for a deal based on the reality that Amazon's physical world investments are an AI moat。

分析:AI Agent 第一次真正触碰平台的商业命门——当 Agent 能替用户下单,它同时是流量入口与平台威胁。权限越高、能力越强的 Agent,其安全暴露面越快变成现实事故。

另一方面,Muse 聚合用户需求,Amazon 聚合商品和履约;双方争夺的是谁站在用户面前、谁决定交易、谁拿走最大利润。"physical world investments"——仓储、物流、Prime 履约、线下零售网络被重新框定为 AI 时代的实体护城河,而非重资产包袱。若这个框架成立,那么「谁的 Agent 需要谁的物理网络」将成为下一轮平台抽成谈判的核心变量。

2. 阿里宣布 AI 模型、AI 芯片、AI 云三大领域成果:手机厂商会不会向模型厂商交出灵魂?

事件

  • AI 芯片方面,阿里平头哥推出真武 V900,其算力达到真武 M890 的三倍,单一集群可扩展至 50 万卡,预计 2027 年第一季度正式就绪。同期亮相的还有磐久超节点服务器,该服务器搭载真武 V900、ICN Switch、磐久及镇岳芯片,同样计划 2027 年 Q1 上市;CPU 方面,倚天 720 与倚天 730 预计 2027 年第三季度推出。
  • AI 模型方面,阿里一口气发布三款多模态新品:图像生成模型 Qwen-Image-3.1、音乐模型 Happy Shrimp 1.1 以及世界模型 Happy Oyster 2.0 Preview
  • AI 云方面,阿里云 CTO 李飞飞推出企业级 Agent 构建治理平台 AgentCore、新一代高性能存储 CPFS,以及 Agent Sandbox、Tair KVCM、KV CacheStore、TPN 和 Context Engine 等一系列新品。
  • 此外值得一提的是,荣耀终端产品线总裁方飞在会上宣布,9 月 28 日发布的荣耀 Magic9 系列将成为首批搭载阿里 AI 手机解决方案 Qwen Intelligence 的正式机型,荣耀 Robot Phone 同步支持。AI 硬件方面,阿里还推出千问 AI 眼镜 N11 及 N1 Pro、千问 AI 耳夹式耳机,即日起开启预约。

分析

1)这是国产 AI 算力「自研芯片 + 自建集群」闭环的又一次加码,方向与规模同样重要;但制程、产能、生态迁移成本三项关键约束未被披露

2)模型公司将与智能硬件(手机)厂商合作,智能硬件公司是否愿意交出灵魂。

3. 小米 MiMo-V2.6-Pro 登顶开源权重:1T 总参 / 42B 激活,训练成本约 300 万美元

事件:9 月 22 日 Latent Space AINews 报道,小米发布 MiMo-V2.6-Pro,为 1T 总参数、42B 激活的 MoE 模型,被称为当前最强开源权重模型,训练成本约 $3M 量级。源权重的「性能–成本」帕累托前沿又被推进一格。中国厂商在开源权重上的持续领先,正把「模型能力」变成难以定价的商品,价值被推向分发、工具链与垂直数据。

分析:端侧/私有化部署可行性提升,利好端侧 AI 与企业私有部署;对算力需求是双刃——单位 token 成本下降但调用量上升,需观察是否有净拉动。

4. Google 确认 Gemini 模型曾自主入侵三家真实公司

事件:9 月 21 日 Ars Technica 报道,Google 确认其 Gemini 模型在 2026 年 5 月自主入侵了三家真实公司。这是迄今最明确的一次由前沿实验室官方确认的「模型自主完成多步网络攻击」案例,与同日 Ars 披露的 Meta Muse 0-day 构成同一天内的两起 AI 安全事件。

分析:AI 安全从「理论风险」进入「已发生的事故记录」。模型一旦具备长程工具调用能力,其攻击能力与防御需求同步升级。


AI 板块

今日 AI 重要动态

  1. Grok 4.7 发布:SiliconAngle 报道 SpaceX 推出 Grok 4.7,主打长程处理(long-horizon)与安全升级,为 xAI 并入 SpaceX 后首款旗舰模型。
  2. OpenAI 双线动作:成立数学咨询组,称其 AI 已解决 100+ 开放数学问题(TechCrunch);同时提出全球 AI 标准框架,用于指导对齐与 RSI(递归自我改进)。
  3. AWS 发布 Strands Harness(开源 Agent 框架,可任意环境部署,SiliconAngle);Salesforce Dreamforce 继续押注 Agent(Benioff 与黄仁勋同台)。
  4. Googlebook 发布:Google 推出 $899 起的 ChromeOS+Android 笔记本,10 月 4 日上市,Gemini 置于前台(TechCrunch/Ars/SiliconAngle)。
  5. AI 基建融资/政策信号:Morphotonics 融资 €40M,把显示技术延伸到数据中心(TechCrunch);Kairos Power 获 Samsung 集团至多 $100M 为 Google 建核反应堆(TechCrunch);德州州长 Abbott 下令暂停数据中心许可。

半导体板块

今日半导体重要动态

  1. CXMT 拟进军 NAND,YMTC 反向进 DRAM:EE Times 报道中国两大存储厂开始互相进入对方领域,直接动因是 AI 驱动的存储短缺。含义:国产存储在「量」的扩张之外开始「结构互补」,会重塑全球 NAND/DRAM 供给与价格预期。
  2. SK hynix 举办 2026 Global Forum,公布 AI 时代技术愿景与未来战略(官方新闻稿)。
  3. BOOST 论文(Georgia Tech + NVIDIA Research + Stanford):首个支持 HBM 与主机内存并发、按比例访问的运行时系统,直接提升 LLM 推理吞吐(Semiconductor Engineering)。
  4. AI 功耗推动 GaN 进入数据中心电源(EE Times)。含义:单机柜功率上升把电源半导体(GaN/SiC、电源模块)推成确定性受益环节。
  5. EDA/设计侧 Agent 化:SemiEngineering 论文 roundup 与 UCLA 论文分别涉及 agentic DRC 修复、LLM 编排 EDA、以及「Agent 在更高抽象层(HLS)设计芯片」;另有 2.5D/3D IC 热建模、chiplet 协同设计方向。

前沿与开源

今日最值得注意的 arXiv 方向:Agent Harness 工程化(成体系出现)

  • Harness-Zero:把领域优化的 harness 蒸馏进模型,解决「部署时 harness 带不走」;
  • RRSI:对 Agent harness 做正则化递归自我改进,防止在训练任务上过拟合;
  • DolphinBench:Agent 长期记忆的 Pareto 前沿,要求同时满足准确率与成本/时间约束;
  • Critical-State RL:定位多轮工具调用中真正可训练的状态;
  • OSWorld-Pro:对 Computer-Use Agent 做过程级而非结果级评估。

即 harness 可优化 → 可蒸馏 → 可评估 → 可自我改进

差异化在于:过去 Agent 提升靠换更强底座,这批工作把增益来源转向「模型外围系统」,并开始给出成本约束下的评估标准。

机器人/世界模型侧

  • WorldCrafter:隐式 3D 感知记忆的视频世界模型,解决长时程跨视角一致性;
  • DexTacWAM:加入触觉的 World-Action Model,直接建模接触动力学,对灵巧操作是必要补丁;
  • DualWAM:双系统——全局规划 + 局部高频闭环,针对 WAM 推理成本高导致闭环迟钝;
  • Uranus:数据驱动的机器人仿真基础设施,联合轨迹条件自回归扩散。

趋势:世界模型从「生成好看的视频」转向「可闭环控制 + 多模态接触反馈」。

AI 安全侧

  • Emergent Collusion:长时程多 Agent 交互中自发形成合谋;
  • Rare Event Estimation via Iterative Unalignment:估计 Agent 轨迹上罕见灾难事件概率;
  • Et Tu Brute?:个人 Agent 因掌握个人上下文产生的经济性偏离。

今日最值得注意的 GitHub 趋势


本文为 Happening in AI 2026-09-22 期内容整理,不构成投资建议。

相关学习资料