
一.CPU大小核:能效比的精妙博弈
单集群混搭:允许在一个集群(Cluster)内混合部署不同架构的核心 独立电源管理:每个核心拥有独立的电压频率曲线(DVFS),不再受限于“一荣俱荣,一损俱损”的旧模式。
HMP(Heterogeneous Multi-Processing):早期方案,简单粗暴地将大小核分组,依据负载阈值迁移任务。 EAS(Energy Aware Scheduling):目前的行业标准。它引入了能量模型(Energy Model),内核在调度前会计算将任务分配给不同核心的能耗成本。配合PELT/WALT负载追踪算法,EAS能够预测任务的运行时间,从而选择“能效最高”而非仅仅是“速度最快”的核。例如,对于一个中等负载,EAS可能会选择让大核短暂冲刺完成休眠,而不是让小核长时间低速运行,因为前者总能耗可能更低。
二.AI异构设计:CPU+NPU的算子级分工
1. 为什么不能把任务全丢给NPU?
控制流短板:AI模型的前处理、后处理包含大量分支跳转和非连续内存访问,这是CPU的强项。 动态Shape:NPU通常偏好静态形状的输入。面对NLP任务中动态变化的序列长度,CPU负责处理Padding和Attention Mask更为灵活。 启动开销:对于极微小的算子,启动NPU内核(Kernel Launch)的调度开销可能远大于计算耗时,此时CPU直接计算反而更快。
2. 统一内存架构(Unified Memory)
3. LLM推理中的异构协作实例
CPU(前台):接收用户输入,进行Prompt分词,构建KV Cache的元数据管理。 NPU(主力):执行Embedding层,随后进入Transformer Block循环。NPU利用其高吞吐特性,并行计算Attention(QKV)和FFN(前馈网络)层。由于权重已常驻内存,计算效率极高。 CPU(辅助):在Attention计算中,负责位置编码(RoPE)的旋转计算或动态Mask处理,这些操作往往涉及非规则的索引,CPU更灵活。 NPU(输出):计算最后的Logits输出。 CPU(后处理):进行采样策略计算,决定下一个Token,并循环往复。
三、融合的挑战:当大小核遇上NPU
1. 资源争抢与QoS
2. 热墙与功耗预算
3. 调度开销的悖论
四、结语:走向更智能的异构未来
Chiplet化:不同制程的CPU、GPU、NPU通过先进封装互联,异构将从SoC内部延伸到封装内部。 更智能的调度:硬件直接告诉操作系统哪个核心最适合跑哪个任务,甚至预测NPU的空闲周期。 光追与AI的结合:NPU将不再仅仅处理独立的AI任务,而是作为CPU的协处理器,实时优化图形渲染、物理模拟等传统负载。

夜雨聆风