把服务器泡在水里已经不够看了。真正棘手的问题在于,即便散热效率做到极致,芯片内部那部分"注定要消耗"的电能依然居高不下。这也就不难理解,为什么很多智算中心即使在液冷环境下PUE逼近理论极限,月底结算电费时依旧让人心头一紧。
近日,劲群科技与博思芯宇联手,给出了一种全新的解题思路。双方完成了一项浸没式系统降功耗解决方案的联合部署与连续实测,将劲群科技的单相浸没式液冷系统与博思芯宇自研的芯片全生命周期管理平台(SLM)进行深度融合。简单来说,这套方案从"物理制冷"和"芯片调度"两个维度同时发力,构建了从芯片端到集群端的全链路能效闭环,目的就是让大规模算力集群在跑得稳的同时,还能大幅省电、易于运维。
软硬协同是唯一出路
当下的算力基础设施建设,早就不再是简单堆积服务器的阶段了。政策层面在反复强调绿色化和精细化运营,产业端则普遍面临一个现实矛盾:大模型训练和推理任务越重,纯粹的散热技术就越触及天花板。
液冷,尤其是浸没式液冷,确实是应对高密度部署的重要方向。它的逻辑很直接,把服务器完全浸入绝缘冷却液中,实现极为均匀且高效的热交换,极大压缩了制冷侧的能耗。但这里存在一个普遍的认知误区——液冷主要解决的是热量转移的效率,难以直接干预芯片执行计算任务时产生的净功耗。

单靠硬件制冷,等于只解决了"外部散热"的问题,却没有触碰到"内部能耗"的核心。
高密度算力集群在实际运行中,还会遭遇芯片设计预留的能效冗余、负载波动带来的资源闲置、电力分配失衡等系统级能效流失。如果缺少一套跨层级、智能化的运维大脑,再好的液冷设施也容易陷入被动运维的困境,一旦芯片突发故障,业务中断的风险极高。
液冷负责"降温",平台负责"减负"
这正是劲群和博思芯宇合作的创新之处。他们提供的浸没式降功耗方案,不再局限于制冷硬件的单点突破,而是把目光延伸到芯片负载本身。在劲群提供的原生浸没式液冷测试环境中,博思芯宇的SLM软件平台实现了毫秒级的功能联动,运行十分稳定。

这套方案的价值可以从三个层级来拆解:
在芯片层,平台通过精细化的功耗管理策略,实测可实现芯片功耗降低15%至25%。形象地理解,这就好比给每个算力核心装上了智能节电器,根据实时任务强度动态调节供电状态,而不是让芯片始终处于高功耗的待命冗余。
到了系统层,整机能耗随之下降15%至25%。当制冷端的负载本身就很小,再加上芯片侧的有效节电,叠加效应相当可观。
最终在全集群层面,整体功耗能够降低约20%至30%。这对于一个日夜运转的智算中心而言,意味着惊人的电费节省和更平缓的供电压力。与此同时,该平台还能实现高达97%的芯片级故障预警准确率,将被动式应急转化为主动式防御,大幅降低因芯片异常引发任务中断的风险。
从可测量到可管理,才算真正的降本增效
这套软硬一体方案的价值,并不仅仅在于省电数字本身。它改变了算力基础设施的运维逻辑,让能耗管理从只能被动监测进化为全链路主动干预,让故障处理从事后抢修前置为事前预警。
以往我们谈论绿色数据中心,更多聚焦在PUE指标上了。而现在,劲群科技和博思芯宇的实践表明,真正有效的降功耗,必须是制冷硬件与芯片管理软件的深度协同。既要让服务器泡得清凉,也得让芯片主动节流。当这两只手同时作用,高密度算力集群的运营才算真正迈入了既环保又经济的精细化管理阶段。
--- END ---
上海致融致力于打造一站式Token聚合服务,具有 五大核心优势:1、极致性价比2、高可用稳定3、全智能调度4、全球覆盖5、7×24h支持 我们面向全球寻找各类合作伙伴,请关注(「算链全球资讯」,点击菜单栏或回复“合作”获取联系方式。
夜雨聆风