乐于分享
好东西不私藏

AI时代的开源基础软件,正在发生什么?——CCF中国开源大会分论坛回顾

AI时代的开源基础软件,正在发生什么?——CCF中国开源大会分论坛回顾

8月15日下午,2026 CCF中国开源大会分论坛「AI时代的开源基础软件技术论坛」在重庆举行。9位来自开源一线的技术专家,围绕数据库、AI编译器、分布式训练、推理内存、集群调度、超智融合与大数据加速七个方向,各自交出了一份面向AI时代的“答卷”。

数据库:openGauss的多模进化与超节点协同

openGauss研发总监熊钦指出,AI时代越来越多数据库操作由Agent完成,带来“秒级创建、随用随删”的新诉求。openGauss以“1+2”战略应对:做强内核以及多写多读与AI两大关键技术方向。

在AI场景openGauss社区的DataVec多模能力将标量、向量、全文、图谱“四库合一”,一套数据库替代四套部署;Serverless DB让数据库分支“Git化”,通过写时复制实现秒级分支创建并支持增量合并;oGMemory则把记忆分层管理、按意图召回,显著降低Token消耗。

openGauss研发总监 熊钦

openGauss技术委员会委员彭炯则聚焦“数据库如何吃满超节点”。通过灵衢总线UB,CPU可直接访问其他节点内存,时延降到约400纳秒。基于此,一写多读架构把事务快照放进共享内存,备节点读事务时延大幅降低;多写多读oGRAC则可解决页面ping-pong问题,把页面请求从“四步变两步”,再基于内存亲和性迁移,多节点线性度大幅提升。

openGauss技术委员会委员 彭炯

AI编译器:让算子开发告别“性能黑盒”

Triton软件专家杨开昕介绍,Triton Ascend把昇腾上低效的离散访存线性化为“偏移、大小、步长”结构化表达转成DMA搬运,用CostModel自动决定SIMT/SIMD路径;通过AutoTune自动寻优,静态与动态双流水让Cube与Vector并行,并提供昇腾亲和扩展接口与图优化,通过layout优化提升访存效率。

Triton软件专家 杨开昕

AscendNPU IR架构师程琛则从编译器视角给出Tile级编程落到昇腾硬件的路径:AscendNPU IR基于MLIR构建HFusion(架构无关优化)与HIVM(昇腾相关优化)两层抽象,通过AutoBlockify消除核间同步、CV流水与1:2并行提升Cube/Vector利用率,让算子的“性能黑盒”变成可预测、可组合的编译流水线。

AscendNPU IR架构师 程琛

分布式训练:用写单卡的方式驾驭千卡

MindSpore技术专家常哲睿介绍了MindSpore HyperParallel分布式加速组件,其设计理念是让开发者用接近单卡编程的方式驾驭千卡集群,把“网络长什么样”和“系统怎么落地”解耦,通过声明式能力将优化注入回去。

核心是三层抽象——DTensor(分布式张量)统一建模全局张量在各设备上的切分策略;DeviceMesh(设备拓扑矩阵)描述集群设备的虚拟多维排列;Placement(放置策略)定义张量维度如何映射到设备矩阵上。切分范式从SPMD(单程序多数据)演进到“集群+多核”的MPMD(多程序多数据),覆盖HSDP、TP、CP、EP、PP等多种并行策略,流水并行支持Gpipe、1F1B、VPP等调度方式。内存优化采用重计算、换存、卸载三级策略;AutoParallel模块通过预跑自动搜索并推荐最优并行策略,降低大规模分布式训练的调优门槛。

MindSpore技术专家 常哲睿

推理基础设施:KV Cache的内存经济学

UB Service Core内存技术专家刘勇指出,推理中KV Cache是内存大户,资源呈“显存小、DRAM中、SSD大”的金字塔。

方案把超节点存储统一编织成加速网:MemFabric做内存池化与统一编址,跨节点读写退化为一次内存拷贝;BoostIO通过NDS让KV Cache从盘直通NPU内存;MemCache在其上做多级缓存,兼容vLLM、SGLang。

UB Service Core内存技术专家 刘勇

集群调度:让万卡集群可用、好用

MindCluster Maintainer李睿介绍,MindCluster是面向昇腾硬件、基于K8s生态的一体化集群管理底座。其“超节点亲和性调度算法”感知超节点/框/抽屉拓扑,避免任务被拆到多个超节点而退化为走慢网络,把任务收敛在灵衢高速互联网络内,性能提升40%以上。高可用上,训练故障进程不退出的在线Step重计算恢复,推理侧提供“缩P保D”等的分层恢复策略。

MindCluster Maintainer 李睿

超智融合:HPC与AI的殊途同归

华为HPC技术专家朱延超认为,超算与智算殊途同归。针对新一代鲲鹏众核处理器,传统fork-join模型语义不足、600多核并行度难以线性扩展。为此推出KUPL,对标弥补传统OpenMP语义局限,提供众核并行(计算图+队列)、异步数据搬运(SDMA)、矩阵编程(矩阵外积指令集)三类API,并作为运行时对接存量框架,让已有应用不改写即可受益。DFT、AlphaFold3、纯CPU大模型部署三个实践均验证了这套软件栈。

华为HPC技术专家 朱延超

大数据:用向量化改造传统引擎

OmniRuntime Maintainer尹伟杰介绍,面对数据膨胀与内存昂贵,客户核心诉求是“不扩容也能处理更多数据”。OmniOperator用C/C++原生算子替换Spark的Java算子,自研列式格式OmniVec并配合SVE指令向量化,通过Gluten胶水层无缝接入;OmniStream把列式思路用于Flink,OmniStateStore合并读写优化有状态算子的IO。典型业务约一个月即可接入,性能提升30%以上。

OmniRuntime Maintainer 尹伟杰

AI把性能压力传导到软件栈的每一层,开源基础软件以“软硬协同+极致性能工程”作答。当算力走向超节点、模型走向Agent,比拼的不再是单点功能,而是全栈协同深度与开源生态广度的综合能力。

论坛回放视频:

https://www.chaspark.com/#/live/1304192330967134208

END

关注我们,了解更多