大模型时代,AI开发者正面临一个日益尖锐的矛盾:模型参数持续膨胀,硬件架构日趋复杂,但传统编译技术却难以将底层算力充分释放。输入序列长度的动态变化、训练与推理场景的频繁切换、多芯片异构环境的适配难题——每一道关卡都在拷问着AI编译器的上限。今天,未定义软件正式推出全链路自研 AI 编译器(核函数生成器)-深析,以全局视角重构编译范式,为 AI 开发者、大模型厂商,硬件加速卡厂商提供一套高性能编译方案。
从“局部优化”到“全局调度”:编译器的新角色
传统 AI 编译器往往扮演“网络优化器”的角色——在有限的网络图片段内做局部调优,面对更深层次的融合优化等复杂场景时力不从心。深析彻底打破了这一局限,创新性地提出 “Compiler as Manager” 理念,将编译器从被动的代码生成工具升级为主动的全局资源调度中心。深析能够进行计算图级别的核函数生成,最大化算子融合空间,可以大幅减少 Kernel Launch 开销与 Global Memory 读写开销,加速神经网络运行。
易替换高级别语言伪码:一套高级别语言伪码构成的伪码核函数,开发人员可以通过自行的关键字替换,高级别语言片上微核(输入数据和输出数据都在芯片片上而非 Global Memory)开发来迁移至目标平台,转换为真实可以运行的代码,适合非硬件厂商客户或者其他无法授予目标平台生成权限的客户,本编译器亦在某些可开发平台(高级别语言片上微核系各硬件厂商闭源产品,外部开发者无法介入)上提供一定程度的高级别语言片上微核。