乐于分享
好东西不私藏

未定义软件推出全链路自研 AI 编译器,高效自动生成模式释放智能芯片澎湃算力

未定义软件推出全链路自研 AI 编译器,高效自动生成模式释放智能芯片澎湃算力
大模型时代,AI开发者正面临一个日益尖锐的矛盾:模型参数持续膨胀,硬件架构日趋复杂,但传统编译技术却难以将底层算力充分释放。输入序列长度的动态变化、训练与推理场景的频繁切换、多芯片异构环境的适配难题——每一道关卡都在拷问着AI编译器的上限。
今天,未定义软件正式推出全链路自研 AI 编译器(核函数生成器)-深析,以全局视角重构编译范式,为 AI 开发者、大模型厂商,硬件加速卡厂商提供一套高性能编译方案。

从“局部优化”到“全局调度”:编译器的新角色

传统 AI 编译器往往扮演“网络优化器”的角色——在有限的网络图片段内做局部调优,面对更深层次的融合优化等复杂场景时力不从心。深析彻底打破了这一局限,创新性地提出 “Compiler as Manager” 理念,将编译器从被动的代码生成工具升级为主动的全局资源调度中心。深析能够进行计算图级别的核函数生成,最大化算子融合空间,可以大幅减少 Kernel Launch 开销与 Global Memory 读写开销,加速神经网络运行。

从“算子生成”到“网络片段”生成:深度自动融合

深析将自动融合从优化技巧升级为编程范式。这一范式清晰定义了“语义描述→计算图生长→硬件亲和切分”的全链路,开发者只需关注网络结构,系统自动完成算子融合与片段划分,端到端效率提升立竿见影。

硬件无关:一次编写,处处运行

面对 GPU、NPU、GPGPU、DSA、RISC-V 等多元AI芯片生态,硬件碎片化已成为制约AI规模化部署的关键瓶颈。深析基于自研架构设计,支持从神经网络构建 API 到各硬件后端高级别 DSL 的完整生成路径。开发者只需编写一份基于深析API 构建的算子或者网络模型,深析编译器即可自动适配目标硬件,生成多种高度优化的终端产品:如数据操作流图、易替换高级别语言伪码、无需替换的高级别语言代码、.so等二进制产品,服务于不同客户的多场景需求。其中
  • 数据操作流图:指导性质的数据流动和操作流动图 / 符号描述,文本文件形式,适合开发人员进行深度分析并基于此撰写优化代码。
  • 易替换高级别语言伪码:一套高级别语言伪码构成的伪码核函数,开发人员可以通过自行的关键字替换,高级别语言片上微核(输入数据和输出数据都在芯片片上而非 Global Memory)开发来迁移至目标平台,转换为真实可以运行的代码,适合非硬件厂商客户或者其他无法授予目标平台生成权限的客户,本编译器亦在某些可开发平台(高级别语言片上微核系各硬件厂商闭源产品,外部开发者无法介入)上提供一定程度的高级别语言片上微核。
  • 无需替换的高级别语言代码:生成的完整的高级别语言核函数,适合可以进行生成权限授权的加速卡厂商客户:需要授予生成权限,并提供(或者合作开发)功能满足的高级别语言片上微核。
  • .so 等二进制产品:仅应用于部分开源平台试用验证等小规模场景。

处处明晰:可预期效率提升

深析让每一个融合决策都透明可溯——延迟、显存、算力消耗实时量化,收益曲线一目了然。开发者不再靠经验“试错”,而是基于清晰的可解释反馈,精准预判每次调整带来的性能变化。从算子生成到网络片段切分,每一步都有据可依,效率提升不再是黑盒运气,而是可度量、可复现的确定性收益。你设定的目标,系统承诺兑现。

欲了解更多产品内容或者购买服务,欢迎与我们联系。
企业微信