
RACE委员会、北京开源芯片研究院与北京算能科技有限公司共同推动面向 RISC-V + AI 生态的 Tensor 扩展指令集开源发布。该指令集在 RISC-V 基础指令集架构之上,面向人工智能计算需求引入 Tensor 级计算语义与统一的张量编程模型,支持卷积、矩阵乘、数据搬运、多精度计算和量化等核心 AI 工作负载,为 AI 编译器以及TPU 架构设计与实现提供开放、统一、可扩展的基础能力。
项目背景
当前,人工智能技术快速发展,从大模型训练到智能推理应用,计算负载正持续向大规模并行 Tensor 计算演进。相较于传统以通用处理器为中心的计算模式,现代AI 工作负载更加依赖TPU 类专用加速器所提供的高吞吐计算能力,同时对多精度计算融合、数据布局转换以及计算与存储协同调度等关键能力提出更高要求。
RISC-V 作为开放指令集架构,为产业协同提供了开放基础。如何在开放架构体系下建立面向 AI 计算的新型软硬件接口,成为推动 RISC-V AI 生态发展的重要方向。Tensor 扩展指令集通过在基础 ISA 之上引入面向 AI 计算的高级抽象,使算法、编译器和硬件实现之间能够建立更加统一的表达方式,为构建开放的 AI 加速计算生态提供新的指令集架构基础。
指令集设计理念

Tensor 扩展指令集围绕AI 计算访存需求,共定义 126 条扩展指令,从Tensor 数据组织、计算语义以及数据搬运机制等方面进行系统设计。该扩展引入面向 Tensor 计算的寄存器模型,通过 Tensor 配置寄存器描述数据布局、形状、数据类型及存储位置,使软件能够以更加直接、自然的方式表达 AI 计算任务。同时,围绕深度学习中的典型计算模式,构建覆盖卷积、矩阵乘、Pooling、逐元素计算、精度转换、量化计算以及数据重排等操作的 Tensor 指令体系,为 AI 算法向硬件执行映射提供统一接口。
不同于通用处理器依赖基础指令组合完成复杂 AI 计算,Tensor 扩展更加关注 AI 计算过程中的高层语义表达。通过将典型 AI 计算模式映射为可执行指令,可以降低软件层面的算子拆解复杂度,提高编译器优化空间,并为不同实现形态的 TPU 类 AI 加速器提供灵活的架构实现路径。
在 AI 计算过程中,数据搬运效率与计算能力同样决定系统整体性能。Tensor 扩展设计了配套的数据搬运机制,通过 DMA 相关指令支持 Tensor 数据加载、存储、复制、转置以及 Gather/Scatter 等操作,实现计算单元与存储系统之间的数据流协同优化,为高吞吐 AI 计算提供基础支持。
指令集验证与展望
在应用落地方面,Tensor 扩展指令集已被企业处理器平台所采用,并实现完整指令支持。基于该扩展的处理器已完成流片,并在硬件层面验证了Tensor 指令体系在AI 加速架构中的可行性,为后续TPU 类AI加速器设计、编译工具链适配以及软硬件生态建设提供了工程基础。
此次 Tensor 扩展指令集开源发布,是 RISC-V AI 生态建设的重要探索。通过开放指令规范,可以进一步促进芯片设计、编译工具链、系统软件以及高校科研之间的协同创新,推动 AI 指令集、工具链和处理器实现之间形成更加开放的合作模式,为面向大模型、边缘智能和高性能 AI 计算的开放架构发展提供基础支撑。
未来,RISC-V Tensor 扩展将持续面向人工智能计算需求演进,推动从指令集规范、编译工具链到 TPU 类 AI 加速器实现的开放协同,与产业界、学术界共同建设开放、可持续发展的 AI 计算生态。
开启你的RISC-V AI之旅,期待与你共创辉煌!
相关指令集文档可通过以下两种方式查看与下载,欢迎大家提供修改建议进行讨论。
方式一:复制并在浏览器中打开官方网址: riscv-ai.org.cn/resource/34
方式二:点击左下角「阅读原文」,即可一键直达社区!
夜雨聆风