版本说明
版本配套说明
产品版本信息
产品名称 |
TorchNPU |
|---|---|
产品版本 |
26.1.0 |
版本类型 |
正式版本 |
发布时间 |
2026年7月 |
维护周期 |
参考分支维护策略 |
相关产品版本配套说明
固件和驱动的版本配套表与所有的昇腾硬件及CANN版本相关,具体选择请参考CANN版本说明。
TorchNPU代码分支名称采用 {PyTorch版本}-{TorchNPU版本} 的命名规则,前者为TorchNPU匹配的PyTorch版本,详细匹配如下表:
| TorchNPU代码分支名称 | PyTorch版本 | TorchNPU版本 | TorchNPU安装包版本 | CANN版本 | Python版本 |
|---|---|---|---|---|---|
| v2.7.1-26.1.0 | 2.7.1 | 26.1.0 | 2.7.1.post8 | 9.1.0 | Python3.9.x、Python3.10.x、Python3.11.x、Python3.12.x、Python3.13.x |
| v2.9.0-26.1.0 | 2.9.0 | 26.1.0 | 2.9.0.post6 | 9.1.0 | Python3.10.x、Python3.11.x、Python3.12.x、Python3.13.x |
| v2.10.0-26.1.0 | 2.10.0 | 26.1.0 | 2.10.0.post4 | 9.1.0 | Python3.10.x、Python3.11.x、Python3.12.x、Python3.13.x |
| v2.11.0-26.1.0 | 2.11.0 | 26.1.0 | 2.11.0 | 9.1.0 | Python3.10.x、Python3.11.x、Python3.12.x、Python3.13.x |
| v2.12.0-26.1.0 | 2.12.0 | 26.1.0 | 2.12.0 | 9.1.0 | Python3.10.x、Python3.11.x、Python3.12.x、Python3.13.x |
版本兼容性说明
Note
表格中“Y”表示兼容。
| TorchNPU | CANN版本 | ||
|---|---|---|---|
| 8.5.X | 9.0.X | 9.1.X | |
| 7.3.X | Y | Y | Y |
| 26.0.X | Y | Y | Y |
| 26.1.X | Y | Y | Y |
更新说明
新增特性
| 组件 | 特性 | 说明 |
|---|---|---|
| TorchNPU | Eager模式使能DVM无图融合算子。 | Eager模式支持DVM(Device Virtual Machine)算子融合,减小调度执行开销,加速网络执行。 |
| NPU上支持LibTorch Stable ABI。 | NPU已实现与CUDA对齐的LibTorch Stable ABI能力。 | |
| 关键计算类API支持异构输入。 | 关键计算类API支持输入为CPU上标量Tensor和NPU上非标量Tensor进行计算,提升API一致性。 | |
| 支持输入张量全轴动态场景下的算子编译。 | 在图模式支持输入张量全轴动态(如 [-1,-1,-1,-1])场景下的算子编译,增加图模式在动态shape场景的泛化性和性能。 | |
| 支持Ascend 950DT款型。 | 将已有的TorchNPU能力在Ascend 950DT中进行适配。 | |
| 将原Ascend Extension for PyTorch和torch_npu统一更名为TorchNPU。 | 除导入名和Whl包名前缀保持不变外,其余部分均修改为TorchNPU。 |
删除特性
无
接口变更说明
本章节的接口变更说明包括新增、修改、废弃和删除。接口变更只体现代码层面的修改,不包含文档本身在语言、格式、链接等方面的优化改进。
- 新增:表示此次版本新增的接口。
- 修改:表示本接口相比于上个版本有修改。
- 废弃:表示该接口自作出废弃声明的版本起停止演进,且在声明一年后可能被移除。
- 删除:表示该接口在此次版本被移除。
表 1 TorchNPU接口变更汇总
| 变更版本 | 类名/API原型 | 类/API类别 | 变更类别 | 变更说明 |
|---|---|---|---|---|
| v2.7.1 | torch_npu.print_npugraph_tensor | 自定义接口 | 新增 | 依赖CANN 8.5.0及以上版本 |
| torch_npu.npu_chunk_gated_delta_rule | 自定义接口 | 新增 | 依赖CANN 8.5.0及以上版本 | |
| torch_npu.npu_rotate_quant | 自定义接口 | 新增 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_apply_rotary_pos_emb | 自定义接口 | 新增 | 不依赖特定的CANN版本 | |
| torch_npu.npu_add_quant_matmul_ | 自定义接口 | 新增 | 依赖CANN 9.0.0及以上版本 | |
| torch_npu.npu_alltoallv_quant_gmm | 自定义接口 | 新增 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_dynamic_dual_level_mx_quant | 自定义接口 | 新增 | 依赖CANN 9.0.0及以上版本 | |
| torch_npu.npu_fused_causal_conv1d | 自定义接口 | 新增 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_grouped_dynamic_block_quant | 自定义接口 | 新增 | 依赖CANN 9.0.0及以上版本 | |
| torch_npu.npu_masked_causal_conv1d | 自定义接口 | 新增 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_mhc_post | 自定义接口 | 新增 | 依赖CANN 9.0.0及以上版本 | |
| torch_npu.npu_mhc_pre | 自定义接口 | 新增 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_mhc_sinkhorn | 自定义接口 | 新增 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_transpose_quant_batchmatmul | 自定义接口 | 新增 | 依赖CANN 9.0.0及以上版本 | |
| torch_npu.save_npugraph_tensor | 自定义接口 | 修改 | 依赖CANN 8.5.0及以上版本 | |
| torch_npu.npu_rms_norm_quant | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_scaled_masked_softmax | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_cross_entropy_loss | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_attention_update | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_fusion_attention | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_gelu_mul | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_top_k_top_p | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_gather_sparse_index | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_swiglu_quant | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_add_rms_norm | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| (beta)torch_npu.npu.finalize_dump | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| (beta)torch_npu.npu.init_dump | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| (beta)torch_npu.npu.set_dump | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.apply_rotary_pos_emb | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| (beta)torch_npu.npu_ciou | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| (beta)torch_npu.npu_iou | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_grouped_matmul_swiglu_quant_v2 | 自定义接口 | 修改 | 依赖CANN 9.0.0及以上版本 | |
| torch_npu.npu_mla_prolog_v3 | 自定义接口 | 修改 | 依赖CANN 9.0.0及以上版本 | |
| torch_npu.npu_lightning_indexer | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_quant_lightning_indexer | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| torch_npu.npu_sparse_flash_attention | 自定义接口 | 修改 | 依赖CANN 9.1.0版本 | |
| v2.9.0 | 变更同v2.7.1版本 | |||
| v2.10.0 | 变更同v2.7.1版本 | |||
| v2.11.0 | 变更同v2.7.1版本 | |||
| v2.12.0 | 变更同v2.7.1版本 | |||
Ascend 950DT非兼容变更说明
| 组件 | 变更说明 |
|---|---|
| TorchNPU | 因Ascend 950DT架构变更,部分算子及通信接口发生调整。因此,调用相关API时,需注意Ascend 950DT产品与Atlas A2 训练系列产品/Atlas A3 训练系列产品在接口约束上的差异,具体请参考《原生API》。 |
| Ascend 950DT当前仅支持Inductor后端编译器中的Triton和DVM模式,暂不支持MLIR模式,具体请参考Inductor。 |
已解决问题
问题描述 |
现象:GDN算子自定义适配过程中,aclnn_extension模块未传递stream参数。 影响:导致算子间执行顺序异常,数据同步机制未能正确生效。 |
|---|---|
严重级别 |
一般 |
根因分析 |
EXEC_NPU_CMD_V1_EXT与EXEC_NPU_CMD_V2_EXT中内存申请释放未配套,未与对应的EXEC_NPU_CMD_V1及EXEC_NPU_CMD_V2保持一致,导致内存申请或释放有问题,从而导致精度问题。 |
解决方案 |
EXEC_NPU_CMD_V1_EXT及EXEC_NPU_CMD_V2_EXT中内存(包含workspace)申请与释放修正,与EXEC_NPU_CMD_V1及EXEC_NPU_CMD_V2保持一致。 |
修改影响 |
修复后,使用GDN算子的模型整网精度正常。 |
遗留问题
无
升级影响
升级过程中对现行系统的影响
-
对业务的影响
软件版本升级过程中会导致业务中断。
-
对网络通信的影响
对通信无影响。
升级后对现行系统的影响
无
版本配套文档
| 文档名称 | 内容简介 | 更新说明 |
|---|---|---|
| 《软件安装》 | 提供在昇腾设备安装PyTorch框架训练环境,以及升级、卸载等操作。 | • 新增适配PyTorch 2.11.0和PyTorch 2.12.0。 • 新增软件安装FAQ。 • 新增支持Ascend 950DT相关内容。 |
| 《TorchNPU概述》 | TorchNPU插件是基于昇腾的深度学习适配框架,使昇腾NPU可以支持PyTorch框架,为PyTorch框架的使用者提供昇腾AI处理器的超强算力。 | • 更新软件架构相关内容。 • 新增TorchNPU插件启动阶段的初始化流程相关内容。 • 新增支持Ascend 950DT相关内容。 |
| 《快速入门》 | 提供了一个简单的模型迁移样例,采用了最简单的自动迁移方法,帮助用户快速体验GPU模型脚本迁移到昇腾NPU上的流程。 | 新增支持Ascend 950DT相关内容。 |
| 《Torch.compile》 | 通过“动态图捕获+静态图优化+高效代码生成”的方式显著加速模型训练和推理任务。 | 内容独立且优化。 |
| 《配套软件库》 | 为TorchNPU提供扩展能力的配套软件库。 | • 仅保留原《套件与三方库支持清单》中的“昇腾自研插件”部分。 • 新增HyperParallel和AKG组件。 |
| 《故障处理》 | 以开发者在执行推理、训练过程中可能遇到的各类异常故障现象为入口,提供自助式问题定位、问题处理方法,方便开发者快速定位并解决故障。 | 新增“使用NZ格式后精度异常”相关内容。 |
| 《原生API》 | 提供PyTorch 2.12.0/2.11.0/2.10.0/2.9.0/2.7.1版本原生API在昇腾设备上的支持情况。 | • 新增PyTorch 2.11.0和PyTorch 2.12.0原生API支持清单。 • 新增支持Ascend 950DT相关内容。 |
| 《自定义API》 | 提供TorchNPU自定义API的函数原型、功能说明、参数说明与调用示例等。 | • 新增适配PyTorch 2.11.0和PyTorch 2.12.0。 • 新增支持Ascend 950DT相关内容。 • 具体接口变更请参考接口变更说明。 |
| 《环境变量》 | 在TorchNPU训练和在线推理过程中可使用的环境变量。 | • 新增“TORCHINDUCTOR_USE_AKG”。 • 新增“(beta)TORCHINDUCTOR_ENABLE_MFUSION”。 • 新增“TORCH_NPU_LAZY_FUSION”。 • 新增“TORCH_HCCL_BLOCKING_WAIT”。 • 新增支持Ascend 950DT相关内容。 |
| 《框架特性》 | 基于TorchNPU提供昇腾AI处理器的超强算力,从内存优化、报错定位、高性能计算等方面打造一系列独有特性。 | 更新“torch_npu.npu.NPUGraph”相关内容。 |
| 《TorchAir》 | 作为昇腾TorchNPU的图模式能力扩展库,提供昇腾设备亲和的torch.compile图模式后端,实现PyTorch网络在昇腾NPU上的图模式推理加速和优化。 | • npugraph_ex功能增强:新增支持SuperKernel融合优化功能、force_recapture功能、图捕获安全策略配置等。 • GE图模式功能增强:扩展npu_stream_switch接口,支持指定并发策略等。 • 新增支持Ascend 950DT相关内容。 |
| 《安全声明》 | 提供了TorchNPU、OpPlugin、TorchAir和Ascend Extension for TensorPipe组件的软件版本、系统加固要求、安全配置(数据存储、调试接口、运行环境等)、权限配置、防火墙等设置。 | 例行更新。 |
病毒扫描及漏洞修补列表
病毒扫描结果
| 防病毒软件名称 | 防病毒软件版本 | 病毒库版本 | 扫描时间 | 扫描结果 |
|---|---|---|---|---|
| QiAnXin | 8.0.5.5260 | 2026-07-05 08:00:00.0 | 2026-07-06 | 无病毒,无恶意 |
| Kaspersky | 12.0.0.6672 | 2026-07-06 10:03:00.0 | 2026-07-06 | 无病毒,无恶意 |
| Bitdefender | 7.5.1.200224 | 7.101156 | 2026-07-06 | 无病毒,无恶意 |
漏洞修补列表
本版本无漏洞修复。