已合并
update: 更新文件 release-note.md #114
shane创建于 5月12日
update: 更新文件 release-note.md #114
已合并
共 2 个文件变更+8-18
| @@ -52,23 +52,11 @@ | |||
| 52 | 子包独立升级的具体操作请参考[子包独立升级](#子包独立升级)。 | 52 | 子包独立升级的具体操作请参考[子包独立升级](#子包独立升级)。 |
| 53 | 53 | ||
| 54 | ## 关键特性 | 54 | ## 关键特性 |
| 55 | - | 55 | +### DS推理Decode阶段性能:npugraph_ex新增支持SuperKernel融合 |
| 56 | -### 安装易用性提升:新增apt和pip安装方式,提供一站式下载安装能力 | 56 | +在Atlas A3系列产品上,基于Aclgraph路径,提供了SuperKernel算子融合技术,在已编译的二进制代码基础上融合创建一个超级Kernel函数(简称SuperKernel),以调用子函数的方式调用多个其它内核函数,达到缩减调度开销、优化计算任务的目的,可大幅提升DS推理Decode阶段性能。 |
| 57 | - | 57 | +### aclgraph算子性能提升:支持非连续静态算子执行 |
| 58 | -新增**apt**和**pip**安装方式。当前已支持conda、yum、apt、pip四种主流安装方式,进一步提升了不同环境下的部署灵活性。同时,新增**CANN一站式下载安装能力**,提供产品型号与软件包查询命令及自动匹配机制,简化安装流程,提升软件获取与部署效率。 | 58 | +在Atlas A2系列产品和Atlas A3系列产品上,新增支持非连续输入的静态算子执行。支持将存在非连续输入的动态算子落盘编译为静态算子后执行。该机制可以提升aclgraph整网/Superkernel算子执行效率。 |
| 59 | - | 59 | + |
| 60 | -### DeepSeek系列加速:DSA系列算子性能优化并支持确定性计算 | ||
| 61 | - | ||
| 62 | -在Atlas A2 系列产品和Atlas A3 系列产品上,DSA系列算子进一步提升流水并行度,其中SFAG算子性能提升至2x~6x+,模型提升至1.5x+,加速效果显著。新增支持确定性计算能力,可满足对结果一致性要求较高的场景需求,有助于提升训练与推理过程中的可复现性,并便于问题定位和稳定性验证。 | ||
| 63 | - | ||
| 64 | -### 多模态场景加速:新增块稀疏Attention算子支持 | ||
| 65 | - | ||
| 66 | -在Atlas A2 系列产品和Atlas A3 系列产品上,新增支持块稀疏Attention算子(Block-wise Sparse Attention,BSA)。在按Block划分的稀疏模式下,相比通用Flah Attention,90%稀疏率情况下,BSA计算量降低90%,执行速度提升至5x。该能力对多模态模型优化尤为关键,wan2.2和hunyuanvideo1.5在70%稀疏率时,模型分别提升至1.7x和1.5x。 | ||
| 67 | - | ||
| 68 | -### 小消息高频通信场景加速:HCCL支持批量通信合并机制 | ||
| 69 | - | ||
| 70 | -在Atlas A2 系列产品和Atlas A3 系列产品上,HCCL新增支持批量通信合并机制(HcclGroupStart/HcclGroupEnd接口),支持将多个通信操作合并后统一提交与执行。该机制可支持send/recv异步下发,提升小消息、高频通信场景下的执行效率。 | ||
| 71 | - | ||
| 72 | ## 新增特性 | 60 | ## 新增特性 |
| 73 | 61 | ||
| 74 | ### 公共模块 | 62 | ### 公共模块 |
| @@ -13,4 +13,6 @@ | |||
| 13 | # Feture list | 13 | # Feture list |
| 14 | ## 状态说明:discussion(方案讨论,需求未接受),developing(开发中),Testing(测试中),Accepted(已验收) | 14 | ## 状态说明:discussion(方案讨论,需求未接受),developing(开发中),Testing(测试中),Accepted(已验收) |
| 15 | |no|feature|status|sig|owner| | 15 | |no|feature|status|sig|owner| |
| 16 | -|:----|:---|:---|:--|:----| | 16 | +|:----|:---|:---|:--|:----| |
| 17 | +|1|[npugraph_ex新增支持SuperKernel融合]()|Accepted|sig-ops-transformer|cc-z| | ||
| 18 | +|2|[aclgraph支持非连续静态算子执行]()|Accepted|sig-ops-transformer|cc-z| | ||