已合并
update: 更新文件 release-note.md #114
update: 更新文件 release-note.md #114
已合并
shane创建于 5月12日
2 个文件变更+8-18
@@ -52,23 +52,11 @@
52子包独立升级的具体操作请参考[子包独立升级](#子包独立升级)。52子包独立升级的具体操作请参考[子包独立升级](#子包独立升级)。
53 53 
54## 关键特性54## 关键特性
55- 55+### DS推理Decode阶段性能:npugraph_ex新增支持SuperKernel融合
56-### 安装易用性提升:新增apt和pip安装方式,提供一下载安装56+在Atlas A3系列产品上基于Aclgraph路径,提供了SuperKernel算子融合技术,在已编译的二进制代码基础上融合创建个超级Kernel函数(简称SuperKernel),以调用子函数的方调用多个其它内核函数,达到缩减调度开销、优化计算任务的目的,可大幅提升DS推理Decode阶段性
57- 57+### aclgraph算子性能提升:支持非连续静态算子执行
58-新增**apt**和**pip**安装方式。当前已支持conda、yum、apt、pip四种主流安装方式,进一步提升了不同环境下部署灵活性同时,新增**CANN一站式下载安装能力**,提供产品型号与软件包查询命令及自匹配机制,简化安装流程,提升软件获取与部署效率。58+在Atlas A2系列产品和Atlas A3系列产品上,新增支持非连续输入静态算子执行支持将存在非连续输入的态算子落盘编译为静态算子后执行。该机制可以提升aclgraph整网/Superkernel算子执行效率。
59- 59+
60-### DeepSeek系列加速:DSA系列算子性能优化并支持确定性计算
61- 
62-在Atlas A2 系列产品和Atlas A3 系列产品上,DSA系列算子进一步提升流水并行度,其中SFAG算子性能提升至2x~6x+,模型提升至1.5x+,加速效果显著。新增支持确定性计算能力,可满足对结果一致性要求较高的场景需求,有助于提升训练与推理过程中的可复现性,并便于问题定位和稳定性验证。
63- 
64-### 多模态场景加速:新增块稀疏Attention算子支持
65- 
66-在Atlas A2 系列产品和Atlas A3 系列产品上,新增支持块稀疏Attention算子(Block-wise Sparse Attention,BSA)。在按Block划分的稀疏模式下,相比通用Flah Attention,90%稀疏率情况下,BSA计算量降低90%,执行速度提升至5x。该能力对多模态模型优化尤为关键,wan2.2和hunyuanvideo1.5在70%稀疏率时,模型分别提升至1.7x和1.5x。
67- 
68-### 小消息高频通信场景加速:HCCL支持批量通信合并机制
69- 
70-在Atlas A2 系列产品和Atlas A3 系列产品上,HCCL新增支持批量通信合并机制(HcclGroupStart/HcclGroupEnd接口),支持将多个通信操作合并后统一提交与执行。该机制可支持send/recv异步下发,提升小消息、高频通信场景下的执行效率。
71- 
72## 新增特性60## 新增特性
73 61 
74### 公共模块62### 公共模块
@@ -13,4 +13,6 @@
13# Feture list13# Feture list
14## 状态说明:discussion(方案讨论,需求未接受),developing(开发中),Testing(测试中),Accepted(已验收)14## 状态说明:discussion(方案讨论,需求未接受),developing(开发中),Testing(测试中),Accepted(已验收)
15|no|feature|status|sig|owner|15|no|feature|status|sig|owner|
16-|:----|:---|:---|:--|:----|16+|:----|:---|:---|:--|:----|
17+|1|[npugraph_ex新增支持SuperKernel融合]()|Accepted|sig-ops-transformer|cc-z|
18+|2|[aclgraph支持非连续静态算子执行]()|Accepted|sig-ops-transformer|cc-z|