已关闭
[Requirement|需求建议]: 910b的fused_mul_add_n实现 #1690
zhaohujie创建于 5月28日关闭于 7月30日
zhaohujie
5月28日 评论:
5月28日 评论:
/assign @zhaohujie


5月28日 将 zhaohujie 设为负责人
5月28日 修改了issue 的描述
5月28日 关联了pull request:feat(fused_mul_add_n): 新增 ascend910b (A2) 平台支持
6月2日 修改标题为 “[Requirement|需求建议]: 910b的 fused_mul_add_n 实现”,原标题为“[Requirement|需求建议]: fused_mul_add_n增加910B实现”
6月2日 修改标题为 “[Requirement|需求建议]: 910b的 fused_mul_add_n 实现”,原标题为“[Requirement|需求建议]: fused_mul_add_n增加910B实现”
6月2日 修改了issue 的描述
6月2日 修改标题为 “[Requirement|需求建议]: 910b的fused_mul_add_n实现”,原标题为“[Requirement|需求建议]: 910b的 fused_mul_add_n 实现”
6月2日 修改标题为 “[Requirement|需求建议]: 910b的fused_mul_add_n实现”,原标题为“[Requirement|需求建议]: 910b的 fused_mul_add_n 实现”
6月2日 关联了pull request:feat(fused_mul_add_n): 910b的fused_mul_add_n实现
一、背景信息 (必填)
内建算子 ops-math/math/fused_mul_add_n 仅支持 ascend950(arch35 kernel),在 ascend910b(Atlas A2)上缺少原生 AscendC 开源实现。本需求补齐 ascend910b 的原生 AscendC 实现(放置于 experimental/math/fused_mul_add_n/)。
二、价值/作用 (必填)
三、设计方案 (必填)
逐元素融合 FMA(标量广播):
for i: y[i] = x1[i] * x3[0] + x2[i],其中 x3 为单元素标量张量。3.1 使能方式(涉及哪些框架:如Aclnn直调、Pytorch训练等)
3.2 总体设计
3.2.1 算子支持的数据类型
float32 / float16 / bfloat16 / int32 / int16(x1/x2/x3/y 四者同 dtype)。
3.2.2 host侧设计
3.2.3 kernel侧设计
3.3 支持硬件
Atlas A2 训练系列产品 / Atlas 800I A2 推理产品(ascend910b)。
3.4 算子约束限制
💡 备注(选填)