已合并
fix: support quantized NPU flip dispatch #36068
fix: support quantized NPU flip dispatch #36068
已合并
hz893创建于 5月19日
hz893成员
5月19日
# 【合入来源】 - [ ] 需求 - [x] 问题单 https://gitcode.com/Ascend/pytorch/issues/2207 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 说明:修复 NPU 量化 tensor 执行 `flip` 时的分发与错误语义问题,并补充 CI 中暴露的 complex dtype 测试处理。 # 【修改方案】 1. 新增 NPU 量化 `flip` 实现,并在 codegen stub 中注册 `QuantizedPrivateUse1` 对应 kernel,使量化 NPU tensor 进入专用实现。 2. 对 per-tensor affine 量化 tensor,先通过 `int_repr()` 获取底层整型表示,再转发到普通 `aten::flip`;随后使用原 tensor 的 size、dtype、scale、zero_point 和 memory format 构造量化结果,并通过 `set_` 复用翻转后的底层存储。 3. 对 `quint4x2`、`quint2x4` 保持不支持报错;对 per-channel quantized tensor,先执行维度合法性检查,再按 CPU/CUDA 语义报出 uniformly quantized 相关错误,保证错误优先级一致。 4. 在 `test_shape_ops.py` 中补充 NPU 专用 complex skip:仅当 `NPU + jit_compile=True + dtype.is_complex` 时跳过 `flip` / `flip_errors` / `flip_numpy` / `fliplr` / `flipud` 相关 complex 用例,规避当前 `jit_compile=True` 下 NPU 无法创建 complex tensor 的既有限制。该 skip 不影响 CPU/CUDA,也不影响 NPU `jit_compile=False` 路径。 # 【资料变更】 不涉及。 # 【接口变更】 不涉及跨仓或客户面可见接口变更。 # 【功能验证】 1. 本地执行量化 flip 相关用例,验证 `quint8`、`qint8`、`qint32` per-tensor affine 结果与 CPU/CUDA 语义一致。 2. 本地验证 per-channel quantized flip 错误信息与 CPU/CUDA 对齐。 3. 本地验证 `jit_compile=True` 下 10 个 complex flip 实例均按预期 skip:`OK (skipped=10)`。 4. 本地验证非 complex invalid 实例 `int64/float64` 仍正常执行并通过。 # 【CheckList】 - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常
likedislike
Pull Request已成功合入, 合并人@ascend-robot
(感谢 hz893 的贡献)
Hhz893成员
5月19日 创建了 pull request,commit 4c7ed1c9
ascend-robot
ascend-robot成员
5月19日 评论:

Thanks for your pull-request.
The full list of commands accepted by me can be found at here
You can get sig-info at here


PR Approval Progress

Congratulations! All modules have met the lgtm and approve requirements.

Module Approval Details

module lgtm status approve status
repo-Ascend/pytorch chujinjin, hbhu_bin (2/2) chujinjin (1/1)
test chujinjin, hbhu_bin (2/2) chujinjin (1/1)

💡 Tip:

  • Committer can comment /approve or /lgtm
  • Commenting /approve implies both code review (lgtm) and intent to merge (approve)

CLA Signature Pass

hz893, thanks for your pull request. All authors of the commits have signed the CLA. 👍

likedislike
ascend-robotascend-robot成员
5月19日 添加了label:ascend-cla/yes
ascend-robot
ascend-robot成员
5月19日 评论:

当前仓库存在以下 保护分支

Protected Branch Version Release
master
v2.11.0
v2.10.0
v2.9.0
v2.7.1
v2.12.0

评论 /sync <branch1> <branch2> ... 可将当前 PR 修改同步到其它分支(创建同步 PR):
a) 如果当前 PR 是 Open 状态,同步操作将延迟到 PR 被合并时执行
b) 如果当前 PR 已经 Merged,将立即执行同步操作

注意:

  1. /sync 命令可以指定同步到多个分支,仅最后一个 /sync 命令生效
  2. 如果创建的同步 PR 不正确,可通过向同步 PR 的源分支提交轻量级 PR 完善,或使用 /close 命令关闭
likedislike
ascend-robot
ascend-robot成员
5月19日 评论:

Ascend docs pipeline is running...

likedislike
此处折叠了106条消息 查看更多
hbhu_bin成员
6月4日 评论:

/lgtm

likedislike
chujinjin成员
6月5日 评论:

/approve

likedislike
ascend-robotascend-robot成员
6月5日 添加了label:approvedlgtm
ascend-robotascend-robot成员
6月5日 合入了pull request
ascend-robot
ascend-robot成员
6月5日 评论:
流水线 pytorch_gitcode_PR_multiVersion#10029 [ commitID:3cac10af ] 已完成
likedislike