已关闭
[benchmarks/torchbench] fambench_xlmr 模型无法在 NPU 上运行:canary 白名单缺失 + fairseq checkpoint/deepcopy 兼容问题 #4686
huyuchao创建于 9月8日关闭于 10 天前
9月8日 添加了label:triage-review
TorchNPU-Bot
9月8日 评论:
9月8日 评论:
issue待分派,添加triage-review标签


9月8日 添加了label:bot-triaged;删除了label:triage-review
TorchNPU-Bot
9月8日 评论:
9月8日 评论:
检测到当前 issue 已关联 PR,自动添加标签:bot-triaged


15 天前 关联了里程碑:v26.2.0
chenrayray
10 天前 评论:
10 天前 评论:
因为本单相关实施 PR 已全部结束(1 个已合入、1 个已关闭),按照本轮 issue 整理规则,先关闭此单。其中关闭但未合入的 PR 不代表对应修复已交付。
核对的 PR:
- pytorch !45955:已关闭(未合入)
- pytorch !46021:已合入
如仍有问题或需要继续推进,请重新打开,并补充当前 PyTorch / TorchNPU / CANN 版本、硬件环境、复现步骤及相关日志;需求类请补充尚未完成的具体内容。


10 天前 关闭了 issue
10 天前 issue状态由 TODO 改变为 DONE
10 天前 添加了label:resolved
问题现象
torchbench.py --only fambench_xlmr选不中模型:fambench_xlmr 位于 canary_models 目录,runner 的CANARY_MODELS白名单未包含(默认仅 torchrec_dlrm)。torch.load默认weights_only=True拒绝 fairseq checkpoint(含 argparse.Namespace 等非白名单对象)。copy.deepcopy无限递归:fairseqHubInterface动态__getattr__代理导致深拷贝回环——模型已声明DEEPCOPY=False上游契约,但 runner 的deepcopy_model未消费该旗标。TORCHINDUCTOR_NPU_BACKEND=default)下--inductor编译失败:safe_softmax 融合 kernel UB overflow(10.76Mb > 1.57Mb,bishengir 降级 code-motion 重试仍败);triton_experimental后端编译成功。修复方案(对应 PR #46021,fambench_xlmr 与 vision_maskrcnn 合并提交;原 #45955 已并入关闭)
torchbench.py:CANARY_MODELS加入fambench_xlmr(全量套件仍走 SKIP,仅--only手动选中)。npu_support.py:@register_patch("fambench_xlmr"),与库上其余模型 patch 同构:Model.__init__包装内 scopedtorch.load → weights_only=False(try/finally 恢复,仅加载 checkpoint 期间生效);common.py deepcopy_model镜像util/env_check.py语义(DEEPCOPY=False不拷贝)+torchbench.py旗标传递(镜像util/backends/cudagraph.py),模型自带的DEEPCOPY = False声明生效。验证