已关闭
[Bug]: 开启torchair之后,TensorMove算子耗时飙升 #231
lss07创建于  2025年12月19日关闭于  1月7日
lss07
lss07
2025年12月19日 创建

在提交问题之前,请通过搜索现有和历史问题确保该问题尚未被提出并解决。

您的环境信息

-- CANN 版本:  8.5.0
-- Pytorch/Torch_npu 版本 : v 2.6.0
-- Python 版本 : 3.11
-- 操作系统版本 : openeuler24.03

🐛 请描述bug

开启torchair之前,TensorMove 算子占比只有0.02%。开启torchair之后,TensorMove 算子占比50%。
希望定位 TensorMove 算子增加的原因,以确认性能影响。
image.png
image.png

likedislike
SunYapingSunYaping成员
2025年12月19日 将 wang-pierre-jiacheng 设为负责人
luboyang成员
2025年12月19日 评论:

先确认下您这边用的是max-autotune路径是嘛,tensormove的产生有可能是torchair在翻译dynamo图的操作时,根据dynamo图的语义产生的,如果模型中的inplace算子较多就有可能产生这种情况;可以打印一下torchair的dump图以及torchair的python日志,看一下具体tensormove是由什么操作产生的。

likedislike
lss07
lss07
2025年12月23日 评论:

使用的reduce-overhead模式,打印了torchair的dump图以及torchair的python日志,没有找到tensormove

likedislike
lss07
lss07
2025年12月23日 评论:

切换max-autotune模式后执行时,提示torch.ops.aten.index_put.default ge_converter is not implemented!,设置config.debug.fx_summary.type = "csv"之后,又可以跑通执行了,但是性能不及reduce-overhead模式

likedislike
lss07lss07
2025年12月23日 修改了issue 的描述
wang-pierre-jiacheng
wang-pierre-jiacheng成员
2025年12月23日 评论:

切换max-autotune模式后执行时,提示torch.ops.aten.index_put.default ge_converter is not implemented!,设置config.debug.fx_summary.type = "csv"之后,又可以跑通执行了,但是性能不及reduce-overhead模式

@lss07

请确认下csv文件中是否有提升不支持的算子名称。

likedislike
SunYaping
SunYaping成员
1月7日 评论:

可以添加torchair小助手,加技术交流群和专门们一对一交流哦~

likedislike
SunYapingSunYaping成员
1月7日 issue状态由 TODO 改变为 DONE
SunYapingSunYaping成员
1月7日 关闭了 issue