已开启
sd2 #2
rmch创建于  3月19日
rmch成员
3月19日 创建

Seedance2.0 torch.compile
一、现有工作落地
针对Seedance2.0模型完成torch.compile适配优化,已实现ROPE、MoE等核心模块的入图自动融合,该项优化落地后,整网计算性能提升1.8%左右,同时全程保障模型精度对齐,达成精度保底的核心要求,未出现精度偏差问题。

二、当前适配推进现状

GPU与NPU侧的整网入图适配呈现差异化进展:GPU端已顺利开启全量整网入图,适配流程通畅;NPU端因启用FSDP细粒度切分策略,受切分逻辑限制,仅能对切分后的小粒度module执行入图操作,目前该适配功能已打通,双机运行场景下精度可实现200step loss基本对齐(相对误差<1%)。由于当前NPU侧入图覆盖范围较大,结合最新迭代代码,模型最终的精度稳定性、实际性能收益仍需开展专项测试验证。

三、后续核心发力方向

后续将围绕模型优化与后端适配三大核心方向推进工作:其一,重点开展显存优化专项分析,核心目标压降激活值显存占用,缓解显存压力;其二,推进DVM后端的落地适配与调试;其三,推进动态shape相关的inductor-triton后端,同时进一步拓展模型模块融合范围,通过更全面的融合策略,实现更优的整网性能提升。

likedislike
rmch成员
5月8日 评论:

shape: (4096,4096) x (4096,4096), dtype=fp32, iters=50

set=KEEP_DTYPE readback=KEEP_DTYPE match=True avg= 1.904 ms max_err=6.409e-04 mean_err=3.897e-05
set=ALLOW_FP32_DOWN_PRECISION readback=ALLOW_FP32_DOWN_PRECISION match=True avg= 1.029 ms max_err=4.999e-02 mean_err=7.502e-03
set=USE_FP16 readback=USE_FP16 match=True avg= 0.743 ms max_err=1.589e-01 mean_err=1.813e-02
set=USE_HF32 readback=USE_HF32 match=True avg= 1.062 ms max_err=4.999e-02 mean_err=7.502e-03
set=FORCE_GRP_ACC_FOR_FP32 readback=FORCE_GRP_ACC_FOR_FP32 match=True avg= 3.873 ms max_err=3.662e-04 mean_err=2.921e-05

likedislike