已关闭
[Bug]: Diffusion-Planner FP32 训练 loss 无法对齐 README 基准(950 0.0619 vs A100 0.1631) #373
feiyangR创建于 7 天前关闭于 6 天前
7 天前 添加了label:bug
feiyangR
7 天前 评论:
7 天前 评论:
xiangyuming
7 天前 评论:
7 天前 评论:
/label add triaged


7 天前 添加了label:triaged
6 天前 添加了label:resolved
feiyangR
4 天前 评论:
4 天前 评论:
数据集疑似有误,需要确认修订。


在提交新问题之前,请确保您已经在社区中搜索过相关问题,并使用了社区中提供的资源/工具后,仍未找到满意的解决方式。
⚠️ 安全信息提醒:请仔细检查提供的文本内容,确保其不包含敏感数据信息,包括但不限于:
在分享配置信息或代码示例时,请将敏感信息脱敏处理,或使用
<TOKEN>等占位符替代原有内容。环境信息
🐛 问题描述
现象
按 README 与 test/train_8p.sh 的基准口径(FP32、GBS=2048、8 卡、30 epoch、train_boston 子集)在 Ascend 950 上实跑 Diffusion-Planner,最终训练 loss 为 0.0619,与 README 给出的竞品 A(A100)0.1631、Atlas 800T A2 0.1619 相差约 2.6 倍,无法对齐。
已核对的配置与数据集(均对齐)
关键线索:950 逐 epoch 训练 loss 轨迹(train_full_8p_base_fp32.log)
epoch1=1.4252, epoch2=0.4064, epoch3=0.2455, epoch4=0.1916, epoch5=0.1628, epoch6=0.1436, ..., epoch30=0.0619
第 5 个 epoch 的 loss(0.1628)已与 README 的 A100(0.1631)/A2(0.1619)几乎重合,说明两侧早期训练动力学一致,差异主要来自后续 25 个 epoch 的继续收敛。
需要确认
其他说明
适配 patch(diffusionPlanner.patch)将 decoder.py 中 self._guidance_fn = None(关闭 classifier guidance)。经核对,classifier guidance 属采样/闭环阶段的评分梯度引导、不进入扩散去噪训练损失,且原公版 train_predictor.py 也未注册 --guidance_fn(默认 None),故该改动不参与上述训练 loss 差异,仅影响闭环规划质量。
欢迎加入社区,感谢您对社区的贡献 🎉!