已关闭
[Bug]: epochs参数硬编码影响模型训练效果 #180
xql-ai-developer创建于  4月4日关闭于  4月22日
xql-ai-developer
xql-ai-developer
4月4日 创建

在提交新问题之前,请确保您已经在社区中搜索过相关问题,并使用了社区中提供的资源/工具后,仍未找到满意的解决方式。

⚠️ 安全信息提醒:请仔细检查提供的文本内容,确保其不包含敏感数据信息,包括但不限于:

  • API 令牌或密钥
  • 密码或身份验证凭证
  • 私有网址或接口地址
  • 个人或机密数据
  • ...

在分享配置信息或代码示例时,请将敏感信息脱敏处理,或使用 <TOKEN> 等占位符替代原有内容。

环境信息

操作系统:HCE2.0
硬件版本:A2
CANN版本:8.2.RC2
依赖版本:
mmcv 2.2.0
torch 2.1.0
torch-npu 2.1.0.post13.dev20250722
torchvision 0.16.0

🐛 问题描述

1、训练环境准备
https://gitcode.com/Ascend/DrivingSDK/blob/master/model_examples/BEVFusion/README.md
2、准备数据
https://www.nuscenes.org/data/v1.0-mini.tgz
3、启动模型训练
bash test/train_full_8p_base_fp32.sh --batch-size=4 --num-npu=2 --epochs 20

问题描述:
启动脚本中即使通过--epochs 20或者手动修改train_full_8p_base_fp32.sh中的epochs=20,该参数在模型训练过程中也不会生效,epochs参数目前在py文件中是硬编码的,如果使用的mini数据集,就会导致模型在训练过程中随着epoch轮次的增加,模型评估阶段的各项评价指标一直不正常,比如mAP的值一直为0(接近0),经过定位发现epochs的值会影响模型的训练方法(余弦退火算法)和学习率的设置,硬编码的方式不合理。

欢迎加入社区,感谢您对社区的贡献 🎉!

likedislike
ascend-robotascend-robot成员
4月4日 添加了label:bug
jayhuajayhua成员
4月7日 添加了label:triaged
jayhua
jayhua成员
4月7日 评论:

感谢您的反馈,我们会对这个问题进行跟踪

likedislike
xiangyumingxiangyuming成员
4月7日 关联了pull request:Add epoch parameter support for BEVFusion training script.
xiangyuming
xiangyuming成员
4月7日 评论:

已针对epoch传参进行修改,待PR合入后可基于--epochs=XXX进行传参,例如:bash test/train_full_8p_base_fp32.sh --batch-size=4 --num-npu=1 --epochs=1

likedislike
ascend-robotascend-robot成员
4月9日 关闭了 issue
ascend-robotascend-robot成员
4月9日 添加了label:resolved
xiangyumingxiangyuming成员
4月22日 issue类型由 Bug-Report 改变为 需求
xiangyumingxiangyuming成员
4月22日 重新打开了 issue
xiangyumingxiangyuming成员
4月22日 issue状态由 TODO 改变为 DONE
xiangyumingxiangyuming成员
4月22日 关闭了 issue
xiangyumingxiangyuming成员
4月30日 关联了pull request:Add epoch parameter support for BEVFusion training script.