已关闭
[Bug]: epochs参数硬编码影响模型训练效果 #180
xql-ai-developer创建于 4月4日关闭于 4月22日
4月4日 添加了label:bug
4月7日 添加了label:triaged
jayhua
4月7日 评论:
4月7日 评论:
感谢您的反馈,我们会对这个问题进行跟踪


4月7日 关联了pull request:Add epoch parameter support for BEVFusion training script.
xiangyuming
4月7日 评论:
4月7日 评论:
已针对epoch传参进行修改,待PR合入后可基于--epochs=XXX进行传参,例如:bash test/train_full_8p_base_fp32.sh --batch-size=4 --num-npu=1 --epochs=1


4月9日 关闭了 issue
4月9日 添加了label:resolved
4月22日 issue类型由 Bug-Report 改变为 需求
4月22日 重新打开了 issue
4月22日 issue状态由 TODO 改变为 DONE
4月22日 关闭了 issue
4月30日 关联了pull request:Add epoch parameter support for BEVFusion training script.
在提交新问题之前,请确保您已经在社区中搜索过相关问题,并使用了社区中提供的资源/工具后,仍未找到满意的解决方式。
⚠️ 安全信息提醒:请仔细检查提供的文本内容,确保其不包含敏感数据信息,包括但不限于:
在分享配置信息或代码示例时,请将敏感信息脱敏处理,或使用
<TOKEN>等占位符替代原有内容。环境信息
操作系统:HCE2.0
硬件版本:A2
CANN版本:8.2.RC2
依赖版本:
mmcv 2.2.0
torch 2.1.0
torch-npu 2.1.0.post13.dev20250722
torchvision 0.16.0
🐛 问题描述
1、训练环境准备
https://gitcode.com/Ascend/DrivingSDK/blob/master/model_examples/BEVFusion/README.md
2、准备数据
https://www.nuscenes.org/data/v1.0-mini.tgz
3、启动模型训练
bash test/train_full_8p_base_fp32.sh --batch-size=4 --num-npu=2 --epochs 20
问题描述:
启动脚本中即使通过--epochs 20或者手动修改train_full_8p_base_fp32.sh中的epochs=20,该参数在模型训练过程中也不会生效,epochs参数目前在py文件中是硬编码的,如果使用的mini数据集,就会导致模型在训练过程中随着epoch轮次的增加,模型评估阶段的各项评价指标一直不正常,比如mAP的值一直为0(接近0),经过定位发现epochs的值会影响模型的训练方法(余弦退火算法)和学习率的设置,硬编码的方式不合理。
欢迎加入社区,感谢您对社区的贡献 🎉!