已关闭
[Course-Feedback|课程反馈]: Qwen3-1.7B Wordle 强化学习实战数据矛盾 #327
咸粥联盟创建于  7月30日关闭于  8月6日
咸粥联盟
咸粥联盟
7月30日 创建

Thanks for sending an issue! Please fill in the following template to help quickly solve your problem.

一、课程名称 (必填)

Qwen3-1.7B Wordle 强化学习实战,第 4 章《调优与问题排查》— 04.02 / 04.03 / 04.04 答案文件

二、反馈类型 (必填)

• 课程内容错误

三、反馈详情 (必填)

答案文件中反复声称 entropy_coeff=0.005 是"更合理/更安全"的选择,但 notebook 正文实验数据明确显示 0.005 会导致训练失败,已验证的正确值是 0.002

矛盾对照:

位置 正文实验数据 答案文件说法
04.02 notebook 实验表 0.005 → entropy 从 0.531 飙到 0.998(step 25) 再飙到 3.721(step 38),run 0630_1646 熵快速飙升并停止
04.02 警告框 "本 recipe 使用已完整验证的 0.002 作为默认值"
04.02 推荐组合 A/B 均使用 entropy_coeff=0.002
04.03 修复方案表 entropy_coeff=0.002
04.02_answer.txt Q2 "0.005 是更合理的选择"
04.03_answer.txt Q3 "0.005 比 0.01 更安全"
04.03_answer.txt Q5 "加 entropy_coeff=0.005 可以建立平衡"
04.04_answer.txt Q2 "0.005 更合理"
04.04_answer.txt Q10 "加 entropy_coeff=0.005 可以建立平衡"

涉及文件(5 处解析):

  • 04_tuning_and_troubleshooting/answer/04.02_answer.txt 第 5 行
  • 04_tuning_and_troubleshooting/answer/04.03_answer.txt 第 8 行、第 14 行
  • 04_tuning_and_troubleshooting/answer/04.04_answer.txt 第 5 行、第 29 行

建议修正: 将所有答案解析中的 0.005 改为 0.002,与 notebook 实验数据和推荐配置保持一致。

四、环境信息 (可选)

💡 备注(选填)

likedislike
ink_polymer
ink_polymer成员
7月30日 评论:

尊敬的开发者您好,您的建议已收到,待内部评估后反馈,感谢您的支持

likedislike
zhoujian
zhoujian成员
8月6日 评论:

您好,感谢您的反馈。第 4 章正文与答案已统一 entropy_coeff 的实验结论,0.005 明确作为探索影响过强的观测案例,调参结论采用受控短程对比。相关修改已通过关联 PR !455 合入。

likedislike
ink_polymerink_polymer成员
8月6日 issue状态由 进行中 改变为 已完成
ink_polymerink_polymer成员
8月6日 关闭了 issue
CANN-robotCANN-robot成员
8月6日 添加了label:resolved