已关闭
[Course-Feedback|课程反馈]: <Qwen3-1.7B Wordle 强化学习实战> 04.02/04.03/04.04 答案解析推荐 entropy_coeff=0.005,与正确选项(0.002)、课程实验数据(0.005 飙升停止)及推荐值矛盾 #258
涛创建于 7月29日关闭于 8月6日
7月29日 修改标题为 “[Course-Feedback|课程反馈]: <Qwen3-1.7B Wordle 强化学习实战> 04.02/04.03/04.04 答案解析推荐 entropy_coeff=0.005,与正确选项(0.002)、课程实验数据(0.005 飙升停止)及推荐值矛盾”,原标题为“[Course-Feedback|课程反馈]: Qwen3-1.7B Wordle 强化学习实战 04.02/04.03/04.04 答案解析推荐 entropy_coeff=0.005,与正确选项(0.002)、课程实验数据(0.005 飙升停止)及推荐值矛盾”
7月29日 修改标题为 “[Course-Feedback|课程反馈]: <Qwen3-1.7B Wordle 强化学习实战> 04.02/04.03/04.04 答案解析推荐 entropy_coeff=0.005,与正确选项(0.002)、课程实验数据(0.005 飙升停止)及推荐值矛盾”,原标题为“[Course-Feedback|课程反馈]: Qwen3-1.7B Wordle 强化学习实战 04.02/04.03/04.04 答案解析推荐 entropy_coeff=0.005,与正确选项(0.002)、课程实验数据(0.005 飙升停止)及推荐值矛盾”
ink_polymer
7月30日 评论:
7月30日 评论:
尊敬的开发者您好,您的建议已收到,待内部评估后反馈,感谢您的支持


7月30日 关联了pull request:docs: refresh Wordle RL training guidance
zhoujian
7月30日 评论:
7月30日 评论:
您好,感谢您的反馈,答案解析已修改,同时适配了最新的稳定训练参数,详见PR。


7月30日 将 depeng1994 设为负责人
7月30日 删除了关联的pull request:docs: refresh Wordle RL training guidance
7月30日 关联了pull request:docs: refresh Wordle RL training guidance
8月6日 issue状态由 进行中 改变为 已完成
8月6日 关闭了 issue
8月6日 添加了label:resolved
Thanks for sending an issue! Please fill in the following template to help quickly solve your problem.
一、课程名称
Qwen3-1.7B Wordle 强化学习实战
二、反馈类型
课程内容错误
三、反馈详情
章节/小节:第 4 章 04.02/04.03/04.04 练习与答案
问题位置:-
04_tuning_and_troubleshooting/answer/04.02_answer.txt第 4-5 行(Q2 解析)04_tuning_and_troubleshooting/answer/04.03_answer.txt第 7-8 行(Q3 解析)、第 13-14 行(Q5 答案 B 但解析写 0.005)04_tuning_and_troubleshooting/answer/04.04_answer.txt第 4-5 行(Q2 解析)、第 28-29 行(Q10 答案 B 但解析写 0.005)04.02_hyperparameter_tuning.ipynbcell1(实验表 0.005 行"3.721 飙升并停止"、"0.002 作为默认值")、cell8(Q1"entropy_coeff=0(默认值)")背景与难点
entropy_coeff 是本课程最核心的调参变量。04.02 cell1 的实验表明确:0.002 → 0701_1404 稳定完成、correct 70%;0.005 → 0.998(step25)→3.721(step38)"熵快速飙升并停止";0.01 → 4.51 飙升。03.04 cell8 训练脚本默认 entropy_coeff=0.002,04.03 修复方案表也是 0.002。即课程权威推荐值为 0.002,且 0.005 被实验数据证明不稳定。但多处练习答案解析却把 0.005 表述为"更合理/更安全"的推荐值,甚至在与选项 0.002 配对的解析中写成 0.005。
学习者操作
04.03_answer.txt。实际结果
04.03_answer.txtQ5:答案标"B"(选项为 0.002),但解析写"加 entropy_coeff=0.005 可以在 pg_loss 和 entropy 之间建立平衡"——选项值与解析值不一致。04.04_answer.txtQ10:同样答案"B"(0.002),解析写"加 entropy_coeff=0.005"。04.02_answer.txtQ2 解析:"0.005 是更合理的选择"。04.03_answer.txtQ3 解析:"0.005 比 0.01 更安全"。04.04_answer.txtQ2 解析:"0.005 更合理"。预期结果
答案解析推荐的超参数值应与正确选项、课程实验数据和正文推荐值(0.002)一致;0.005 既已被实验证明不稳定,不应被表述为"更合理/更安全"。
根因
首个偏离预期位置为
04.03_answer.txtQ5 解析。根因为练习与答案问题:答案解析文本与选项、实验数据未对齐,把不稳定值 0.005 误写为推荐值。影响
建议改法
04.03_answer.txtQ5 与04.04_answer.txtQ10 的解析:将"加 entropy_coeff=0.005"改为"加 entropy_coeff=0.002",与选项 B 及 04.03 修复方案表一致。04.02_answer.txtQ2、04.03_answer.txtQ3、04.04_answer.txtQ2 的解析:删除"0.005 更合理/更安全"的表述,改为"0.01 过强会飙升;课程已验证 0.002 为稳定默认值,0.005 在实验中仍出现 3.721 飙升,不应作为推荐"。04.02cell8 Q1 题干"entropy_coeff=0(默认值)":澄清为"entropy_coeff=0(verl 框架默认,未启用 entropy bonus)",与 cell1"0.002 作为 recipe 默认值"区分,避免"默认值"歧义。entropy_coeff与0.005/0.002出现处,确保正文、实验表、练习、答案四处取值表述一致。