已关闭
[Course-Feedback|课程反馈]: <Qwen3-1.7B Wordle 强化学习实战> 04.02/04.03/04.04 答案解析推荐 entropy_coeff=0.005,与正确选项(0.002)、课程实验数据(0.005 飙升停止)及推荐值矛盾 #258
创建于  7月29日关闭于  8月6日
涛
7月29日 创建

Thanks for sending an issue! Please fill in the following template to help quickly solve your problem.

一、课程名称

Qwen3-1.7B Wordle 强化学习实战

二、反馈类型

课程内容错误

三、反馈详情

章节/小节:第 4 章 04.02/04.03/04.04 练习与答案

问题位置:- 04_tuning_and_troubleshooting/answer/04.02_answer.txt 第 4-5 行(Q2 解析)

  • 04_tuning_and_troubleshooting/answer/04.03_answer.txt 第 7-8 行(Q3 解析)、第 13-14 行(Q5 答案 B 但解析写 0.005)
  • 04_tuning_and_troubleshooting/answer/04.04_answer.txt 第 4-5 行(Q2 解析)、第 28-29 行(Q10 答案 B 但解析写 0.005)
  • 关联正文:04.02_hyperparameter_tuning.ipynb cell1(实验表 0.005 行"3.721 飙升并停止"、"0.002 作为默认值")、cell8(Q1"entropy_coeff=0(默认值)")

背景与难点

entropy_coeff 是本课程最核心的调参变量。04.02 cell1 的实验表明确:0.002 → 0701_1404 稳定完成、correct 70%;0.005 → 0.998(step25)→3.721(step38)"熵快速飙升并停止";0.01 → 4.51 飙升。03.04 cell8 训练脚本默认 entropy_coeff=0.002,04.03 修复方案表也是 0.002。即课程权威推荐值为 0.002,且 0.005 被实验数据证明不稳定。但多处练习答案解析却把 0.005 表述为"更合理/更安全"的推荐值,甚至在与选项 0.002 配对的解析中写成 0.005。

学习者操作

  1. 学完 04.02,看到 cell1 实验表:0.005 行"3.721 飙升并停止",并看到"本 recipe 使用已完整验证的 0.002 作为默认值"。
  2. 做 04.03 Q5"以下哪个是修复策略崩塌的有效方案?B. 加 entropy_coeff=0.002",查看 04.03_answer.txt
  3. 做 04.02 Q2、04.03 Q3、04.04 Q2/Q10,查看对应解析。

实际结果

  • 04.03_answer.txt Q5:答案标"B"(选项为 0.002),但解析写"加 entropy_coeff=0.005 可以在 pg_loss 和 entropy 之间建立平衡"——选项值与解析值不一致。
  • 04.04_answer.txt Q10:同样答案"B"(0.002),解析写"加 entropy_coeff=0.005"。
  • 04.02_answer.txt Q2 解析:"0.005 是更合理的选择"。
  • 04.03_answer.txt Q3 解析:"0.005 比 0.01 更安全"。
  • 04.04_answer.txt Q2 解析:"0.005 更合理"。
  • 上述"0.005 更合理/更安全"与 04.02 cell1 实验数据(0.005→3.721 飙升并停止)和课程推荐值 0.002 直接矛盾。
  • 另:04.02 cell8 Q1 题干写"entropy_coeff=0(默认值)",而 04.02 cell1 正文写"0.002 作为默认值",对"默认值"指代(verl 框架默认 0 vs recipe 默认 0.002)未澄清,加剧取值困惑。
  • 证据来源:静态比对答案文件与 04.02 正文/实验表。

预期结果

答案解析推荐的超参数值应与正确选项、课程实验数据和正文推荐值(0.002)一致;0.005 既已被实验证明不稳定,不应被表述为"更合理/更安全"。

根因

首个偏离预期位置为 04.03_answer.txt Q5 解析。根因为练习与答案问题:答案解析文本与选项、实验数据未对齐,把不稳定值 0.005 误写为推荐值。

影响

  • 受影响人群:所有按答案解析理解调参依据的学习者,尤其是会照搬解析结论上手调参者。
  • 学习影响:形成"0.005 是推荐值"的错误认知;若学习者据解析采用 0.005,按课程自身实验数据训练会在约 38 步 entropy 飙升到 3.721 并停止,直接导致训练失败;同时 Q5/Q10"答案 B(0.002) 但解析 0.005"的自相矛盾会让学习者无法判断正确值。
  • 修复价值:统一 entropy_coeff 取值表述,使调参建议可被安全照做。

建议改法

  1. 04.03_answer.txt Q5 与 04.04_answer.txt Q10 的解析:将"加 entropy_coeff=0.005"改为"加 entropy_coeff=0.002",与选项 B 及 04.03 修复方案表一致。
  2. 04.02_answer.txt Q2、04.03_answer.txt Q3、04.04_answer.txt Q2 的解析:删除"0.005 更合理/更安全"的表述,改为"0.01 过强会飙升;课程已验证 0.002 为稳定默认值,0.005 在实验中仍出现 3.721 飙升,不应作为推荐"。
  3. 04.02 cell8 Q1 题干"entropy_coeff=0(默认值)":澄清为"entropy_coeff=0(verl 框架默认,未启用 entropy bonus)",与 cell1"0.002 作为 recipe 默认值"区分,避免"默认值"歧义。
  4. 全量检索 entropy_coeff0.005/0.002 出现处,确保正文、实验表、练习、答案四处取值表述一致。
likedislike
涛
7月29日 修改标题为 “[Course-Feedback|课程反馈]: <Qwen3-1.7B Wordle 强化学习实战> 04.02/04.03/04.04 答案解析推荐 entropy_coeff=0.005,与正确选项(0.002)、课程实验数据(0.005 飙升停止)及推荐值矛盾”,原标题为“[Course-Feedback|课程反馈]: Qwen3-1.7B Wordle 强化学习实战 04.02/04.03/04.04 答案解析推荐 entropy_coeff=0.005,与正确选项(0.002)、课程实验数据(0.005 飙升停止)及推荐值矛盾”
ink_polymer
ink_polymer成员
7月30日 评论:

尊敬的开发者您好,您的建议已收到,待内部评估后反馈,感谢您的支持

likedislike
zhoujianzhoujian成员
7月30日 关联了pull request:docs: refresh Wordle RL training guidance
zhoujian
zhoujian成员
7月30日 评论:

您好,感谢您的反馈,答案解析已修改,同时适配了最新的稳定训练参数,详见PR。

likedislike
ink_polymerink_polymer成员
7月30日 将 depeng1994 设为负责人
zhoujianzhoujian成员
7月30日 删除了关联的pull request:docs: refresh Wordle RL training guidance
zhoujianzhoujian成员
7月30日 关联了pull request:docs: refresh Wordle RL training guidance
ink_polymerink_polymer成员
8月6日 issue状态由 进行中 改变为 已完成
ink_polymerink_polymer成员
8月6日 关闭了 issue
CANN-robotCANN-robot成员
8月6日 添加了label:resolved