已关闭
[Course-Feedback|课程反馈]: Qwen3-1.7B Wordle 强化学习实战 配置不统一 #334
咸粥联盟创建于  7月30日关闭于  8月6日
咸粥联盟
咸粥联盟
7月30日 创建

Thanks for sending an issue! Please fill in the following template to help quickly solve your problem.

一、课程名称 (必填)

Qwen3-1.7B Wordle 强化学习实战
第 2 章 — 02.04 KL 散度与训练稳定性

二、反馈类型 (必填)

课程内容建议

三、反馈详情 (必填)

02.04 notebook 的 KL coef 表格将 0.01 标注为"配合 entropy_coeff 使用,推荐",但紧接着的"当前配置"明确使用 kl_loss_coef = 0.001,两者相差 10 倍,容易让学习者困惑。

KL coef 表格(02.04 notebook 第 96-100 行):

KL coef 效果 风险
0.001 轻微约束 多数环境够用,漂移较大时偏弱
0.01 中等约束 配合 entropy_coeff 使用,推荐

当前配置:

actor.kl_loss_coef = 0.001

建议: 在表格或正文中补充说明为何实际 recipe 采用 0.001 而非推荐的 0.01(例如"本 recipe 已针对 Wordle 验证 0.001 足够,0.01 适用于漂移更大的场景"),或调整表格中的"推荐"标注以避免与实际配置冲突。

四、环境信息 (可选)

💡 备注(选填)

likedislike
ink_polymer
ink_polymer成员
7月30日 评论:

尊敬的开发者您好,您的建议已收到,待内部评估后反馈,感谢您的支持

likedislike
zhoujian
zhoujian成员
8月6日 评论:

您好,感谢您的反馈。KL coef 表格已按约束强度和适用风险进行说明,当前 recipe 使用的 0.001 已明确为调试起点,需结合实际 KL 指标继续观察。相关修改已通过关联 PR !455 合入。

likedislike
ink_polymerink_polymer成员
8月6日 issue状态由 进行中 改变为 已完成
ink_polymerink_polymer成员
8月6日 关闭了 issue
CANN-robotCANN-robot成员
8月6日 添加了label:resolved