已关闭
[Course-Feedback|课程反馈]: Qwen3-1.7B Wordle 强化学习实战 配置不统一 #334
咸粥联盟创建于 7月30日关闭于 8月6日
ink_polymer
7月30日 评论:
7月30日 评论:
尊敬的开发者您好,您的建议已收到,待内部评估后反馈,感谢您的支持


zhoujian
8月6日 评论:
8月6日 评论:
您好,感谢您的反馈。KL coef 表格已按约束强度和适用风险进行说明,当前 recipe 使用的 0.001 已明确为调试起点,需结合实际 KL 指标继续观察。相关修改已通过关联 PR !455 合入。


8月6日 issue状态由 进行中 改变为 已完成
8月6日 关闭了 issue
8月6日 添加了label:resolved
Thanks for sending an issue! Please fill in the following template to help quickly solve your problem.
一、课程名称 (必填)
Qwen3-1.7B Wordle 强化学习实战
第 2 章 — 02.04 KL 散度与训练稳定性
二、反馈类型 (必填)
课程内容建议
三、反馈详情 (必填)
02.04 notebook 的 KL coef 表格将
0.01标注为"配合 entropy_coeff 使用,推荐",但紧接着的"当前配置"明确使用kl_loss_coef = 0.001,两者相差 10 倍,容易让学习者困惑。KL coef 表格(02.04 notebook 第 96-100 行):
当前配置:
建议: 在表格或正文中补充说明为何实际 recipe 采用 0.001 而非推荐的 0.01(例如"本 recipe 已针对 Wordle 验证 0.001 足够,0.01 适用于漂移更大的场景"),或调整表格中的"推荐"标注以避免与实际配置冲突。
四、环境信息 (可选)
💡 备注(选填)