Star
0
Fork
0
代码
介绍
代码
Issues
Pull Requests
流水线
Actions
项目讨论
Wiki
项目成员
1
分析
项目设置
Star
0
Fork
0
main
hello-agents
/
code
/
chapter11
下载当前目录
M
Meredith2328
docs(chapter11): 为 GRPO 学习率补充策略坍塌提示(注释与说明)
046f71ba
创建于
8月7日
历史提交
文件
最后提交记录
最后更新时间
accelerate_configs
Add chapter11
11 个月前
.env.example
Add chapter11
11 个月前
00_quick_test.py
docs(chapter11): 为 GRPO 学习率补充策略坍塌提示(注释与说明) 章节 11 的 GRPO demo 与文档建议学习率 1e-5~5e-5,在小参数模型 (如 Qwen3-0.6B)+ GSM8K 上,5e-5 会导致 GRPO 策略坍塌 (准确率 57.0% → 2.4%),1e-6 可稳定收敛。 本次仅做注释与文档层面的补充,不改动任何代码行为: - code/chapter11/00_quick_test.py、05_grpo_training.py:在 GRPO 配置处 添加注释,提示学习率过大可能导致策略坍塌,必要时可调至 1e-6; - docs/chapter11(中英两版):GRPO 学习率建议改为 1e-6~1e-5,并提示风险。
1 个月前
01_dataset_loading.py
Add chapter11
11 个月前
02_reward_functions.py
Add chapter11
11 个月前
03_lora_configuration.py
Add chapter11
11 个月前
04_sft_training.py
Add chapter11
11 个月前
05_grpo_training.py
docs(chapter11): 为 GRPO 学习率补充策略坍塌提示(注释与说明) 章节 11 的 GRPO demo 与文档建议学习率 1e-5~5e-5,在小参数模型 (如 Qwen3-0.6B)+ GSM8K 上,5e-5 会导致 GRPO 策略坍塌 (准确率 57.0% → 2.4%),1e-6 可稳定收敛。 本次仅做注释与文档层面的补充,不改动任何代码行为: - code/chapter11/00_quick_test.py、05_grpo_training.py:在 GRPO 配置处 添加注释,提示学习率过大可能导致策略坍塌,必要时可调至 1e-6; - docs/chapter11(中英两版):GRPO 学习率建议改为 1e-6~1e-5,并提示风险。
1 个月前
06_complete_pipeline.py
Add chapter11
11 个月前
07_model_evaluation.py
Add chapter11
11 个月前
08_distributed_training.py
Add chapter11
11 个月前
config.json
Add chapter11
11 个月前