| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
[mindspeed-rl] 补充dapo和grpo规则奖励计算相关UT测试用例 Co-authored-by: McFlurry<zhangjianxiang3@huawei.com> # message auto-generated for no-merge-commit merge: !836 merge master into master [mindspeed-rl] 补充dapo和grpo规则奖励计算相关UT测试用例 Created-by: McFlurry100 Commit-by: McFlurry Merged-by: ascend-robot Description: 补充dapo和grpo规则奖励计算相关UT测试用例 See merge request: Ascend/MindSpeed-RL!836 | 7 个月前 | |
修改qwen25-32b的长序列精度问题、以及推20k随机步数oom Co-authored-by: d00613215<daikang6@huawei.com> # message auto-generated for no-merge-commit merge: !894 merge master into master 修改qwen25-32b的长序列精度问题、以及推20k随机步数oom Created-by: daikang123 Commit-by: d00613215 Merged-by: ascend-robot Description: 修改qwen25-32b推20k,随机步数后oom 修改qwen25-32b的长序列精度问题 See merge request: Ascend/MindSpeed-RL!894 | 6 个月前 | |
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
[mindspeed-rl] 补充dapo和grpo规则奖励计算相关UT测试用例 Co-authored-by: McFlurry<zhangjianxiang3@huawei.com> # message auto-generated for no-merge-commit merge: !836 merge master into master [mindspeed-rl] 补充dapo和grpo规则奖励计算相关UT测试用例 Created-by: McFlurry100 Commit-by: McFlurry Merged-by: ascend-robot Description: 补充dapo和grpo规则奖励计算相关UT测试用例 See merge request: Ascend/MindSpeed-RL!836 | 7 个月前 | |
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 7 个月前 | ||
| 6 个月前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 7 个月前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 |