希望在 HyperParallel master 中新增 Hyper-RL 同步强化学习训推功能,复用现有模型加载和分布式并行能力,结合 vLLM 推理引擎,打通采样、奖励计算、训练更新及权重同步流程。
本次主要支持:
可以分别使用 HyperParallel 训练能力和 vLLM 推理能力,通过独立脚本组织强化学习流程。
但该方式需要自行维护模型接入、采样与训练编排、参数布局转换及权重同步逻辑,存在重复实现和维护成本。
希望将上述能力统一接入 master,提供可配置、可测试的训练与推理流程。
涉及训练与推理流程的可观测性和可靠性:
在 hyper_parallel/rl 中新增 RL 配置与训练入口,主要提供以下配置能力:
在 hyper_parallel/models/qwen3 中提供 Qwen3 模型接入及运行时适配,复用共享模型构建、FSDP 和 TP 能力。
具体配置字段及接口定义以实现和接口评审结果为准。
本次以新增 RL 功能和 Qwen3 模型适配为主,不计划删除或替换现有公共 API。
功能代码主要位于:
复用现有共享框架能力,不修改共享 core、platform 和 trainer 框架代码;相关兼容性通过回归测试验证。
首阶段验证范围为单节点 Ascend NPU、Qwen3-4B 模型和 GSM8K 数据集,不将其他模型、异步训练或未测试的并行组合作为本次验收范围。
预期验收标准:
🚀 功能描述
希望在 HyperParallel master 中新增 Hyper-RL 同步强化学习训推功能,复用现有模型加载和分布式并行能力,结合 vLLM 推理引擎,打通采样、奖励计算、训练更新及权重同步流程。
本次主要支持:
现有替代方案
可以分别使用 HyperParallel 训练能力和 vLLM 推理能力,通过独立脚本组织强化学习流程。
但该方式需要自行维护模型接入、采样与训练编排、参数布局转换及权重同步逻辑,存在重复实现和维护成本。
希望将上述能力统一接入 master,提供可配置、可测试的训练与推理流程。
与DFX相关性DF
涉及训练与推理流程的可观测性和可靠性:
提议的新API
在 hyper_parallel/rl 中新增 RL 配置与训练入口,主要提供以下配置能力:
在 hyper_parallel/models/qwen3 中提供 Qwen3 模型接入及运行时适配,复用共享模型构建、FSDP 和 TP 能力。
具体配置字段及接口定义以实现和接口评审结果为准。
是否影响现有API
本次以新增 RL 功能和 Qwen3 模型适配为主,不计划删除或替换现有公共 API。
功能代码主要位于:
复用现有共享框架能力,不修改共享 core、platform 和 trainer 框架代码;相关兼容性通过回归测试验证。
补充信息
首阶段验证范围为单节点 Ascend NPU、Qwen3-4B 模型和 GSM8K 数据集,不将其他模型、异步训练或未测试的并行组合作为本次验收范围。
预期验收标准: