已合并
feat(online-rl): 打通结合AIGW任务采集、策略训练与跨进程验证闭环 #2543
feat(online-rl): 打通结合AIGW任务采集、策略训练与跨进程验证闭环 #2543
已合并
mengyuanli创建于 8 天前
mengyuanli
mengyuanli成员
8 天前

Paired: GitHub #982GitCode !2543

What type of PR is this?

/kind feature

Online RL 端到端验证报告

验证环境

  • 模型:Qwen3-4B-Instruct-2507
  • 推理:vLLM,GPU 0
  • 训练:VERL PPO,GPU 1、2
  • 网关:AgentBox Adapter AIGW
  • 存储:独立 Redis
  • 训练样本:4 条,其中 reward=1 和 reward=0 各 2 条

验证链路

  • JiuwenSwarm:JiuwenSwarm CLI -> OpenAI 协议 -> AIGW -> vLLM -> RL Service -> PPO -> LoRA
  • Claude Code:Claude Code CLI -> Anthropic 协议 -> AIGW -> vLLM -> RL Service -> PPO -> LoRA

两条链路均使用真实进程和真实 GPU 训练,不使用 mock Agent、mock AIGW、fake PPO 或 fake LoRA。

验证结果

用例 结果 耗时
JiuwenSwarm Online RL ST 通过 256.79 秒
Claude Code Online RL ST 通过 198.99 秒
Online RL 单元测试 157 passed 16.71 秒

两项 ST 均完成以下验证:

  1. Agent 通过 AIGW 产生可训练轨迹。
  2. 正负 reward 样本进入同一训练批次。
  3. VERL PPO 完成真实参数更新。
  4. 生成并持久化非零 LoRA。
  5. LoRA 成功加载到 vLLM。
  6. Rewarded 样本的策略偏好相对训练前得到改善。
  7. 新建 Task 绑定训练后的 LoRA,并再次完成 Agent 推理。

LoRA 产物证据

Claude Code ST 生成的 LoRA:

  • 策略版本:qwen3-4b-online-rl-st:v1
  • 文件大小:132,187,856 bytes
  • LoRA 张量数:504
  • 非零张量数:504
  • 参数最大绝对值:0.019775370
  • vLLM load_lora_adapter200 OK

JiuwenSwarm ST 同样生成约 126 MiB 的 adapter_model.safetensors,并完成 LoRA 激活及训练后 CLI 请求。

结论

JiuwenSwarm 的 OpenAI 协议路径和 Claude Code 的 Anthropic 协议路径均已跑通完整 Online RL 闭环,能够从真实 Agent 交互采集训练样本、执行 PPO、产生有效 LoRA,并让后续 Task 使用更新后的策略。

Self-checklist:(请自检,在[ ]内打上x,我们将检视你的完成情况,否则会导致pr无法合入

Linked Closing Issues:

likedislike
Pull Request已成功合入, 合并人@openJiuwen-bot
(感谢 mengyuanli 的贡献)
atomgit-bot
atomgit-bot
8 天前 评论:

🤖 正在生成合并请求摘要,请稍候…

likedislike
OopenJiuwen-bot成员
8 天前 将seanzhang_cn,xinyu-jiuwen设为审查人
atomgit-bot
atomgit-bot
8 天前 评论:

🤖 AI 代码检视正在进行中,请稍候…

likedislike
OopenJiuwen-bot成员
8 天前 添加了label:sig/sig-agent-core
atomgit-bot
atomgit-bot
8 天前 评论:

AtomGit AI 助手使用指南

在 PR 评论中使用命令即可触发。支持在普通评论和代码行评论中使用。

功能 命令 说明
代码审查 /ai review 检查代码质量、潜在问题、安全风险
PR 摘要 /ai summary 生成 PR 变更内容的结构化摘要
代码解释 /ai explain 解释代码变更的逻辑和意图
自由提问 @atomgit-bot <问题> 询问关于本 PR 的任何问题
帮助 /ai help 显示此帮助信息

免责声明

AI 助手可能存在误判,请结合自身判断。可以对评论点 👍 或 👎 帮助我们改进。

likedislike
此处折叠了100条消息 查看更多
Yyangzequ成员
7 天前 将pull request提交信息修改为 “feat(online‑rl): Complete the closed‑loop integrating AIGW task collection, policy training and cross‑process validation Refs: #1371” ,原信息为 “feat(online‑rl): Complete the closed‑loop integrating AIGW task collection, policy training and cross‑process validation ”
yangzequ成员
7 天前 评论:

/lgtm

likedislike
OopenJiuwen-bot成员
7 天前 添加了label:lgtm-yangzequ
openJiuwen-bot成员
7 天前 评论:

Review Code Feedback

  • The label lgtm-yangzequ was added to this pull request. It means that yangzequ reviewed the code changes. 👋
Tips
  • If this pull request is not merged while all conditions are met, comment /check-pr to try again. 😄
likedislike
OopenJiuwen-bot成员
7 天前 合入了pull request