已合并
feat(online-rl): 打通结合AIGW任务采集、策略训练与跨进程验证闭环 #2543
mengyuanli创建于 8 天前
feat(online-rl): 打通结合AIGW任务采集、策略训练与跨进程验证闭环 #2543
已合并
Pull Request已成功合入, 合并人@openJiuwen-bot
(感谢 mengyuanli 的贡献)atomgit-bot
8 天前 评论:
8 天前 评论:
🤖 正在生成合并请求摘要,请稍候…


8 天前 将seanzhang_cn,xinyu-jiuwen设为审查人
atomgit-bot
8 天前 评论:
8 天前 评论:
🤖 AI 代码检视正在进行中,请稍候…


8 天前 添加了label:sig/sig-agent-core
atomgit-bot
8 天前 评论:
8 天前 评论:
此处折叠了100条消息 查看更多
7 天前 将pull request提交信息修改为 “feat(online‑rl): Complete the closed‑loop integrating AIGW task collection, policy training and cross‑process validation
Refs: #1371” ,原信息为 “feat(online‑rl): Complete the closed‑loop integrating AIGW task collection, policy training and cross‑process validation
”
7 天前 添加了label:lgtm-yangzequ
openJiuwen-bot
7 天前 评论:
7 天前 评论:
7 天前 合入了pull request
Paired: GitHub #982 ↔ GitCode !2543
What type of PR is this?
/kind feature
Online RL 端到端验证报告
验证环境
验证链路
两条链路均使用真实进程和真实 GPU 训练,不使用 mock Agent、mock AIGW、fake PPO 或 fake LoRA。
验证结果
两项 ST 均完成以下验证:
LoRA 产物证据
Claude Code ST 生成的 LoRA:
qwen3-4b-online-rl-st:v1load_lora_adapter:200 OKJiuwenSwarm ST 同样生成约 126 MiB 的
adapter_model.safetensors,并完成 LoRA 激活及训练后 CLI 请求。结论
JiuwenSwarm 的 OpenAI 协议路径和 Claude Code 的 Anthropic 协议路径均已跑通完整 Online RL 闭环,能够从真实 Agent 交互采集训练样本、执行 PPO、产生有效 LoRA,并让后续 Task 使用更新后的策略。
Self-checklist:(请自检,在[ ]内打上x,我们将检视你的完成情况,否则会导致pr无法合入)
Linked Closing Issues: