AReaL:基于 ReaLHF 的全异步强化学习训练系统项目

The RL Bridge for LLM-based Agent Applications. Made Simple & Flexible.

分支113Tags27
文件最后提交记录最后更新时间
2 个月前
2 个月前
5 个月前
8 天前
2 个月前
8 天前
1 个月前
7 个月前
3 个月前
8 天前
8 天前
5 个月前
3 个月前
8 天前
1 年前
6 个月前
26 天前
3 个月前
3 个月前
4 个月前
2 个月前
2 个月前
22 天前
2 个月前
2 个月前
4 个月前
1 个月前
2 个月前
8 天前
8 天前
8 天前
8 天前

AReaL: 大规模异步强化学习系统

| 论文 | 文档 | 中文文档 | Ask DeepWiki | 🤗 模型与数据 | 微信交流群 |

ReaL

AReaL 是一个强化学习(RL)基础设施,旨在连接基础模型训练与现代基于智能体的应用。它最初由清华大学智能产业研究院(IIIS)和蚂蚁集团 AReaL 团队的研究人员与工程师共同开发。

AReaL 基于完全异步的强化学习训练范式构建,在效率和可扩展性方面进行了优化,特别适用于训练大规模推理型和智能体模型

AReaL 的使命是让广大开发者和研究人员能够便捷、高效且经济地构建 AI 智能体。

如同奶茶般——可定制、可扩展且令人愉悦——我们希望 AReaL 能为您的 AI 开发体验带来灵活性与乐趣。干杯!

AReaL 亮点

📰 新闻

[2026/07/01] 🎉 我们发布了AReaL 2.0,这是一个重要的架构里程碑。此版本将 AReaL 重构为微服务架构,包含独立的训练推理智能体权重更新服务,并提供了Hermes 在线 RL 循环端到端 SWE RL 训练示例。详情请查看我们的技术报告

[2026/06/17] 🔬 推出KPop——双向二进制 KL 散度 token 掩码。可通过 rejection_sampling.metric=binary_kl 进行配置。同时新增IcePop 配置(基于重要性比率的 token 掩码)。欢迎查看gsm8k_kpop.yamlgsm8k_icepop.yaml快速上手!

📋 历史版本

[2026/04/23] 🚀 我们很高兴发布与Scaffoldings的集成,用于智能体 RL 训练——现已在我们的示例中上线!特别感谢 @narutolhy 和 @WeiHaocheng 的贡献 🙌。Scaffoldings 的模块化设计实现了智能体执行、奖励计算和轨迹获取的彻底解耦。这使开发者在实现智能体 RL 方法时能够复用现有模块,从而专注于自己的创新模块。

[2026/04/18] 我们荣幸地宣布,AReaL 首次社区双周会议圆满举行!感谢所有参会者。会议材料现已在此处提供。我们的下一次会议定于2026/05/01,仍将以中文进行;未来将安排英文会议。热烈欢迎大家参与!更多详情请参见社区

[2026/03/02] 我们提供了完整示例,只需将 base_urlapi_key 替换为 AReaL 的 RL 服务,即可训练您自己的 🦞 OpenClaw 智能体——无需复杂依赖,无需代码更改,可与任何智能体运行时兼容!

[2026/02/06] 我们欣然推出AReaL-SEA,一个自进化数据合成引擎。结合 AReaL 上的 RL 训练,2350 亿参数 MoE 模型在 tau2\\tau^2-bench 上超越 GPT 5,并达到与 Gemini 3.0 Pro 相当的性能!查看论文模型数据代码

[2026/01/15] 祝贺我们的合作伙伴 CAMEL-AI 开源了SETA——他们使用 AReaL 训练的终端智能体 RL 项目!查看他们的训练工作流X 平台公告

[2026/01/01] 新年快乐!感谢 @HwVanICI 的杰出贡献,我们激动地正式宣布 AReaL 训练已稳定支持昇腾 NPU 设备!相关代码在ascend 分支中积极维护并持续更新。查看文档开始使用,如有任何问题欢迎反馈!

[2025/08/30] 推出 ASearcher,这是一款基于 AReaL 端到端异步 RL 训练构建的最先进搜索智能体。查看论文开源仓库

[2025/07/31] (AReaL-lite) 我们推出 AReaL-lite,这是 AReaL 的轻量级版本,专为 AI 研究人员和快速原型开发设计。AReaL-lite 采用算法优先的 API 设计,优先考虑易用性和算法开发,同时原生支持全异步智能体 RL。凭借减少 80% 的代码量,AReaL-lite 仍保持了 AReaL 90% 的性能和核心功能。查看AReaL-lite 设计文档快速入门指南,开启您的AReaL-lite之旅!

[2025/06/03] (v0.3, boba²) 我们发布 boba²(双波霸),用于全异步 RL 训练。与同步系统相比,它实现了2.77 倍加速,同时提供相当或更优的训练性能。此外,异步 RL 显著简化了多轮智能体 RL 训练的设置!查看v0.3 概览博客研究论文

[2025/03/31] (v0.2, boba) 推出我们的里程碑版本——boba!请称它为 A-ReaL-boba!此版本支持 SGLang,训练速度显著提升,并提供用于数学推理的最先进 70 亿和 320 亿参数模型。查看v0.2 技术博客

[2025/02/24] (v0.1) 我们的初始版本包含 15 亿和 70 亿参数大型推理模型(LRM)的可复现结果。查看v0.1 技术博客

🚀 快速开始

首先,安装该包:

git clone https://github.com/areal-project/AReaL
cd AReaL
pip install uv
# Install flash-attn pre-built wheel first to avoid compiling from source
# (pick the wheel matching your Python version; see https://github.com/mjun0812/flash-attention-prebuild-wheels/releases)
uv pip install "https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.7.16/flash_attn-2.8.3+cu128torch2.9-cp312-cp312-linux_x86_64.whl"
uv sync --extra cuda  # installs training packages + SGLang (default inference backend)
# For vLLM instead: cp pyproject.vllm.toml pyproject.toml && cp uv.vllm.lock uv.lock && uv sync --extra cuda

我们的训练脚本会自动下载所需的数据集(openai/gsm8k)和模型(Qwen/Qwen2-1.5B-Instruct)。要在单个节点上运行:

python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.type=local

如果您希望在 Ray 集群上运行实验,请更新 YAML 文件中的路径以指向您的共享存储,然后运行:

python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml \
  cluster.n_nodes=2 cluster.n_gpus_per_node=8 \
  cluster.fileroot=/path/to/nfs \
  scheduler.type=ray

如需全面的设置说明,请参阅 我们的快速入门指南

📚 示例

数学与推理

任务 描述 性能
数学 使用 GRPO、PPO、DAPO、REINFORCE、RLOO、LitePPO、DR-GRPO、GSPO 等方法进行 GSM8K 数学推理 -
多轮数学 跨轮次应用奖励折扣的多轮数学智能体 训练曲线
LoRA 数学 使用 LoRA(SGLang/vLLM 后端)进行参数高效数学训练 -
倒计时 带有自定义奖励的倒计时数字游戏 训练曲线

智能体强化学习

任务 描述 性能
通用智能体 适用于任何智能体框架的通用智能体训练 指南
Hermes 在线强化学习 在 AReaL 2.0 下使用 Hermes 智能体的端到端在线强化学习循环 指南
编码智能体强化学习 使用 AReaL-SWEAgent/Claude 代码智能体进行端到端编码智能体强化学习训练 指南
Tau2 客户服务 Tau2-Bench(零售、航空、电信)上的客户服务智能体 论文
搜索智能体 采用通义千问-深度求索工作流的端到端搜索智能体 训练曲线
工具集成推理 推理过程中的多轮工具调用(Python 执行器、计算器) 训练曲线
OpenAI 智能体集成 与 OpenAI 智能体 SDK 集成以实现智能体工作流 -
CAMEL-AI 集成 与 CAMEL-AI 框架集成以进行智能体强化学习 -

视觉语言模型

任务 描述 性能表现
VLM 使用 GRPO 进行 Geometry3K 和 CLEVR Count 70K 视觉推理 -
VLM on NPU 在华为 NPU 硬件上进行 VLM 训练 基准测试结果

对齐与基础设施

任务 描述 性能表现
RLHF 奖励建模 在 Anthropic HH-RLHF 上进行 Bradley-Terry 奖励建模 训练曲线
SkyPilot 部署 使用 SkyPilot 进行云部署(GCP、AWS、Kubernetes) 截图展示

🔧 支持矩阵

🧠 算法

所有强化学习算法均支持异步和同步版本,可通过设置 max_head_offpolicyness=0 实现。详见 异步强化学习指南

算法 文档说明 论文/博客 配置示例
GRPO 📖 文档 📄 论文 🔗 GSM8K 示例
GSPO 📖 文档 📄 论文 🔗 GSM8K 示例
PPO 📖 文档 📄 论文 🔗 GSM8K 示例
DAPO 📖 文档 📄 论文 🔗 GSM8K 示例
LitePPO 📖 文档 📄 论文 🔗 GSM8K 示例
Dr.GRPO 📖 文档 📄 论文 🔗 GSM8K 示例
REINFORCE++ - 📄 论文 🔗 GSM8K 示例
RLOO 📖 文档 📄 论文 🔗 GSM8K 示例
SAPO 📖 文档 📄 论文 🔗 GSM8K 示例
IcePop 📖 文档 📄 博客 🔗 GSM8K 示例
KPop 📖 文档 📄 博客 🔗 GSM8K 示例
M2PO 📖 文档 📄 论文 🔗 GSM8K 示例
DPO 📖 文档 📄 论文 🔗 HH-RLHF 示例
RLHF 奖励建模 - - 🔗 RLHF 示例
SFT - - 🔗 GSM8K 示例
知识蒸馏 📖 文档 📄 论文 🔗 GSM8K 示例

模型

模型系列 Megatron PyTorch FSDP PyTorch Archon 说明
Qwen2/3 -
Qwen3-MoE -
Qwen2.5-VL 视觉语言模型
Qwen3-VL 视觉语言模型
Gemma 3 视觉语言模型
其他 Hugging Face LLM 兼容性取决于 transformers 的版本

有关如何将新模型集成到 AReaL 中的信息,请查看 AI 编码助手指南Archon 参考文档

训练后端

后端 数据并行 (DP) 张量并行 (Tensor Parallel) 张量并行内的序列并行 (Sequence Parallel within TP) 上下文并行 (Context Parallel) 流水线并行 (Pipeline Parallel) 专家并行 (Expert Parallel) 一维序列打包 (1D Sequence Packing) LoRA
Megatron ✅ (ZeRO-1) ✅ (搭配 vLLM 推理后端)
PyTorch FSDP ✅ (FSDP2)
PyTorch Archon ✅ (FSDP2)

推理后端

后端 张量并行 上下文并行 流水线并行 数据并行注意力 专家并行
vLLM
SGLang

📖 资源

教程

代码详解

最佳实践

自定义

算法

参考

🤝 贡献指南

我们热烈欢迎社区的贡献!无论您是修复漏洞、添加功能、改进文档,还是帮助他人,您的贡献都非常宝贵。 请查看我们的 贡献指南 以获取详细信息。

# Fork and clone the repository
git clone https://github.com/YOUR-USERNAME/AReaL
cd AReaL

# Install uv and sync dependencies
pip install uv
# Install flash-attn pre-built wheel to avoid compiling from source
uv pip install "https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.7.16/flash_attn-2.8.3+cu128torch2.9-cp312-cp312-linux_x86_64.whl"
# Use `--extra cuda` on Linux with CUDA (installs training packages + SGLang)
uv sync --extra cuda --group dev
# For vLLM instead:
# cp pyproject.vllm.toml pyproject.toml && cp uv.vllm.lock uv.lock && uv sync --extra cuda --group dev
# Or without CUDA support
# uv sync --group dev

# Set up pre-commit hooks (formatting, linting, commit message checks)
pre-commit install --install-hooks

# Make changes
git checkout -b feat/gpt-o5
git add .
# `git commit` will automatically check your files and commit messages
git commit -m "feat: implement gpt-o5 training loop"
git push

🗺️ 未来路线图

AReaL 目前处于积极开发阶段,计划每周发布次要版本,每月发布主要版本。我们热烈欢迎社区参与和贡献。同时,我们也正在积极招聘实习生和全职员工,在美国和中国均有开放职位。

📢 社区

WeChat QR Code

我们热烈欢迎大家加入我们的社区!我们设有 微信群 用于实时讨论,并在 GitHub 讨论区 进行异步交流。

更多详情和会议资料,请查阅我们的 社区仓库

🙏 致谢

我们衷心感谢主要贡献者来自清华大学交叉信息研究院(IIIS)的 AReaL 团队以及蚂蚁集团。

我们还获得了以下团队(按字母顺序排列)的宝贵支持:

  • 蚂蚁集团数据智能实验室提供的数据支持

  • @HwVanICI 在 vLLM、LoRA、NPU 集成等方面的支持

  • 香港科技大学 Relaxed System Lab 在众多系统相关方面的无缝协作

  • SGLang 团队 对自定义权重更新功能的支持以及在 AReaL-lite 开发过程中的贡献

  • 蚂蚁集团超级计算技术(SCT)团队在大规模集群运维方面的专业知识

  • 特别感谢 @Lyken17 在整个 API 设计过程中提供的宝贵建议

我们也对社区的所有开创性工作深表感谢,特别是 OpenPsi 公司的 ReaLHF 项目以及其他优秀项目,包括但不限于 DeepScaleROpen-Reasoner-ZeroOpenRLHFVeRLSGLangQwQLight-R1DAPO

📜 许可证

本项目采用 Apache License 2.0 许可证。

📄 引用

@inproceedings{mei2025real,
  author       = {Mei, Zhiyu and Fu, Wei and Li, Kaiwei and Wang, Guangju and Zhang, Huanchen and Wu, Yi},
  title        = {ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation},
  booktitle    = {Proceedings of the Eighth Conference on Machine Learning and Systems,
                  MLSys 2025, Santa Clara, CA, USA, May 12-15, 2025},
  publisher    = {mlsys.org},
  year         = {2025},
}
@misc{fu2025areal,
      title={AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning},
      author={Wei Fu and Jiaxuan Gao and Xujie Shen and Chen Zhu and Zhiyu Mei and Chuyi He and Shusheng Xu and Guo Wei and Jun Mei and Jiashu Wang and Tongkai Yang and Binhang Yuan and Yi Wu},
      year={2025},
      eprint={2505.24298},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.24298},
}

项目介绍

分布式强化学习系统用于大规模语言模型推理【此简介由AI生成】

定制我的领域
355.71 K590访问 GitHub