简介
Aura(Agentic Ultra-fast Reinforcement Architecture) 是一个面向通用模型的训推调一体化 Agent 强化学习框架,旨在通过统一的训练、推理与优化基础设施,帮助大模型从通用语言能力进一步演化为具备自主规划、工具调用、环境交互、任务执行与长程决策能力的智能 Agent。 Aura 以任务轨迹、环境反馈和奖励信号为核心驱动,通过强化学习等后训练技术,持续挖掘和提升基础模型在复杂任务场景下的推理与决策能力。模型能够在与环境不断交互的过程中学习更优策略,实现从“生成式模型”向“行动型智能体”的能力跃迁。 Aura 通过统一抽象接口兼容多种训练引擎、推理引擎与 Agent 框架,支持用户灵活接入自定义模型、任务环境以及工具链,降低 Agent 开发和优化过程中的工程复杂度。开发者可以基于 Aura 快速构建面向不同业务场景的智能 Agent,并结合领域数据、反馈信号和实际运行结果持续迭代模型能力。同时,Aura 支持多样化的强化学习算法、奖励机制和优化策略,为不同类型任务提供灵活的训练与调优能力,帮助模型在真实环境中不断学习、适应和进化。
如果第一次使用本软件,可以从快速入门中的样例开始上手,并确保按照其中步骤准备好相关环境和软件包。
如果对于相关流程已比较熟悉,可以直接跳转到Python接口说明获取需要的函数接口,加速数据处理流程。
软件架构
Aura 软件架构如图 1所示。
图1 Aura 软件架构

表1 架构图模块介绍
| 模块 | 说明 |
|---|---|
| 第三方 Agent 引擎 | 支持多种Agent引擎,包括rLLM |
| Serve (训推通信) | 支持训练侧向推理侧和agent侧的http通信 |
| Rollouter (轨迹生成) | 负责Agent轨迹生成,包含轨迹管理和自定义轨迹生成接口 |
| Scheduler | 推理请求调度器,支持负载均衡 |
| Memory | 轨迹数据持久化存储,使用Episode格式 |
| Trainer (训练任务编排) | 训练任务管理和编排,通过data_manager协调训练和推理的数据流动。 |
| 推理引擎 | 支持第三方推理引擎,包括vllm-ascend |
| 训练引擎 | 支持第三方训练引擎,包括verl |
| RAY 分布式资源管理 | 基于Ray的分布式资源管理,支持共卡/分离部署 |
支持特性
- 训推共卡使用指南(On-Policy 策略):训练与推理在同一组卡上通过时分复用协同运行
- 训推分离使用指南(One-Step-Off 策略):训练与推理在不同节点上并行执行
- 自定义 Agent 接入指南:将自定义 agent 接入 Aura 训练框架