简介

Aura(Agentic Ultra-fast Reinforcement Architecture) 是一个面向通用模型的训推调一体化 Agent 强化学习框架,旨在通过统一的训练、推理与优化基础设施,帮助大模型从通用语言能力进一步演化为具备自主规划、工具调用、环境交互、任务执行与长程决策能力的智能 Agent。 Aura 以任务轨迹、环境反馈和奖励信号为核心驱动,通过强化学习等后训练技术,持续挖掘和提升基础模型在复杂任务场景下的推理与决策能力。模型能够在与环境不断交互的过程中学习更优策略,实现从“生成式模型”向“行动型智能体”的能力跃迁。 Aura 通过统一抽象接口兼容多种训练引擎、推理引擎与 Agent 框架,支持用户灵活接入自定义模型、任务环境以及工具链,降低 Agent 开发和优化过程中的工程复杂度。开发者可以基于 Aura 快速构建面向不同业务场景的智能 Agent,并结合领域数据、反馈信号和实际运行结果持续迭代模型能力。同时,Aura 支持多样化的强化学习算法、奖励机制和优化策略,为不同类型任务提供灵活的训练与调优能力,帮助模型在真实环境中不断学习、适应和进化。

使用导引

如果第一次使用本软件,可以从快速入门中的样例开始上手,并确保按照其中步骤准备好相关环境和软件包。

如果对于相关流程已比较熟悉,可以直接跳转到Python接口说明获取需要的函数接口,加速数据处理流程。

软件架构

Aura 软件架构如图 1所示。

图1 Aura 软件架构

表1 架构图模块介绍

模块 说明
第三方 Agent 引擎 支持多种Agent引擎,包括rLLM
Serve (训推通信) 支持训练侧向推理侧和agent侧的http通信
Rollouter (轨迹生成) 负责Agent轨迹生成,包含轨迹管理和自定义轨迹生成接口
Scheduler 推理请求调度器,支持负载均衡
Memory 轨迹数据持久化存储,使用Episode格式
Trainer (训练任务编排) 训练任务管理和编排,通过data_manager协调训练和推理的数据流动。
推理引擎 支持第三方推理引擎,包括vllm-ascend
训练引擎 支持第三方训练引擎,包括verl
RAY 分布式资源管理 基于Ray的分布式资源管理,支持共卡/分离部署

支持特性