可用于大语言模型的强化学习训练,支持多种RL算法如PPO、GRPO等,能无缝集成现有LLM框架(FSDP、Megatron-LM等),具备灵活设备映射和高效吞吐量,兼容主流模型并支持多模态与工具调用。【此简介由AI生成】