verl:基于大语言模型生态的强化学习训练库项目

可用于大语言模型的强化学习训练,支持多种RL算法如PPO、GRPO等,能无缝集成现有LLM框架(FSDP、Megatron-LM等),具备灵活设备映射和高效吞吐量,兼容主流模型并支持多模态与工具调用。【此简介由AI生成】

分支1Tags0

项目介绍

可用于大语言模型的强化学习训练,支持多种RL算法如PPO、GRPO等,能无缝集成现有LLM框架(FSDP、Megatron-LM等),具备灵活设备映射和高效吞吐量,兼容主流模型并支持多模态与工具调用。【此简介由AI生成】

定制我的领域