OpenRLHF
活跃简介
OpenRLHF 是一个高性能的 Agent 强化学习框架,基于 Ray 和 vLLM 提供 PPO、DAPO、REINFORCE++ 等算法,支持 Agent 和 VLM 的大规模训练。
核心特性
- 首个基于 Ray + vLLM 分布式架构的生产级开源 RLHF 框架
- 支持 PPO、DAPO、REINFORCE++、GRPO 和 RLOO 强化学习算法
- 混合引擎调度,所有模型共享 GPU 以最小化空闲时间
- 支持 VLM(视觉语言模型)RLHF,可训练带图像输入的模型
- 多轮 Agent RL,支持复杂环境交互和自定义奖励函数
- 集成 DeepSpeed ZeRO-3,支持 70B+ 参数模型训练
适用场景
💡 使用 RLHF 训练大语言模型进行对齐和安全优化
💡 使用 REINFORCE++ 和 GRPO 算法微调推理模型
💡 训练视觉语言模型进行多轮图像交互
💡 为领域特定 RL 训练构建自定义 Agent 奖励函数
优势与不足
✅ 优势
- • 活跃维护,近期持续更新
- • 社区热度高(9.9k stars)
- • 开源许可证友好(Apache-2.0)
- • 项目有一定历史沉淀(已维护 3 年)
分类
快速开始
通过 pip 安装:`pip install openrlhf`。需要 Ray 和 vLLM。使用 `ray_start.sh` 和示例脚本运行 SFT 训练。Agent RL:定义自定义奖励函数并使用 `--train.agent_func_path`。查看 examples/scripts/ 获取即用的训练配置。