ART
活跃简介
ART(Agent Reinforcement Trainer)是一个使用 GRPO 算法训练多步 Agent 的强化学习框架,支持为 Qwen、Llama 等模型进行在职训练以完成真实世界任务。
核心特性
- 基于 GRPO 的强化学习,用于在真实世界任务上训练多步 Agent
- W&B Training 无服务器 RL,通过共享推理集群降低 40% 成本并提速 28%
- 预置笔记本示例,涵盖邮件搜索、2048、井字棋、Codenames 和 MCP 工具掌握
- 支持 SFT 蒸馏,将大模型能力迁移到小模型
- 检查点到推理管道,每个检查点通过 W&B Inference 即时可用
- 支持 Qwen、Llama 等开源模型的微调和强化学习训练
适用场景
💡 训练 Agent 执行邮件搜索和游戏等复杂多步任务
💡 将前沿模型的能力蒸馏到更小、更易部署的模型
💡 通过在线强化学习提升 Agent 可靠性
💡 利用无服务器 RL 基础设施快速迭代 Agent 行为
分类
快速开始
通过 pip 安装:`pip install openpipe-art`。尝试 Colab 笔记本获取实践示例。使用 W&B 无服务器 RL 时,设置 W&B API 密钥并通过 `ServerlessBackend` 注册 `TrainableModel`。使用 Python 定义奖励函数运行训练。