ART

活跃
GitHub Python Apache-2.0

简介

ART(Agent Reinforcement Trainer)是一个使用 GRPO 算法训练多步 Agent 的强化学习框架,支持为 Qwen、Llama 等模型进行在职训练以完成真实世界任务。

核心特性

  • 基于 GRPO 的强化学习,用于在真实世界任务上训练多步 Agent
  • W&B Training 无服务器 RL,通过共享推理集群降低 40% 成本并提速 28%
  • 预置笔记本示例,涵盖邮件搜索、2048、井字棋、Codenames 和 MCP 工具掌握
  • 支持 SFT 蒸馏,将大模型能力迁移到小模型
  • 检查点到推理管道,每个检查点通过 W&B Inference 即时可用
  • 支持 Qwen、Llama 等开源模型的微调和强化学习训练

适用场景

💡 训练 Agent 执行邮件搜索和游戏等复杂多步任务
💡 将前沿模型的能力蒸馏到更小、更易部署的模型
💡 通过在线强化学习提升 Agent 可靠性
💡 利用无服务器 RL 基础设施快速迭代 Agent 行为

快速开始

通过 pip 安装:`pip install openpipe-art`。尝试 Colab 笔记本获取实践示例。使用 W&B 无服务器 RL 时,设置 W&B API 密钥并通过 `ServerlessBackend` 注册 `TrainableModel`。使用 Python 定义奖励函数运行训练。

相关项目