RouteLLM
不活跃简介
RouteLLM 是一个用于 LLM 路由服务的评估框架,通过智能请求路由在降低推理成本的同时保持输出质量,支持多种路由策略的对比评测。
核心特性
- 直接替换 OpenAI 客户端,自动在强模型和弱模型之间路由查询
- 预训练路由器可降低高达 85% 的成本,同时保持 95% 的 GPT-4 质量
- 多种路由策略(矩阵分解、交换排名、句子 BERT)并支持基准测试对比
- 兼容 OpenAI 的服务器模式,可与任何现有 LLM 客户端集成
- 可配置的成本阈值,实现成本与质量的精细权衡控制
- 通过 LiteLLM 支持多种模型 — Anthropic、Gemini、Bedrock、Together、Ollama 等
适用场景
💡 在生产环境中通过将简单查询路由到低成本模型来降低 LLM 推理成本
💡 对不同 LLM 路由策略进行 A/B 测试和对比评估
💡 构建成本感知的 AI 应用,根据查询复杂度动态选择模型层级
💡 部署兼容 OpenAI 的代理,智能平衡响应质量和开支
💡 跨标准化基准研究和评估 LLM 路由算法
分类
快速开始
pip install 'routellm[serve,eval]' → 设置 OPENAI_API_KEY 和提供商密钥 → 使用 routers=['mf'] 初始化 Controller → 设置 strong_model(如 gpt-4)和 weak_model(如 Mixtral)→ 校准阈值以达到目标成本比例 → 在补全请求中使用 model='router-mf-{threshold}' → 可选:启动兼容 OpenAI 的服务器供任意客户端使用