MLflow

活跃
GitHub Python Apache-2.0

简介

MLflow 是开源 AI 工程平台,为 Agent 和 LLM 应用提供调试、评估、监控和优化能力,支持模型与数据访问管理。

核心特性

  • LLM可观测性 — 基于OpenTelemetry捕获Agent和LLM应用的完整调用链
  • 系统评估 — 50+内置指标和LLM Judge,自动评估模型输出质量
  • Prompt注册与优化 — 版本管理Prompt,支持自动优化算法改进性能
  • AI网关 — 统一API网关管理多LLM提供商,支持限流、降级和A/B测试
  • 实验跟踪 — 记录模型参数、指标和评估结果,跨实验对比
  • 模型注册与部署 — 协作管理ML模型全生命周期,支持Docker/K8s/AWS部署

适用场景

💡 监控生产环境中LLM应用的延迟、成本和质量指标
💡 在部署前系统评估Prompt版本的效果并发现回归
💡 通过AI网关统一管理OpenAI、Anthropic等多个LLM提供商的访问
💡 跟踪ML实验迭代,对比不同模型参数和训练数据的效果
💡 将训练好的模型部署到云端或Kubernetes集群进行推理服务

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(27.5k stars)
  • 开源许可证友好(Apache-2.0)

⚠️ 不足

  • Issue 积压较多(2.0k 个 open issues)

快速开始

pip install mlflow
uvx mlflow server

# 在Python代码中:
import mlflow
mlflow.set_tracking_uri("http://localhost:5000")
mlflow.openai.autolog()

from openai import OpenAI
client = OpenAI()
response = client.responses.create(
    model="gpt-4o-mini",
    input="Hello!",
)
print(response)

相关项目

SwanLab

4.2k · Python
活跃 A+

开源的现代设计 AI 训练追踪与可视化工具,支持 PyTorch、Transformers 等主流框架,帮助开发者监控和评估 AI Agent 的训练过程。

pythonobservabilityevaluation +2
  • · 50+ 主流框架无缝集成:原生支持 PyTorch、Transformers、HuggingFace Accelerate、PaddleNLP、NVIDIA NeMo RL 等框架,两行代码接入训练流程
  • · 丰富的可视化图表系统:支持折线图、标量图、PR 曲线、ROC 曲线、混淆矩阵、3D 点云、分子结构、ECharts 自定义图表等 20+ 图表类型
  • · 多维度硬件监控:实时监控 GPU(NVIDIA/AMD ROCm/海光 DCU/寒武纪 MLU/摩尔线程/沐曦/天数智芯/昆仑芯)、磁盘利用率、网络流量等硬件指标

OpenInference

1.1k · Python
活跃 A

OpenInference 是一个基于 OpenTelemetry 的 AI 可观测性检测规范和工具包,为 LLM 应用的推理过程提供标准化追踪、指标采集和 Span 定义,帮助开发者监控和调试 AI Agent 系统。

observabilitypythonllm +2
  • · 基于 OpenTelemetry 的检测规范,用于追踪 LLM 推理和应用上下文
  • · 为 15+ ML 框架提供检测库:OpenAI、LlamaIndex、LangChain、DSPy、CrewAI、Agno 等
  • · 语义约定,为 LLM 应用提供标准化的 Span 属性