Text Embeddings Inference

活跃
GitHub Rust Apache-2.0

简介

HuggingFace 开源的文本嵌入模型推理服务,使用 Rust 构建以实现高性能推理,支持多种嵌入模型,是构建 RAG 系统和向量检索管道的核心基础设施组件。

核心特性

  • 基于 Rust 的极速推理,无需模型图编译步骤
  • 支持 15+ 模型系列,包括 Qwen3、GTE、BERT、JinaBERT、ModernBERT
  • 基于 Token 的动态批处理,采用 Flash Attention 和 cuBLASLt 优化
  • 生产就绪,支持分布式追踪(OpenTelemetry)和 Prometheus 指标
  • Docker 镜像启动快速,支持真正的无服务器部署
  • 支持 Safetensors 和 ONNX 权重加载,Mac 上支持 Metal 加速

适用场景

💡 为 RAG 管道构建高吞吐量的嵌入服务
💡 大规模部署向量检索系统,实现低延迟响应
💡 在生产环境中部署重排序和序列分类模型
💡 在 GPU 和 Apple Silicon 上本地运行嵌入推理
💡 将嵌入生成集成到实时搜索应用中

快速开始

```bash
docker run --gpus all -p 8080:80 \
  -v $PWD/data:/data \
  ghcr.io/huggingface/text-embeddings-inference:latest \
  --model-id Qwen/Qwen3-Embedding-0.6B

curl http://localhost:8080/embed \
  -X POST \
  -H 'Content-Type: application/json' \
  -d '{"inputs": "什么是深度学习?"}'
```

相关项目