Text Embeddings Inference
活跃简介
HuggingFace 开源的文本嵌入模型推理服务,使用 Rust 构建以实现高性能推理,支持多种嵌入模型,是构建 RAG 系统和向量检索管道的核心基础设施组件。
核心特性
- 基于 Rust 的极速推理,无需模型图编译步骤
- 支持 15+ 模型系列,包括 Qwen3、GTE、BERT、JinaBERT、ModernBERT
- 基于 Token 的动态批处理,采用 Flash Attention 和 cuBLASLt 优化
- 生产就绪,支持分布式追踪(OpenTelemetry)和 Prometheus 指标
- Docker 镜像启动快速,支持真正的无服务器部署
- 支持 Safetensors 和 ONNX 权重加载,Mac 上支持 Metal 加速
适用场景
💡 为 RAG 管道构建高吞吐量的嵌入服务
💡 大规模部署向量检索系统,实现低延迟响应
💡 在生产环境中部署重排序和序列分类模型
💡 在 GPU 和 Apple Silicon 上本地运行嵌入推理
💡 将嵌入生成集成到实时搜索应用中
分类
快速开始
```bash
docker run --gpus all -p 8080:80 \
-v $PWD/data:/data \
ghcr.io/huggingface/text-embeddings-inference:latest \
--model-id Qwen/Qwen3-Embedding-0.6B
curl http://localhost:8080/embed \
-X POST \
-H 'Content-Type: application/json' \
-d '{"inputs": "什么是深度学习?"}'
```