EmbedAnything

活跃
GitHub Rust Apache-2.0

简介

EmbedAnything 是一个用 Rust 构建的高性能嵌入推理和索引框架,提供模块化、内存安全的 RAG 数据摄取和索引管道,支持本地和云端部署。

核心特性

  • Rust 构建的高性能嵌入框架,无需 PyTorch 依赖,内存占用极低
  • 向量流式处理:文件预处理与模型推理分离,大幅降低管线延迟
  • 多模态支持:文本(PDF/TXT/MD)、图片(JPG)、音频(WAV)
  • 多种嵌入类型:Dense、Sparse、ONNX、Model2Vec、Late-interaction
  • 模块化适配器架构,一行代码即可切换不同向量数据库
  • GPU 加速支持,可直接导入 AWS S3 桶文件

适用场景

💡 大规模文档语义搜索和 RAG 系统的嵌入管线
💡 多模态内容(文本+图片+音频)的统一向量化处理
💡 生产环境高性能嵌入推理,替代 PyTorch 方案降低部署成本
💡 结合 Weaviate、Milvus 等向量数据库构建检索系统
💡 需要 GPU 加速的海量数据嵌入与索引场景

快速开始

1. 安装:pip install embed-anything
2. 选择嵌入模型(HuggingFace / ONNX)
3. 配置 TextEmbedConfig(chunk_size、batch_size)
4. 调用 embed_file() 嵌入文档并流式写入向量数据库

相关项目

相关文章