FlagEmbedding

活跃
GitHub Python MIT

简介

智源研究院开源的 BGE 系列嵌入模型与检索工具,提供业界领先的中英文文本嵌入与重排序模型,广泛应用于 RAG 系统和 AI Agent 检索链路。

核心特性

  • 业界领先的多语言嵌入模型 BGE-M3,支持 100+ 语言的稠密、词法和多向量检索
  • BGE-VL 多模态嵌入模型,支持文本到图像、图像到文本及跨模态视觉搜索
  • 轻量级重排序器,支持 token 压缩和分层轻量化操作,高效节省资源
  • 具备上下文学习能力的嵌入模型 bge-en-icl,可编码更丰富的语义查询
  • 覆盖嵌入、检索、重排序和长上下文 LLM 扩展的完整工具包
  • MIT 许可证完全开源,支持学术和商业使用

适用场景

💡 构建 RAG 管道,为企业知识库提供高质量文本检索
💡 支持 100+ 语言的多语言语义搜索
💡 使用 BGE-VL 进行图像-文本跨模态视觉搜索应用
💡 通过 Activation-Beacon 上下文扩展增强长上下文 LLM 能力
💡 搜索引擎结果重排序,提升搜索相关性和精确度

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(12.1k stars)
  • 开源许可证友好(MIT)
  • 项目有一定历史沉淀(已维护 3 年)

⚠️ 不足

  • Issue 积压较多(907 个 open issues)

快速开始

pip install FlagEmbedding && python -c "from FlagEmbedding import BGEM3FlagModel; model = BGEM3FlagModel('BAAI/bge-m3'); output = model.encode(['Hello world']); print(output['dense_vecs'].shape)"

相关项目

LanceDB

11.2k · Rust
活跃 A

开源的多模态嵌入式向量检索库,支持零服务器部署,提供 Lance 列式格式实现高效向量搜索和过滤,适用于 AI Agent 长期记忆与 RAG 场景。

vector-databaseembeddingsretrieval +2
  • · 毫秒级向量搜索,支持数十亿向量的高性能索引和检索
  • · 综合搜索能力:向量相似度搜索、全文搜索和 SQL 查询三合一
  • · 多模态支持:存储和查询文本、图像、视频、点云等多种数据类型

LightRAG

38.9k · Python
活跃 A+

LightRAG 是一个简洁高效的 RAG 框架,使用图结构增强检索效果,发表于 EMNLP 2025。

raggraphretrieval +2
  • · 图结构增强检索 — 使用知识图谱实体和关系进行双层检索(local/global),比传统向量检索更精准
  • · 四种文本分块策略 — 支持 Fixed、Recursive、Vector、Paragraph 分块,适应不同文档类型
  • · 多后端存储支持 — 兼容 Neo4j、PostgreSQL、MongoDB、OpenSearch、JSON KV Store 等多种存储方案

RAG Techniques

29.1k · Jupyter Notebook
活跃 A+

NirDiamant 的 RAG_Techniques 仓库系统收录并演示了当下主流的检索增强生成(RAG)进阶技术与工程实践。

ragretrievaltechniques +2
  • · 系统化分类 — 把 RAG 技术按简单 / 高级 / 模块化等维度组织,便于按需学习
  • · 可运行 Notebook — 每个技术都附 Jupyter Notebook 与最小可运行代码
  • · 评测与对比 — 同时提供检索质量、答案质量的评测脚本与可视化

相关文章