FlagEmbedding
活跃简介
智源研究院开源的 BGE 系列嵌入模型与检索工具,提供业界领先的中英文文本嵌入与重排序模型,广泛应用于 RAG 系统和 AI Agent 检索链路。
核心特性
- 业界领先的多语言嵌入模型 BGE-M3,支持 100+ 语言的稠密、词法和多向量检索
- BGE-VL 多模态嵌入模型,支持文本到图像、图像到文本及跨模态视觉搜索
- 轻量级重排序器,支持 token 压缩和分层轻量化操作,高效节省资源
- 具备上下文学习能力的嵌入模型 bge-en-icl,可编码更丰富的语义查询
- 覆盖嵌入、检索、重排序和长上下文 LLM 扩展的完整工具包
- MIT 许可证完全开源,支持学术和商业使用
适用场景
💡 构建 RAG 管道,为企业知识库提供高质量文本检索
💡 支持 100+ 语言的多语言语义搜索
💡 使用 BGE-VL 进行图像-文本跨模态视觉搜索应用
💡 通过 Activation-Beacon 上下文扩展增强长上下文 LLM 能力
💡 搜索引擎结果重排序,提升搜索相关性和精确度
优势与不足
✅ 优势
- • 活跃维护,近期持续更新
- • 社区热度高(12.1k stars)
- • 开源许可证友好(MIT)
- • 项目有一定历史沉淀(已维护 3 年)
⚠️ 不足
- • Issue 积压较多(907 个 open issues)
分类
快速开始
pip install FlagEmbedding && python -c "from FlagEmbedding import BGEM3FlagModel; model = BGEM3FlagModel('BAAI/bge-m3'); output = model.encode(['Hello world']); print(output['dense_vecs'].shape)"