LanceDB

活跃
GitHub Rust Apache-2.0

简介

开源的多模态嵌入式向量检索库,支持零服务器部署,提供 Lance 列式格式实现高效向量搜索和过滤,适用于 AI Agent 长期记忆与 RAG 场景。

核心特性

  • 毫秒级向量搜索,支持数十亿向量的高性能索引和检索
  • 综合搜索能力:向量相似度搜索、全文搜索和 SQL 查询三合一
  • 多模态支持:存储和查询文本、图像、视频、点云等多种数据类型
  • 零拷贝、自动版本管理,无需额外基础设施即可管理数据版本
  • GPU 加速向量索引构建,大幅提升大规模数据处理性能
  • 丰富的生态集成:LangChain、LlamaIndex、Apache Arrow、Pandas、DuckDB 等

适用场景

💡 为 AI Agent 构建长期记忆存储,支持高效的语义检索和上下文召回
💡 搭建 RAG(检索增强生成)应用,实现多模态知识库问答
💡 构建推荐系统,利用向量相似度进行个性化内容匹配
💡 处理大规模多模态数据集,支持跨模态搜索和分析
💡 作为嵌入式数据库集成到 Python/TypeScript/Rust 应用中,零服务器部署

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(11.2k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 3 年)

⚠️ 不足

  • Issue 积压较多(618 个 open issues)

快速开始

pip install lancedb 安装 Python SDK。使用 import lancedb; db = lancedb.connect('~/.lancedb') 连接本地数据库,table = db.create_table('my_table', data) 创建表并插入数据,results = table.search(query).limit(10).to_pandas() 执行向量搜索。详见 docs.lancedb.com/quickstart。

相关项目

pgvector

22.6k · C
活跃 A+

PostgreSQL 的开源向量相似性搜索扩展,为关系型数据库原生支持向量存储与 ANN 检索,是构建 AI Agent 记忆和 RAG 系统的基础设施组件。

vector-databasepostgresqlsimilarity-search +2
  • · PostgreSQL 原生扩展 — 在关系型数据库中直接存储和查询向量,无需额外基础设施
  • · 多种距离度量 — 支持 L2、余弦距离、内积、L1、Hamming 和 Jaccard 距离
  • · 精确和近似搜索 — 支持 HNSW 和 IVFFlat 索引实现 ANN 近似最近邻搜索

HelixDB

5.7k · Rust
活跃 A+

使用 Rust 从零构建的开源图向量数据库,融合图数据库与向量检索能力,为 AI Agent 提供同时支持知识图谱和语义搜索的统一存储方案。

graph-databasevector-databaserag +2
  • · 图向量数据库,在一个系统中结合图遍历和向量相似性搜索
  • · 基于 Rust 的引擎,高性能且资源消耗低
  • · TypeScript 和 Rust SDK,使用声明式查询 DSL 构建查询

Embedchain

63.4k · Python
活跃 A+

Embedchain 是一个面向 AI Agent 的通用记忆层,支持将多种数据源快速接入 LLM,构建具有上下文记忆的 AI 应用。

memoryragembeddings +2
  • · 通用记忆层 — 将多种数据源(网页、PDF、YouTube、Notion 等)快速接入 LLM 构建上下文
  • · 向量化存储 — 自动将数据分块、嵌入并存入向量数据库,支持语义检索
  • · 多 LLM 后端支持 — 兼容 OpenAI、Cohere、Ollama 等多种 LLM 和嵌入模型

HyperDB

1.4k · Python
不活跃 C

HyperDB 是一个面向 LLM Agent 设计的超快速本地向量数据库,提供轻量级的向量存储和相似度搜索能力,适合嵌入到 Agent 应用中作为即时记忆和知识检索组件。

vector-databasepythonagent +2
  • · 超快速本地向量数据库,专为 LLM Agent 设计
  • · C++ 高性能后端,通过 MKL BLAS 实现硬件加速运算
  • · 简洁统一的接口,兼容所有主流大语言模型 Agent 框架