Chroma

活跃
GitHub Rust Apache-2.0

简介

Chroma 是一个开源的 AI 原生嵌入式数据库,专为构建 LLM 应用而设计。提供简单的 API 来存储嵌入向量、执行相似度搜索,是构建 RAG 应用的理想选择。

核心特性

  • 极简核心 API — 仅 4 个函数:create_collection、add、query、get,5 分钟上手
  • 自动嵌入处理 — add 时自动执行 tokenization、embedding 和索引,无需手动处理
  • 元数据过滤 — 支持按 metadata 字段精确过滤和文档内容全文搜索
  • 混合搜索 — 支持向量相似度搜索和全文检索的混合查询模式
  • 多语言客户端 — Python 和 JavaScript/TypeScript 客户端,pip/npm 一键安装
  • 持久化存储 — 支持内存模式快速原型和持久化模式部署,chroma run 启动服务端

适用场景

💡 RAG 应用后端 — 为 LLM 提供向量检索能力,实现基于私有数据的问答
💡 语义搜索 — 对文档、图片描述等非结构化数据进行相似度检索
💡 推荐系统 — 基于用户行为 embedding 实现个性化推荐
💡 知识图谱补充 — 存储实体 embedding,支持语义级别的知识关联查询
💡 快速原型验证 — 用内存模式快速验证 AI 应用的检索效果

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(29.1k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 3 年)

快速开始

pip install chromadb

import chromadb

# 内存模式快速启动
client = chromadb.Client()
collection = client.create_collection('my-docs')

# 添加文档(自动处理嵌入)
collection.add(
    documents=['这是文档一', '这是文档二'],
    metadatas=[{'source': 'notion'}, {'source': 'google-docs'}],
    ids=['doc1', 'doc2']
)

# 查询最相似的 2 个结果
results = collection.query(
    query_texts=['查询文档'],
    n_results=2
)
print(results)

相关项目

RAGatouille

4.0k · Python
不活跃 C

轻松使用和训练最先进的后期交互检索方法(ColBERT),模块化设计,可将 ColBERT 模型集成到任何 RAG 管道中,显著提升检索精度。

ragpythonembedding +1
  • · ColBERT 后期交互检索:将先进的 ColBERT 模型封装为简单 API,无需深入了解检索论文即可在 RAG 管道中使用后期交互检索方法
  • · 端到端训练与微调:内置 RAGTrainer 和 TrainingDataProcessor,自动处理数据去重、正负样本配对和硬负例挖掘,支持从零训练或微调预训练模型
  • · 模块化可组合架构:DataProcessor、NegativeMiner 等组件可独立使用,也支持自定义 NegativeMiner 接入训练管道

DeepLake

9.2k · C++
正常 A

DeepLake 是面向 AI Agent 的数据运行时,提供无服务器 Postgres 和多模态数据湖,支持可扩展的数据检索与训练。专为 AI 智能体场景设计,统一向量存储、数据集管理和流式加载。

vector-databasedata-processingpython +3
  • · 面向 AI Agent 的数据运行时,提供无服务器 Postgres 和多模态数据湖架构
  • · 统一向量存储、数据集管理和流式加载,专为 LLM 应用和深度学习训练设计
  • · 原生多云支持,一个 API 即可操作 S3、GCP、Azure 和本地存储

zvec

15.4k · C++
活跃 A+

阿里巴巴开源的轻量级高性能进程内向量数据库,采用 C++ 核心实现,支持 Node.js 和 Python 绑定,适用于 RAG、Agent 记忆和向量检索场景。

vector-databaseragembedding +3
  • · 极速进程内向量数据库,毫秒级搜索数十亿向量
  • · 支持稠密和稀疏向量,单次调用原生支持多向量查询
  • · 混合搜索结合语义相似度和结构化过滤器,实现精准检索

ColiVara

1.5k · Python
正常 B

ColiVara 是一套基于视觉嵌入的文档检索服务,无需 OCR 或文本提取,直接通过视觉模型对文档进行存储、搜索和检索,在文本和视觉文档上均达到领先的检索性能。

ragvector-databaseembedding +2
  • · 基于视觉的检索——使用 ColPali 视觉语言模型生成文档嵌入,而非文本分块或 OCR
  • · 支持 100+ 格式——处理 PDF、DOCX、PPTX 及 100+ 其他文件格式,自动转换为图像
  • · 元数据过滤——按集合和文档元数据字段(作者、年份、标签等)过滤搜索

相关文章