WrenAI

活跃
GitHub Python NOASSERTION

简介

WrenAI 是一个开源的 Text-to-SQL 和 Text-to-Chart GenBI Agent,内置语义层,支持用自然语言查询数据库,自动生成 SQL 语句和可视化图表,兼容 PostgreSQL、BigQuery、Snowflake 等十余种数据源。

核心特性

  • 开源上下文层,为 AI Agent 提供业务语义、示例和治理能力
  • Agent 驱动设计,CLI 内置工作流指南按需加载
  • 建模定义语言(MDL)支持模型、关系、立方体、指标和行级/列级访问控制
  • 支持 22+ 数据源,基于 Apache DataFusion 引擎
  • Agent SDK 集成 LangChain/LangGraph 和 Pydantic AI
  • 可审查、可复现的上下文,所有定义支持 Git 版本管理

适用场景

💡 自然语言查询数据库生成 SQL 和可视化图表
💡 为 AI Agent 构建业务数据语义层
💡 多数据源统一查询和 BI 分析
💡 Agent 驱动的数据探索和报告生成
💡 企业数据治理和访问控制

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(17.5k stars)
  • 项目有一定历史沉淀(已维护 2 年)

⚠️ 不足

  • 缺少明确的开源许可证

快速开始

```bash
pip install wrenai
npx skills add Canner/WrenAI
```

安装 CLI 和发现存根后,在项目目录中告诉 Agent:「用 Wren 设置我的数据库」。Agent 会运行 `wren skills get onboarding`,按步骤完成连接配置、项目搭建和首次查询。支持 `jaffle_shop` 示例数据集快速体验。

相关项目

LangExtract

38.5k · Python
活跃 A+

Google 开源的 Python 库,用于利用 LLM 从非结构化文本中精确提取结构化信息,支持源文本标注和交互式可视化,适用于数据标注和知识抽取场景。

data-processingllmpython +2
  • · 精确源文本锚定 — 每条提取结果映射到原文精确位置,支持视觉高亮追溯验证
  • · 受控结构化输出 — 基于 few-shot 示例强制一致输出 Schema,利用 Gemini 受控生成保证结果鲁棒性
  • · 长文档优化策略 — 通过文本分块、并行处理和多轮扫描克服大文档「大海捞针」问题,提升召回率

Crawlee

25.7k · TypeScript
活跃 A+

Crawlee 是一个面向 Node.js 的 Web 爬取和浏览器自动化库,支持 Puppeteer、Playwright、Cheerio 等多种引擎,专为构建可靠的爬虫而设计,可提取 HTML、PDF 等数据用于 AI、LLM 和 RAG 应用。

typescriptjavascriptdata-processing +3
  • · 多引擎统一接口 — 同一 API 支持 Puppeteer、Playwright、Cheerio 和原始 HTTP
  • · 反检测伪装 — 默认配置即可模拟人类行为规避主流反爬机制
  • · 代理轮换与会话管理 — 内置代理轮换、指纹生成和会话持久化

Docstrange

1.5k · Python
不活跃 B

通用文档格式转换工具,支持从 PDF、图片、Word、PPT 等提取数据并转换为 Markdown、JSON、CSV 等多种格式。

pythonragtools +2
  • · 多格式转换——将 PDF、DOCX、PPTX、XLSX、图片和 URL 转换为 Markdown、JSON、CSV 和 HTML
  • · 7B 参数模型——升级的核心模型,显著提高准确性和对复杂文档的理解能力
  • · 高级 OCR 管道——从扫描文档、手机照片和收据中高精度提取文本