Easy Dataset

不活跃
GitHub JavaScript NOASSERTION

简介

easy-dataset 是一个为 LLM 微调与 Agent 训练快速构造数据集的工具,支持自动标注、采样与导出主流格式。

核心特性

  • 一键生成 — 输入原始文本自动产出 QA / SFT 数据集
  • LLM 标注 — 用主流 LLM 完成高质量标注
  • 多格式导出 — 支持 Alpaca、ShareGPT、JSONL、Parquet
  • 可视化校对 — 校对界面方便人工抽检与修改
  • 难度分层 — 按难度自动分层,便于课程式训练
  • 可扩展 — 用户可加入自定义 prompt 与过滤规则

适用场景

💡 为特定领域 LLM 微调快速构造数据集
💡 为 Agent 任务准备多步骤训练样本
💡 用人工校对界面降低标注工作量
💡 把现有文档一键转化为训练数据集

优势与不足

优势

  • 社区热度高(14.9k stars)
  • Issue 响应及时,积压少

⚠️ 不足

  • 缺少明确的开源许可证

快速开始

npm install -g @easy-dataset/cli
dataset init my-data
dataset generate --input ./docs --format alpaca

相关项目

WrenAI

17.5k · Python
活跃 A

WrenAI 是一个开源的 Text-to-SQL 和 Text-to-Chart GenBI Agent,内置语义层,支持用自然语言查询数据库,自动生成 SQL 语句和可视化图表,兼容 PostgreSQL、BigQuery、Snowflake 等十余种数据源。

llmtypescriptagent +2
  • · 开源上下文层,为 AI Agent 提供业务语义、示例和治理能力
  • · Agent 驱动设计,CLI 内置工作流指南按需加载
  • · 建模定义语言(MDL)支持模型、关系、立方体、指标和行级/列级访问控制

LangExtract

38.5k · Python
活跃 A+

Google 开源的 Python 库,用于利用 LLM 从非结构化文本中精确提取结构化信息,支持源文本标注和交互式可视化,适用于数据标注和知识抽取场景。

data-processingllmpython +2
  • · 精确源文本锚定 — 每条提取结果映射到原文精确位置,支持视觉高亮追溯验证
  • · 受控结构化输出 — 基于 few-shot 示例强制一致输出 Schema,利用 Gemini 受控生成保证结果鲁棒性
  • · 长文档优化策略 — 通过文本分块、并行处理和多轮扫描克服大文档「大海捞针」问题,提升召回率

AI Engineering Hub

37.3k · Jupyter Notebook
活跃 A+

深入讲解 LLM、RAG 和真实 AI 智能体应用的教程合集,包含丰富的 Notebook 示例,是学习 AI 工程化实践的优质资源。

ragagentllm +1
  • · 93+ 生产就绪项目 — 覆盖 OCR、RAG、Agent、语音、多模态等多个领域
  • · 三级难度分类 — 初级(22)、中级(48)、高级(23)项目循序渐进
  • · LLM 实战教程 — 包含 DeepSeek、Llama、Gemma、Qwen 等模型的本地部署与应用