Easy Dataset
不活跃简介
easy-dataset 是一个为 LLM 微调与 Agent 训练快速构造数据集的工具,支持自动标注、采样与导出主流格式。
核心特性
- 一键生成 — 输入原始文本自动产出 QA / SFT 数据集
- LLM 标注 — 用主流 LLM 完成高质量标注
- 多格式导出 — 支持 Alpaca、ShareGPT、JSONL、Parquet
- 可视化校对 — 校对界面方便人工抽检与修改
- 难度分层 — 按难度自动分层,便于课程式训练
- 可扩展 — 用户可加入自定义 prompt 与过滤规则
适用场景
💡 为特定领域 LLM 微调快速构造数据集
💡 为 Agent 任务准备多步骤训练样本
💡 用人工校对界面降低标注工作量
💡 把现有文档一键转化为训练数据集
优势与不足
✅ 优势
- • 社区热度高(14.9k stars)
- • Issue 响应及时,积压少
⚠️ 不足
- • 缺少明确的开源许可证
快速开始
npm install -g @easy-dataset/cli
dataset init my-data
dataset generate --input ./docs --format alpaca