KTransformers

活跃
GitHub Python Apache-2.0

简介

灵活的异构LLM推理与微调优化框架,支持在消费级硬件上高效运行大语言模型,提供内核级优化和多种量化方案。

核心特性

  • CPU-GPU 异构计算实现高效 LLM 推理和微调
  • 针对 Intel CPU INT4/INT8 量化推理优化的 AMX/AVX 内核
  • NUMA 感知内存管理的 MoE 优化,适用于 Mixture-of-Experts 模型
  • 与 LLaMA-Factory 集成,支持超大 MoE 模型微调(DeepSeek-V3/R1)
  • FP8 GPU 内核支持,在单 GPU 24GB 显存下实现 3-28 倍加速
  • 多后端支持:Intel AMX、NVIDIA CUDA、AMD ROCm 和 Ascend NPU

适用场景

💡 在 24GB 显存的消费级硬件上运行 DeepSeek-R1/V3
💡 使用量化技术在有限 GPU 内存下微调大型 MoE 模型
💡 与 SGLang 集成实现大规模生产级 LLM 服务
💡 在边缘设备上使用 CPU-GPU 混合推理部署 AI Agent
💡 LLM 工作负载的异构计算优化研究

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(19.5k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 2 年)

快速开始

cd kt-kernel
pip install .

# 使用 LLaMA-Factory 进行微调:
# cd /path/to/LLaMA-Factory
# pip install -e . && pip install -r requirements/ktransformers.txt

相关项目

mistral.rs

7.7k · Rust
活跃 A

基于Rust构建的快速灵活LLM推理引擎,支持多种模型架构和量化方案,提供高性能的本地LLM部署能力。

rustllmtools +1
  • · 零配置模型加载 — 从任意 Hugging Face 模型自动检测架构、量化格式和聊天模板
  • · 真正的多模态 — 一个引擎支持文本、视觉、视频、音频输入、语音生成、图像生成和嵌入
  • · 智能量化 — UQFF 预构建量化和 ISQ,每个级别自动选择最佳格式

Vision Agents

8.1k · Python
活跃 A+

Stream 开源的视觉与语音智能体框架,支持任意模型和视频提供商,利用边缘网络实现超低延迟的实时多模态 AI 交互。

voiceagentpython +3
  • · 实时视频 AI,集成 YOLO、Roboflow 并结合 Gemini/OpenAI 进行实时视觉理解
  • · 通过 Stream 边缘网络实现 30ms 以下超低延迟音视频传输,500ms 内加入
  • · 原生 SDK 方法来自 OpenAI、Gemini 和 Claude,始终使用最新 LLM 能力

MiroThinker

8.4k · Python
正常 A

专为复杂研究和预测任务优化的深度研究 Agent 框架,其 MiroThinker-1.7 和 MiroThinker-H1 模型在 BrowseComp 基准上分别达到 74.0 和 88.2 分,支持多步骤推理和信息检索。

pythonagentllm +3
  • · 专为复杂研究和预测任务优化的深度研究 Agent 框架
  • · MiroThinker-1.7 模型在 BrowseComp 基准达到 74.0 分,H1 模型达到 88.2 分
  • · 支持 256K 上下文窗口和每次任务最多 300 次工具调用

LangExtract

38.5k · Python
活跃 A+

Google 开源的 Python 库,用于利用 LLM 从非结构化文本中精确提取结构化信息,支持源文本标注和交互式可视化,适用于数据标注和知识抽取场景。

data-processingllmpython +2
  • · 精确源文本锚定 — 每条提取结果映射到原文精确位置,支持视觉高亮追溯验证
  • · 受控结构化输出 — 基于 few-shot 示例强制一致输出 Schema,利用 Gemini 受控生成保证结果鲁棒性
  • · 长文档优化策略 — 通过文本分块、并行处理和多轮扫描克服大文档「大海捞针」问题,提升召回率