KTransformers
活跃简介
灵活的异构LLM推理与微调优化框架,支持在消费级硬件上高效运行大语言模型,提供内核级优化和多种量化方案。
核心特性
- CPU-GPU 异构计算实现高效 LLM 推理和微调
- 针对 Intel CPU INT4/INT8 量化推理优化的 AMX/AVX 内核
- NUMA 感知内存管理的 MoE 优化,适用于 Mixture-of-Experts 模型
- 与 LLaMA-Factory 集成,支持超大 MoE 模型微调(DeepSeek-V3/R1)
- FP8 GPU 内核支持,在单 GPU 24GB 显存下实现 3-28 倍加速
- 多后端支持:Intel AMX、NVIDIA CUDA、AMD ROCm 和 Ascend NPU
适用场景
💡 在 24GB 显存的消费级硬件上运行 DeepSeek-R1/V3
💡 使用量化技术在有限 GPU 内存下微调大型 MoE 模型
💡 与 SGLang 集成实现大规模生产级 LLM 服务
💡 在边缘设备上使用 CPU-GPU 混合推理部署 AI Agent
💡 LLM 工作负载的异构计算优化研究
分类
快速开始
cd kt-kernel
pip install .
# 使用 LLaMA-Factory 进行微调:
# cd /path/to/LLaMA-Factory
# pip install -e . && pip install -r requirements/ktransformers.txt