Intel Extension for PyTorch LLM

不活跃
GitHub Python Apache-2.0

简介

Intel 开源的大语言模型推理加速与微调工具,支持 LLaMA、Qwen、DeepSeek 等主流模型在 Intel GPU 上高效运行,无缝集成主流 Agent 框架。

核心特性

  • Intel 开源 LLM 加速库,支持在 Intel GPU(Arc/Flex/Max)、NPU 和 CPU 上高效运行
  • 支持 LLaMA、Qwen、DeepSeek、Mistral 等 70+ 主流模型的低比特(FP8/FP6/FP4/INT4)量化
  • 无缝集成 llama.cpp、Ollama、vLLM、LangChain、LlamaIndex 等主流框架
  • FlashMoE 技术:仅需 1-2 张 Intel Arc GPU 即可运行 DeepSeek V3/R1 671B 模型
  • 提供 Ollama 和 llama.cpp 便携包,零安装即可在 Intel GPU 上运行
  • 支持 HuggingFace PEFT/TRL 微调和 Axolotl 等完整训练生态

适用场景

💡 在 Intel GPU 硬件上本地部署大语言模型,实现隐私保护的离线推理
💡 利用低比特量化技术在消费级 Intel Arc 显卡上运行百亿参数模型
💡 在已有 LangChain/LlamaIndex 项目中替换推理后端以加速 Intel 硬件上的性能
💡 通过 Ollama 便携包快速搭建本地 AI 助手,无需复杂环境配置
💡 企业使用 Intel GPU 集群进行大规模 LLM 推理服务部署和成本优化

快速开始

1. 安装:pip install ipex-llm(推荐一键安装命令)
2. 下载 Ollama 便携包或 llama.cpp 便携包
3. 设置环境变量激活 Intel GPU 加速
4. 使用 Ollama 运行模型:ollama run deepseek-r1
5. 或在 Python 中使用 HuggingFace Transformers 加载模型
6. 参考文档配置 LangChain 等框架集成

相关项目