Intel Extension for PyTorch LLM
不活跃简介
Intel 开源的大语言模型推理加速与微调工具,支持 LLaMA、Qwen、DeepSeek 等主流模型在 Intel GPU 上高效运行,无缝集成主流 Agent 框架。
核心特性
- Intel 开源 LLM 加速库,支持在 Intel GPU(Arc/Flex/Max)、NPU 和 CPU 上高效运行
- 支持 LLaMA、Qwen、DeepSeek、Mistral 等 70+ 主流模型的低比特(FP8/FP6/FP4/INT4)量化
- 无缝集成 llama.cpp、Ollama、vLLM、LangChain、LlamaIndex 等主流框架
- FlashMoE 技术:仅需 1-2 张 Intel Arc GPU 即可运行 DeepSeek V3/R1 671B 模型
- 提供 Ollama 和 llama.cpp 便携包,零安装即可在 Intel GPU 上运行
- 支持 HuggingFace PEFT/TRL 微调和 Axolotl 等完整训练生态
适用场景
💡 在 Intel GPU 硬件上本地部署大语言模型,实现隐私保护的离线推理
💡 利用低比特量化技术在消费级 Intel Arc 显卡上运行百亿参数模型
💡 在已有 LangChain/LlamaIndex 项目中替换推理后端以加速 Intel 硬件上的性能
💡 通过 Ollama 便携包快速搭建本地 AI 助手,无需复杂环境配置
💡 企业使用 Intel GPU 集群进行大规模 LLM 推理服务部署和成本优化
分类
快速开始
1. 安装:pip install ipex-llm(推荐一键安装命令)
2. 下载 Ollama 便携包或 llama.cpp 便携包
3. 设置环境变量激活 Intel GPU 加速
4. 使用 Ollama 运行模型:ollama run deepseek-r1
5. 或在 Python 中使用 HuggingFace Transformers 加载模型
6. 参考文档配置 LangChain 等框架集成