mistral.rs
活跃简介
基于Rust构建的快速灵活LLM推理引擎,支持多种模型架构和量化方案,提供高性能的本地LLM部署能力。
核心特性
- 零配置模型加载 — 从任意 Hugging Face 模型自动检测架构、量化格式和聊天模板
- 真正的多模态 — 一个引擎支持文本、视觉、视频、音频输入、语音生成、图像生成和嵌入
- 智能量化 — UQFF 预构建量化和 ISQ,每个级别自动选择最佳格式
- OpenAI + Anthropic 兼容服务 — 单进程同时暴露 /v1 和 /v1/messages 端点
- 内置 Web UI — 在 /ui 提供推理、代码执行、图表和内联文件显示,编辑消息可分支对话
- 智能体运行时 — Web 搜索、带模型反馈的本地 Python 代码执行、会话管理和自定义工具钩子
适用场景
💡 在 CUDA、Metal 和 CPU 上高性能运行本地 LLM 推理
💡 为现有应用部署 OpenAI/Anthropic 兼容的 API 服务器
💡 构建具有 Web 搜索和代码执行能力的智能体工作流
💡 通过 mistralrs tune 为特定硬件量化和优化模型
💡 通过统一推理引擎生成图像、语音和嵌入
分类
快速开始
通过 curl 安装:curl --proto '=https' --tlsv1.2 -sSf https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.sh | sh。然后运行:mistralrs run -m Qwen/Qwen3-4B 进行交互式聊天,或 mistralrs serve -m google/gemma-4-E4B-it 启动带内置 Web UI 的 API 服务器,访问 localhost:1234/ui。