mistral.rs

活跃
GitHub Rust MIT

简介

基于Rust构建的快速灵活LLM推理引擎,支持多种模型架构和量化方案,提供高性能的本地LLM部署能力。

核心特性

  • 零配置模型加载 — 从任意 Hugging Face 模型自动检测架构、量化格式和聊天模板
  • 真正的多模态 — 一个引擎支持文本、视觉、视频、音频输入、语音生成、图像生成和嵌入
  • 智能量化 — UQFF 预构建量化和 ISQ,每个级别自动选择最佳格式
  • OpenAI + Anthropic 兼容服务 — 单进程同时暴露 /v1 和 /v1/messages 端点
  • 内置 Web UI — 在 /ui 提供推理、代码执行、图表和内联文件显示,编辑消息可分支对话
  • 智能体运行时 — Web 搜索、带模型反馈的本地 Python 代码执行、会话管理和自定义工具钩子

适用场景

💡 在 CUDA、Metal 和 CPU 上高性能运行本地 LLM 推理
💡 为现有应用部署 OpenAI/Anthropic 兼容的 API 服务器
💡 构建具有 Web 搜索和代码执行能力的智能体工作流
💡 通过 mistralrs tune 为特定硬件量化和优化模型
💡 通过统一推理引擎生成图像、语音和嵌入

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(7.7k stars)
  • 开源许可证友好(MIT)
  • 项目有一定历史沉淀(已维护 2 年)

快速开始

通过 curl 安装:curl --proto '=https' --tlsv1.2 -sSf https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.sh | sh。然后运行:mistralrs run -m Qwen/Qwen3-4B 进行交互式聊天,或 mistralrs serve -m google/gemma-4-E4B-it 启动带内置 Web UI 的 API 服务器,访问 localhost:1234/ui。

相关项目

Vision Agents

8.1k · Python
活跃 A+

Stream 开源的视觉与语音智能体框架,支持任意模型和视频提供商,利用边缘网络实现超低延迟的实时多模态 AI 交互。

voiceagentpython +3
  • · 实时视频 AI,集成 YOLO、Roboflow 并结合 Gemini/OpenAI 进行实时视觉理解
  • · 通过 Stream 边缘网络实现 30ms 以下超低延迟音视频传输,500ms 内加入
  • · 原生 SDK 方法来自 OpenAI、Gemini 和 Claude,始终使用最新 LLM 能力

MiroThinker

8.4k · Python
正常 A

专为复杂研究和预测任务优化的深度研究 Agent 框架,其 MiroThinker-1.7 和 MiroThinker-H1 模型在 BrowseComp 基准上分别达到 74.0 和 88.2 分,支持多步骤推理和信息检索。

pythonagentllm +3
  • · 专为复杂研究和预测任务优化的深度研究 Agent 框架
  • · MiroThinker-1.7 模型在 BrowseComp 基准达到 74.0 分,H1 模型达到 88.2 分
  • · 支持 256K 上下文窗口和每次任务最多 300 次工具调用