DeepReasoning

不活跃
GitHub Rust MIT

简介

高性能LLM推理API和聊天界面,集成DeepSeek R1的思维链推理与Anthropic Claude模型,实现深度推理能力。

核心特性

  • 在单一数据流中结合 DeepSeek R1 思维链推理与 Claude 代码生成能力
  • 高性能 Rust API 实现零延迟的双模型推理
  • 自带密钥(BYOK)架构,完全掌控 API 密钥和数据隐私
  • 支持流式和非流式模式,通过请求体进行丰富配置
  • 可使用 Docker 或源码编译在自有基础设施上自托管
  • MIT 开源许可证,活跃的社区贡献

适用场景

💡 需要深度推理后进行精确代码生成的复杂问题求解
💡 构建同时需要分析和创造能力的 AI 驱动开发工具
💡 创建具有元认知推理和自我修正能力的对话 Agent
💡 开发对数据隐私和本地推理有关键需求的应用
💡 探索推理模型和生成模型协同效应的研究项目

优势与不足

优势

  • 社区热度高(5.4k stars)
  • 开源许可证友好(MIT)

⚠️ 不足

  • 已超过 11 个月未更新

快速开始

git clone https://github.com/winfunc/deepreasoning.git && cd deepreasoning && cargo build --release

相关项目

mistral.rs

7.7k · Rust
活跃 A

基于Rust构建的快速灵活LLM推理引擎,支持多种模型架构和量化方案,提供高性能的本地LLM部署能力。

rustllmtools +1
  • · 零配置模型加载 — 从任意 Hugging Face 模型自动检测架构、量化格式和聊天模板
  • · 真正的多模态 — 一个引擎支持文本、视觉、视频、音频输入、语音生成、图像生成和嵌入
  • · 智能量化 — UQFF 预构建量化和 ISQ,每个级别自动选择最佳格式

vLLM

91.3k · Python
活跃 A

vLLM 是一个高吞吐量、低内存占用的 LLM 推理与服务引擎,支持连续批处理、PagedAttention 等优化技术,广泛用于生产环境中的大模型部署。

llmpythonframework +2
  • · PagedAttention 内存管理 — 通过分页机制高效管理注意力 KV cache,大幅降低显存占用
  • · 连续批处理与分块预取 — 支持 continuous batching、chunked prefill 和 prefix caching,实现高吞吐推理
  • · 多量化格式支持 — 覆盖 FP8、INT8、INT4、GPTQ/AWQ、GGUF、compressed-tensors 等主流量化方案

Vision Agents

8.1k · Python
活跃 A+

Stream 开源的视觉与语音智能体框架,支持任意模型和视频提供商,利用边缘网络实现超低延迟的实时多模态 AI 交互。

voiceagentpython +3
  • · 实时视频 AI,集成 YOLO、Roboflow 并结合 Gemini/OpenAI 进行实时视觉理解
  • · 通过 Stream 边缘网络实现 30ms 以下超低延迟音视频传输,500ms 内加入
  • · 原生 SDK 方法来自 OpenAI、Gemini 和 Claude,始终使用最新 LLM 能力

MiroThinker

8.4k · Python
正常 A

专为复杂研究和预测任务优化的深度研究 Agent 框架,其 MiroThinker-1.7 和 MiroThinker-H1 模型在 BrowseComp 基准上分别达到 74.0 和 88.2 分,支持多步骤推理和信息检索。

pythonagentllm +3
  • · 专为复杂研究和预测任务优化的深度研究 Agent 框架
  • · MiroThinker-1.7 模型在 BrowseComp 基准达到 74.0 分,H1 模型达到 88.2 分
  • · 支持 256K 上下文窗口和每次任务最多 300 次工具调用