∴ GitHub / 趋势仓库

antirez / ds4

面向消费级硬件的本地大模型推理引擎,支持 Metal、CUDA 与 ROCm

语言
C
Star
23.5k
Fork
2.3k
当日新增(10-05)
+211
累计在榜
1 天
最高名次
第 16 名
首次上榜
2026-10-05
去 GitHub 查看 ↗

∴ 是什么

DwarfStar 是一个原生的本地推理引擎,针对 DeepSeek V4 Flash、V4.1 Flash、GLM 5.2/5.3、DeepSeek V4 PRO 及 Qwen3.8 Flash Next 等模型优化。代码自包含且刻意收窄,不是通用 GGUF 运行器,需要使用项目自带的 GGUF 文件。项目将模型加载、提示渲染、工具调用、KV 状态、HTTP 服务器和编码 agent 集成测试,并附带 GGUF、imatrix、质量和速度相关工具与数据。

∴ 解决什么问题

  • 在消费级硬件(如 MacBook、DGX Spark、Strix Halo)上运行大型语言模型
  • 内存不足时通过 SSD 流式加载运行大模型
  • 多张 CUDA 卡(包括 Ada Lovelace)作为多用户 LLM 服务器
  • 通过 RDMA 连接两台 128GB Mac 进行张量并行运行 4-bit 模型

∴ 怎么上手

  1. 01git clone https://github.com/antirez/ds4.git
  2. 02cd ds4
  3. 03选择构建:Metal 用 make,DGX Spark 用 make cuda-spark,Strix Halo 用 make strix-halo,多 CUDA 卡用 make cuda-generic
  4. 04在 96 或 128 GB 机器上下载 DeepSeek V4 Flash Q2:./download_model.sh ds4f-q2
  5. 05运行:./ds4
  6. 06运行带提示:./ds4 -p "Explain Redis streams in one paragraph."

∴ 适合谁

拥有 96GB 以上 Mac、DGX Spark、Strix Halo 或 多 CUDA 卡的开发者或研究者,希望本地运行特定大模型,并愿意使用 AI 编码代理定制化修改。

∴ 要点

  • 主要目标平台是 Metal(内置于 96GB 以上 Mac),支持 NVIDIA CUDA(含 DGX Spark、Ada Lovelace)和 ROCm(Strix Halo)
  • 支持 SSD 流式加载和 RDMA 多机张量并行、流水线并行
  • 包含原生编码 agent ds4-agent,支持会话保存、恢复和裁剪
  • 支持视觉模型(DeepSeek Vision Experimental、GLM 5.3 Flash、Qwen3.8 Flash Next)和推测解码
  • 许可证为 MIT,部分源码保留自 llama.cpp/GGML 并注明版权
  • 项目处于 beta 质量,变化快速,可能不稳定
许可证 MIT

解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。

∴ 在榜记录

GitHub Trending 今日榜的每日存档,日期按北京时间。2026-10-05 首次上榜,累计在榜 1 天,最高第 16 名。

2026-10-05 +211
每日新增 Star · 2026-10-05 至 2026-10-05 · 共 1 个在榜日峰值 +211
日期名次当日新增总 Star
#16+21123,511