∴ GitHub / 趋势仓库
antirez / ds4
面向消费级硬件的本地大模型推理引擎,支持 Metal、CUDA 与 ROCm
- 语言
- C
- Star
- 23.5k
- Fork
- 2.3k
- 当日新增(10-05)
- +211
- 累计在榜
- 1 天
- 最高名次
- 第 16 名
- 首次上榜
- 2026-10-05
∴ 是什么
DwarfStar 是一个原生的本地推理引擎,针对 DeepSeek V4 Flash、V4.1 Flash、GLM 5.2/5.3、DeepSeek V4 PRO 及 Qwen3.8 Flash Next 等模型优化。代码自包含且刻意收窄,不是通用 GGUF 运行器,需要使用项目自带的 GGUF 文件。项目将模型加载、提示渲染、工具调用、KV 状态、HTTP 服务器和编码 agent 集成测试,并附带 GGUF、imatrix、质量和速度相关工具与数据。
∴ 解决什么问题
- 在消费级硬件(如 MacBook、DGX Spark、Strix Halo)上运行大型语言模型
- 内存不足时通过 SSD 流式加载运行大模型
- 多张 CUDA 卡(包括 Ada Lovelace)作为多用户 LLM 服务器
- 通过 RDMA 连接两台 128GB Mac 进行张量并行运行 4-bit 模型
∴ 怎么上手
- 01git clone https://github.com/antirez/ds4.git
- 02cd ds4
- 03选择构建:Metal 用 make,DGX Spark 用 make cuda-spark,Strix Halo 用 make strix-halo,多 CUDA 卡用 make cuda-generic
- 04在 96 或 128 GB 机器上下载 DeepSeek V4 Flash Q2:./download_model.sh ds4f-q2
- 05运行:./ds4
- 06运行带提示:./ds4 -p "Explain Redis streams in one paragraph."
∴ 适合谁
拥有 96GB 以上 Mac、DGX Spark、Strix Halo 或 多 CUDA 卡的开发者或研究者,希望本地运行特定大模型,并愿意使用 AI 编码代理定制化修改。
∴ 要点
- 主要目标平台是 Metal(内置于 96GB 以上 Mac),支持 NVIDIA CUDA(含 DGX Spark、Ada Lovelace)和 ROCm(Strix Halo)
- 支持 SSD 流式加载和 RDMA 多机张量并行、流水线并行
- 包含原生编码 agent ds4-agent,支持会话保存、恢复和裁剪
- 支持视觉模型(DeepSeek Vision Experimental、GLM 5.3 Flash、Qwen3.8 Flash Next)和推测解码
- 许可证为 MIT,部分源码保留自 llama.cpp/GGML 并注明版权
- 项目处于 beta 质量,变化快速,可能不稳定
许可证 MIT
解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。
∴ 在榜记录
GitHub Trending 今日榜的每日存档,日期按北京时间。2026-10-05 首次上榜,累计在榜 1 天,最高第 16 名。