∴ GitHub / 趋势仓库
deepseek-ai / DeepGEMM
面向 GPU 的统一高性能张量核心内核库
- 语言
- Cuda
- Star
- 8.6k
- Fork
- 1.4k
- 当日新增(10-06)
- +363
- 累计在榜
- 1 天
- 最高名次
- 第 9 名
- 首次上榜
- 2026-10-06
∴ 是什么
DeepGEMM 是一个面向 NVIDIA GPU 的统一高性能张量核心内核库,整合了现代大语言模型的关键计算原语,包括 FP8、FP4、BF16 的 GEMM、融合 MoE 与重叠通信(Mega MoE)、MQA scoring、HyperConnection 等。所有内核通过 DeepJIT 在运行时编译,安装时无需 CUDA 编译。该库设计简洁,核心内核函数数量有限,便于学习 GPU 内核优化技术。
∴ 解决什么问题
- 为大语言模型中的 GEMM、MoE 等计算提供高性能内核
- 避免对 CUTLASS 和 CuTe 模板或代数的高度依赖,降低使用复杂度
- 支持 FP8、FP4、BF16 等多种精度格式的矩阵乘法
- 在解码阶段 CUDA graph 下支持 masked grouped GEMM,仅计算有效部分
∴ 怎么上手
- 01使用 git clone --recursive 克隆仓库,确保子模块被克隆
- 02运行 ./develop.sh 以链接必要的头文件并构建 C++ 扩展
- 03运行 ./install.sh 进行安装
- 04在 Python 项目中导入 deep_gemm
∴ 适合谁
适用于需要在大语言模型训练、推理或 MoE 场景中使用高性能矩阵乘法内核的开发者,也适合对 NVIDIA GPU 内核优化技术感兴趣的学习者。
∴ 要点
- 支持 SM90 和 SM100 架构,SM90 仅支持 NT 内存布局,SM100 支持全部四种布局
- 支持 FP8、FP4、BF16 等精度,以及 FP8xFP4 混合精度矩阵乘法
- 提供 dense、grouped(contiguous 和 masked)、K-axis-grouped GEMM 等多种接口
- Mega MoE 融合并重叠 EP dispatch、线性层、SwiGLU 和 EP combine,并重叠 NVLink 通信与张量核心计算
- 提供 MQA kernels(非分页和分页版本)用于指数器加权 ReLU MQA logits
- 支持设置 SM 数量、张量核心利用率、PDL(Programmatic Dependent Launch)等实用工具函数
许可证 MIT
解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。
∴ 在榜记录
GitHub Trending 今日榜的每日存档,日期按北京时间。2026-10-06 首次上榜,累计在榜 1 天,最高第 9 名。