∴ GitHub / 趋势仓库

deepseek-ai / DeepGEMM

面向 GPU 的统一高性能张量核心内核库

语言
Cuda
Star
8.6k
Fork
1.4k
当日新增(10-06)
+363
累计在榜
1 天
最高名次
第 9 名
首次上榜
2026-10-06
去 GitHub 查看 ↗

∴ 是什么

DeepGEMM 是一个面向 NVIDIA GPU 的统一高性能张量核心内核库,整合了现代大语言模型的关键计算原语,包括 FP8、FP4、BF16 的 GEMM、融合 MoE 与重叠通信(Mega MoE)、MQA scoring、HyperConnection 等。所有内核通过 DeepJIT 在运行时编译,安装时无需 CUDA 编译。该库设计简洁,核心内核函数数量有限,便于学习 GPU 内核优化技术。

∴ 解决什么问题

  • 为大语言模型中的 GEMM、MoE 等计算提供高性能内核
  • 避免对 CUTLASS 和 CuTe 模板或代数的高度依赖,降低使用复杂度
  • 支持 FP8、FP4、BF16 等多种精度格式的矩阵乘法
  • 在解码阶段 CUDA graph 下支持 masked grouped GEMM,仅计算有效部分

∴ 怎么上手

  1. 01使用 git clone --recursive 克隆仓库,确保子模块被克隆
  2. 02运行 ./develop.sh 以链接必要的头文件并构建 C++ 扩展
  3. 03运行 ./install.sh 进行安装
  4. 04在 Python 项目中导入 deep_gemm

∴ 适合谁

适用于需要在大语言模型训练、推理或 MoE 场景中使用高性能矩阵乘法内核的开发者,也适合对 NVIDIA GPU 内核优化技术感兴趣的学习者。

∴ 要点

  • 支持 SM90 和 SM100 架构,SM90 仅支持 NT 内存布局,SM100 支持全部四种布局
  • 支持 FP8、FP4、BF16 等精度,以及 FP8xFP4 混合精度矩阵乘法
  • 提供 dense、grouped(contiguous 和 masked)、K-axis-grouped GEMM 等多种接口
  • Mega MoE 融合并重叠 EP dispatch、线性层、SwiGLU 和 EP combine,并重叠 NVLink 通信与张量核心计算
  • 提供 MQA kernels(非分页和分页版本)用于指数器加权 ReLU MQA logits
  • 支持设置 SM 数量、张量核心利用率、PDL(Programmatic Dependent Launch)等实用工具函数
许可证 MIT

解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。

∴ 在榜记录

GitHub Trending 今日榜的每日存档,日期按北京时间。2026-10-06 首次上榜,累计在榜 1 天,最高第 9 名。

2026-10-06 +363
每日新增 Star · 2026-10-06 至 2026-10-06 · 共 1 个在榜日峰值 +363
日期名次当日新增总 Star
#9+3638,567