∴ GitHub / 趋势仓库

NVIDIA / Model-Optimizer

统一的大模型优化技术库,涵盖量化、剪枝、蒸馏、NAS、推测解码等

语言
Python
Star
4.9k
Fork
678
当日新增(09-27)
+301
累计在榜
4 天
最高名次
第 3 名
首次上榜
2026-09-24
去 GitHub 查看 ↗项目主页 ↗

∴ 是什么

NVIDIA Model Optimizer(简称 ModelOpt)是一个包含多种模型优化技术的库,支持量化、剪枝、神经架构搜索(NAS)、蒸馏、推测解码和稀疏化,用于加速模型推理。它能够接受 Hugging Face、PyTorch 或 ONNX 格式的模型作为输入,通过 Python API 组合这些技术并导出量化后的检查点。该库还与 NVIDIA Megatron-Bridge、Megatron-LM 和 Hugging Face Accelerate 集成,支持需要训练的优化技术。生成的量化检查点可直接部署到 SGLang、TensorRT-LLM、TensorRT 或 vLLM 等推理框架。

∴ 解决什么问题

  • 加速深度学习模型的推理速度
  • 压缩模型以减少存储和内存占用
  • 在低精度量化下恢复模型准确率
  • 通过剪枝和蒸馏缩小模型规模

∴ 怎么上手

  1. 01pip install -U nvidia-modelopt[all]
  2. 02git clone [email protected]:NVIDIA/Model-Optimizer.git
  3. 03cd Model-Optimizer
  4. 04pip install -e .[dev]

∴ 适合谁

适合使用 Hugging Face、PyTorch 或 ONNX 模型进行推理优化的开发者,尤其是需要在 NVIDIA 推理框架(如 TensorRT-LLM、vLLM)中部署高效量化模型的用户。

∴ 要点

  • 支持多种优化技术:量化、剪枝、NAS、蒸馏、推测解码和稀疏化
  • 输入支持 Hugging Face、PyTorch 和 ONNX 模型
  • 与 NVIDIA Megatron-Bridge、Megatron-LM 和 Hugging Face Accelerate 集成
  • 生成的量化检查点可直接部署到 SGLang、TensorRT-LLM、TensorRT 或 vLLM
  • 统一 Hugging Face 导出 API,支持 transformers 和 diffusers 模型
  • 许可证为 Apache-2.0
许可证 Apache-2.0

解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。

∴ 在榜记录

GitHub Trending 今日榜的每日存档,日期按北京时间。2026-09-24 首次上榜,累计在榜 4 天,最高第 3 名。

2026-09-24 +222026-09-25 +3602026-09-26 +3542026-09-27 +301
每日新增 Star · 2026-09-24 至 2026-09-27 · 共 4 个在榜日峰值 +360
日期名次当日新增总 Star
#3+3014,885
#3+3544,610
#14+3604,302
#5+223,871