∴ GitHub / 趋势仓库
NVIDIA / Model-Optimizer
统一的大模型优化技术库,涵盖量化、剪枝、蒸馏、NAS、推测解码等
- 语言
- Python
- Star
- 4.9k
- Fork
- 678
- 当日新增(09-27)
- +301
- 累计在榜
- 4 天
- 最高名次
- 第 3 名
- 首次上榜
- 2026-09-24
∴ 是什么
NVIDIA Model Optimizer(简称 ModelOpt)是一个包含多种模型优化技术的库,支持量化、剪枝、神经架构搜索(NAS)、蒸馏、推测解码和稀疏化,用于加速模型推理。它能够接受 Hugging Face、PyTorch 或 ONNX 格式的模型作为输入,通过 Python API 组合这些技术并导出量化后的检查点。该库还与 NVIDIA Megatron-Bridge、Megatron-LM 和 Hugging Face Accelerate 集成,支持需要训练的优化技术。生成的量化检查点可直接部署到 SGLang、TensorRT-LLM、TensorRT 或 vLLM 等推理框架。
∴ 解决什么问题
- 加速深度学习模型的推理速度
- 压缩模型以减少存储和内存占用
- 在低精度量化下恢复模型准确率
- 通过剪枝和蒸馏缩小模型规模
∴ 怎么上手
- 01pip install -U nvidia-modelopt[all]
- 02git clone [email protected]:NVIDIA/Model-Optimizer.git
- 03cd Model-Optimizer
- 04pip install -e .[dev]
∴ 适合谁
适合使用 Hugging Face、PyTorch 或 ONNX 模型进行推理优化的开发者,尤其是需要在 NVIDIA 推理框架(如 TensorRT-LLM、vLLM)中部署高效量化模型的用户。
∴ 要点
- 支持多种优化技术:量化、剪枝、NAS、蒸馏、推测解码和稀疏化
- 输入支持 Hugging Face、PyTorch 和 ONNX 模型
- 与 NVIDIA Megatron-Bridge、Megatron-LM 和 Hugging Face Accelerate 集成
- 生成的量化检查点可直接部署到 SGLang、TensorRT-LLM、TensorRT 或 vLLM
- 统一 Hugging Face 导出 API,支持 transformers 和 diffusers 模型
- 许可证为 Apache-2.0
许可证 Apache-2.0
解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。
∴ 在榜记录
GitHub Trending 今日榜的每日存档,日期按北京时间。2026-09-24 首次上榜,累计在榜 4 天,最高第 3 名。