∴ GitHub / 趋势仓库
meituan-longcat / LongCat-Video
13.6B 参数的基础视频生成模型,支持文本、图像、视频续写与长视频生成
- 语言
- Python
- Star
- 8.9k
- Fork
- 1.5k
- 当日新增(10-04)
- +44
- 累计在榜
- 1 天
- 最高名次
- 第 18 名
- 首次上榜
- 2026-10-04
∴ 是什么
LongCat-Video 是一个基于 Python 的基础视频生成模型,参数量为 13.6B,采用统一架构原生支持 Text-to-Video、Image-to-Video 和 Video-Continuation 三种任务。模型通过粗到细的生成策略和 Block Sparse Attention 提升效率,并支持多奖励 GRPO 强化学习。仓库还包含 LongCat-Video-Avatar 系列,用于音频驱动的数字人视频生成。
∴ 解决什么问题
- 现有模型难以生成长时间视频,容易出现色彩漂移或质量下降
- 单一模型无法同时高效支持多种视频生成任务
- 高分辨率视频生成推理效率低
- 音频驱动的数字人视频生成需要更精准的唇形同步和长时间稳定性
∴ 怎么上手
- 01克隆仓库并进入目录:git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video && cd LongCat-Video
- 02创建 conda 环境并激活:conda create -n longcat-video python=3.10 && conda activate longcat-video
- 03安装 PyTorch(按 CUDA 版本配置):pip install torch==2.6.0+cu124 torchvision==0.21.0+cu124 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu124
- 04安装 flash-attn-2 及其他依赖:pip install ninja && pip install psutil && pip install packaging && pip install flash_attn==2.7.4.post1 && pip install -r requirements.txt
- 05安装 LongCat-Video-Avatar 依赖:conda install -c conda-forge librosa && conda install -c conda-forge ffmpeg && pip install -r requirements_avatar.txt
- 06下载模型权重:huggingface-cli download meituan-longcat/LongCat-Video --local-dir ./weights/LongCat-Video
∴ 适合谁
适合需要生成高质量长视频或音频驱动数字人视频的研究人员和开发者,尤其是对视频生成模型有深入需求的技术团队。
∴ 要点
- 统一架构支持文本到视频、图像到视频、视频续写三种任务
- 原生预训练于视频续写任务,可生成分钟级视频且无色彩漂移
- 采用粗到细生成策略和 Block Sparse Attention,支持 720p 30fps 视频高效推理
- 通过多奖励 GRPO 强化学习,性能可与领先开源及商业模型媲美
- LongCat-Video-Avatar-1.5 使用 Whisper-Large 替代 Wav2Vec2,提升唇形同步精度,并支持蒸馏加速推理
- 模型权重以 MIT 许可证发布,提供 Hugging Face 和 ModelScope 下载
许可证 MIT
解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。
∴ 在榜记录
GitHub Trending 今日榜的每日存档,日期按北京时间。2026-10-04 首次上榜,累计在榜 1 天,最高第 18 名。