横跨图像与视频两条线、30+ 模型的技术路线、价格、API 可用性与授权条款对比矩阵;深挖 2026 年最新模型;交叉核对 LMArena / Artificial Analysis / arena.ai 等榜单口径差异;并梳理生成式视觉从 GAN 到世界模型的完整历史脉络。
整个赛道的头部竞争极度拥挤,前十模型 Elo 差距很小,没有任何一家握有稳固领先。四个最重要的结构性变化:
可切换图像/视频、按开源状态与 API 可用性筛选、点击表头排序。技术路线、价格、授权栏均带关键差异标注。
| 模型 / 厂商 | 发布 | 技术路线 | 关键能力 | 价格(API) | API | 授权 | 榜单▼ |
|---|---|---|---|---|---|---|---|
GPT Image 2 OpenAI | 2026-04 | 原生多模态·生成前先推理 | 2K、单次 8 图、非拉丁文字渲染强 | $0.01–0.21/张 | ✓ 有 | 闭源 | 1339 |
Reve 2.1 Reve | 2026 | 布局优先·先搭结构再渲染 | 4K、版式/构图强 | 按平台 | ✓ 有 | 闭源 | 1299 |
MAI-Image-2.5 Microsoft AI | 2026 | 微软首个自研前沿图像模型 | 写实、通用 | 按平台 | ✓ 有 | 闭源 | 1270 |
Nano Banana 2 Google (Gemini 3.1 Flash Image) | 2026-02 | LLM 原生·图像搜索接地 | 512px–4K、极端比例、4角色一致 | ~$0.067/2K | ✓ 有 | 闭源 | 1262 |
HiDream-O1-Image-1.5 HiDream | 2026 | 中国实验室·偏开放 | 通用高质量 | 按平台 | ✓ 有 | 部分开放 | 1245 |
Seedream 5.0 Pro 字节跳动 ByteDance | 2026-02 | DiT·深度思考推理 + 联网 RAG | 4K、图层编辑、锚定 Seedance 视频 | 未公布 | ✓ 有 | 闭源 | 1240 |
Nano Banana Pro Google (Gemini 3 Pro Image) | 2025-11 | LLM 原生·推理+实时搜索接地 | 2K/4K、14 图混合、5 人一致、可读长文本 | ~$0.134/2K | ✓ 有 | 闭源 | 1225 |
Qwen-Image-3.0⚠️ 无权重/无授权/无benchmark 阿里巴巴 Alibaba | 2026-07 | 架构未公开(疑仍 MMDiT) | 4500 token 提示、10px 文字、12 语种密集版式 | 未公布 | ✗ 无 | 仅托管·无权重 | — |
Qwen-Image (v1) 阿里巴巴 Alibaba | 2025-08 | ~20B MMDiT · Qwen2.5-VL 文本编码 | 中英文字最佳、可编辑 | 云 API 计费 | ✓ 有 | 开源 Apache-2.0 | — |
FLUX.2 Black Forest Labs | 2025-11 | 整流流/Flow-Matching Transformer + Mistral-24B VLM | 4MP、最多 10 参考图、统一生成+编辑 | $0.014–0.07/张 | ✓ 有 | 部分开源(klein 4B Apache/其余非商用) | — |
Hunyuan Image 3.0开源榜最强 腾讯 Tencent | 2025 | MoE 扩散 · 80B 总参/64专家/~13B激活 | 中英双语文字业界领先、动漫游戏角色 | 开源自托管 | ✓ 有 | 开源·社区授权 | — |
Imagen 4 / Ultra Google DeepMind | 2025-06 | 扩散 · SynthID 水印 | 文字渲染改进、Fast/Std/Ultra 档 | $0.04 / $0.06/张 | ✓ 有 | 闭源 | — |
Midjourney V8.2⚠️ 无公开API Midjourney | 2026-07 | 专有扩散(架构未公开) | 美学标杆、2K HD、个性化 | 仅订阅 | ✗ 无 | 闭源·无官方API | — |
Ideogram 4.0由闭转开 Ideogram | 2026-06 | 排版/版式优先基础模型 | 多语文字、边界框布局控制、透明图层 | $0.03–0.10/张 | ✓ 有 | 开源·商用授权 | — |
Recraft V4⚠️ 发布日期待确认 Recraft | 2026 | 扩散·设计工作流优化 | 原生 SVG 矢量、品牌风格锁定、标题文字 | 官网计费 | ✓ 有 | 闭源 | — |
Stable Diffusion 3.5 Stability AI | 2024-10 | MMDiT 整流流 | 本地可微调生态(LoRA/ControlNet) | 开源/Ultra API | ✓ 有 | 开源·社区授权 | — |
Kolors已略显过时 快手 Kuaishou | 2024 | 扩散·强中文支持 | 写实、开源生态在用 | 开源自托管 | ✓ 有 | 开源 | — |
原 Stable Diffusion 原班团队,西方最强开源权重图像家族。
能力强但发布方式罕见:只托管、不放权重。
把“推理模型当图像生成器”范式推到当前顶点。
Artificial Analysis 图像榜当前 #1(~1339)。
2.0 是 API 主力;2.5 的 API 已在火山方舟上线,主打 30 秒单镜头一次成片。
竞技场 T2V ~#2;权重已于 08-02 实际放出——但划定了排除地区。
想要开源权重就用 2.2(Apache-2.0);3.0 已上线但闭源、未基准测试。
2025-05 Veo 3“告别默片”,原生同步音频的开创者。
MVL 多模态框架,原生多语音频 + 参考视频提角色一致。
技术强但正退出市场——2026 最大战略故事。
同一个模型在不同榜单能差出上百 Elo。根因:三个都叫“arena”的东西其实是三家不同机构、不同投票池、不同评分数学——再加上一整类“自动化学术基准”,测的根本不是同一件事。
具有重大历史意义的模型/论文——它们是什么、走的什么技术路线、对整个进程的影响。切换查看图像线或视频线;⭐ 为分水岭节点。
扩散/流模型(SD→SDXL→SD3→FLUX)主打开源效率与写实纹理;LLM 原生自回归(GPT-4o、Nano Banana)主打推理、可控、编辑与文字渲染——二者共同定义 2026 前沿。
时序一致性、运动与物理、算力成本、时长。整部架构史就是逐一攻克它们的历史:GAN 给了运动、潜扩散砍了算力、DiT 给了可扩展的时空建模、原生音频给了“可信度”。
Veo 3(2025-05)“告别默片”、Sora 2(2025-09)之后,Kling 3.0、MiniMax H3、Seedance 2.0、Vidu Q3、LTX-2 均已原生出音;无音频的 Runway Gen-4 开始显得落伍。
前沿从 5-10 秒推进到 15-30 秒单镜头(Seedance 2.5、Wan 3.0),并转向 omni 多模态条件——把文/图/视/音一起作为参考,锁定角色、镜头与音色一致性。