模型世界每天在变的几件事:新模型发布、模型上线到哪个 API 平台、模型与产品层的评测、Arena 榜单的名次变动,以及榜上还没揭盲的匿名代号。自动更新,事件是观察、模型是实体:消息流按时间看,各张表按类别和厂商筛,「模型」视图一个模型一行,点进去看它从发布到上各平台的全过程。
| 时间 | 公司 | 模型 | 类别 | 简介 |
|---|---|---|---|---|
| Cantina Security | apex-flash-1 | 文本 | Cantina Security 联合 Yeta Labs 发布开源权重安全研究模型 apex-flash-1:基于 GLM-5.3-Flash 用 GRPO 微调,321.3B 总参数、18B 激活参数,MIT 许可;在 60 项 held-out 漏洞任务中解出 40 项。2026-10-05 09:47:28,发布相关:Cantina Security 发布 apex-flash-1。Cantina Security 联合 Yeta Labs 发布开源权重安全研究模型 apex-flash-1:基于 GLM-5.3-Flash 用 GRPO 微调,321.3B 总参数、18B 激活参数,MIT 许可;在 60 项 held-out 漏洞任务中解出 40 项。
| |
| Cantina Security | apex-flash-1 | 其他 | Cantina Security 联合 Yeta Labs 发布开源权重模型 apex-flash-1,基于 GLM-5.3-Flash 用 GRPO 微调,321.3B 总参数、18B 激活参数,MIT 许可。Cantina Security 联合 Yeta Labs 发布开源权重模型 apex-flash-1,基于 GLM-5.3-Flash 用 GRPO 微调,321.3B 总参数、18B 激活参数,MIT 许可。
| |
| MarkTechPost | Aleph | 文本 | Aleph Alpha 发布面向德英双语的开源权重 MoE 模型 Kolibri(Kolibri-1),总参数 78.1B,每 token 仅激活 3.46B,上下文最高 1,048,576 tokens,以 Apache 2.0 许可在 Hugging Face 上线。2026-10-04 15:01:04,发布相关:MarkTechPost 发布 Aleph。Aleph Alpha 发布面向德英双语的开源权重 MoE 模型 Kolibri(Kolibri-1),总参数 78.1B,每 token 仅激活 3.46B,上下文最高 1,048,576 tokens,以 Apache 2.0 许可在 Hugging Face 上线。
| |
| Aleph Alpha | Kolibri | 文本 | Cohere 转发 Aleph Alpha 发布的 Kolibri 模型:78B 参数、3.46B 激活参数、最高 1M tokens 上下文,欧洲打造。模型权重以 Apache 2.0 许可开放,可在自有硬件上运行。Cohere 转发 Aleph Alpha 发布的 Kolibri 模型:78B 参数、3.46B 激活参数、最高 1M tokens 上下文,欧洲打造。模型权重以 Apache 2.0 许可开放,可在自有硬件上运行。
| |
| — | Show HN | 文本 | Janus 是一个 Go 单二进制本地 LLM 服务器,通过 Vulkan 在 AMD/Intel/NVIDIA GPU 或 CPU 上运行 .gguf 模型,并暴露 OpenAI 兼容 API,无需 Python、Docker 或 Ol…Janus 是一个 Go 单二进制本地 LLM 服务器,通过 Vulkan 在 AMD/Intel/NVIDIA GPU 或 CPU 上运行 .gguf 模型,并暴露 OpenAI 兼容 API,无需 Python、Docker 或 Ollama。
| |
| Cohere | North Small Translate | 文本 | Cohere 推出开源机器翻译模型 North Small Translate,开放权重与流程;自称 1T 参数以下最好的机器翻译模型,并发布本地化负责人 Tom Kocmi 讲解视频。2026-10-04 00:35:44,发布相关:Cohere 发布 North Small Translate。开源机器翻译模型,开放权重与流程;Cohere 称其为 1T 参数以下最好的机器翻译模型。
| |
| Cohere | North Small Translate | 文本 | Cohere 推出新的开源机器翻译模型 North Small Translate,开放权重和流程。Cohere 称其为 1T 参数以下最好的机器翻译模型,并发布本地化负责人 Tom Kocmi 的讲解视频。Cohere 推出新的开源机器翻译模型 North Small Translate,开放权重和流程。Cohere 称其为 1T 参数以下最好的机器翻译模型,并发布本地化负责人 Tom Kocmi 的讲解视频。
| |
| Aleph Alpha | Kolibri | 文本 | Aleph Alpha 于德国统一日发布开放权重模型 Kolibri:78B 总参数、约 3–3.46B 激活的德英双语 MoE Transformer,支持最长 1M token 上下文,权重以 Apache 2.0 许可上传 Hugging Face。2026-10-03 23:13:44,发布相关:Aleph Alpha 发布 Kolibri。78B 总参数、约 3–3.46B 激活的德英双语 MoE Transformer,支持最长 1M token 上下文,权重以 Apache 2.0 开放并上线 Hugging Face。
| |
| Ai2 | AstaBrief 8B | 文本 | Ai2 开源基于 Qwen3-8B 的科学报告生成模型 AstaBrief 8B 及训练数据,该模型将研究问题和检索到的文献片段一次性生成带引用的报告,已作为 Fast 模式上线 Asta 的报告生成功能。2026-10-02 23:19:50,发布相关:Ai2 开源 AstaBrief 8B。Ai2 开源基于 Qwen3-8B 的科学报告生成模型 AstaBrief 8B 及训练数据,该模型将研究问题和检索到的文献片段一次性生成带引用的报告,已作为 Fast 模式上线 Asta 的报告生成功能。
| |
| Ai2 | AstaBrief 8B | 文本 | Ai2 开源基于 Qwen3-8B 的科学报告生成模型 AstaBrief 8B 及训练数据,该模型将研究问题和检索到的文献片段一次性生成带引用的报告,已作为 Fast 模式上线 Asta 的报告生成功能。Ai2 开源基于 Qwen3-8B 的科学报告生成模型 AstaBrief 8B 及训练数据,该模型将研究问题和检索到的文献片段一次性生成带引用的报告,已作为 Fast 模式上线 Asta 的报告生成功能。
| |
| The Decoder:AI News | Microsoft | 语音 | Microsoft AI 发布实时转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首段结果仅约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,限期内每小时音频 0.54 美元。2026-10-02 17:20:39,发布相关:The Decoder:AI News 发布 Microsoft。Microsoft AI 发布实时转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首段结果仅约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,限期内每小时音频 0.54 美元。
| |
| — | Ai2 | 文本 | Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据…Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。
| |
| Kling | Kling 4.0 | 生视频 | 可灵AI公众号发布超级创作者、奥美资深创意总监盛健松对 Kling 4.0 内测版的实测。Kling 4.0 已开启内测,将于10月正式发布,支持最长30秒原生视频生成、主体与场景资产调用、声音延续、动作迁移,并提升复杂运镜稳定性、长提示词理解和跨镜头一致性。2026-10-02 12:04:46,发布相关:Kling 发布 Kling 4.0。可灵AI公众号发布超级创作者、奥美资深创意总监盛健松对 Kling 4.0 内测版的实测。Kling 4.0 已开启内测,将于10月正式发布,支持最长30秒原生视频生成、主体与场景资产调用、声音延续、动作迁移,并提升复杂运镜稳定性、长提示词理解和跨镜头一致性。
| |
| Microsoft AI | MAI-Transcribe-2-Streaming | 语音 | 微软发布首个实时流式语音转写模型,支持 60 种语言与自动语言检测;AA-WER Streaming:WER 2.50%、终稿延迟 0.13 秒登顶,流式约 $0.54/小时音频。2026-10-02 07:04:38,发布相关:Microsoft AI 发布 MAI-Transcribe-2-Streaming。微软发布首个实时流式语音转写模型,支持 60 种语言与自动语言检测;AA-WER Streaming:WER 2.50%、终稿延迟 0.13 秒登顶,流式约 $0.54/小时音频。
| |
| Perplexity | pplx-decider-27b | 文本 | Perplexity CEO Aravind Srinivas 宣布开源多模态决策模型 pplx-decider-27b,并通过新的 Decisions API 提供,输入 token 价格为 4 美分/百万,输出 token 免费,还表…Perplexity CEO Aravind Srinivas 宣布开源多模态决策模型 pplx-decider-27b,并通过新的 Decisions API 提供,输入 token 价格为 4 美分/百万,输出 token 免费,还表示未来几天会进一步降价。该模型 (API 版本 pplx-decider-v1-27b)被训练为对固定答案集输出概率分布而非文本,在 7,210 行固定评测集的 11 个决策基准上总体准确率 85.71%,其中 RAGTruth 88.80%、TabFact 90.60%。
| |
| Suno | Speech beta | 音乐 | Suno 推出 Speech beta,称其为首个能把语音与原创背景音乐作为一条完整曲目生成的音频模型。用户输入文字并描述想要的声音和音乐风格即可创作,beta 已向所有用户开放,官方提示仍存在口音漂移、停顿过重等问题并将持续改进。Suno 推出 Speech beta,称其为首个能把语音与原创背景音乐作为一条完整曲目生成的音频模型。用户输入文字并描述想要的声音和音乐风格即可创作,beta 已向所有用户开放,官方提示仍存在口音漂移、停顿过重等问题并将持续改进。
| |
| Black Forest Labs | FLUX 3 Image | 生图 | 现在就在 Higgsfield 上试用 FLUX 3 Image: https://higgsfield.ai/ai/image?model=flux-3-image现在就在 Higgsfield 上试用 FLUX 3 Image: https://higgsfield.ai/ai/image?model=flux-3-image
| |
| Tavus | Griffin | 其他 | Tavus 发布 Human Interaction Model Griffin,称首个通过视频图灵测试:48% 实时视频对话者误认其为真人;NVIDIA 全双工 AI 视频基准生成分 3.83/5(真人 3.92)。2026-10-02 03:50:44,发布相关:Tavus 发布 Griffin。Tavus 发布 Human Interaction Model Griffin,称首个通过视频图灵测试:48% 实时视频对话者误认其为真人;NVIDIA 全双工 AI 视频基准生成分 3.83/5(真人 3.92)。
| |
| webAI | TwIL-LM3-Pro | 文本 | webAI 发布开源模型 TwIL-LM3-Pro,仅 3.6B 参数,可在普通电脑本地量化运行,BIG-Bench Hard 得分 95.4,远超 Qwen3-8B 的 63.7。其训练配方为:在形式逻辑上微调、将权重合并回基座模型,再…webAI 发布开源模型 TwIL-LM3-Pro,仅 3.6B 参数,可在普通电脑本地量化运行,BIG-Bench Hard 得分 95.4,远超 Qwen3-8B 的 63.7。其训练配方为:在形式逻辑上微调、将权重合并回基座模型,再用程序化验证器做 RL,逻辑分数提升的同时通用推理保持稳定。该模型在 SVAMP 上得 95%、MuSR 上得 64.1%,均为所比较小模型中的最高分。
| |
| Microsoft AI | MAI-Voice-2.1-Flash | 语音 | MAI-Voice-2.1-Flash 即将登陆 MAI Playground 与 API,侧重低延迟语音生成;与 Transcribe/Voice 系列一并提供 Chatter 演示体验。2026-10-02 02:15:37,发布相关:Microsoft AI 发布 MAI-Voice-2.1-Flash。MAI-Voice-2.1-Flash 即将登陆 MAI Playground 与 API,侧重低延迟语音生成;与 Transcribe/Voice 系列一并提供 Chatter 演示体验。
| |
| Tavus | Griffin | 多模态 | Tavus 发布 Griffin,称其为首个通过视频图灵测试的人类交互模型 (HIM),48% 与之实时对话的人认为它是真人,此前系统通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上得 3.83 分 (真人为 …Tavus 发布 Griffin,称其为首个通过视频图灵测试的人类交互模型 (HIM),48% 与之实时对话的人认为它是真人,此前系统通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上得 3.83 分 (真人为 3.92),次优系统为 2.80 分;它将听、想、说和面部动画整合在单一系统中,可在对话者仍在说话时读取表情、语气并实时反应。
| |
| Odyssey | PROWL-2 | 世界模型 | 今天我们推出 PROWL-2,智能体及其世界模型通过递归学习实现共同提升。 智能体暴露想象中存在的错误,修复这些错误又能促成进一步的学习。 我们相信,这种开放式学习是迈向超级智能的关键一步。今天我们推出 PROWL-2,智能体及其世界模型通过递归学习实现共同提升。 智能体暴露想象中存在的错误,修复这些错误又能促成进一步的学习。 我们相信,这种开放式学习是迈向超级智能的关键一步。
| |
| Cloudflare | Clef | 文本 | Cloudflare 发布决策模型 Clef 与 Clef-flash,托管于 Workers AI,并以 Apache 2.0 在 Hugging Face 开源;同步推出 RL 微调服务。2026-10-02 01:31:03,发布相关:Cloudflare 发布 Clef。Cloudflare 发布决策模型 Clef 与 Clef-flash,托管于 Workers AI,并以 Apache 2.0 在 Hugging Face 开源;同步推出 RL 微调服务。
| |
| Cloudflare | Clef-flash | 文本 | Cloudflare 轻量决策模型 Clef-flash,与 Clef 同批开源并上线 Workers AI。2026-10-02 01:31:03,发布相关:Cloudflare 发布 Clef-flash。Cloudflare 轻量决策模型 Clef-flash,与 Clef 同批开源并上线 Workers AI。
| |
| Cloudflare | Clef / Clef-flash | 文本 | Cloudflare 发布两款决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,并以 Apache 2.0 许可证在 Hugging Face 完全开源。Cloudflare 发布两款决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,并以 Apache 2.0 许可证在 Hugging Face 完全开源。
| |
| Cohere | Embed 5 | 文本 | Cohere 发布 Embed 5 嵌入家族(Pro / Fast),支持文本、图像及图文融合、100+ 语言与 128K 上下文;两档共享向量空间,可用 Pro 建索引、Fast 查询。2026-10-02 01:13:12,发布相关:Cohere 发布 Embed 5。Cohere 发布 Embed 5 嵌入家族(Pro / Fast),支持文本、图像及图文融合、100+ 语言与 128K 上下文;两档共享向量空间,可用 Pro 建索引、Fast 查询。
| |
| Amazon | Strands Decider 2B | 文本 | AWS 开源高速低成本决策模型 Strands Decider 2B,可在预设选项间排序并输出置信度,灵感来自 TypeSafe 的 Jev,可本地运行。2026-10-02 00:49:22,发布相关:Amazon 发布 Strands Decider 2B。AWS 开源高速低成本决策模型 Strands Decider 2B,可在预设选项间排序并输出置信度,灵感来自 TypeSafe 的 Jev,可本地运行。
| |
| Amazon | Strands Decider 2B | 文本 | AWS 开源高速低成本决策模型 Strands Decider 2B,可在预设选项间排序并输出置信度,完全开源且可本地运行。AWS 开源高速低成本决策模型 Strands Decider 2B,可在预设选项间排序并输出置信度,完全开源且可本地运行。
| |
| Microsoft AI | MAI-Voice-2.1 | 语音 | Microsoft AI 同步推出 MAI-Voice-2.1 语音生成系列(含 Flash),面向对话式语音智能体;与 MAI-Transcribe-2-Streaming 一并登陆 MAI Playground / API。2026-10-02 00:00:00,发布相关:Microsoft AI 发布 MAI-Voice-2.1。Microsoft AI 同步推出 MAI-Voice-2.1 语音生成系列(含 Flash),面向对话式语音智能体;与 MAI-Transcribe-2-Streaming 一并登陆 MAI Playground / API。
| |
| Microsoft | MAI-Transcribe-2-Streaming | 语音 | Microsoft AI 发布流式转录模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 准确率榜排名第一,支持 60 种语言实时转录,收到音频约 100ms 即产出初步结果,内部评测显…Microsoft AI 发布流式转录模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 准确率榜排名第一,支持 60 种语言实时转录,收到音频约 100ms 即产出初步结果,内部评测显示字幕出现速度比最接近的竞品快 2 倍,介绍价 $0.54 每小时音频。
| |
| Viggle AI | Viggle Turbo v0.3 | 其他 | Viggle Turbo v0.3 发布:新 9-step 模式画面更干净、细节与小字更好;ComfyUI 可用 LoRA 或单文件 int8/fp8/GGUF。2026-10-01 23:39:34,发布相关:Viggle AI 发布 Viggle Turbo v0.3。Viggle Turbo v0.3 发布:新 9-step 模式画面更干净、细节与小字更好;ComfyUI 可用 LoRA 或单文件 int8/fp8/GGUF。
| |
| 开源社区 | OpenDLSS | 文本 | 开源项目 OpenDLSS 用 Vulkan 重新实现了 NVIDIA DLSS 5 的神经渲染网络,与原版 DLSS-NR build 310.8.0 比特级一致,75 个 block 边界的中间结果逐字节匹配。2026-10-01 19:14:13,发布相关:开源社区 发布 OpenDLSS。开源项目 OpenDLSS 用 Vulkan 重新实现了 NVIDIA DLSS 5 的神经渲染网络,与原版 DLSS-NR build 310.8.0 比特级一致,75 个 block 边界的中间结果逐字节匹配。
| |
| Ai2 / Allen Institute for AI | Ai2 | 文本 | Ai2 发布 Olmo-core 3,这是支持大规模混合专家(MoE)训练的开源框架,已验证可扩展至万亿参数级别。在 8 张 NVIDIA B300 GPU 上,47B 参数 MoE 吞吐达 52,000 tokens/秒/GPU,约为旧 FSDP 实现的 2.7 倍;专家池从 8 扩至 128 而训练吞吐下降不足 5%。2026-10-01 16:00:00,发布相关:Ai2 / Allen Institute for AI 发布 Ai2。Ai2 发布 Olmo-core 3,这是支持大规模混合专家(MoE)训练的开源框架,已验证可扩展至万亿参数级别。在 8 张 NVIDIA B300 GPU 上,47B 参数 MoE 吞吐达 52,000 tokens/秒/GPU,约为旧 FSDP 实现的 2.7 倍;专家池从 8 扩至 128 而训练吞吐下降不足 5%。
| |
| NVIDIA | Kumo Tabular | 其他 | NVIDIA 发布 Kumo Tabular 表格基础模型系列,用于分类和回归,以标注行为上下文、单次前向传播预测新行,无需训练、调参或特征工程。NVIDIA 发布 Kumo Tabular 表格基础模型系列,用于分类和回归,以标注行为上下文、单次前向传播预测新行,无需训练、调参或特征工程。
| |
| Perplexity | pplx-embed-v2-context-9b-preview | 文本 | Perplexity Research 与 turbopuffer 发布上下文嵌入模型 pplx-embed-v2-context-9b-preview,权重以 MIT 许可托管在 Hugging Face,可自托管部署,尚未上线 Perplexity API。2026-10-01 11:23:39,发布相关:Perplexity 发布 pplx-embed-v2-context-9b-preview。Perplexity Research 与 turbopuffer 发布上下文嵌入模型 pplx-embed-v2-context-9b-preview,权重以 MIT 许可托管在 Hugging Face,可自托管部署,尚未上线 Perplexity API。
| |
| Gemini 4 Argon | 文本 | (同主题清洗)谷歌向小批合作伙伴逐步推出 Gemini 4 Argon;早班已入库官宣/评测,本条为 rollout 跟进报道,勿作新发布。2026-10-01 09:14:56,发布相关:Google 的 Gemini 4 Argon(rollout 跟进,早班已覆盖)。据彭博社报道,谷歌开始向小批网络安全合作伙伴逐步推出旗舰模型 Gemini 4 Argon。
| ||
| Gemini 4 Argon | 文本 | Google DeepMind 发布前沿模型 Gemini 4 Argon,经 Fairwind Program 面向部分受信任测试者推出;单次输出上限可达 1M tokens。2026-10-01 04:30:24,发布相关:Google 发布 Gemini 4 Argon。Google DeepMind 发布前沿模型 Gemini 4 Argon,经 Fairwind Program 面向部分受信任测试者推出;单次输出上限可达 1M tokens。
| ||
| Runway | Praxis-1 | 世界模型 | Runway 机器人负责人 Andy Chen 阐述了 Runway 在机器人领域的独特方法,并以我们的开放权重世界动作模型 Praxis-1 的首次亮相作为结尾。 了解 Praxis-1 并申请早期访问:https://runway.com/praxis-12026-09-30 22:07:54,发布相关:Runway 发布 Praxis-1。Runway 机器人负责人 Andy Chen 阐述了 Runway 在机器人领域的独特方法,并以我们的开放权重世界动作模型 Praxis-1 的首次亮相作为结尾。 了解 Praxis-1 并申请早期访问:https://runway.com/praxis-1
| |
| webAI | TwIL-LM3-Pro | 文本 | webAI(Austin)发布 3.66B 本地模型 TwIL-LM3-Pro,形式逻辑评测相对 IBM Granite / VibeThinker-3B / Qwen3.5-4B / LFM2.5 有显著提升。2026-10-01 05:21:14,发布相关:webAI 发布 TwIL-LM3-Pro。美国 Austin 的 webAI 发布 3.66B 本地模型 TwIL-LM3-Pro,将 IBM Granite 的形式逻辑得分提升 28%,在形式逻辑上比 VibeThinker-3B 高约 35%、比 Qwen3.5-4B 高 24%、比 Liquid AI 的 LFM2.5-8B-A1B 高 47%。
| |
| MiniMax | H3 | 生视频 | 5/ 基于 @MiniMax_AI H3 构建,由 HeyGen 后训练。查看基准测试、提示词和 50+ 片段:https://developers.heygen.com/heygen-video-1.0-catalog5/ 基于 @MiniMax_AI H3 构建,由 HeyGen 后训练。查看基准测试、提示词和 50+ 片段:https://developers.heygen.com/heygen-video-1.0-catalog
|
条目由程序自动采集与整理,未经人工逐条核实,以各厂商官方公告为准。