怎么聊起来的
- 2025 年 11 月新
Kimi发布线性注意力架构,KDA模块+增量注意力,逐步摆脱Full Attention。2 期
- 14:25阿里 Qwen 团队 apple to apple 比较几种线性注意力混合方式;Kimi Linear 对 Gated Delta 的具体改进

119. Kimi Linear、Minimax M2?和杨松琳考古算法变种史,并预演未来架构改进方案
张小珺Jùn|商业访谈录 · 2025-11-03 · 103 分钟
原站 ↗- 11:19聊聊最近参与的新工作,前几天刚发布的《Kimi Linear: An Expressive, Efficient Attention Architecture》
- 14:39《Kimi Linear》论文重点讲解:KDA模块(Kimi Delta Attention,增量注意力机制)
- 20:20Kimi Linear Attention vs DeepSeek Sparse Attention:Kimi走线性注意力路线,DeepSeek走稀疏注意力路线
- 40:30Kimi Linear每3层KDA插入1层全注意力层,三比一的比例快变成共识了