PODCAST · 张小珺Jùn|商业访谈录
2025 年 11 月节目
3 期 · 3 期带分节
- 11-28121. 对DeepMind谭捷的访谈:机器人、跨本体、世界模型、Gemini Robotics 1.5和Google126 分钟
- 02:00机器人是在真实世界里做图形学,图形学是在simulation里做机器人嘉宾小传:小时候喜欢打游戏,读博士读的计算机图形学
- 13:06机器人基座大模型到底是不是一个非常独立的学科?So far, not yet今天的机器人发展到什么阶段了?
- 23:44Robotics最大问题是数据,它在一个非常复杂的unstructured environment里,可以发生任何事情最大的问题还是数据问题
- 47:32生成极大量仿真数据,是弥补它缺点的一个重要手段我们比较重视的一点还是数据、数据、数据
- 01:03:48世界模型就是Vision-Language-Vision,vision和language in,生成下一帧的图像世界模型的定义是:如果给上前一帧,再给上机器人的
- 01:08:29如果你有灵巧手,触觉就非常重要,之所以我前面觉得触觉不重要,是受限于当时的硬件如果你有灵巧手,触觉就非常重要
- 01:17:35一个有使命感的人,他不会容忍说“I’m on a wrong ship”这几年Google AI或者robotics的研究文化上有没有发生过变化?
- 11-18120. 小鹏新上任的刘先明首次访谈:Language是毒药、拆掉L、简单即美、换帅、小鹏的AI转型109 分钟
- 02:16人物小记曾在Meta、Cruise,从事机器学习与计算机视觉研究
- 19:00大模型拆Language我们的做法简单直接,把VLA的Language拆掉就完了
- 33:53小鹏汽车向物理AI战略的转型为什么一家汽车公司的自动驾驶战略需要向AI战略转型?
- 54:30换帅的背后过去1年做过“头铁”的事情
- 11-03119. Kimi Linear、Minimax M2?和杨松琳考古算法变种史,并预演未来架构改进方案103 分钟
- 04:00个人、研究主线与线性注意力机制的探索之路
- 06:27松琳做过一个开源库:flash-linear-attention(简称FLA)
- 07:04怎么通俗理解Linear Attention的Linear?
- 11:19聊聊最近参与的新工作,前几天刚发布的《Kimi Linear: An Expressive, Efficient Attention Architecture》
- 12:20为什么Kimi在年初开始需要重新设计注意力机制?设计的背景和目标
- 14:39《Kimi Linear》论文重点讲解:KDA模块(Kimi Delta Attention,增量注意力机制)
- 18:56Kimi内部有一个Scaling Ladder(规模阶梯),在一个规模下面表现好就在下一个规模下面去scale,就像通关
- 20:20Kimi Linear Attention vs DeepSeek Sparse Attention:Kimi走线性注意力路线,DeepSeek走稀疏注意力路线
- 23:01Minimax从M1到M2的架构变化,从Linear Attention退回到Full Attention,为什么?
- 27:00硅谷的注意力机制方案不方便说,但可以浅聊一下OpenAI有paper的方案
- 28:05Linear Attention从2020年发明出来开始后的前进线索
- 38:16纯Linear Attention是无效的,混合注意力机制还是有很多全局注意力层,这样下限有保证
- 40:30Kimi Linear每3层KDA插入1层全注意力层,三比一的比例快变成共识了
- 42:32权衡(Trade-off)表达能力(expressivity)与计算效率(efficiency)
- 46:28chunkwise algorithm for parallelization(分块并行算法)
- 47:55如何设计Attention?两条主流和一些非主流路线
- 49:36结合Linear Attention和Sparse Attention的未来理想方案
- 55:36公平的比较:Linear Attention vs Sliding-Window Attention(滑窗注意力)
- 57:05Transformer → MoE → Linear/Sparse Attention的算法演变,背后动因是给定你相同的FLOPs(浮点运算量),利用这些FLO
- 58:26近几年架构方面突破最大的是MoE,下一个突破可能是Attention;Transformer就两个模块,一个是FFN,一个是Attention;现在FFN已经雕
- 01:01:28数据、算法、算力是驱动人工智能的三驾马车,当数据遇到数据强,算法创新变得更重要
- 01:02:48架构的未来:1、能不能干掉全局注意力?它是阻止context window继续scale up的主要瓶颈
- 01:04:30如何把Linear Attention的Transformer继续scale up?
- 01:07:43中国AI的算法创新相比海外肯定是更强的——因为没有那么多卡(
- 01:10:56其他训练细节:NoPE vs. RoPE
- 01:12:09DeepSeek-OCR
- 01:12:55松琳也参与了Qwen3-Next,没有参与Minimax M2
- 01:13:39“雕”架构的人
- 01:15:16自己的心路:“当你很清楚你要做什么的时候,你是不会遇到什么挫折的”
- 01:23:12说到考古,我们在最后聊聊从Transformer开始的算法变种历史
- 01:29:50Delta Rule算法、硬件亲和、DeepSeek非常追求硬件和算法的匹配
- 01:42:23给更年轻的年轻人的建议