PODCAST · 晚点聊 LateTalk

2025 年 11 月节目

4 期 · 4 期带分节

  • 11-30143: 阿里、Kimi都在用的DeltaNet是什么?|与杨松琳聊线性注意力新改进
    1. 02:07注意力机制是什么?
    2. 04:21DeltaNet 的提出,用 Delta Rule 来增强 in-context retrieval
    3. 09:41近年的改进主要是模型架构,而非“更新规则”
    4. 14:25阿里 Qwen 团队 apple to apple 比较几种线性注意力混合方式;Kimi Linear 对 Gated Delta 的具体改进
    5. 17:00更新规则和模型架构改进的区别:更新规则是在算子层面“动刀”
    6. 19:50算法出身,自学 Infra;学习 Hazy Research Group 的风格
    7. 23:28Qwen 和 Kimi 大概率在下一代旗舰模型用线性注意力,而 MiniMax 用回 full attention;DeepSeek 目前释放的改进都是“稀疏注
    8. 37:07稀疏注意力 vs 线性注意力潜力对比
    9. 39:40即使算力无限,线性注意力仍有价值,因为它在有限数据中的学习效率更高,而高质量数据正是当前瓶颈
    10. 42:28线性注意力在状态追踪上也可能有效果优势,而状态追踪对 Agentic 很重要
    11. 47:33线性注意力的“归纳偏见”和 The Bitter Lesson:先验与 scalable 并不矛盾
    12. 49:30回应 RWKV(原始智能)彭博:从未说发明 DeltaNet,一直在给 Schmidhuber 署名
    13. 51:51关注注意力改进的起点,数学知识、Infra,交叉能力怎么积累?
    14. 58:48发现 Hoseholder 累乘和 DeltaNet 关联的过程
    15. 01:02:44AI 何时能像人这样产生联想?——Prompt 合适,大模型应该能独立发现这个算法
    16. 01:04:11FLA 小组的产生,受 Tri Dao 做 FlashAttention 的启发,像运营产品一样运营技术社区;Kimi 从 FLA 小组招募了线性注意力研究者
    17. 01:11:24稀疏注意力的改进,DeepSeek 年初 NSA 到最近 DSA 的变化
    18. 01:16:44线性注意力的改进,从线性混合全注意力,到线性混合稀疏注意力(比如混合 DeepSeek DSA 和 Kimi KDA 😀
    19. 01:21:10更广泛来说,关注何种模型演进?——持续学习
  • 11-24142: 斑马CPO修佳明:一款能主动教学的 AI 产品是如何出现的
    1. 04:36确定性的方向
    2. 08:01与模型“搏斗”
    3. 13:58为什么开发 delay 了?
    4. 20:56从维持能力到突破能力
    5. 24:08让大模型学会人的教学经验与教学法
    6. 29:36更难的是对(教学)难度的控制
    7. 34:16这种模式适合所有人吗?
    8. 35:54让 AI 提供一种教学情绪价值
    9. 41:38对 AI 外教人格的理解
    10. 47:37试用用户的反馈与规则设定
    11. 52:06如何衡量 AI 的教学能力?
    12. 56:28未来的 AI 教学产品会如何发展
    13. 59:22如何运用数据和经验:斑马的 AI 壁垒在哪里
    14. 01:04:05AI 产品还是教育产品?斑马的付费和定价策略
  • 11-23141: Strutt 洪小平:大疆激光雷达前负责人做了台“电动轮椅”?不做人形也能通向具身
    1. 02:07伯克利物理学博士→组建大疆光电部:奔着量产做激光雷达
    2. 08:26大疆→南方科技大学:新工科教育 & 思考创业,锁定「机器人」方向
    3. 14:03直接做人形机器人和具身“终极形态”,是“有方法、没路径”
    4. 18:04OpenAI 加大投入 LLM 时,已有早期信,具身没到这个状态;识别早期信号的核心是数据积累
    5. 22:43看到“老龄化”去收,就是它了!
    6. 25:13个人移动设备能获得宝贵的家庭、生活场景数据
    7. 29:28ev¹ 是泛个人出行设备,它的完整体验
    8. 35:07出行的自由和喜悦,不分健康或残疾、衰老或年轻
    9. 41:13大家更关注 PMF 的 M(需求),但有时 P(产品)做得足够好,M 就能自动打开
    10. 43:26ev¹ 的开发,从做加法到做减法
    11. 47:51观察用户说不出来的需求;
    12. 51:19ev¹ 也是一个 Robot Helper 和机器人平台:可加传感器、执行器、计算单元等配件
    13. 56:50在双滚机上做 200 万圈测试
    14. 58:33“产品真正帮到人”的感觉,很触动
    15. 01:00:54Go to Market 策略:定价、渠道、规模
    16. 01:03:55创业,从“定义一个好团队”开始
    17. 01:07:25大疆的“舒适”:技术说话、以结果论英雄、可以专注自己的事
    18. 01:12:35应对未来可能的竞争:品牌、专利布局、团队综合性,本质是团队效率
    19. 01:19:33消费科技公司,在高效 vs 速度上的分布:追觅、Insta360、大疆
    20. 01:22:39为什么大疆到 2019 年才定成文价值观?
    21. 01:24:43Next Question:跨越鸿沟——ev¹ 这样的产品怎么进入大众市场?
    22. 01:28:06连点成线:往期推荐
  • 11-10140: 深势科技张林峰、孙伟杰:AI for Science,从开始到现在
    1. 01:3293 年生人学物理,the party is over 的迷茫
    2. 08:42用 AI 加速第一性原理计算:薛定谔方程、密度泛函、分子动力学
    3. 21:31第一个 milestone:用一套统一方法表示多种“不变性”
    4. 26:27普林 2017 年的 200 多块 P100→DeePMD-kit→DeepModeling 开源社区
    5. 29:51AlphaFold 和 DeePMD,AI 做科研的两种方式
    6. 32:38毕业、回国、创业:机会是 AI for Science,不是 get simulation done 然后发论文
    7. 42:06做微尺度的“达索系统”,把量子物理软件化
    8. 56:14人才培养:在 DP “读大学”的少年们
    9. 01:04:37机器学习数理建模→预训练→大语言模型→科研 Agent→AI 科学家
    10. 01:16:20Agent 正在重塑科研范式
    11. 01:22:46“科研无国界”被挑战,在中国,更能推动开源、开放
    12. 01:29:00垂直还是平台,一个必须做的取舍
    13. 01:32:57诺奖表彰“第一个”,而基础平台要做“最后一个”
    14. 01:39:24我们为 AI 科学家做好准备了吗?
    15. 01:49:13欲望与勇气,《牧羊少年的奇幻之旅》
    16. 01:55:33“老爹,你最光辉的时候是什么时候?”“就是现在!”
    17. 01:57:21“理想主义的实干者才能改变世界”
    18. 01:57:59Next Question:Innovator 什么样?第一批 AI 发现的新成果
    19. 02:04:04连点成线:不约而同,我们在好多期节目里都聊到了 AI 加速科学发现