PODCAST · 晚点聊 LateTalk
2025 年 11 月节目
4 期 · 4 期带分节
- 11-30143: 阿里、Kimi都在用的DeltaNet是什么?|与杨松琳聊线性注意力新改进87 分钟
- 02:07注意力机制是什么?
- 04:21DeltaNet 的提出,用 Delta Rule 来增强 in-context retrieval
- 09:41近年的改进主要是模型架构,而非“更新规则”
- 14:25阿里 Qwen 团队 apple to apple 比较几种线性注意力混合方式;Kimi Linear 对 Gated Delta 的具体改进
- 17:00更新规则和模型架构改进的区别:更新规则是在算子层面“动刀”
- 19:50算法出身,自学 Infra;学习 Hazy Research Group 的风格
- 23:28Qwen 和 Kimi 大概率在下一代旗舰模型用线性注意力,而 MiniMax 用回 full attention;DeepSeek 目前释放的改进都是“稀疏注
- 37:07稀疏注意力 vs 线性注意力潜力对比
- 39:40即使算力无限,线性注意力仍有价值,因为它在有限数据中的学习效率更高,而高质量数据正是当前瓶颈
- 42:28线性注意力在状态追踪上也可能有效果优势,而状态追踪对 Agentic 很重要
- 47:33线性注意力的“归纳偏见”和 The Bitter Lesson:先验与 scalable 并不矛盾
- 49:30回应 RWKV(原始智能)彭博:从未说发明 DeltaNet,一直在给 Schmidhuber 署名
- 51:51关注注意力改进的起点,数学知识、Infra,交叉能力怎么积累?
- 58:48发现 Hoseholder 累乘和 DeltaNet 关联的过程
- 01:02:44AI 何时能像人这样产生联想?——Prompt 合适,大模型应该能独立发现这个算法
- 01:04:11FLA 小组的产生,受 Tri Dao 做 FlashAttention 的启发,像运营产品一样运营技术社区;Kimi 从 FLA 小组招募了线性注意力研究者
- 01:11:24稀疏注意力的改进,DeepSeek 年初 NSA 到最近 DSA 的变化
- 01:16:44线性注意力的改进,从线性混合全注意力,到线性混合稀疏注意力(比如混合 DeepSeek DSA 和 Kimi KDA 😀
- 01:21:10更广泛来说,关注何种模型演进?——持续学习
- 11-24142: 斑马CPO修佳明:一款能主动教学的 AI 产品是如何出现的75 分钟
- 04:36确定性的方向
- 08:01与模型“搏斗”
- 13:58为什么开发 delay 了?
- 20:56从维持能力到突破能力
- 24:08让大模型学会人的教学经验与教学法
- 29:36更难的是对(教学)难度的控制
- 34:16这种模式适合所有人吗?
- 35:54让 AI 提供一种教学情绪价值
- 41:38对 AI 外教人格的理解
- 47:37试用用户的反馈与规则设定
- 52:06如何衡量 AI 的教学能力?
- 56:28未来的 AI 教学产品会如何发展
- 59:22如何运用数据和经验:斑马的 AI 壁垒在哪里
- 01:04:05AI 产品还是教育产品?斑马的付费和定价策略
- 11-23141: Strutt 洪小平:大疆激光雷达前负责人做了台“电动轮椅”?不做人形也能通向具身90 分钟
- 02:07伯克利物理学博士→组建大疆光电部:奔着量产做激光雷达
- 08:26大疆→南方科技大学:新工科教育 & 思考创业,锁定「机器人」方向
- 14:03直接做人形机器人和具身“终极形态”,是“有方法、没路径”
- 18:04OpenAI 加大投入 LLM 时,已有早期信,具身没到这个状态;识别早期信号的核心是数据积累
- 22:43看到“老龄化”去收,就是它了!
- 25:13个人移动设备能获得宝贵的家庭、生活场景数据
- 29:28ev¹ 是泛个人出行设备,它的完整体验
- 35:07出行的自由和喜悦,不分健康或残疾、衰老或年轻
- 41:13大家更关注 PMF 的 M(需求),但有时 P(产品)做得足够好,M 就能自动打开
- 43:26ev¹ 的开发,从做加法到做减法
- 47:51观察用户说不出来的需求;
- 51:19ev¹ 也是一个 Robot Helper 和机器人平台:可加传感器、执行器、计算单元等配件
- 56:50在双滚机上做 200 万圈测试
- 58:33“产品真正帮到人”的感觉,很触动
- 01:00:54Go to Market 策略:定价、渠道、规模
- 01:03:55创业,从“定义一个好团队”开始
- 01:07:25大疆的“舒适”:技术说话、以结果论英雄、可以专注自己的事
- 01:12:35应对未来可能的竞争:品牌、专利布局、团队综合性,本质是团队效率
- 01:19:33消费科技公司,在高效 vs 速度上的分布:追觅、Insta360、大疆
- 01:22:39为什么大疆到 2019 年才定成文价值观?
- 01:24:43Next Question:跨越鸿沟——ev¹ 这样的产品怎么进入大众市场?
- 01:28:06连点成线:往期推荐
- 11-10140: 深势科技张林峰、孙伟杰:AI for Science,从开始到现在127 分钟
- 01:3293 年生人学物理,the party is over 的迷茫
- 08:42用 AI 加速第一性原理计算:薛定谔方程、密度泛函、分子动力学
- 21:31第一个 milestone:用一套统一方法表示多种“不变性”
- 26:27普林 2017 年的 200 多块 P100→DeePMD-kit→DeepModeling 开源社区
- 29:51AlphaFold 和 DeePMD,AI 做科研的两种方式
- 32:38毕业、回国、创业:机会是 AI for Science,不是 get simulation done 然后发论文
- 42:06做微尺度的“达索系统”,把量子物理软件化
- 56:14人才培养:在 DP “读大学”的少年们
- 01:04:37机器学习数理建模→预训练→大语言模型→科研 Agent→AI 科学家
- 01:16:20Agent 正在重塑科研范式
- 01:22:46“科研无国界”被挑战,在中国,更能推动开源、开放
- 01:29:00垂直还是平台,一个必须做的取舍
- 01:32:57诺奖表彰“第一个”,而基础平台要做“最后一个”
- 01:39:24我们为 AI 科学家做好准备了吗?
- 01:49:13欲望与勇气,《牧羊少年的奇幻之旅》
- 01:55:33“老爹,你最光辉的时候是什么时候?”“就是现在!”
- 01:57:21“理想主义的实干者才能改变世界”
- 01:57:59Next Question:Innovator 什么样?第一批 AI 发现的新成果
- 02:04:04连点成线:不约而同,我们在好多期节目里都聊到了 AI 加速科学发现