PODCAST · 晚点聊 LateTalk

2026 年 8 月节目

3 期 · 3 期带分节

  • 08-16179: 蒸馏风暴:一场无人公开谈论的技术竞赛
    1. 02:04典型蒸馏:让学生模型逼近教师的输出行为
    2. 04:26智能体轨迹蒸馏:可被“蒸”的数据越来越丰富
    3. 06:41不是所有使用强模型输出的训练都是蒸馏,但都违反用户协议
    4. 08:05蒸馏规模扩大的两个关键节点
    5. 10:17从为了压缩,到为了变强
    6. 13:51张一鸣的判断:最多只能逼近,很难真正超越
    7. 17:44一个运动员可以既嗑兴奋剂,也勤加训练吗?
    8. 24:41其它公司的蒸馏讨论
    9. 28:52账号、真实问题与数据管线:大规模蒸馏的 know-how
    10. 32:08蒸馏行为可以被隐藏吗?
    11. 34:56学生模型超越教师模型的可能性
    12. 37:29一直逼近而不超越,问题是什么?
    13. 38:35蒸馏的红线与“双标”争议
    14. 44:05更便宜的智能,如何改变前沿模型商业逻辑
  • 08-07178: 与田渊栋聊 RSI:模型自进化如何到来?
    1. 05:53为什么 RSI 在今年变热?
    2. 07:15去年与 GPT-5 合写论文,从不用再招实习生到创业
    3. 13:10coding 能力提升后,研究老手的春天又回来了
    4. 15:26从 AutoML 到 RSI:AI 辅助研究的今夕变化
    5. 19:48Anthropic 长文更多展示了提效,还不是递归自进化
    6. 27:14解决 RSI 不只靠 coding 这个支点
    7. 38:07强者愈强的变数:智能提升可能是跳跃的,而非平滑的
    8. 43:38终极形态也许是“修仙社会”
    9. 45:51First Steps:三个 benchmark 的初步成果
    10. 54:43现在缺什么?数据、算力与可解释性
    11. 57:13自我进化的风险
    12. 59:37“多数人已经绝望了,但我认为AI 终将成为科学”
    13. 01:05:45当 AI 能自己发现新知识,那我就来欣赏吧
    14. 01:08:13从 Waymo 到 FAIR,从工程回到研究
    15. 01:14:11hands on 带来的研究判断:区分难的不同程度
    16. 01:20:26大厂为什么变慢:小团队、扁平协作与 150 人临界点
    17. 01:23:22追求美的结构,也知道这是一种局限
    18. 01:26:09连点成线:延伸推荐
  • 08-03177: 详解Kimi K3:强到冲击Anthropic估值的模型什么样?
    1. 05:13使用体感:长程任务、惊艳的前端能力与被吐槽的不足
    2. 11:15K3 引发的开源、安全与估值大辩论
    3. 16:50Transformer 的「忒修斯之船」
    4. 25:34贵不贵、慢不慢,看单价之外的任务总成本
    5. 29:25K3 为什么现在慢?新架构、Serving Stack 与前缀复用
    6. 34:42权重一旦开放就收不回;真正的护城河在环境、验证和算力
    7. 39:36架构总览:让信息沿序列与深度更高效流动
    8. 42:42Quantile Balancing:近千个专家如何保持负载均衡
    9. 48:38KDA+MLA:线性注意力与全局注意力并非二选一
    10. 54:12线性注意力下,百万上下文如何缓解遗忘
    11. 57:27线性注意力给推理系统带来的工程变化
    12. 01:00:546.3 倍解码加速来自哪里
    13. 01:03:34Attention Residuals:让深层模型选择性读取浅层信息
    14. 01:10:23Per-head Muon 与大规模训练稳定性
    15. 01:14:46AI 能否自己发明优化器
    16. 01:20:34MOPD:九个领域专家为什么先分后合
    17. 01:27:11蒸馏的纯技术定义、on-policy 蒸馏与 off-policy 蒸馏的区别
    18. 01:31:08KDA 结构下,投机采样回退机制的变化
    19. 01:39:47Flash KDA、QAT 与训练—推理一致
    20. 01:46:50下一个开源最强,以及开源能否超过闭源
    21. 01:48:29持续学习、评测与模型平台期