PODCAST · 晚点聊 LateTalk

2025 年 2 月节目

3 期 · 3 期带分节

  • 02-26103: 用Attention串起大模型优化史,详解DeepSeek、Kimi最新注意力机制改进
    1. 00:05注意力机制是大语言模型的核心,优化注意力机制计算效率与效果对长文本处理至关重要
    2. 06:00注意力机制本质是建立词与上下文的动态关联,解决传统 RNN 的遗忘问题
    3. 10:08Transformer 原本的 Full Attention 通过存储所有词向量解决长文本遗忘,但面临存储与计算复杂度瓶颈
    4. 12:24注意力机制 N 方复杂度导致显存与时间开销爆炸,稀疏化成为改进选择
    5. 15:25稀疏注意力与线性注意力(RNN 思路)是注意力机制两大改进方向,各有优劣
    6. 16:27之前稀疏注意力更主流,但 Mamba 之后,线性注意力也比较火
    7. 18:27算法、系统、硬件三层优化共同提升效率,如 MoE 与生成范式革新也能帮助处理长文本
    8. 21:06动态稀疏效果更好但计算效率低,静态稀疏(如滑动窗口)更高效但效果受限
    9. 24:06NSA 与 MoBA 聚焦预训练阶段稀疏化,解决训练与推理的机制差异
    10. 30:27NSA 与 MoBA 均采用动态与静态混合策略,块状稀疏设计适配硬件特性
    11. 24:55稀疏训练突破性能上限质疑,NSA 论文证明效果可超越稠密注意力
    12. 27:23长思维链(CoT)与 RL 需求推动稀疏注意力落地训练阶段
    13. 36:50块状稀疏设计(Block-Level)优化 GPU 并行与内存访问效率
    14. 42:06NSA 实测推理加速显著,MoBA 强调保留关键注意力头提升长程关联
    15. 48:21实验关注训练曲线稳定性与长 CoT 生成能力,而非传统 Benchmark
    16. 55:32存储压缩与多模态长序列处理是下一阶段关键挑战
    17. 57:55记忆架构需突破全存与固定存储的极端,探索类人动态决策机制
    18. 01:02:04长文本能力支撑多模态推理(视频、科研)、情感记忆与知识服务
    19. 01:16:28AGI 需具备科研能力突破知识边界,记忆与效率优化是底层支撑
    20. 01:22:03自组织 AGI 可能颠覆人类对智能的定义,动机与伦理仍是未知领域
    21. 01:26:38稀疏注意力解决存储与计算瓶颈,训练阶段改进适配 RL 与多模态需求
    22. 01:27:21线性注意力(如 MiniMax 01)是另一重要方向,下期节目将深入探讨
  • 02-25102: DeepSeek 启动开源周,大模型开源到底在开什么?
    1. 02:20过往实习、工作中的开源项目
    2. 03:18王子涵分享自己开源工作,包括在数研时做的 agent 相关 benchmark,以及参与 DPCVR 研发和关于 DPCRY 加 agent 的开源报告。
    3. 05:17DeepSeek 开源周预告,强调 Small but sincere;第一个库已发布:FlashMLA;未来开源方向推测
    4. 09:30FlashMLA,一个用 C++ 语言写到算子层的推理框架优化;像 DeepSeek 这样做大量更底层算子优化的努力比较难
    5. 17:14FlashMLA GitHub 反馈(issues)速览:有人想要 FP8,有人问何时支持 NPU?
    6. 19:23一起逛 GitHub 仓库(Repo),在开源项目里该看什么?
    7. 31:30大模型开源到底在开什么:技术报告、模型权重、推理框架、训练框架、数据集。一般一个开源模型都有技术报告和权重,但推理和训练框架的代码和数据集则不一定,尤其是数据集
    8. 35:23vLLM、SGLang,两个活跃的开源推理库;模型权重的下载途径;字节其实开源过一般较少开源的训练框架 (Verl)
    9. 41:25数据开源几乎没有,主要是出于信息敏感性和安全性考虑。
    10. 42:38除了数据集,DeepSeek 已开源过上述各部分,其中子涵参与的 ESFT 工作就也开源了训练框架。
    11. 44:16从闭源到开源,需要 another layer of hard work:如规范代码、适配开源推理或训练框架。
    12. 49:14不同开源策略主要和盈利模式与诉求有关。不靠 API 赚钱或期望推动更大格局变化(如形成标准)可能选择开源最强模型;另外,一些非盈利机构也会“非常开”,如 All
    13. 51:29是否会看到 OpenAI 开源最强模型?不确定。Sam Altman 在 twitter 发起投票的两个开源选项(o3-mini 和 phone-sized m
    14. 52:36子涵分享一个大模型滥用案例:自己推特账号被黑经历,“受害者”现身说法。
    15. 53:32Ilya:“if you value intelligence above all other human qualities, you’re gonna ha
  • 02-11101: 与王小川聊AI✖️医疗:通向“生命科学的数学原理”
    1. 03:28内蒙古脑梗患者案例,百川 M1 给出的诊断方向与协和医院会诊高度吻合
    2. 03:41走向开源是既定计划,方便医疗行业上手调优
    3. 06:09快速追 o1:蒸馏不是秘密
    4. 07:35DeepSeek “技术慢半步”超出预期
    5. 12:53成立百川时就想做医疗,2016 AlphaGo 和魏则西事件带来的思考
    6. 14:482000 年就做基因测序拼接算法,好奇生命的数学原理,研究中医
    7. 17:21ChatGPT 带来的判断:语言是中轴,AI 不是第四次工业革命
    8. 20:36为什么成立时未特别强调医疗?
    9. 21:20为何医疗不是垂直? & 团队反馈
    10. 26:47与北京儿童医院合作,为什么从儿科开始
    11. 30:52今年一季度,每个海淀居民会有 AI 医生助理
    12. 31:57三种付费方式:政府、医院和商保等;另一个机会是出海
    13. 36:53做大模型后“见过的省长和市委书记比过去都多”
    14. 38:45招投标过程分享
    15. 40:37训练医疗超级模型成本更高,但有相应价值。
    16. 42:47中国一年就诊人次超 84 亿
    17. 45:24医疗行业不会被通用智能吃掉,因数据、场景特殊性
    18. 47:56M1 有多模态,主要是为了交互,多模态不能开辟技术赛道
    19. 48:21o1 验证了语言是智能主轴
    20. 51:18下一个范式迁移是 AI 自己造工具
    21. 52:57怎么看“Yann LeCunt 认为只靠语言无法让 AI 理解真实世界规律”?
    22. 56:19更远的未来:义体化、攻壳机动队、AI 延续“人类文明”
    23. 01:02:02需要更多年轻人
    24. 01:05:13去年一年,创造了什么?健康、快乐吗?
    25. 01:06:57室温超导带来“蒙圈”,参与 AI 浪潮的幸运
    26. 01:14:0599.99% 的人低估了变化,大模型有望让世界更平
    27. 01:15:532025 年的两个期待