PODCAST · 张小珺Jùn|商业访谈录

2024 年 9 月节目

5 期 · 5 期带分节

  • 09-2576. 王小川返场谈o1与强化学习:摸到了一条从快思考走向慢思考的路
    1. 03:45Sam Altman被宫斗下课与强化学习大神Noam Brown的动态
    2. 05:45OpenAI o1是范式升级,摸到了一条从快思考走向慢思考的道路
    3. 08:18怎么看o1隐藏思维过程,有人破解o1思维链会被警告要封号?
    4. 09:04从以语言为核心走向思维链,分两阶段运行增加泛化性
    5. 11:38强化学习 vs 监督学习
    6. 16:39除了数学和代码以外,医疗是可以用强化学习提升的领域
    7. 19:55之前做强化学习实验没有CoT(思维链),今天更强调CoT了
    8. 22:16复现o1 vs 复现GPT-4
    9. 26:30未来几年将从强化学习范式走向写代码解决问题新范式
    10. 28:35做“水涨船高的应用”,不只是“沿途下蛋的应用”
    11. 31:35创业公司要走出大厂射程,在射程内你是没什么好活的
  • 09-1875. 和OpenAI前研究员吴翼解读o1:吹响了开挖第二座金矿的号角
    1. 03:04那个年代所有PHD都希望去Google Brain和DeepMind
    2. 03:46OpenAI o1-preview初体验,很意外在用户使用端做这么大规模的推理
    3. 07:20pre-training(预训练)能挖的金矿越来越少,以强化学习为基础的post-training(后训练)是另一个大金矿,使迈向AGI的梯子多了几节
    4. 09:00o1-preview版本是GPT-3时刻,到没到ChatGPT时刻要看正式版本
    5. 10:33o1应该核心关注两个要点和背后的技术原理
    6. 13:54强化学习能否探索出Scaling Law有希望,但很复杂
    7. 15:06强化学习三要素:reward model+搜索和探索+prompt,每一块都很难
    8. 16:422014年开始,UC Berkeley集体转向,押注强化学习
    9. 19:36RL算法的演进:从DQN(Deep Q-Network)到PPO(Proximal Policy Optimization)
    10. 23:45相信会带来通用能力而不是垂类能力提升
    11. 24:47长文本是实现AGI的第一步,推理能力是第二步
    12. 29:57通过o1-preview能反向复原哪些技术细节?
    13. 34:00reward model不太可能有一个单独的小组闭着眼睛训练,是耦合的
    14. 38:30思维链、安全、幻觉和算力
    15. 41:25为什么这么项目叫“Q*”?后来又叫“草莓”?梗都很有意思
    16. 49:49o1不代表垂直模型,依然相信会出现全能的大统一模型
    17. 57:57关于Scaling Law,2019年OpenAI内部讨论的细节
    18. 01:00:262019年的OpenAI处于“闭着眼睛挖矿的状态”
    19. 01:03:20OpenAI当年如何做管理:搞大新闻、发博客,KPI是博客关注量
    20. 01:10:282020年离开OpenAI后悔吗?
  • 09-1174. 从蒸汽机到无人驾驶4|Waymo和它的对手们:我暗中考察了四个月
    1. 02:00Waymo始于2009年,是Google X实验室一个项目
    2. 04:32我访谈Google无人车创始人Sebastian Thrun,结果被人骂了,很惭愧
    3. 07:13DARPA Grand Challenge(美国DARPA出资赞助的无人驾驶赛)被埋没的故事
    4. 13:24Waymo负责人连连换届:
    5. 18:05Waymo技术关键变化,对最简洁漂亮的架构端到端抱有理想
    6. 21:55我带队在凤凰城调研Waymo四个月,还暗中探访了Waymo“老巢”
    7. 38:30无人驾驶第二名Cruise(创始人Kyle Vogt),两年、40人团队,10亿美元卖给通用汽车
    8. 43:24一起安全事故,使Cruise从顶峰极速坠落
    9. 48:00为什么Waymo和Cruise同样作为大企业分支,风格差异这么大?
    10. 57:40Uber也曾是无人驾驶一个有竞争力的对手,怎么退出了比赛?
    11. 59:17另外两位竞争对手现况:Zoox、Aurora
  • 09-0573. AGI范式大转移:和广密预言草莓、OpenAI o1和self-play RL|全球大模型季报4
    1. 05:21为什么不一定能支持模型在GPT-4o基础上大幅跃升?现在处于“真空死亡地带”?
    2. 06:43我最担心的是,纯靠语言模型的经典Scaling Law /Pre train这个物理规律遇到瓶颈,或者在更大参数比如2-3T以上的情况下开始失效了
    3. 09:37如果scaling law在模型变大的过程中不work,现在有三条潜在路径:1、多模态尤其是视觉(但还没有证据说能从视觉模态训练涌现智能能力);
    4. 12:53如果我是AI公司CEO,我会200%资源all in RL这条路
    5. 13:40概念解释:Reinforcement Learning,简称RL,中文强化学习(Ilya用一句话概括强化学习:让AI用随机路径去尝试一个新任务,如果效果超出预期
    6. 19:05代码和数学可以变得很强,能不能泛化到更多领域没有证据
    7. 22:39你也可以把语言和预训练比作人类基因组,携带着人类几千年进化的基因,强化学习RL就是人类成长的一生
    8. 24:55必须很聪明的模型才能有能力做self-play RL的探索
    9. 27:07Anthropic Claude 3.5是这一波标志性的产品,他们不搞Sora/搜索,主线是RL;业内少数人意识到RL的重要性是最近两个月
    10. 28:35硅谷明星公司现阶段的资源投入?1-2家公司把RL当作最高优先级
    11. 28:562024年9月OpenAI和Anthropic即将要发布的,什么值得期待?
    12. 29:42AGI范式大转移之下,还会有GPT-6和GPT-7吗?(可能明年会看到很小的模型比今天GPT-4o要聪明非常多,一个期待是实现AGI不一定需要巨量参数的模型)
    13. 30:33新范式的困境和卡点
    14. 32:52Character.AI出售给Google预示AGI竞赛上半场结束,下半场开始,创始人Noam从Google进入self-play RL下半场
    15. 34:36新范式下,还需要那么多GPU吗?很多人关心英伟达股价
    16. 37:06AGI范式转移只在最核心的researcher中有共识,几百人,还没扩散
    17. 38:55Claude 3.5 Sonnet显著提升,带动了编程工具Cursor的火爆出圈
    18. 40:08OpenAI在造势的草莓、Q*,猜测背后都是强化学习RL
    19. 41:55国内公司应该应该all in 200%跟进RL
    20. 42:44语言模型和RL是乘级关系
    21. 57:00美国通用机器人的明星项目(Pi、The Bot是业界公认最头部的项目,除此之外融资金额很大、声量也比较高的是Skild AI、Figure AI)
    22. 58:31国内vs硅谷机器人:硅谷投robot foundation model一个大脑,像Andorid;在国内投整机,OV和小米
    23. 01:01:56LLM->多模态->具身智能->世界模型,这是AI发展路径
    24. 01:05:54LLM vs 移动互联网,叙事逻辑是什么?哪些明线与暗线?
    25. 01:07:04有没有可能,今天不做强化学习的公司未来都跑不出来
    26. 01:08:05站在现在,重新评论一下中国LLM?“月亮和六便士”
    27. 01:17:10Q*和草莓和RL应该是一件事,草莓是代号,RL是方法
    28. 01:18:07回答红杉美国合伙人 David Cahn发布最新文章《AI’s $600B Question》
    29. 01:20:00在2024年Q3,AI叙事还有哪些非共识?
    30. 01:22:45Character.AI之后,哪些AI公司还会被收购?做个预测
    31. 01:23:382000年互联网hype破灭后只留下Amazon一家公司,今天AI hype如果破灭了,谁是下一个Amazon?
    32. 01:24:24AGI第一幕是科技巨头受益,第二幕还没完全展开
  • 09-0272. 从蒸汽机到无人驾驶3|和孟醒聊特斯拉FSD进化史
    1. 01:30孟醒的学习和创业经历,从幼儿园就开始在中美两边穿梭
    2. 08:33为什么自动驾驶行业和公众之间充斥着信息不对称?
    3. 11:17自动驾驶分两条线:辅助驾驶已经到产品中期,无人驾驶产品还处在Pre-A阶段
    4. 18:18辅助驾驶和自动驾驶各自迈过几道坎?还有哪几道坎要过?
    5. 21:18亲身试驾特斯拉FSD不同版本的感受(从非端到端的最后一个版本V11.3.6到端到端版本V12.3、V12.4,技术提升斜率如何?)
    6. 27:37为什么L4公司看特斯拉FSD像小学生?优化目标和L4公司不一样
    7. 29:09L2直到实现极高驾驶能力之前,应该有最优接管率,不能过高也不能过低
    8. 33:12L2和L4截然不同的产品体系:L2提供更好的人机共驾体验,L4提供成本更低的出行服务能力
    9. 33:36L1-L5的命名体系和它带来的歧义
    10. 43:06特斯拉V12版本和端到端架构为什么重新点燃自动驾驶的热情
    11. 52:20V12更像是辅助驾驶里的GPT-3时刻
    12. 54:11关于特斯拉端到端架构,哪些是已知信息?哪些是黑盒?
    13. 56:43特斯拉自动驾驶的技术演进史(both硬件和软件)
    14. 01:02:54特斯拉是端到端且不用任何规则兜底,国内公司很难做到
    15. 01:04:07特斯拉的纯视觉路线vs大部分公司的激光雷达路线
    16. 01:11:52端到端是自动驾驶的终极大杀器吗?分别探讨L2和L4
    17. 01:17:32复刻特斯拉FSD需要多少花销?大致的估算
    18. 01:19:18几乎所有中国的竞争者都在跟进端到端架构