PODCAST · 晚点聊 LateTalk
2024 年 3 月节目
3 期 · 2 期带分节
- 03-2764: 让奶牛猫跳洗澡舞,与阿里通义薄列峰聊多模态共识中的变量是什么?| AI 大爆炸51 分钟
- 01:50典型的多模态包括文生图、文生视频等;XR 实验室研究范围:解决数字人等问题。
- 03:19多模态有较长的发展脉络,从 GAN 到 Diffusion Model 再到如今的 Sora。
- 06:35Sora 的冲击:恐惧无益,视频生成尚未完全解决,世界模型仍有探索空间。
- 08:04世界模型的定义和实现方法尚未达成共识。
- 09:09Sora 带来了挑战与冲击,创业公司的机会。
- 10:51面对 Sora,大厂的数据优势是否仍存在?
- 12:40多模态模仿人类智能和能力,是自然而重要的发展方向。
- 14:00阿里多模态研究脉络:数字资产生产+技能;技能涵盖表情、动作和交互等。
- 18:26EMO 通过单一语音控制生成视频,无需动作序列。
- 20:40Talking head 之前也有人做,新方法的区别在于使用了大模型。
- 21:32大模型带来的变化:EMO 是 zero shot,生成过程简单、轻量;同时效果更生动、复杂,适应性更强。
- 24:10Animate Anyone 用到通义千问 app 中是技术研发和应用的交集。
- 26:28用户带来的启发:让宠物跳舞比让人跳舞更受欢迎,因为宠物只能通过技术来跳舞。
- 27:10上传狗的人比猫的人更多,因为原初模型更容易识别狗,近期已做了优化,提升了对猫狗的接受率。
- 27:56免费提供 AIGC 功能的成本考量?现阶段更重视用户参与和反馈。
- 29:15为何分精力做产品优化?——现阶段的产品优化实质是模型能力的优化。
- 32:5807年前后关于深度学习的玩笑:“深度学习效果比其它方法高了一个点,但多了很多参数。”
- 33:42深度学习首先在语音识别任务上取得突破。
- 34:45在亚马逊 Amazon Go 解决实际视觉问题的经历。
- 36:30跨学科经历的启发?——实践中积累的正确理解至关重要。
- 38:20为什么物理世界的 AI 进化更慢?——硬件在过去甚至未来都是大瓶颈。
- 42:10多模态大趋势里的变量?——世界模型的实现。
- 43:12世界模型应该能模拟因果,而非仅表达统计关系。实现方式仍不确定。
- 44:37世界模型是否需 3D 化?尚不确定。
- 46:24世界模型应输入哪些数据?
- 48:32有了世界模型后,人们可以用它做什么?
- 03-2163: 来这的人都对上班这件事有所怀疑:和跳海创始人二狗与投资人 Mable 聊聊酒吧、精酿和年轻人78 分钟
- 03-1462: 对谈哲学教授姜宇辉:哲学能解决年轻人的意义危机吗?94 分钟
- 05:51大众对哲学的误解和对电子游戏的误解很相似
- 13:51韩炳哲提出“倦怠社会”,但没告诉我怎么走出倦怠
- 23:38姜老师被哲学“刺痛”的时刻
- 33:03先贤的思想还能帮我们理解数字时代的困境吗?
- 40:54普通人打开哲学的正确方式
- 48:25哲学提供的三种生命策略:超越论、内在论、虚无论
- 51:28都在谈使命、愿景,柏拉图和互联网大厂的区别在哪?
- 54:58如何用亚里士多德的“实践智慧”对抗生活的无意义感
- 1:09:42刷手机、“买买买”的快乐,为什么总是让人更空虚?
- 1:17:49无论世界是怎样的,我们总是可以对它说“不”
- 1:24:00真正的生命从你想了解自我开始,完整的生命从你想了解他人开始