DeepSeek R1 技术报告逐句讲解3 期 · 16 段
R1-Zero 与 R1、GRPO、蒸馏等报告细节被逐篇拆解,并讨论其与Kimi K1.5、o1路线差异。
- 55:10还是先看deepseek
- 07:25科普 DeepSeek-R1 & DeepSeek-V3:它们的工作原理和训练方式?
- 18:40DeepSeek 超越了 OpenAI 吗?我们掌握了他们没有的技术了吗?DeepSeek 到底有没有蒸馏 OpenAI?蒸馏能超越 SOTA 吗?
- 21:43DeepSeek-R1 代表的 RL vs Anthropic RLHF 的路线之争?
- 28:04DeepSeek 的胜利中,什么因素最重要?——开源、技术、成本、产品?
- 42:45DeepSeek-V3 为什么可以只花 550 万美元?李飞飞 50 美元训出媲美 DeepSeek-R1、OpenAI o1 的 AI 推理模型 s1 是怎么
- 55:12为什么梁文峰和 DeepSeek 能做出来?为什么其他国内大厂做不出来?
- 56:54DeepSeek 的胜利看上去是技术的胜利,AI 时代 PM 应该怎么办?
- 01:13:35DeepSeek 自己会做 chatbot 吗?
- 01:19:35预测 DeepSeek 的下一步?
- 01:26:56用 Peter Thiel 的创新理论来分析 DeepSeek/R1 在低成本推理方面的成功,具体在哪些层面实现了协同创新?
- 33:03DeepSeek-R1-Zero and DeepSeek-R1技术报告《DeepSeek-R1: Incentivizing Reasoning Capabi
- 01:16:18DeepSeek-R1:冷启动强化学习( Reinforcement Learning with Cold Start)
- 01:42:33DeepSeek-R1技术报告是一片优美精妙的算法论文,有很多“发现”,这是它成为爆款报告的原因
- 01:43:50对DeepSeek-R1训练成本的估算:
- 02:20:07DeepSeek论文的结尾谈未来往哪里发展?