152. 领读Kimi K3技术报告:从架构创新聊起,注意力美学、多教师蒸馏和开源MoE

播放真实单集
Episode Summary真实 show notes
今天的节目是一集 学习播客 ,学习Kimi K3技术报告,希望和大家一起领略“技术之美”。 K3是有效扩展到2.8T总参数并全量开源的MoE模型。大家可能注意到,这集技术报告的领读距离模型发布已经过去一段时间。期间,我们试图寻找一位合适的嘉宾,我们希望这位嘉宾的学术和工作背景非常适合讲K3。最后找到孙宇涛。 宇涛目前是清华大学计算机系博士候选人,上海创智学院璞锐学者。他从博士开始的研究方向是LLM架构、预训练,架构创新一直是他的兴趣点,这正好是K3亮点之一。 宇涛透过领读K3技术报告也串联讲解了十多篇相关论文。 他的语速非常快——前方语速预警。 OUTLINE: 02:00 宇涛的自我介绍和研究经历,为什么对架构创新最感兴趣? 16:05 从Kimi K3论文出发,论文讲解的框架与脉络 19:02 宇涛开始领读论文: 1 导读 Kimi K3将设计概括为沿sequence、depth和width三个维度扩展信息流;其中depth与width本质上仍是模型容量扩展的两种组织⽅式,这⼀“三维 scaling”更多是贯穿论⽂的叙事框架。 2 Model Architecture 2.1 线性注意⼒的前世今⽣ [Microsoft Research] RetNet :最初的 data-independent decay 与 chunk-recurrent 递归形式 [NVIDIA] Gated DeltaNet :引⼊ gated delta rule [Moonshot AI] Kimi Linear :fine-grained decay及其带来的infra变化 2.2 Gated
Business Vocabulary规则派生 · 可核对
aillm
Marketing Insight规则派生 · 可核对
商业启示与英文表达将由此基于真实内容萃取。当前为结构占位,不生成虚构事实。