本期节目邀请清华大学博士候选人孙宇涛,深度解析 Kimi K3 的技术架构与预训练策略。K3 通过混合注意力机制、门控 MLA 及潜在专家混合(Latent MoE)等设计,在提升模型智能上限的同时兼顾推理效率。孙宇涛指出,K3 在长上下文处理中采用 Nope 编码以优化外推表现,并利用 Quantile Balancing 解决大规模分布式训练中的负载均衡难题。该模型验证了在 2.8T 参数量级下,通过架构与基础设施的协同设计及科学的预训练调优,能实现有效扩展。K3 的实践表明,大模型研究已从单纯的架构创新转向系统性优化,模型参数规模仍是决定智能上限的核心驱动力。
Outlines
Sign in to continue reading, translating and more.
Open full episode in Podwise
