YouTube23 Feb 2025
2h 36m

逐篇讲解DeepSeek、Kimi、MiniMax注意力机制新论文(含投屏版)——“硬件上的暴力美学”

Podcast cover

Zhang Xiaojun Podcast

DeepSeek、Kimi 和 MiniMax 近期发布的注意力机制论文,标志着大模型技术从单纯的数据堆叠转向深度的架构创新。DeepSeek 的 Native Sparse Attention 通过动态稀疏化与硬件协同设计,在预训练阶段实现了性能与效率的双重提升,甚至在部分基准测试中超越了全注意力机制。Kimi 的 MOBA 架构追求极简,利用 SGD 动态选择 KV 块,但在微调阶段需通过混合架构解决梯度稀疏问题。MiniMax 则采用线性注意力与 Softmax 注意力的混合模型,在保持检索能力的同时显著降低了推理开销。这些创新旨在解决长文本建模的计算瓶颈,通过硬件亲和的算法设计,为大模型在推理时间扩展及长序列处理上提供了更高效的路径。

Outlines

Sign in to continue reading, translating and more.

Open full episode in Podwise