DeepSeek、Kimi 和 MiniMax 近期发布的注意力机制论文,标志着大模型技术从单纯的数据堆叠转向深度的架构创新。DeepSeek 的 Native Sparse Attention 通过动态稀疏化与硬件协同设计,在预训练阶段实现了性能与效率的双重提升,甚至在部分基准测试中超越了全注意力机制。Kimi 的 MOBA 架构追求极简,利用 SGD 动态选择 KV 块,但在微调阶段需通过混合架构解决梯度稀疏问题。MiniMax 则采用线性注意力与 Softmax 注意力的混合模型,在保持检索能力的同时显著降低了推理开销。这些创新旨在解决长文本建模的计算瓶颈,通过硬件亲和的算法设计,为大模型在推理时间扩展及长序列处理上提供了更高效的路径。
Outlines
Sign in to continue reading, translating and more.
Open full episode in Podwise
