线性注意力与SSM
核心:Transformer 的 O(n²) 注意力是长上下文天花板,替代架构以 O(n) 换成本。
动机:1M token 自注意力约 1 万亿次操作、~2TB 显存——纯注意力架构在超长序列上不可行
SSM 思路:把历史压缩进固定大小状态向量,推理 O(n)、常数内存、无 KV Cache——像"日志摘要"而非注意力的"记忆宫殿"
演进:S4(固定参数)→ Mamba(选择性:参数随输入变化,"关注该关注的")→ Mamba-2(证明 SSM 与 Attention 数学统一)→ Mamba-3(ICLR 2026 Oral:梯形离散化+复数状态+MIMO)
RWKV:训练并行、推理循环,社区驱动 7 个版本;RWKV-7 3B 多项基准超 Llama 3.2
工业落地全是混合架构:MiniMax-01(7 份线性注意力:1 份全注意力,4M 上下文)、Kimi Linear(KV Cache -75%,1M 上下文解码吞吐 6×)、NVIDIA Nemotron-3
保留全注意力的原因:精确检索("上文第三个词是什么")与 in-context learning 是线性架构弱项
判断:2026 前沿模型仍以注意力为主,"多数便宜层+少数全注意力层"的混合架构是务实主流
