新篇基础arXiv:2312.00752
Mamba:选择性状态空间
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Albert Gu, Tri Dao
arXiv · 2023
4.0k 引用 · 1.4k 阅读 · 0 收藏
摘要
提出带输入选择的状态空间模型,沿序列过滤信息,实现线性时间建模并在长上下文上表现强劲。
Introduces a selective state-space model that filters information along the sequence, achieving linear-time sequence modeling with strong long-context results.
提要
Mamba 提出带输入选择的状态空间模型,在线性时间下沿序列过滤信息。它重新打开一个问题:注意力是否是序列建模的唯一终点。
01背景与动机
序列建模长期由 Transformer 主导,其自注意力能建模任意位置依赖,但复杂度随长度二次增长,制约超长上下文应用。线性复杂度的状态空间模型是一条替代路线,然而经典 SSM 参数固定、与输入无关,缺乏按内容选择信息的能力。
Mamba 的核心动机是让 SSM 的关键参数随输入变化,从而在保持线性时间复杂度的同时获得内容选择能力。这样模型可以沿序列动态过滤信息,保留任务相关信号并抑制无关内容,使状态空间路线更贴近离散序列上的实际筛选需求。
02核心方法
Mamba 将选择性机制引入状态空间,使状态转移等相关参数成为输入的函数,从而能根据当前标记决定保留或遗忘哪些信息。与参数固定的经典 SSM 不同,这种输入依赖选择让信息过滤沿序列发生,同时整体计算仍对序列长度保持线性扩展。
为实现高效训练与推理,作者给出硬件感知的选择性扫描实现,把关键计算映射到现代 GPU 的更快存储层级,缓解朴素扫描的带宽瓶颈。该方法在语言建模与音频等模态上完成验证,表明选择性 SSM 可以作为实用的序列建模主干,而不仅是理论上的线性复杂度构造。
03结果与证据
论文表明,使状态参数依赖输入后,SSM 在需要内容感知的序列任务上行为明显改善,并在长上下文设定中展现有竞争力的建模能力。验证覆盖语言与音频等领域,用来支持线性时间复杂度与选择机制可以并存这一核心主张。
相关证据主要来自架构对照与长程依赖相关的实验观察,而不是依赖单项指标的堆叠。总体结论是:在维持线性复杂度的前提下,输入依赖的状态更新足以支撑强序列建模,从而为非注意力主干提供可以讨论的实证基础。
04影响与意义
Mamba 推动了后续混合架构探索,例如将状态空间层与注意力层结合的 Jamba 等设计,试图在效率与表达能力之间取得折中。它也促使社区重新思考超长上下文:当计算随长度近似线性增长时,窗口大小、记忆机制与系统栈的假设都需要一并调整。
更广泛地说,这项工作表明在单纯的规模扩展叙事之外,架构多样性仍然具有明确的研究与工程价值。选择机制可以在不诉诸全连接注意力的情况下完成信息筛选,为序列系统设计提供了另一条可落地、可与现有模块组合的路径。
05局限
尽管思路清晰,Mamba 及相关 SSM 变体在软件生态、工具链与大规模训练成熟度上仍落后于 Transformer,复现、部署与配套基础设施的完善仍需时间。社区在优化配方、分布式策略与生产经验上大多围绕注意力模型积累,迁移与运维成本不可忽视。
此外,并非所有任务设定都对选择性 SSM 更有利;在联想召回等强调任意位置精确绑定的问题上,其优势并不必然成立。因此实际架构选型仍需结合任务结构、硬件约束与工程成熟度综合判断,而不是把线性复杂度等同于全面替代。
06要点
- 01选择机制可以替代全连接注意力。
- 02算法要能映射到硬件才算数。
- 03架构多样性在缩放定律之外仍然有价值。
标签
相关论文
FlashAttention:把注意力写成 IO 感知算法
FlashAttention: Fast and Memory-Efficient Exact Attention
DeepSeek-V2:MLA 与经济型 MoE
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
Transformer:注意力就够了
Attention Is All You Need
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。