状态空间模型是什么?
处理一段序列(比如一句话),Transformer 的做法是让每个词都去看所有其他词——信息足,但代价是计算量随长度「平方级」暴涨。状态空间模型(State Space Model,SSM)换了个思路:像一条缓缓流动的河,用一个不断更新的「隐藏状态」把前面看到的信息压缩、带往后面,边读边更新。这样处理长序列时,内存和时间都更省。它和 Transformer 差在哪?
Transformer:全员互看每个位置都关注所有位置,效果好,但越长越贵。
SSM:状态接力
只靠一个「状态」往下传,处理超长文本时更有优势。
它为什么突然火了?
线性复杂度长度翻倍,成本只翻一倍左右,而不是平方倍,长文本非常划算。
长程依赖
对「前文和当前相隔很远」的场景,SSM 也能保持记忆。
硬件友好
计算模式规律,便于在 GPU 上高效运行。
它的代表与局限
Mamba 就是最出名的 SSM 变体之一。SSM 在长序列、实时推理上很有潜力,不过在需要「全局精细对比」的任务上,Transformer 仍占上风。两者未来很可能是互补,而非取代。一句话记住:状态空间模型是处理序列的「新路线」——用压缩的状态接力,换来长文本上的高效率。
评论