跳到主内容
快讯直播
AI智模界
AI 词典

xLSTM:给 LSTM 换上指数门控和矩阵记忆

一句话定义:xLSTM(Extended LSTM,扩展长短期记忆)是 LSTM 的现代化改造版——把门控函数从 sigmoid 换成指数函数,让记忆既能衰减也能放大;再把记忆单元从向量升级成矩阵,最后像 Transformer 那样带残差和归一化地层层堆叠。

它想解决什么。LSTM 的核心是"门控 + 细胞状态":用几个 0~1 之间的开关决定哪些信息留下、哪些丢掉。问题是那个遗忘门用的是 sigmoid,输出永远在 0 到 1 之间,只能衰减记忆,不能放大;而且它必须按时间顺序一步步递推,GPU 上的并行度上不去。于是长上下文这块阵地基本被 Transformer 拿走了。

指数门控:把 sigmoid 换成指数激活。打个比方,老 LSTM 的遗忘门像只能往下拧的音量旋钮,声音只会越来越小;指数门控既能往下也能往上拧,前面被衰减掉的信号,后面可以重新放大回满格。sLSTM 里输入门和遗忘门都走指数,mLSTM 则是指数输入门配 sigmoid 遗忘门。指数容易数值爆炸,所以 sLSTM 额外引入了归一化状态(normalizer state)和稳定状态(stabilizer state)来兜底。

矩阵记忆:经典 LSTM 的细胞状态是一个向量,像一条只能顺序读写的磁带;mLSTM 把记忆换成一个矩阵,用类似 key-value 的方式写入和读取,相当于配了一本可擦写笔记本。更关键的是它去掉了隐藏层之间的循环连接,因此可以在时间维度上并行训练——这才是它能"现代化"的前提。

堆叠:像 Transformer 一样加残差连接、归一化层,把 sLSTM 块和 mLSTM 块按比例交替堆成深网络。

维度经典 LSTMTransformerxLSTM
门控sigmoid,限 0~1无门控,靠注意力加权指数门控,可大于 1
记忆形态向量KV cache矩阵
随序列长度的计算量线性平方线性
时间维并行训练不可天然可mLSTM 可,sLSTM 不可

和相邻概念的区别。和 Transformer 比,它是线性复杂度,推理时每步只需维护固定大小的状态,显存不随上下文增长;和 Mamba 这类状态空间模型比,它保留了显式的门控和更强的记忆混合机制,走的是"把 RNN 做现代化"而不是"彻底换成 SSM"的路线。具体实现细节和实验设置,以官方论文和代码仓库为准。

实际意义。对从业者来说,xLSTM 代表"线性复杂度 + 长上下文"这条路线的一支力量,适合流式推理、超长序列、端侧部署这类 Transformer 吃着费劲的场景。它目前仍在演进中,是否在你的任务上更划算,得拿真实数据跑一遍,别只看论文里的漂亮曲线。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。