首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >状态空间模型 >状态空间模型为何能实现线性复杂度?

状态空间模型为何能实现线性复杂度?

词条归属:状态空间模型

1. 避免全局两两比对

Transformer 的自注意力需要对序列中每个 token 与其他所有 token 计算关系,形成长度为 N 的 N×N 注意力矩阵,因此复杂度为 O(N²)。SSM 不做全局比对,而是逐 token 更新固定维度状态,每个 token 的计算成本恒定。

2. 固定维度状态

SSM 的隐藏状态维度不随序列长度增长。处理 N 个 token 需要 N 步,每步成本相同,总复杂度因此为线性的 O(N)。这意味着序列长度翻倍时,计算量只翻倍,而非像 Transformer 那样增长为四倍。

3. 推理阶段的实际收益

线性复杂度在超长序列上优势尤为明显。当序列达到百万 token 级别时,Transformer 的平方复杂度在现有硬件上几乎不可行,而 SSM 的线性扩展使其能够处理基因组、长音频、长文档等超长输入。

相关文章
状态空间模型为视频世界模型解锁长期记忆
视频世界模型通过根据动作预测未来帧,为人工智能在动态环境中进行规划和推理开辟了广阔前景。近期,特别是视频扩散模型的进步,在生成逼真的未来序列方面展现出了惊人的能力。然而,一个重大瓶颈依然存在:长期记忆的维持。由于使用传统的注意力层处理长序列会产生高昂的计算成本,当前模型难以记住过去较远时间的事件和状态,这限制了它们执行需要持续理解复杂场景的任务的能力。
用户11764306
2026-03-17
3660
从线性注意力视角揭秘视觉Mamba,清华、阿里合作提出全新MILA模型
论文第一作者为清华大学自动化系博士生韩东辰,指导老师为黄高副教授。他的主要研究方向包括高效模型架构设计、多模态大模型等。
机器之心
2025-02-14
6670
告别 Transformer:Mamba 模型如何实现线性时间序列建模
在深度学习领域,Transformer 架构已成为处理序列数据的主流方法。然而,随着序列长度的增加,Transformer 在计算和内存方面的需求也急剧上升。为了解决这一问题,研究人员提出了 Mamba(Linear-Time Sequence Modeling with Selective State Spaces)模型,一种基于选择性状态空间(Selective State Space Model,SSM)的新型架构。本文将通俗易懂地介绍 Mamba 的原理、优势以及应用场景。
未名编程
2025-04-23
2.7K0
ECCV 2024 | ModelMambaIR:基于Mamba模型用于图像恢复的简单基线
近年来,图像恢复领域取得了显著进展,主要归功于现代深度神经网络(如CNN和Transformer)的发展。然而,现有的恢复骨干网络在全局感受野和高效计算之间面临困境,限制了其在实际应用中的应用。最近,选择性结构化状态空间模型(尤其是改进版Mamba)在长程依赖建模方面展现出巨大潜力,具有线性复杂度,为解决上述困境提供了一种方法。然而,标准的Mamba在低级视觉任务中仍面临局部像素遗忘和通道冗余等挑战。在本文中,作者提出了一种简单但有效的基线模型,名为MambaIR,通过引入局部增强和通道注意力来改进原始Mamba。通过这种方式,MambaIR利用了局部像素相似性并减少了通道冗余。大量实验证明了作者方法的优越性,例如,MambaIR在图像超分辨率任务中比SwinIR高出0.45dB,且具有相似的计算成本但拥有全局感受野。
小白学视觉
2024-12-23
1.5K0
PCM:一种新型点云学习模型、引入状态空间模型Mamba高效全局建模(天工AI开源)
https://github.com/SkyworkAI/PointCloudMamba
AI进修生
2024-12-02
1.8K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券