首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Transformer >Transformer 的自注意力(Self-Attention)如何计算?

Transformer 的自注意力(Self-Attention)如何计算?

词条归属:Transformer

1. 自注意力的定义

自注意力(Self-Attention)是一种将同一序列内部不同位置相互关联的注意力机制,其查询、键、值均来自同一个输入序列。与交叉注意力(Cross-Attention)不同——后者查询来自一个序列、键和值来自另一个序列——自注意力用于在单一序列内部建立全局依赖。

2. 计算流程

自注意力的计算分为四步:

  • 对输入序列的每个位置,分别乘以三个可学习的权重矩阵,得到查询、键、值三组向量
  • 将查询与所有键做点积,得到注意力分数矩阵
  • 对分数进行缩放并施加 softmax,得到归一化的注意力权重
  • 用注意力权重对值向量加权求和,得到该位置的输出表示

3. 全局依赖的一步关联

由于所有位置可以同时进行上述计算,任意两个位置之间的信息传递只需一次注意力操作即可完成,最大路径长度为常数。这使得模型能够高效捕捉长距离依赖,也是 Transformer 相较循环结构的关键优势之一。

相关文章
自注意力机制(Self-attention)
最近,学了好多东西,今天看了一下李飞飞老师讲解的自注意力机制,因此在这记录一下,以供日后复习,同时自己学习消化知识也好。
卡伊德
2022-09-13
2.1K0
图解自注意力机制(Self-Attention)
传统的Attention机制发生在Target的元素和Source中的所有元素之间。
机器学习AI算法工程
2024-04-11
7.5K0
自注意力机制(Self-Attention)
普通自注意力(Self-Attention)的工作原理主要是让模型能够关注输入序列中不同位置的信息,并根据这些信息来生成当前位置的输出。它是Transformer模型中的一个关键组件,尤其在处理序列数据(如文本、语音等)时表现出色。
jack.yang
2025-04-05
2.1K0
自注意力层(Self-Attention Layer)
自注意力层(Self-Attention Layer)是Transformer架构中的一个核心组件,它使得模型能够捕捉到输入序列中不同位置之间的依赖关系,而无需依赖于传统的循环神经网络(RNN)或卷积神经网络(CNN)的结构。以下是对自注意力层的详细解析:
jack.yang
2025-04-05
1.1K0
为什么出现Transformer:传统RNN的问题;Attention(注意力机制)和Self-Attention(自注意力机制)区别
​推荐文章:深入探索MyBatis-Plus:高效实现字段模糊查询的秘诀-腾讯云开发者社区-腾讯云
zhangjiqun
2024-11-19
6480
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券