首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Transformer >Transformer 的多头注意力(Multi-Head Attention)有什么作用?

Transformer 的多头注意力(Multi-Head Attention)有什么作用?

词条归属:Transformer

1. 多头机制的动机

单一的注意力函数只能学习一种关注模式,难以同时捕捉序列中不同层面、不同粒度的关系。多头注意力(Multi-Head Attention)通过并行运行多个独立的注意力函数,让模型能够同时关注来自不同表示子空间的信息。

2. 计算方式

多头注意力将查询、键、值分别用不同的学习投影线性变换 h 次,得到 h 组投影;对每组投影分别施加单头注意力,得到 h 个输出;再将这 h 个输出拼接起来,经过一次额外的输出投影得到最终结果。原始 Transformer 采用 8 个注意力头。

3. 主要作用

  • 让不同注意力头分别聚焦于语法结构、语义关联、长距离上下文等不同维度的关系
  • 缓解单头注意力因平均化而损失有效分辨率的问题
  • 在不显著增加计算量的前提下增强模型的表达能力
相关文章
深度学习基础 | 超详细逐步图解 Transformer
读完先修知识中的文章之后,你会发现:RNN由于其顺序结构训练速度常常受到限制,既然Attention模型本身可以看到全局的信息, 那么一个自然的疑问是我们能不能去掉RNN结构,仅仅依赖于Attention模型,这样我们可以使训练并行化,同时拥有全局信息?
NewBeeNLP
2021-11-04
2.4K0
Transformer+self-attention超详解(亦个人心得)
链接|https://zhuanlan.zhihu.com/p/432814387
zenRRan
2021-12-09
6.9K2
Transformer到底是什么?为什么我还是无法理解Transformer?
究其原因,是但凡讲到Transformer,铺天盖地的资料上来就直奔自注意力机制(Self-Attention)的Q、K、V细节,只钻枝叶、不谈全局,只见树林,不见森林。
烟雨平生
2026-04-14
1.1K2
[深度学习概念]·谷歌transformer论文解读(转)
这篇博客的主要内容是对谷歌提出的transformer 进行论文解读,包含算法复杂度的分析。对应的论文是 “Attention is all you need", 链接如下 https://arxiv.org/pdf/1706.03762.pdf 。
小宋是呢
2019-06-27
2.1K0
【深度学习】Transformer简介
最早提出的Transformer模型[1]针对的是自然语言翻译任务。在自然语言翻译任务中,既需要理解每个单词的含义,也需要利用单词的前后顺序关系。常用的自然语言模型是循环神经网络(Recurrent Neural Network,RNN)和卷积神经网络(Convolutional Neural Network,CNN)。
Twcat_tree
2023-11-24
5K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券