首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Transformer >Transformer 的掩码机制(Mask)是如何工作的?

Transformer 的掩码机制(Mask)是如何工作的?

词条归属:Transformer

1. 掩码的目的

掩码机制用于控制注意力可以"看到"哪些位置,通过在注意力分数矩阵中将不允许的位置置为极小值(如负无穷),使其经 softmax 后权重归零。掩码是层数学定义的一部分,而非单纯的实现细节。

2. 因果掩码

在解码器的自注意力中,为保证自回归生成特性——即当前位置只能依赖此前已生成的位置——需要施加因果掩码(Causal Mask),禁止位置 i 关注位置 i 之后的所有位置。这确保模型在预测下一个 token 时不会"偷看"未来信息。

3. 交叉注意力掩码与填充掩码

在编码器—解码器的交叉注意力中,解码器状态作为查询、编码器输出作为键和值,用于将生成过程对齐到输入序列。此外,在处理长度不等的批量样本时,填充掩码(Padding Mask)用于排除为对齐而补齐的占位位置,避免无效 token 干扰注意力计算。

相关文章
解密:OpenAI和DeepMind都用的Transformer是如何工作的
Transformer 是为解决序列转换或问题而设计的架构,该任务将一个输入序列转化为一个输出序列。 语音识别、文本转语音等问题都属于这类任务。
机器之心
2019-04-29
1.5K0
自注意力中的不同的掩码介绍以及他们是如何工作的?
在研究自注意力时,有很多的名词需要我们着重的关注,比如填充掩码,前瞻掩码等等,但网上没有太多注意力掩码的教程和它是如何工作的信息,另外还有以下的细节需要详细的解释:
deephub
2022-11-11
1.6K0
[labelme]labelme如何将标注的json格式转成png的mask文件掩码文件
labelme工具不仅仅具有标注功能,而且可以将json文件转化为png的分割训练文件,如果您是一个类别则可以直接用labelme_json_to_dataset进行转换最后提取对应的掩码文件即可进行语义分割训练。如果您是>=2个类别则不推荐使用labelme工具进行转换,官方已经提示使用labelme_json_to_dataset进行超过2个类别转换可能会导致颜色映射错误,从而导致转换Png混乱,进一步导致训练的模型识别能力很差或者根本不能识别。官方的labelme_json_todatase工具转换要求json绝对路径不能包含中文路径或者空格,否则需要更改代码才能正常转换。这里不做讲解怎么改代码,下面我们将带大家怎么转换。转换前需要注意几点:
git clone firc-dataset
2025-07-17
2.1K0
Hadoop 的 Checkpoint 机制是如何工作的?如何优化 Checkpoint 的频率?
Hadoop 的 Checkpoint 机制主要用于维护文件系统的元数据一致性,防止因 NameNode 故障导致的数据丢失。Checkpoint 主要通过 Secondary NameNode(在 Hadoop 2.x 及以后的版本中,这个角色可以由 Checkpoint Node 或 Standby NameNode 承担)来实现。
代码小李
2025-01-23
6720
谷歌、DeepMind和OpenAI都在用的Transformer是如何工作的?| 干货
不论是各处霸榜的谷歌BERT、OpenAI最近的强大NLP模型GPT-2,还是DeepMind击败星际2顶尖职业玩家的AlphaStar,背后都有 Transformer的身影。
量子位
2019-04-23
9500
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券