NLP中的Attention总结

NLP中的Attention总结

article/2025/10/14 21:12:01

Attention是模拟人脑的注意力机制。人在看到一些东西，往往只关注重要的信息，而忽略其他信息。自然语言处理中的attention是对文本分配注意力权重，Attention的本质就是从关注全部变为关注重点。

1 Attention的原理

在这里插入图片描述
Attention的计算过程：

query和key向量进行相似度计算，得到权重。
将得到的权值进行归一化，得到每个key的归一化权重。
根据权重，对value进行加权求和。

2 Attention的类型

在这里插入图片描述

如上图，按不同的方式，可将attention分为不同类型。

在这里插入图片描述

3 attention计算方式

attention通俗来讲是用两个向量(query,key)计算得到一个得分score。从数学角度看，就是两个向量得到一个数值。一般有以下计算方式：

（1）点乘： $s(q,k)=q\cdot k$

（2）余弦相似度： $s(q,k)=\frac{q\cdot k}{|q||k|}$

还有引入学习参数的方式

（3）矩阵相乘： $s(q,k)=q^TWk$

（4）小网络学习（多层感知机）：输入两个向量，输出一个数值

4 attention的使用场景

4.1 长文本任务

如篇章级别的任务，这类型任务输入的信息过多，使用attention捕获关键信息。

4.2 涉及两端相关文本

可能需要对两端内容进行对齐，如机器翻译，翻译时当前词与原文的信息对齐。阅读理解，问题与原文信息的对齐。

4.3 任务只依赖某些特征

某些任务只依赖与部分强特征词。

引用自：

[1]Attention用于NLP的一些小结

[2]一文看懂attention

http://chatgpt.dhexx.cn/article/TRAfAqpq.shtml

相关文章

Attention 理解汇总

Attention 理解汇总

在 Encoder-Decoder中，预测每个Decoder 的语义编码 c 是一样的，句子 X 中每个词对输出 Y 的每个词的影响都是相同的。这样有两个弊端： 一是语义向量无法完全表示整个序列的信息； 二是先输入的内容携带的信息会被后输入的信息稀…

阅读更多...

$[深度学习] 自然语言处理 --- Self-Attention(三) 知识点与源码解析$

[深度学习] 自然语言处理 --- Self-Attention(三) 知识点与源码解析

在当前的 NLP 领域，Transformer / BERT 已然成为基础应用，而 Self-Attention 则是两者的核心部分，下面尝试用 Q&A 和源码的形式深入 Self-Attention 的细节。一 Q&A 1. Self-Attention 的核心是什么？ Self-Attention …

阅读更多...

attention介绍

attention介绍

Attention 正在被越来越广泛的得到应用。 Attention 到底有什么特别之处？他的原理和本质是什么？Attention都有哪些类型？本文将详细讲解Attention的方方面面。 Attention 的本质是什么 Attention（注意力）机制如果浅层…

阅读更多...

Attention原理

Attention原理

文章目录 Attention原理HAN原理利用Attention模型进行文本分类参考资料 Attention原理转载一个Hierarchical Attention神经网络的实现转载图解Transformer 转载 Attention原理和源码解析论文链接 Attention is All You Need HAN原理论文链接Hierarchical Attention Net…

阅读更多...

$Transformer详解（二）：Attention机制$

Transformer详解（二）：Attention机制

1.Encoder-Decoder中的attention机制上一篇文章最后，在Encoder-Decoder框架中，输入数据的全部信息被保存在了C。而这个C很容易受到输入句子长度的影响。当句子过长时，C就有可能存不下这些信息，导致模型后续的精度下降。Attentio…

阅读更多...

attention模型

attention模型

以机器翻译为例说明： 普通的RNN机器翻译模型: 次结构弱点在于当target句子太长时，前面encoder学习到的embedding vector(红边框)可能会被后面的decoder遗忘。因此改进版本如下: 这样，每次在输入target的word的时候，除了可以看到…

阅读更多...

【深度学习】Self-Attention 原理与代码实现

【深度学习】Self-Attention 原理与代码实现

1.Self-Attention 结构在计算的时候需要用到矩阵Q(查询),K(键值),V(值)。在实际中，Self-Attention 接收的是输入(单词的表示向量x组成的矩阵X) 或者上一个 Encoder block 的输出。而Q,K,V正是通过 Self-Attention 的输入进行线性变换得到的。 2. Q, K, V 的计算 S…

阅读更多...

Self -Attention、Multi-Head Attention、Cross-Attention

Self -Attention、Multi-Head Attention、Cross-Attention

Self -Attention Transformer结构图上图是论文中 Transformer 的内部结构图，左侧为 Encoder block，右侧为 Decoder block。红色圈中的部分为 Multi-Head Attention，是由多个 Self-Attention组成的，可以看到 Encoder block 包含一…

阅读更多...

$Attention Rollout$

Attention Rollout

问题陈述从图1a中的原始attention可以看出，只有在最开始的几层，不同位置的attention模式有一些区别，但是更高层中的attention权重更加一致。这表示随着模型层数的增加，嵌入的内容变得更加情境化，可能都带有类似的信息…

阅读更多...

Attention可视化

Attention可视化

Attention matrix： https://github.com/rockingdingo/deepnlp/blob/r0.1.6/deepnlp/textsum/eval.py plot_attention(data, X_labelNone, Y_labelNone)函数 #!/usr/bin/python # -*- coding:utf-8 -*-""" Evaluation Method for summarization tas…

阅读更多...

Attention机制

Attention机制

文章目录一、Attention机制是什么？二、推荐论文与链接三、self-attention 一、Attention机制是什么？ Attention机制最早在视觉领域提出，九几年就被提出来的思想，真正火起来应该算是2014年Google Mind发表了《Recurrent Models o…

阅读更多...

Attention详解

Attention详解

1.背景知识 Seq2Seq模型：使用两个RNN，一个作为编码器，一个作为解码器。编码器：将输入数据编码成一个特征向量。解码器：将特征向量解码成预测结果。缺点：只将编码器的最后一个节点的结果进行了输出&am…

阅读更多...

浅析NLP中的Attention技术

浅析NLP中的Attention技术

Attention（注意力机制）在NLP、图像领域被广泛采用，其显而易见的优点包括： （1）从context中捕捉关键信息； （2）良好的可视性和可解释性。我们常用QKV模型来理解Attention&…

阅读更多...

Attention 机制

Attention 机制

文章目录 Attention 的本质是什么Attention 的3大优点Attention 的原理Attention 的 N 种类型转载来源：https://easyai.tech/ai-definition/attention/ Attention 正在被越来越广泛的得到应用。尤其是 BERT 火爆了之后。 Attention 到底有什么特别之处&#xff1f…

阅读更多...

详解Transformer中Self-Attention以及Multi-Head Attention

详解Transformer中Self-Attention以及Multi-Head Attention

原文名称：Attention Is All You Need 原文链接：https://arxiv.org/abs/1706.03762 如果不想看文章的可以看下我在b站上录的视频：https://b23.tv/gucpvt 最近Transformer在CV领域很火，Transformer是2017年Google在Computation an…

阅读更多...

Attention 一综述

Attention 一综述

近年来，注意力（Attention）机制被广泛应用到基于深度学习的自然语言处理(NLP)各个任务中。随着注意力机制的深入研究，各式各样的attention被研究者们提出，如单个、多个、交互式等等。去年6月，google机器翻译…

阅读更多...

从Attention到Bert——1 Attention解读

从Attention到Bert——1 Attention解读

下一篇从Attention到Bert——2 transformer解读文章目录 1 Attention的发展历史2015-2017年 2 Attention的原理3 Multi-Head Attention4 Self-Attention为什么需要self-attention什么是self-attention 5 Position Embedding 最早，attention诞生于CV领域&#xff0…

阅读更多...

Attention UNet

Attention UNet

Attention UNet论文解析 - 知乎Attention UNet论文地址： https://arxiv.org/pdf/1804.03999.pdf 代码地址： https://github.com/ozan-oktay/Attention-Gated-NetworksAttention UNet在UNet中引入注意力机制，在对编码器每个分辨率上的特征与解…

阅读更多...

attention

attention

文章目录 Attention基本的Attention原理参考 Hierarchical Attention原理实践参考 Self Attentionother Attention Attention Attention是一种机制，可以应用到许多不同的模型中，像CNN、RNN、seq2seq等。Attention通过权重给模型赋予了区分辨别的能力&am…

阅读更多...

史上最小白之Attention详解

史上最小白之Attention详解

1.前言在自然语言处理领域，近几年最火的是什么？是BERT！谷歌团队2018提出的用于生成词向量的BERT算法在NLP的11项任务中取得了非常出色的效果，堪称2018年深度学习领域最振奋人心的消息。而BERT算法又是基于Transformer&#xff0…

阅读更多...

推荐文章