查看: 3900| 回复: 4
跳转到指定楼层
上一主题 下一主题
收起左侧

Transformer为什么取代RNN和LSTM

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x

在许多自然语言处理(NLP)任务中,Transformers都优于LSTM和RNN。
从公式的角度来看,Transformer之所以取代RNN和LSTM,主要是因为其计算方式和模型架构在处理序列数据时更为高效和灵活。
以下是对比RNN/LSTM和Transformer的公式以及它们的不同之处:

  • RNN公式:

对于一个输入序列 x1,x2,…,xT,RNN的hidden state h在时间t的表达式是
激活函数是Tanh和ReLU

  • LSTM公式:

用门控机制来缓解RNN的梯度消失问题,hidden state的更新涉及多个门控(输入门 f、遗忘门 i、输出门 o)



为什么 RNN/LSTM 结果不如 Transformer?
  • RNN/LSTM: 隐状态 hth_tht​ 的计算依赖于前一个时间步的隐状态 ht−1h_{t-1}ht−1​,这是一个递归过程,需要逐步计算,难以并行化。
  • Transformer: 自注意力计算所有词对词的关系(QKTQK^TQKT),与序列的长度无关,允许所有词同时计算,大大提升了并行化能力。

长距离依赖:
  • RNN/LSTM: 通过逐步的隐状态传递(ht−1→hth_{t-1} \to h_tht−1​→ht​),长距离依赖难以保留,容易出现梯度消失或爆炸。



让我们看Attention逻辑如何解决丢失信息的问题:

  • Attention逻辑:

Transformer的核心机制是自注意力机制(Self-Attention),它计算输入序列中所有词之间的相互关系,而不是逐步地处理序列。关键的公式包括计算注意力分数(Attention Scores)和注意力权重(Attention Weights)

  • 注意力分数(Scaled Dot-Product Attention):给定一个查询(Query)QQQ,键(Key)KKK,值(Value)VVV,注意力机制首先计算查询和键的点积,再进行缩放和softmax操作:
  • Attention(Q,K,V)=
    , Q=XW^Q, K=XW^K, V=XW^V, dk​ 是键向量的维度,用于缩放点积结果。



Multi-Head Attention:
,



Transformer在算法中的革新使得我们能够规避NLP任务中,甚至是更广泛的seq to seq generation中完整得专递信息





评分

参与人数 1大米 +1 收起 理由
MiGTeddyBear + 1 给你点个赞!

查看全部评分


上一篇:category variable转成dummy variable,会不会妨碍机器学习性能?
下一篇:如何构建一个基于k近邻算法的推荐系统
全局:
说明文字 语句这种东西虽然看上去是sequence 其实是个graph
回复

使用道具 举报

推荐
zhaochen20 2024-9-1 08:02:56 | 只看该作者
全局:
地里怎么开始搞学术了?
回复

使用道具 举报

🔗
STAT_410 2024-9-1 02:48:39 | 只看该作者
全局:
qkv算式支持cross-attention所以才正式开启多模态时代
回复

使用道具 举报

🔗
dentist911 2024-9-1 11:26:23 | 只看该作者
全局:
3939199 发表于 2024-8-31 21:33
说明文字 语句这种东西虽然看上去是sequence 其实是个graph

词和词之间的关系可能真是和NN的连接来记忆和形成逻辑的
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表