查看: 289| 回复: 0
跳转到指定楼层
上一主题 下一主题
收起左侧

Transformer面试必考知识点总结

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
Transformer几乎是所有MLE/DS面试的必考内容。整理一下最高频的考点,希望对大家准备面试有帮助。

一、Self-Attention机制

Q、K、V分别是什么?Attention(Q,K,V)=softmax(Q K转置 /√d_k)V。必追问:为什么要除以√d_k?点积过大时会把softmax推入饱和区,导致梯度消失。还要会算复杂度:O(n平方·d),n是序列长度。

二、Multi-Head Attention

为什么用多头?每个头学习不同子空间的表示。维度关系:d_model = 头数 × d_k。常考:多头和单头大维度attention的区别?

三、位置编码

正弦位置编码、BERT的可学习位置编码、LLaMA的RoPE旋转位置编码。面试常问三者的优缺点,以及为什么RoPE在长文本上表现更好。

四、Layer Norm vs Batch Norm

Transformer用Layer Norm,因为NLP里batch内句子长度不一,BN统计量不稳定。追问:Pre-LN vs Post-LN对训练稳定性的影响?Pre-LN是现在的主流。

五、FFN前馈网络

两层MLP,维度先升后降,激活函数常用GELU。FFN占了Transformer约三分之二的参数量。

六、训练相关

Masked LM vs Causal LM的mask区别;学习率warmup的原因(初期梯度方差大);残差连接缓解梯度消失。

建议每个知识点做到一句话讲清核心、能展开讲三分钟,基本就稳了。祝大家面试顺利!

评分

参与人数 3大米 +22 收起 理由
instant_dev + 20 给你点个赞!
Christina200 + 1 赞一个
chuqixiaozhu + 1 给你点个赞!

查看全部评分


上一篇:现在转MLE还可以吗
下一篇:MLE电面高频ML Coding题型总结
您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表