注册一亩三分地论坛,查看更多干货!
您需要 登录 才可以下载或查看附件。没有帐号?注册账号 
x
Transformer几乎是所有MLE/DS面试的必考内容。整理一下最高频的考点,希望对大家准备面试有帮助。
一、Self-Attention机制
Q、K、V分别是什么?Attention(Q,K,V)=softmax(Q K转置 /√d_k)V。必追问:为什么要除以√d_k?点积过大时会把softmax推入饱和区,导致梯度消失。还要会算复杂度:O(n平方·d),n是序列长度。
二、Multi-Head Attention
为什么用多头?每个头学习不同子空间的表示。维度关系:d_model = 头数 × d_k。常考:多头和单头大维度attention的区别?
三、位置编码
正弦位置编码、BERT的可学习位置编码、LLaMA的RoPE旋转位置编码。面试常问三者的优缺点,以及为什么RoPE在长文本上表现更好。
四、Layer Norm vs Batch Norm
Transformer用Layer Norm,因为NLP里batch内句子长度不一,BN统计量不稳定。追问:Pre-LN vs Post-LN对训练稳定性的影响?Pre-LN是现在的主流。
五、FFN前馈网络
两层MLP,维度先升后降,激活函数常用GELU。FFN占了Transformer约三分之二的参数量。
六、训练相关
Masked LM vs Causal LM的mask区别;学习率warmup的原因(初期梯度方差大);残差连接缓解梯度消失。
建议每个知识点做到一句话讲清核心、能展开讲三分钟,基本就稳了。祝大家面试顺利! |