本讲主线
老师推荐了 The Illustrated Transformer 作为辅助材料。
这节课基于 Tatsu H 对 2017-2025 年经典模型的统计,讨论两个问题:
- 不同模型在架构与超参数上有哪些共性与分歧?
- 这些演化背后的工程动机是什么?

架构与超参数观察
Pre-Norm vs Post-Norm 几乎所有现代 LLM(BERT 这类早期模型除外)都采用 Pre-Norm。核心原因是训练更稳定,梯度路径更顺畅。近年还出现了 double norm 等变体(如 Grok、Gemma 2),但尚未完全普及。
LayerNorm vs RMSNorm RMSNorm 不计算均值,只做均方根归一化,计算更简单。表面上看节省 FLOPs 不多,但在真实系统中,norm 的时间开销往往受 data movement 影响明显,因此 RMSNorm 的工程收益更像是在缓解内存墙,而不仅是减少算术量。
激活函数演化 从早期 ReLU,到 GPT 系列常见的 GeLU,再到近年广泛采用的 SwiGLU(门控激活变体)。门控结构通过逐元素调制,提升了表达能力与训练效率的折中表现。
串行层与并行层 传统 Transformer block 以串行堆叠为主。并行 block(如部分 GPT-J 设计)存在,但总体采用度不高。
位置编码路线 Sine/Absolute/Relative 都在不同阶段被主流模型采用。近年 RoPE(rotary position embeddings)几乎成为事实标准之一。
FFN 维度比(ffn dim : model dim) 传统经验常用 4 倍宽度;在 GLU 系列激活流行后,很多模型会选在 2.5-3.5 区间(常见约 8/3),以平衡参数规模与表达能力。
Attention 头部比例
head_dim × num_heads与model_dim的比例大多维持在 1 左右。深度与宽度(Aspect Ratio) 过深模型并行性差、延迟高。工程上常在深度和宽度之间做折中,现代模型经验区间集中在较稳定的可训练比值附近。
Mixture of Experts (MoE)
MoE 的核心思想是:用多个专家 FFN + 一个路由层,替代单一的致密 FFN,从而以更低激活计算获得更高参数容量。

路由机制
很多 routing 算法都可归纳为 “choose top-k”。常见三类范式:
- Token chooses expert
- Expert chooses token
- 全局 routing
目前主流 MoE 基本采用标准的 token-choice top-k。

DeepSeek V3 的经验表明:更多小专家 + 共享专家 的组合非常有效,在多个 benchmark 上带来了稳定增益。
如何训练 MoE
- Reinforcement learning 优化 gating policy:理论上更“正确”,但梯度方差和工程复杂度高,尚未普及;
- Stochastic perturbations。这里主要讲了这两年关于如何随机扰动的工作,比如加一些高斯噪声之类的;
- Heuristic balancing losses(启发式平衡损失)。系统效率要求我们均衡地使用专家模型。这里讲了 DeepSeek 从 v1 到 v3 的一些使用到的技术细节。
本节结论
- MoE 利用稀疏性:并非每个 token 都需要激活整个模型;
- 离散路由是难点,但 top-k 启发式在实践中非常有效;
- 大量实证结果说明 MoE 具备高性价比,因此已成为顶级模型的重要路线。