CS336 Lecture 5-6: GPUs & Kernels, Triton
为什么这两讲至关重要 在已经学过的课程中,L1-L4 讲的是"模型长什么样",L7-L8 讲的是"多卡怎么协作"。L5-L6 卡在两者之间——单卡内部到底在发生什么。 如果你不理解 GPU 的硬件结构,你就无法理解: 为什么 Flash Attention 是过去五年 LLM 领域最重要的系统优化 为什么大矩阵乘法是"compute-bound"而 Attention 是"memory-bound" 为什么你写的 PyTorch 代码有时 GPU 利用率只有 30% ZeRO-3 的通信开销到底卡在哪里(看懂 L7-8 那块没懂的) Percy 在 L6 的原话很直白:“You cannot optimize what you don’t measure, and you cannot measure what you don’t understand.” Lecture 5:GPU 架构解剖(Tatsu) 5.1 从一张 H100 说起 H100 的基本参数: HBM(显存):80GB,带宽 ~3.35 TB/s SRAM(片上共享内存):每 SM 约 256KB,总带宽 ~几十 TB/s(比 HBM 快一个数量级) 计算能力:BF16 下 ~990 TFLOPS 关键不在于这些数字有多大,而在于数字之间的比例。 ...