<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>微调 on Ganko Space</title><link>https://ganko.asia/tags/%E5%BE%AE%E8%B0%83/</link><description>Recent content in 微调 on Ganko Space</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Mon, 27 Apr 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ganko.asia/tags/%E5%BE%AE%E8%B0%83/index.xml" rel="self" type="application/rss+xml"/><item><title>多卡并行训练和微调技术</title><link>https://ganko.asia/posts/%E5%A4%9A%E5%8D%A1%E5%B9%B6%E8%A1%8C%E8%AE%AD%E7%BB%83%E5%92%8C%E5%BE%AE%E8%B0%83%E6%8A%80%E6%9C%AF/</link><pubDate>Mon, 27 Apr 2026 00:00:00 +0000</pubDate><guid>https://ganko.asia/posts/%E5%A4%9A%E5%8D%A1%E5%B9%B6%E8%A1%8C%E8%AE%AD%E7%BB%83%E5%92%8C%E5%BE%AE%E8%B0%83%E6%8A%80%E6%9C%AF/</guid><description>&lt;blockquote>
&lt;p>这是使用 Google DeepResearch 生成的偏理论分析报告，内容基于2026/4/27之前的公开资料和技术文献，主要是方便自己学习，准确性和时效性可能无法完全保证。&lt;/p>&lt;/blockquote>
&lt;hr>
&lt;h2 id="第一章-深度学习分布式训练的底层基石显存与通信的博弈">第一章 深度学习分布式训练的底层基石：显存与通信的博弈&lt;/h2>
&lt;p>随着大语言模型（LLM）参数规模从十亿级别飙升至万亿级别，深度学习的训练与微调已经彻底演变为一项复杂的系统工程。在这一演进过程中，单张图形处理器（GPU）的显存容量与计算能力已无法满足动辄数千吉字节（GB）的内存需求，多卡并行架构成为必然选择。&lt;/p>
&lt;p>在多卡分布式训练中，架构设计的核心挑战始终围绕着**“显存墙（Memory Wall）”&lt;strong>与&lt;/strong>“通信墙（Communication Wall）”**的博弈展开。&lt;/p>
&lt;h3 id="11-显存消耗模型解构">[1].1 显存消耗模型解构&lt;/h3>
&lt;p>要深刻理解分布式训练的演进，必须首先解构模型在训练过程中的显存消耗。在采用混合精度训练（Mixed Precision Training）及 Adam 优化器的情况下，每个模型参数通常需要消耗约 &lt;strong>20 字节&lt;/strong>的显存：&lt;/p>
&lt;ul>
&lt;li>&lt;strong>模型状态（Model States）：&lt;/strong>
&lt;ul>
&lt;li>&lt;strong>权重与梯度：&lt;/strong> 半精度（16-bit）各占用 [2] 字节（共 [4] 字节）。&lt;/li>
&lt;li>&lt;strong>权重与梯度副本：&lt;/strong> 全精度（32-bit）各占用 [4] 字节（共 [8] 字节）。&lt;/li>
&lt;li>&lt;strong>优化器状态：&lt;/strong> Adam 优化器的一阶与二阶矩估计状态各占用 [4] 字节（共 [8] 字节）。&lt;/li>
&lt;/ul>
&lt;/li>
&lt;li>&lt;strong>剩余消耗：&lt;/strong> 前向传播过程中产生的**残差状态（Residual States，即激活值 Activations）**和各类临时缓冲区，会随着批次大小（Batch Size）和序列长度呈线性甚至二次方增长。&lt;/li>
&lt;/ul>
&lt;blockquote>
&lt;p>&lt;strong>示例：&lt;/strong> 一个 [75] 亿参数的模型，仅静态模型状态就需要消耗约 150GB 显存，远超单张 H100（80GB）的物理极限。&lt;/p>&lt;/blockquote>
&lt;h3 id="12-通信原语与同步机制">[1].2 通信原语与同步机制&lt;/h3>
&lt;p>在多 GPU 协同计算时，节点间必须通过特定的**集体通信原语（Collective Communications）**进行数据交互：&lt;/p>
&lt;ol>
&lt;li>&lt;strong>基础原语：&lt;/strong> 包括广播（Broadcast）、收集（Gather）、分散（Scatter）以及规约（Reduce）。&lt;/li>
&lt;li>&lt;strong>核心同步机制：&lt;/strong> &lt;strong>全规约（All-Reduce）&lt;/strong>。它确保了所有 GPU 在反向传播后能够获得一致的梯度总和。&lt;/li>
&lt;/ol>
&lt;p>从底层实现来看，最优的 All-Reduce 操作通常被分解为两个连续步骤：&lt;strong>Reduce-Scatter（规约-分散）&lt;/strong> 与 &lt;strong>All-Gather（全收集）&lt;/strong>。理解这种分解机制是掌握高级状态切分策略（如 ZeRO 和 FSDP）的技术基石。&lt;/p></description></item></channel></rss>