资讯

训练和推理都用GPU——前向反向与缓存的三笔账

Bili-科技·2026/9/11 06:50:54🔗 原文

📋总体概括

本文是一篇面向深度学习开发者的GPU显存与算力科普解析,围绕「训练与推理为何账目不同」展开。作者以单参数模型拆解前向、反向与优化器更新三笔账,结合PyTorch固定版本源码解释eval模式下自动微分未关闭的原因,并梳理梯度累积、Adam历史状态、激活重算的生命周期,以及Prefill、decode与分层KV缓存的容量公式,最后给出显存排障路径。其价值在于把开发者常混淆的显存口径与异步计时问题讲透。

关键信息

  • 以单参数模型拆解前向、反向与优化器更新三笔账,CPU即可核验梯度计算过程
  • 引用PyTorch固定版本源码说明:eval模式并不关闭自动微分,解释删掉反向传播后显存仍上涨的原因
  • 梳理梯度累积、Adam历史状态与激活重算三者的显存生命周期差异
  • 给出Prefill、decode与分层KV缓存的容量公式,厘清分类、编码与自回归推理的边界
  • 提供GPU异步计时、显存统计口径辨析与三条排障路径的实操方法

🔥犀利点评

显存问题90%的争论都源于「口径不一致」——有人看的是PyTorch统计,有人看的是nvidia-smi,还有人忽略了缓存未释放。这篇文章最狠的一刀是点破eval不关自动微分这个反直觉事实,多少人推理时显存莫名膨胀却归咎于「模型太大」。把三笔账分开算,比堆一堆调参玄学有用得多,属于被面试和线上事故双重验证过的硬知识。

本文由本站自动聚合,以下为原始来源:前往 Bili-科技 阅读全文