资讯
训练和推理都用GPU——前向反向与缓存的三笔账
📋总体概括
删掉反向传播,显存为什么还在涨?训练与推理共享 GPU,却有三本不同的账。 本期内容: 1. 用一个参数拆开前向、反向与优化器更新,CPU 也能核验梯度 2. PyTorch 固定版本源码:eval 为什么不关闭自动微分 3. 梯度累积、Adam 历史与激活重算的生命周期 4. 分类、编码和自回归推理的边界 5. Prefill、decode 与分层 KV 缓存的容量公式 6. GPU 异步计时
⚡关键信息
- ▸删掉反向传播,显存为什么还在涨?训练与推理共享 GPU,却有三本不同的账。
- ▸1. 用一个参数拆开前向、反向与优化器更新,CPU 也能核验梯度
- ▸2. PyTorch 固定版本源码:eval 为什么不关闭自动微分
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 B站-科技区 阅读全文 →