GPU 执行与内存映射
了解工作如何组织、数据存放在何处——从单个线程到全局内存。悬停任意区域即可高亮显示。
线程
→
Warp(32 线程)
→
线程块
→
SM(计算核)
片上
GPU 芯片
SM 0
核心计算单元
线程块 0
Warp 0
32 线程,锁步执行
Warp 1
32 线程
⋮ 最多 32 个 warp(最多 1024 线程)
线程块 1
在同一 SM 上运行
寄存器文件
256 KB · 每线程私有
共享内存
按块分配 · 程序员管理
L1 缓存
每 SM 一个 · 硬件管理
Warp 调度器
每个周期发射就绪的 warp
SM 1
线程块 2
寄存器 · 共享内存 · L1 · 调度器
SM 2
线程块 3
寄存器 · 共享内存 · L1 · 调度器
SM 3
线程块 4
寄存器 · 共享内存 · L1 · 调度器
最多 132 个 SM
(H100 SXM)
L2 缓存
50 MB · 所有 SM 共享 · 硬件管理
↕
内存总线
片外
HBM(全局内存 / 显存)
80 GB · 3.35 TB/s(H100 SXM)
模型权重
KV 缓存
激活
中间缓冲区
容量最大但速度最慢。访问延迟约 400+ 个周期。内核优化的重点是最小化对这里的往返访问。