GPU 执行与内存映射
了解工作如何组织、数据存放在何处——从单个线程到全局内存。悬停任意区域即可高亮显示。
片上GPU 芯片
SM 0核心计算单元
线程块 0
Warp 032 线程,锁步执行
Warp 132 线程
⋮ 最多 32 个 warp(最多 1024 线程)
线程块 1 在同一 SM 上运行
寄存器文件
256 KB · 每线程私有
共享内存
按块分配 · 程序员管理
L1 缓存
每 SM 一个 · 硬件管理
Warp 调度器
每个周期发射就绪的 warp
SM 1
线程块 2
寄存器 · 共享内存 · L1 · 调度器
SM 2
线程块 3
寄存器 · 共享内存 · L1 · 调度器
SM 3
线程块 4
寄存器 · 共享内存 · L1 · 调度器
最多 132 个 SM
(H100 SXM)
L2 缓存 50 MB · 所有 SM 共享 · 硬件管理
内存总线
片外HBM(全局内存 / 显存)
80 GB · 3.35 TB/s(H100 SXM)
模型权重
KV 缓存
激活
中间缓冲区
容量最大但速度最慢。访问延迟约 400+ 个周期。内核优化的重点是最小化对这里的往返访问。