KV 缓存显存计算器
计算基于 Transformer 的 LLM 中 KV 缓存所需的显存
标准计算
简化计算
模型参数
批次大小 (B)
并行处理的序列数量
序列长度 (S)
每个输入包含的 token 数量
常见取值:1024, 2048, 4096, 8192
层数 (L)
Transformer 层数
注意力头数 (H)
每层的注意力头数量
注意力头维度 (D)
每个注意力头的维度
模型维度
隐藏层维度 (H × D)
位宽精度 (Q)
每个数值的位宽(例如 FP16 为 16,FP32 为 32),除以 8 将位转换为字节
FP32 (32-bit)
FP16 (16-bit)
INT8 (8-bit)
FP4 (4-bit)
KV 缓存大小:
0.5 GB
这是存储序列中所有 token 的键和值向量所需的估计显存。
公式:
KV Cache Size (GB) = 2 × B × S × L × H × D × (Q / 8) / (1024^3)
注:
KV 缓存大小随序列长度线性增长。对于较长的对话或文档,这可能成为显著的显存瓶颈。