KV 缓存显存计算器
计算基于 Transformer 的 LLM 中 KV 缓存所需的显存
模型参数
批次大小 (B)
并行处理的序列数量
序列长度 (S)
每个输入包含的 token 数量
常见取值:1024, 2048, 4096, 8192
层数 (L)
Transformer 层数
注意力头数 (H)
每层的注意力头数量
注意力头维度 (D)
每个注意力头的维度
位宽精度 (Q)
每个数值的位宽(例如 FP16 为 16,FP32 为 32),除以 8 将位转换为字节
KV 缓存大小: 0.5 GB
这是存储序列中所有 token 的键和值向量所需的估计显存。
公式:
KV Cache Size (GB) = 2 × B × S × L × H × D × (Q / 8) / (1024^3)
注:
KV 缓存大小随序列长度线性增长。对于较长的对话或文档,这可能成为显著的显存瓶颈。