GPU 显存计算器
估算加载并运行 LLM 所需的 GPU 显存 (VRAM)
快速预设:
模型参数
参数规模 (P)
模型总参数量,单位为十亿(例如 8B 模型为 8)
位宽精度 (Q)
模型权重的数值格式。更低的精度可减少显存占用,但可能降低准确性。
FP32 (32-bit)
FP16 / BF16 (16-bit)
FP8 / INT8 (8-bit)
INT4 / FP4 (4-bit)
额外开销 (%)
权重之外的额外显存开销
典型范围:10–30%。涵盖 KV 缓存、激活值和框架缓冲区。
所需显存:
19.2 GB
按所选精度加载并运行该模型所需的估计 GPU 显存。
公式:
Memory (GB) = P × (Q / 8) × (1 + Overhead)
显存足够的 GPU 配置示例:
注:
此估算涵盖模型权重及指定的额外开销。实际占用会随批次大小、序列长度和推理框架而变化。请始终在目标硬件上进行基准测试。