本地运行LLM需要多少VRAM?

运行本地LLM时的主要问题很简单:它能装进你的GPU吗?答案取决于模型大小、量化和上下文长度。本指南为你提供了选择合适VRAM容量的实用起点。

量化如何影响VRAM

量化降低了存储模型权重时使用的精度。低位量化使模型更小,使用更少的VRAM,但会损失一些质量。

量化 每权重位数 典型用途
Q8_0 8 非常高质量
Q6_K ~6.6 很好的质量
Q5_K_M ~5.5 质量和大小兼顾
Q4_K_M ~4.5 大小和质量良好平衡
Q3_K_M ~3.5 更低VRAM,更多质量损失

Q4_K_M是VRAM受限时的常见选择。如果你有更多可用VRAM,Q5或Q6可以让你以更少的量化运行同一模型。

按模型大小的近似VRAM需求

这些是模型权重的粗略估计。实际所需VRAM更高,因为运行时、KV缓存和上下文也使用内存。

模型大小 Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2.5 GB
8B ~9 GB ~7 GB ~5.5 GB ~4.5 GB
12B ~13 GB ~10 GB ~8 GB ~6.5 GB
14B ~16 GB ~12 GB ~9 GB ~7.5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

这些是估计值,不是硬性限制。不同的模型架构和量化格式可以改变实际大小。

不同VRAM容量能运行什么

VRAM 实用范围 当前示例
8 GB 大约4B到9B的小模型 Gemma 4 E4B, Qwen3.5 9B
12 GB 大约9B到14B的小到中型模型 Gemma 4 12B, Qwen3.5 9B
16 GB 12B到27B,使用较低量化 Gemma 4 26B-A4B, Qwen3.6 27B at Q4
24 GB 27B到35B,Q4到Q6 Qwen3.8 27B, Gemma 4 31B
32 GB 27B到35B,使用较高量化 Qwen3.8 27B, Gemma 4 31B
48 GB 大型密集模型,使用较低量化 70B级模型,Q3到Q4
80 GB 大型密集模型,使用较高量化 70B级模型,Q4到Q6

这些范围适用于权重能装进GPU的模型。大型MoE模型不同:每个token只有部分参数被激活,但模型仍需存储全部权重。因此,总参数超过100B的模型不能仅仅因为活跃参数少而适配100B的VRAM预算。

MoE模型

混合专家模型包含多个参数组,称为专家。每个token只使用部分专家,这可能使推理比相同总参数数的密集模型更高效。

然而,未激活的专家仍然是模型的一部分。因此,大型MoE模型可能需要的内存远多于其活跃参数数所暗示的。非常大的模型可能需要多个GPU或系统RAM卸载。

上下文长度也占用VRAM

模型权重只是内存需求的一部分。随着上下文变长,KV缓存会增长,因此以64K上下文运行同一模型所需的VRAM可能远多于以4K运行。

  • 更长的上下文需要更多VRAM。
  • KV缓存精度影响内存使用。
  • 批大小和并发用户也会增加内存使用。
  • 留一些VRAM给运行时,而不是完全用模型权重填满GPU。

实用提示

  • 检查要运行的量化模型的实际大小。
  • 不要将模型文件大小作为确切的VRAM需求。为KV缓存和运行时留出空间。
  • 如果模型不能完全装进VRAM,可以将其部分卸载到系统RAM,但推理通常会变慢。
  • 对于长上下文或代理型工作负载,预算的VRAM要比模型权重单独所需的多。
  • 当单个GPU的VRAM不足时,多个GPU可以拆分模型。

在DaDesktop上运行

你不需要购买GPU来运行本地LLM。DaDesktop为你提供带有所需VRAM的云桌面,让你无需拥有硬件即可直接运行模型。

选择适合你模型的VRAM层级,加载它,然后开始使用。无需设置,无需购买硬件,无需驱动问题。查看可用GPU以了解选项。