本地运行LLM需要多少VRAM?
运行本地LLM时的主要问题很简单:它能装进你的GPU吗?答案取决于模型大小、量化和上下文长度。本指南为你提供了选择合适VRAM容量的实用起点。
量化如何影响VRAM
量化降低了存储模型权重时使用的精度。低位量化使模型更小,使用更少的VRAM,但会损失一些质量。
| 量化 | 每权重位数 | 典型用途 |
|---|---|---|
| Q8_0 | 8 | 非常高质量 |
| Q6_K | ~6.6 | 很好的质量 |
| Q5_K_M | ~5.5 | 质量和大小兼顾 |
| Q4_K_M | ~4.5 | 大小和质量良好平衡 |
| Q3_K_M | ~3.5 | 更低VRAM,更多质量损失 |
Q4_K_M是VRAM受限时的常见选择。如果你有更多可用VRAM,Q5或Q6可以让你以更少的量化运行同一模型。
按模型大小的近似VRAM需求
这些是模型权重的粗略估计。实际所需VRAM更高,因为运行时、KV缓存和上下文也使用内存。
| 模型大小 | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2.5 GB |
| 8B | ~9 GB | ~7 GB | ~5.5 GB | ~4.5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6.5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7.5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
这些是估计值,不是硬性限制。不同的模型架构和量化格式可以改变实际大小。
不同VRAM容量能运行什么
| VRAM | 实用范围 | 当前示例 |
|---|---|---|
| 8 GB | 大约4B到9B的小模型 | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | 大约9B到14B的小到中型模型 | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B到27B,使用较低量化 | Gemma 4 26B-A4B, Qwen3.6 27B at Q4 |
| 24 GB | 27B到35B,Q4到Q6 | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B到35B,使用较高量化 | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | 大型密集模型,使用较低量化 | 70B级模型,Q3到Q4 |
| 80 GB | 大型密集模型,使用较高量化 | 70B级模型,Q4到Q6 |
这些范围适用于权重能装进GPU的模型。大型MoE模型不同:每个token只有部分参数被激活,但模型仍需存储全部权重。因此,总参数超过100B的模型不能仅仅因为活跃参数少而适配100B的VRAM预算。
MoE模型
混合专家模型包含多个参数组,称为专家。每个token只使用部分专家,这可能使推理比相同总参数数的密集模型更高效。
然而,未激活的专家仍然是模型的一部分。因此,大型MoE模型可能需要的内存远多于其活跃参数数所暗示的。非常大的模型可能需要多个GPU或系统RAM卸载。
上下文长度也占用VRAM
模型权重只是内存需求的一部分。随着上下文变长,KV缓存会增长,因此以64K上下文运行同一模型所需的VRAM可能远多于以4K运行。
- 更长的上下文需要更多VRAM。
- KV缓存精度影响内存使用。
- 批大小和并发用户也会增加内存使用。
- 留一些VRAM给运行时,而不是完全用模型权重填满GPU。
实用提示
- 检查要运行的量化模型的实际大小。
- 不要将模型文件大小作为确切的VRAM需求。为KV缓存和运行时留出空间。
- 如果模型不能完全装进VRAM,可以将其部分卸载到系统RAM,但推理通常会变慢。
- 对于长上下文或代理型工作负载,预算的VRAM要比模型权重单独所需的多。
- 当单个GPU的VRAM不足时,多个GPU可以拆分模型。
在DaDesktop上运行
你不需要购买GPU来运行本地LLM。DaDesktop为你提供带有所需VRAM的云桌面,让你无需拥有硬件即可直接运行模型。
选择适合你模型的VRAM层级,加载它,然后开始使用。无需设置,无需购买硬件,无需驱动问题。查看可用GPU以了解选项。