¿Qué GPU para LLMs locales?
VRAM por modelo para inferencia LLM local (cuantización Q4 y Q8), más VRAM gaming por resolución — del mismo registro que usa el planificador.
VRAM por modelo
Cuánta memoria GPU necesita cada modelo para servirse, con contexto 8k. Contextos mayores añaden ~0,05 GB por 1k tokens.
| Modelo | Q4 (4 bits) | Q8 (8 bits) |
|---|---|---|
| Mistral 7B | 8 GB de VRAM | 12 GB de VRAM |
| Llama 3.1 8B | 8 GB de VRAM | 12 GB de VRAM |
| Qwen 2.5 7B | 8 GB de VRAM | 12 GB de VRAM |
| Phi-4 14B | 12 GB de VRAM | 20 GB de VRAM |
| Qwen 2.5 14B | 12 GB de VRAM | 20 GB de VRAM |
| Codestral 22B | 20 GB de VRAM | 32 GB de VRAM |
| Qwen 2.5 32B | 24 GB de VRAM | 40 GB de VRAM |
| Llama 3.1 70B | 80 GB de VRAM | 80 GB de VRAM |
| Qwen 2.5 72B | 80 GB de VRAM | 96 GB de VRAM |
| DeepSeek R1 8B (distill) | 8 GB de VRAM | 12 GB de VRAM |
Estimación: parámetros × bytes-por-cuant más sobrecarga de runtime y contexto, redondeado al tamaño GPU real más cercano.
VRAM gaming por resolución
Suelos VRAM cómodos para títulos modernos en alto — aproximados, no ajustados por título.
1080p
8 GB de VRAM
1080p high settings — 8GB is the comfortable floor for modern titles.
1440p
12 GB de VRAM
1440p high settings — 12GB avoids texture-streaming hitches.
4k
16 GB de VRAM
4K high settings — 16GB for texture headroom.