WisePC
Menú
Guía de GPU

¿Qué GPU para LLMs locales?

VRAM por modelo para inferencia LLM local (cuantización Q4 y Q8), más VRAM gaming por resolución — del mismo registro que usa el planificador.

VRAM por modelo

Cuánta memoria GPU necesita cada modelo para servirse, con contexto 8k. Contextos mayores añaden ~0,05 GB por 1k tokens.

ModeloQ4 (4 bits)Q8 (8 bits)
Mistral 7B8 GB de VRAM12 GB de VRAM
Llama 3.1 8B8 GB de VRAM12 GB de VRAM
Qwen 2.5 7B8 GB de VRAM12 GB de VRAM
Phi-4 14B12 GB de VRAM20 GB de VRAM
Qwen 2.5 14B12 GB de VRAM20 GB de VRAM
Codestral 22B20 GB de VRAM32 GB de VRAM
Qwen 2.5 32B24 GB de VRAM40 GB de VRAM
Llama 3.1 70B80 GB de VRAM80 GB de VRAM
Qwen 2.5 72B80 GB de VRAM96 GB de VRAM
DeepSeek R1 8B (distill)8 GB de VRAM12 GB de VRAM

Estimación: parámetros × bytes-por-cuant más sobrecarga de runtime y contexto, redondeado al tamaño GPU real más cercano.

VRAM gaming por resolución

Suelos VRAM cómodos para títulos modernos en alto — aproximados, no ajustados por título.

1080p

8 GB de VRAM

1080p high settings — 8GB is the comfortable floor for modern titles.

1440p

12 GB de VRAM

1440p high settings — 12GB avoids texture-streaming hitches.

4k

16 GB de VRAM

4K high settings — 16GB for texture headroom.

Comprobar mi hardwareVer un build de chat 32B