WisePC
Menu
Guia de GPU

Qual GPU para LLMs locais?

VRAM por modelo para inferência LLM local (quantização Q4 e Q8), mais VRAM gaming por resolução — do mesmo registro que o planejador usa.

VRAM por modelo

Quanta memória GPU cada modelo precisa para servir, com contexto 8k. Contextos maiores adicionam ~0,05 GB por 1k tokens.

ModeloQ4 (4-bit)Q8 (8-bit)
Mistral 7B8 GB de VRAM12 GB de VRAM
Llama 3.1 8B8 GB de VRAM12 GB de VRAM
Qwen 2.5 7B8 GB de VRAM12 GB de VRAM
Phi-4 14B12 GB de VRAM20 GB de VRAM
Qwen 2.5 14B12 GB de VRAM20 GB de VRAM
Codestral 22B20 GB de VRAM32 GB de VRAM
Qwen 2.5 32B24 GB de VRAM40 GB de VRAM
Llama 3.1 70B80 GB de VRAM80 GB de VRAM
Qwen 2.5 72B80 GB de VRAM96 GB de VRAM
DeepSeek R1 8B (distill)8 GB de VRAM12 GB de VRAM

Estimativa: parâmetros × bytes-por-quant mais sobrecarga de runtime e contexto, arredondado ao tamanho GPU real mais próximo.

VRAM gaming por resolução

Pisos VRAM confortáveis para títulos modernos no alto — aproximados, não afinados por título.

1080p

8 GB de VRAM

1080p high settings — 8GB is the comfortable floor for modern titles.

1440p

12 GB de VRAM

1440p high settings — 12GB avoids texture-streaming hitches.

4k

16 GB de VRAM

4K high settings — 16GB for texture headroom.

Verificar meu hardwareVer um build de chat 32B