WisePC
Meniu
Ghid de dimensionare GPU

Ce GPU pentru LLM-uri locale?

Necesarul de VRAM per model pentru inferență LLM locală (cuantizare Q4 și Q8), plus VRAM de gaming per rezoluție — din același registru pe care îl folosește planner-ul.

VRAM per model

Câtă memorie GPU cere servirea fiecărui model, la context 8k. Contextele mai mari adaugă ~0,05 GB per 1k tokeni.

ModelQ4 (4-bit)Q8 (8-bit)
Mistral 7B8 GB VRAM12 GB VRAM
Llama 3.1 8B8 GB VRAM12 GB VRAM
Qwen 2.5 7B8 GB VRAM12 GB VRAM
Phi-4 14B12 GB VRAM20 GB VRAM
Qwen 2.5 14B12 GB VRAM20 GB VRAM
Codestral 22B20 GB VRAM32 GB VRAM
Qwen 2.5 32B24 GB VRAM40 GB VRAM
Llama 3.1 70B80 GB VRAM80 GB VRAM
Qwen 2.5 72B80 GB VRAM96 GB VRAM
DeepSeek R1 8B (distill)8 GB VRAM12 GB VRAM

Estimare: parametri × octeți-per-cuant plus overhead de runtime și context, rotunjit la cea mai apropiată placă reală.

VRAM de gaming per rezoluție

Praguri confortabile de VRAM pentru titluri moderne pe setări high — aproximative, nu tunate per titlu.

1080p

8 GB VRAM

1080p high settings — 8GB is the comfortable floor for modern titles.

1440p

12 GB VRAM

1440p high settings — 12GB avoids texture-streaming hitches.

4k

16 GB VRAM

4K high settings — 16GB for texture headroom.

Verifică-mi hardware-ulVezi un build de chat 32B