Quale GPU per gli LLM locali?
Fabbisogno VRAM per modello per l'inferenza LLM locale (quantizzazione Q4 e Q8), più VRAM gaming per risoluzione — dallo stesso registro del planner.
VRAM per modello
Quanta memoria GPU serve a ciascun modello, con contesto 8k. Contesti maggiori aggiungono ~0,05 GB ogni 1k token.
| Modello | Q4 (4-bit) | Q8 (8-bit) |
|---|---|---|
| Mistral 7B | 8 GB di VRAM | 12 GB di VRAM |
| Llama 3.1 8B | 8 GB di VRAM | 12 GB di VRAM |
| Qwen 2.5 7B | 8 GB di VRAM | 12 GB di VRAM |
| Phi-4 14B | 12 GB di VRAM | 20 GB di VRAM |
| Qwen 2.5 14B | 12 GB di VRAM | 20 GB di VRAM |
| Codestral 22B | 20 GB di VRAM | 32 GB di VRAM |
| Qwen 2.5 32B | 24 GB di VRAM | 40 GB di VRAM |
| Llama 3.1 70B | 80 GB di VRAM | 80 GB di VRAM |
| Qwen 2.5 72B | 80 GB di VRAM | 96 GB di VRAM |
| DeepSeek R1 8B (distill) | 8 GB di VRAM | 12 GB di VRAM |
Stima: parametri × byte-per-quant più overhead di runtime e contesto, arrotondato alla taglia GPU reale più vicina.
VRAM gaming per risoluzione
Soglie VRAM confortevoli per titoli moderni su alto — approssimative, non tarate per titolo.
1080p
8 GB di VRAM
1080p high settings — 8GB is the comfortable floor for modern titles.
1440p
12 GB di VRAM
1440p high settings — 12GB avoids texture-streaming hitches.
4k
16 GB di VRAM
4K high settings — 16GB for texture headroom.