Modello, quantizzazione e contesto contro la memoria della tua scheda: quanti layer entrano in VRAM, cosa resta alla CPU, e un verdetto secco. La parte "ci sta" è aritmetica sui dati pubblici del modello; la velocità è misurata su una sola scheda, una GTX 750 Ti da 2 GB del 2014 — dove non è misurata, la pagina lo dice.
Configurazione
▾
▾
token
▾
GB
▾
I modelli MoE (Mixtral, DeepSeek-V3, Qwen3-MoE…) non seguono questa formula: i pesi attivi per token non sono tutti i pesi in memoria. Qui non sono trattati.
Pesi del modello
—
KV cache al contesto scelto
—
Layer in VRAM
—
Come si riempie la scheda
pesiKV cachebuffer runtime (stima)
Misurato su questa scheda
GTX 750 Ti 2 GB · AMD FX-6350 · 19-26/08/2026
Modello (file Ollama)
Tetto layer
tok/s al tetto
Note
llama3.2:1b Q4_K_M
17 / 17
31,00
entra tutto: gira
llama3.2:3b Q4_K_M, ctx 4096
18 / 29
6,00
KV f16; con flash attention + KV q8_0 sale a 22 layer e 7,72-7,77 tok/s
llama3.2:3b Q3_K_M
24 / 29
8,14
più veloce, ma affidabilità tool-calling 81% contro 94% di Q8
llama3.2:3b Q8_0
12 / 29
3,415
il file pesa 3,4 GB: quasi tutto in CPU
qwen2.5:3b Q4_K_M, ctx 4096
31 / 37
8,41
33 layer e 9,54 tok/s con KV q8_0
qwen2.5:3b Q8_0, ctx 8192
18 / 37
3,82
configurazione di produzione: 24,5 J per token misurati alla presa
mistral:7b Q4_K_M
auto
1,74
già a 16 layer va in out-of-memory: non gira in VRAM, solo CPU
Ollama conta un layer in più rispetto al config.json (l'output): 29 per llama3.2:3b, 37 per qwen2.5:3b. Il costo misurato per layer su llama3.2:3b Q4_K_M è 63,8-71,8 MiB; la formula di questa pagina dà 67. Dettaglio e dati grezzi negli articoli linkati in fondo.
Vuoi che te lo faccia girare io?
Con offload parziale le leve sono tre — num_gpu forzato, KV cache quantizzata, quantizzazione giusta — e messe insieme su una scheda da 2 GB hanno più che raddoppiato la velocità. È il servizio che offro su Fiverr (pagina in inglese).