ServerDiCasa
Sizing · LLM locali con Ollama / llama.cpp

Ci sta in VRAM?

Modello, quantizzazione e contesto contro la memoria della tua scheda: quanti layer entrano in VRAM, cosa resta alla CPU, e un verdetto secco. La parte "ci sta" è aritmetica sui dati pubblici del modello; la velocità è misurata su una sola scheda, una GTX 750 Ti da 2 GB del 2014 — dove non è misurata, la pagina lo dice.

Configurazione

token
GB

I modelli MoE (Mixtral, DeepSeek-V3, Qwen3-MoE…) non seguono questa formula: i pesi attivi per token non sono tutti i pesi in memoria. Qui non sono trattati.

Pesi del modello
KV cache al contesto scelto
Layer in VRAM

Come si riempie la scheda

pesiKV cachebuffer runtime (stima)