Memory budget · 32 GB
Best local LLMs for 32GB
32GB is not a single ceiling. A 32GB Mac, a 32GB GPU and a 32GB Laptop each leave a different amount free for model weights, so the largest model you can run changes with the memory type, not just the number.
- Usable range
- 21–31 GB
- Models that fit
- 108
- Memory types
- 3
- Top pick
- 36B
What 32GB actually gives you
Usable figures are sourced per device (tap a card for the full profile). Verdicts below use Q4_K_M, the community-default quant.
Runs comfortably on the most capable 32GB setup (Nvidia GeForce RTX 5090 (32GB), ~31 GB usable) at ~22.5 GB. Check it against your exact device on its model page.
Models ranked for 32GB
- NELlama-3.3-Nemotron-Super-49B-v149B · ~30.6 GB at Q4_K_M
- Mixtral 8x7B46.7B MoE · ~28.9 GB at Q4_K_M
- SESeed-OSS 36B Instruct36B · ~22.5 GB at Q4_K_M
- Qwen3.6 35B-A3B36B MoE · ~24.5 GB at Q4_K_M
- CRCommand R 35B35B · ~22.3 GB at Q4_K_M
- OROrnith 1.0 35B35B MoE · ~23.2 GB at Q4_K_M
- Qwen-AgentWorld 35B-A3B34.7B MoE · ~24.3 GB at Q4_K_M
- YiYi 1.5 34B34B · ~21.4 GB at Q4_K_M
- FNFalcon-H1-34B-Instruct34B · ~21.1 GB at Q4_K_M
- LALaguna XS 2.133.4B MoE · ~22.2 GB at Q4_K_M
- Gemma 4 31B32.7B · ~20.5 GB at Q4_K_M
- Qwen2.5 32B32B · ~22.1 GB at Q4_K_M
- Qwen3 32B32B · ~22 GB at Q4_K_M · Elo 1347
- DeepSeek-R1-Distill-Qwen 32B32B · ~22.1 GB at Q4_K_M
- Qwen2.5 Coder 32B32B · ~20.7 GB at Q4_K_M
- Granite 4.0 H Small32B MoE · ~20.4 GB at Q4_K_M
- GLGLM-4-32B-041432B · ~20.5 GB at Q4_K_M
- EXEXAONE 4.0 32B32B · ~20.2 GB at Q4_K_M
- OLOLMo 2 32B Instruct32B · ~21.7 GB at Q4_K_M
- Granite 4.0 H Small32B MoE · ~20.3 GB at Q4_K_M
- OLOlmo 3.1 32B Instruct32B · ~20.3 GB at Q4_K_M
- Qwen3 30B-A3B30.5B MoE · ~20.7 GB at Q4_K_M · Elo 1383
- Qwen3-Coder 30B-A3B30.5B MoE · ~19.4 GB at Q4_K_M
- NONorth Mini Code 1.030.5B MoE · ~21.1 GB at Q4_K_M
- SSarvam-30B30B MoE · ~21.7 GB at Q4_K_M
- NENemotron 3 Nano 30B-A3B30B MoE · ~25.1 GB at Q4_K_M
- NENemotron Cascade 2 30B-A3B30B MoE · ~25.1 GB at Q4_K_M
- GLGLM-4.7-Flash30B MoE · ~19.2 GB at Q4_K_M
- Granite 4.1 30B28.9B · ~19.1 GB at Q4_K_M
- Qwen3.6 27B27.8B · ~18.9 GB at Q4_K_M
- Gemma 2 27B27B · ~18.7 GB at Q4_K_M · Elo 1289
- Gemma 3 27B27B · ~18.6 GB at Q4_K_M · Elo 1366
- Gemma 4 26B-A4B26.5B MoE · ~19 GB at Q4_K_M
- Mistral Small 3 24B24B · ~16.3 GB at Q4_K_M · Elo 1357
- SSarvam-M 24B24B · ~16.3 GB at Q4_K_M
- Mistral Small 3.1 24B24B · ~15.4 GB at Q4_K_M
- Magistral Small24B · ~16 GB at Q4_K_M
- Devstral Small24B · ~15.4 GB at Q4_K_M
- LFLFM2 24B-A2B24B MoE · ~15.4 GB at Q4_K_M
- gpt-oss 20B21B MoE · ~13.2 GB at Q4_K_M
- ERERNIE 4.5 21B-A3B21B MoE · ~14.3 GB at Q4_K_M
- DeepSeek-V2-Lite16B MoE · ~12.2 GB at Q4_K_M
- Phi-4 14B14B · ~10.8 GB at Q4_K_M · Elo 1256
- Qwen2.5 14B14B · ~10.7 GB at Q4_K_M
- Qwen3 14B14B · ~10.7 GB at Q4_K_M
- DeepSeek-R1-Distill-Qwen 14B14B · ~10.7 GB at Q4_K_M
- Qwen2.5 Coder 14B14B · ~10.1 GB at Q4_K_M
- Phi-4-reasoning14B · ~10.1 GB at Q4_K_M
- Mistral Nemo 12B12.2B · ~8.6 GB at Q4_K_M
- Gemma 3 12B12B · ~8.9 GB at Q4_K_M · Elo 1342
- Gemma 4 12B12B · ~8.7 GB at Q4_K_M
- Llama 3.2 Vision 11B10.7B · ~9 GB at Q4_K_M
- FNFalcon3 10B10B · ~7.5 GB at Q4_K_M
- Gemma 2 9B9B · ~7.3 GB at Q4_K_M · Elo 1266
- GLGLM-4 9B9B · ~7.3 GB at Q4_K_M
- GLGLM-4-9B-04149B · ~7.2 GB at Q4_K_M
- NENemotron Nano 9B v29B · ~7.6 GB at Q4_K_M
- OROrnith 1.0 9B9B · ~7.1 GB at Q4_K_M
- Granite 4.1 8B8.8B · ~6.8 GB at Q4_K_M
- LFLFM2.5 8B-A1B8.3B MoE · ~6.7 GB at Q4_K_M
- Qwen2.5-VL 7B8.29B · ~7.1 GB at Q4_K_M
- DeepSeek-R1-0528-Qwen3-8B8.19B · ~6.2 GB at Q4_K_M
- Llama 3.1 8B8B · ~6.4 GB at Q4_K_M · Elo 1211
- Qwen3 8B8B · ~6.5 GB at Q4_K_M
- DeepSeek-R1-Distill-Llama 8B8B · ~6.4 GB at Q4_K_M
- Gemma 3n E4B8B · ~5.7 GB at Q4_K_M
- Gemma 4 E4B8B · ~6.5 GB at Q4_K_M
- Mistral 7B7B · ~5.8 GB at Q4_K_M · Elo 1149
- Qwen2.5 7B7B · ~6.1 GB at Q4_K_M
- DeepSeek-R1-Distill-Qwen 7B7B · ~6.1 GB at Q4_K_M
- Qwen2.5 Coder 7B7B · ~5.8 GB at Q4_K_M
- Gemma 4 E2B5.1B · ~4.4 GB at Q4_K_M
- Gemma 3 4B4B · ~3.8 GB at Q4_K_M · Elo 1303
- Qwen3 4B4B · ~3.8 GB at Q4_K_M
- NENemotron 3 Nano 4B4B · ~3.9 GB at Q4_K_M
- Phi-3.5-mini 3.8B3.82B · ~3.7 GB at Q4_K_M
- Phi-4-mini 3.8B3.8B · ~3.8 GB at Q4_K_M
- Phi-4-mini-reasoning3.8B · ~3.6 GB at Q4_K_M
- Qwen2.5-VL 3B3.75B · ~4.4 GB at Q4_K_M
- Granite 4.1 3B3.4B · ~3.3 GB at Q4_K_M
- Qwen2.5 3B3.09B · ~3.3 GB at Q4_K_M
- Qwen2.5 Coder 3B3.09B · ~3 GB at Q4_K_M
- Llama 3.2 3B3B · ~3.2 GB at Q4_K_M · Elo 1166
- SmolLM3 3B3B · ~3 GB at Q4_K_M
- OPApple OpenELM 3B3B · ~3 GB at Q4_K_M
- Gemma 2 2B2.61B · ~2.9 GB at Q4_K_M
- Granite 3.1 2B2.53B · ~2.8 GB at Q4_K_M
- SSarvam-1 2B2B · ~2.7 GB at Q4_K_M
- SmolLM2 1.7B1.7B · ~2.2 GB at Q4_K_M · Elo 1114
- Qwen3 1.7B1.7B · ~2.4 GB at Q4_K_M
- Qwen2.5 1.5B1.54B · ~2.2 GB at Q4_K_M
- Qwen2.5 Coder 1.5B1.54B · ~2 GB at Q4_K_M
- MIMiniCPM-V 4.61.3B · ~1.6 GB at Q4_K_M
- LFLFM2 1.2B1.17B · ~2.5 GB at Q4_K_M
- LFLFM2.5 1.2B1.17B · ~1.8 GB at Q4_K_M
- LFLFM2.5 1.2B Thinking1.17B · ~1.8 GB at Q4_K_M
- TLTinyLlama 1.1B1.1B · ~1.8 GB at Q4_K_M
- OPApple OpenELM 1.1B1.1B · ~1.7 GB at Q4_K_M
- Llama 3.2 1B1B · ~1.8 GB at Q4_K_M · Elo 1110
- Gemma 3 1B1B · ~1.8 GB at Q4_K_M
- LFLFM2 700M0.742B · ~1.9 GB at Q4_K_M
- Qwen3 0.6B0.6B · ~1.5 GB at Q4_K_M
- Qwen2.5 0.5B0.494B · ~1.5 GB at Q4_K_M
- Qwen2.5 Coder 0.5B0.494B · ~1.4 GB at Q4_K_M
- SmolLM2 360M0.362B · ~1.2 GB at Q4_K_M
- LFLFM2 350M0.354B · ~1.4 GB at Q4_K_M
- Gemma 3 270M0.27B · ~1.1 GB at Q4_K_M
- SmolLM2 135M0.135B · ~1 GB at Q4_K_M
Each chip links to the full breakdown for that model on a real 32GB device. "Tight" means it fits but with little headroom, close other apps.
The ceiling, per memory type
Apple M5 (32GB) (~21 GB usable)
Runs up to Qwen3.6 27B (27.8B) comfortably at Q4_K_M. Larger models either sit tight or spill past the ~21 GB it can give a model.
Nvidia GeForce RTX 5090 (32GB) (~31 GB usable)
Runs up to Qwen3.6 35B-A3B (36B) comfortably at Q4_K_M. Larger models either sit tight or spill past the ~31 GB it can give a model.
32GB RAM Laptop (CPU/iGPU only) (~28 GB usable)
Runs up to Qwen3.6 35B-A3B (36B) comfortably at Q4_K_M. Larger models either sit tight or spill past the ~28 GB it can give a model.
Too large for any 32GB device
FAQ
How much of 32GB can a model actually use?
It depends on the memory type. Apple unified memory: about 21 GB (Apple M5 (32GB)); GPU VRAM: about 31 GB (Nvidia GeForce RTX 5090 (32GB)); System RAM (CPU only): about 28 GB (32GB RAM Laptop (CPU/iGPU only)). The rest is reserved for the OS, display and runtime overhead.
What is the best local LLM for 32GB?
Seed-OSS 36B Instruct (36B) is the strongest model that runs comfortably at Q4_K_M on the most capable 32GB setup (Nvidia GeForce RTX 5090 (32GB), ~31 GB usable). On a tighter 32GB device the ceiling is lower, shown per row above.
Why does a 32GB GPU fit a bigger model than a 32GB Mac?
A discrete GPU gives almost all of its VRAM to the model (leave ~1 GB for the driver). Apple Silicon shares one unified pool with macOS, so roughly 66% is available to the GPU for weights. Same 32GB sticker, different usable budget, so the model ceiling differs.
Sources
- amazon.com
- amd.com
- apple.com/macbook-pro
- apple.com/newsroom/2025
- apple.com/newsroom/2026
- developer.apple.com
- en.wikipedia.org/wiki/DDR5_SDRAM
- en.wikipedia.org/wiki/GeForce_RTX_50_series
- huggingface.co/bartowski/ByteDance-Seed_Seed-OSS-36B-Instruct-GGUF
- huggingface.co/bartowski/Meta-Llama-3.1-70B-Instruct-GGUF
- huggingface.co/ByteDance-Seed
- notebookcheck.net
- nvidia.com
- ollama.com/library/llama3.1:70b
- ollama.com/library/mixtral:8x7b
- spheron.network
- support.apple.com
- walmart.com
Memory figures are estimates at Q4_K_M with a small context. See methodology.