Memory budget · 256 GB
Best local LLMs for 256GB
The Apple M3 Ultra (256GB) gives about ~192 GB of its 256GB to model weights after the OS takes its share. 121 of 135 local LLMs fit, biggest first.
- Usable range
- 192–192 GB
- Models that fit
- 121
- Memory types
- 1
- Top pick
- 235B
What 256GB actually gives you
Usable figures are sourced per device (tap a card for the full profile). Verdicts below use Q4_K_M, the community-default quant.
Runs comfortably on the most capable 256GB setup (Apple M3 Ultra (256GB), ~192 GB usable) at ~136.9 GB. Check it against your exact device on its model page.
Models ranked for 256GB
- DeepSeek-V4-Flash284B MoE · ~179.7 GB at Q4_K_M
- Qwen3 235B A22B235B MoE · ~136.9 GB at Q4_K_M
- NENemotron 3 Super 120B-A12B120B MoE · ~80.3 GB at Q4_K_M
- LALaguna S 2.1118B MoE · ~92.8 GB at Q4_K_M
- gpt-oss 120B117B MoE · ~62.4 GB at Q4_K_M
- Llama 4 Scout109B MoE · ~64.2 GB at Q4_K_M
- GLGLM-4.5-Air106B MoE · ~71.8 GB at Q4_K_M
- SSarvam-105B105B MoE · ~67.5 GB at Q4_K_M
- HYHunyuan-A13B-Instruct80B MoE · ~48.3 GB at Q4_K_M
- Qwen2.5 72B72B · ~50.2 GB at Q4_K_M · Elo 1303
- Llama 3.3 70B70B · ~45.3 GB at Q4_K_M · Elo 1318
- NELlama-3.3-Nemotron-Super-49B-v149B · ~30.6 GB at Q4_K_M
- Mixtral 8x7B46.7B MoE · ~28.9 GB at Q4_K_M
- SESeed-OSS 36B Instruct36B · ~22.5 GB at Q4_K_M
- Qwen3.6 35B-A3B36B MoE · ~24.5 GB at Q4_K_M
- CRCommand R 35B35B · ~22.3 GB at Q4_K_M
- OROrnith 1.0 35B35B MoE · ~23.2 GB at Q4_K_M
- Qwen-AgentWorld 35B-A3B34.7B MoE · ~24.3 GB at Q4_K_M
- YiYi 1.5 34B34B · ~21.4 GB at Q4_K_M
- FNFalcon-H1-34B-Instruct34B · ~21.1 GB at Q4_K_M
- LALaguna XS 2.133.4B MoE · ~22.2 GB at Q4_K_M
- Gemma 4 31B32.7B · ~20.5 GB at Q4_K_M
- Qwen2.5 32B32B · ~22.1 GB at Q4_K_M
- DeepSeek-R1-Distill-Qwen 32B32B · ~22.1 GB at Q4_K_M
- Qwen2.5 Coder 32B32B · ~20.7 GB at Q4_K_M
- Granite 4.0 H Small32B MoE · ~20.4 GB at Q4_K_M
- GLGLM-4-32B-041432B · ~20.5 GB at Q4_K_M
- EXEXAONE 4.0 32B32B · ~20.2 GB at Q4_K_M
- OLOLMo 2 32B Instruct32B · ~21.7 GB at Q4_K_M
- Granite 4.0 H Small32B MoE · ~20.3 GB at Q4_K_M
- OLOlmo 3.1 32B Instruct32B · ~20.3 GB at Q4_K_M
- Qwen3 30B-A3B30.5B MoE · ~20.7 GB at Q4_K_M · Elo 1383
- Qwen3-Coder 30B-A3B30.5B MoE · ~19.4 GB at Q4_K_M
- NONorth Mini Code 1.030.5B MoE · ~21.1 GB at Q4_K_M
- SSarvam-30B30B MoE · ~21.7 GB at Q4_K_M
- NENemotron 3 Nano 30B-A3B30B MoE · ~25.1 GB at Q4_K_M
- NENemotron Cascade 2 30B-A3B30B MoE · ~25.1 GB at Q4_K_M
- GLGLM-4.7-Flash30B MoE · ~19.2 GB at Q4_K_M
- Granite 4.1 30B28.9B · ~19.1 GB at Q4_K_M
- Qwen3.6 27B27.8B · ~18.9 GB at Q4_K_M
- Gemma 2 27B27B · ~18.7 GB at Q4_K_M · Elo 1289
- Gemma 3 27B27B · ~18.6 GB at Q4_K_M · Elo 1366
- Gemma 4 26B-A4B26.5B MoE · ~19 GB at Q4_K_M
- Mistral Small 3 24B24B · ~16.3 GB at Q4_K_M · Elo 1357
- SSarvam-M 24B24B · ~16.3 GB at Q4_K_M
- Mistral Small 3.1 24B24B · ~15.4 GB at Q4_K_M
- Magistral Small24B · ~16 GB at Q4_K_M
- Devstral Small24B · ~15.4 GB at Q4_K_M
- LFLFM2 24B-A2B24B MoE · ~15.4 GB at Q4_K_M
- gpt-oss 20B21B MoE · ~13.2 GB at Q4_K_M
- ERERNIE 4.5 21B-A3B21B MoE · ~14.3 GB at Q4_K_M
- DeepSeek-V2-Lite16B MoE · ~12.2 GB at Q4_K_M
- Qwen2.5 14B14B · ~10.7 GB at Q4_K_M
- DeepSeek-R1-Distill-Qwen 14B14B · ~10.7 GB at Q4_K_M
- Qwen2.5 Coder 14B14B · ~10.1 GB at Q4_K_M
- Phi-4-reasoning14B · ~10.1 GB at Q4_K_M
- Mistral Nemo 12B12.2B · ~8.6 GB at Q4_K_M
- Gemma 3 12B12B · ~8.9 GB at Q4_K_M · Elo 1342
- Gemma 4 12B12B · ~8.7 GB at Q4_K_M
- Llama 3.2 Vision 11B10.7B · ~9 GB at Q4_K_M
- FNFalcon3 10B10B · ~7.5 GB at Q4_K_M
- Gemma 2 9B9B · ~7.3 GB at Q4_K_M · Elo 1266
- GLGLM-4-9B-04149B · ~7.2 GB at Q4_K_M
- NENemotron Nano 9B v29B · ~7.6 GB at Q4_K_M
- OROrnith 1.0 9B9B · ~7.1 GB at Q4_K_M
- Granite 4.1 8B8.8B · ~6.8 GB at Q4_K_M
- LFLFM2.5 8B-A1B8.3B MoE · ~6.7 GB at Q4_K_M
- Qwen2.5-VL 7B8.29B · ~7.1 GB at Q4_K_M
- DeepSeek-R1-0528-Qwen3-8B8.19B · ~6.2 GB at Q4_K_M
- Llama 3.1 8B8B · ~6.4 GB at Q4_K_M · Elo 1211
- DeepSeek-R1-Distill-Llama 8B8B · ~6.4 GB at Q4_K_M
- Gemma 3n E4B8B · ~5.7 GB at Q4_K_M
- Gemma 4 E4B8B · ~6.5 GB at Q4_K_M
- Mistral 7B7B · ~5.8 GB at Q4_K_M · Elo 1149
- Qwen2.5 7B7B · ~6.1 GB at Q4_K_M
- DeepSeek-R1-Distill-Qwen 7B7B · ~6.1 GB at Q4_K_M
- Qwen2.5 Coder 7B7B · ~5.8 GB at Q4_K_M
- Gemma 4 E2B5.1B · ~4.4 GB at Q4_K_M
- Gemma 3 4B4B · ~3.8 GB at Q4_K_M · Elo 1303
- NENemotron 3 Nano 4B4B · ~3.9 GB at Q4_K_M
- Phi-3.5-mini 3.8B3.82B · ~3.7 GB at Q4_K_M
- Phi-4-mini 3.8B3.8B · ~3.8 GB at Q4_K_M
- Phi-4-mini-reasoning3.8B · ~3.6 GB at Q4_K_M
- Qwen2.5-VL 3B3.75B · ~4.4 GB at Q4_K_M
- Granite 4.1 3B3.4B · ~3.3 GB at Q4_K_M
- Qwen2.5 3B3.09B · ~3.3 GB at Q4_K_M
- Qwen2.5 Coder 3B3.09B · ~3 GB at Q4_K_M
- Llama 3.2 3B3B · ~3.2 GB at Q4_K_M · Elo 1166
- SmolLM3 3B3B · ~3 GB at Q4_K_M
- OPApple OpenELM 3B3B · ~3 GB at Q4_K_M
- Gemma 2 2B2.61B · ~2.9 GB at Q4_K_M
- Granite 3.1 2B2.53B · ~2.8 GB at Q4_K_M
- SSarvam-1 2B2B · ~2.7 GB at Q4_K_M
- SmolLM2 1.7B1.7B · ~2.2 GB at Q4_K_M · Elo 1114
- Qwen3 1.7B1.7B · ~2.4 GB at Q4_K_M
- Qwen2.5 1.5B1.54B · ~2.2 GB at Q4_K_M
- Qwen2.5 Coder 1.5B1.54B · ~2 GB at Q4_K_M
- MIMiniCPM-V 4.61.3B · ~1.6 GB at Q4_K_M
- LFLFM2.5 1.2B1.17B · ~1.8 GB at Q4_K_M
- LFLFM2.5 1.2B Thinking1.17B · ~1.8 GB at Q4_K_M
- TLTinyLlama 1.1B1.1B · ~1.8 GB at Q4_K_M
- OPApple OpenELM 1.1B1.1B · ~1.7 GB at Q4_K_M
- Llama 3.2 1B1B · ~1.8 GB at Q4_K_M · Elo 1110
- Gemma 3 1B1B · ~1.8 GB at Q4_K_M
- Qwen3 0.6B0.6B · ~1.5 GB at Q4_K_M
- Qwen2.5 0.5B0.494B · ~1.5 GB at Q4_K_M
- Qwen2.5 Coder 0.5B0.494B · ~1.4 GB at Q4_K_M
- SmolLM2 360M0.362B · ~1.2 GB at Q4_K_M
- Gemma 3 270M0.27B · ~1.1 GB at Q4_K_M
- SmolLM2 135M0.135B · ~1 GB at Q4_K_M
Each chip links to the full breakdown for that model on a real 256GB device. "Tight" means it fits but with little headroom, close other apps.
The ceiling, per memory type
Apple M3 Ultra (256GB) (~192 GB usable)
Runs up to Qwen3 235B A22B (235B) comfortably at Q4_K_M. Larger models either sit tight or spill past the ~192 GB it can give a model.
Too large for any 256GB device
FAQ
How much of 256GB can a model actually use?
It depends on the memory type. Apple unified memory: about 192 GB (Apple M3 Ultra (256GB)). The rest is reserved for the OS, display and runtime overhead.
What is the best local LLM for 256GB?
Qwen3 235B A22B (235B) is the strongest model that runs comfortably at Q4_K_M on the most capable 256GB setup (Apple M3 Ultra (256GB), ~192 GB usable). On a tighter 256GB device the ceiling is lower, shown per row above.
Sources
Memory figures are estimates at Q4_K_M with a small context. See methodology.