Memory budget · 6 GB
Best local LLMs for 6GB
The Nvidia GeForce RTX 2060 (6GB) gives about ~5 GB of its 6GB to model weights after the driver and display take their share. 40 of 155 local LLMs fit, biggest first.
- Usable range
- 5 GB
- Models that fit
- 40
- Memory types
- 1
- Top pick
- 4B
What 6GB actually gives you
Usable figures are sourced per device (tap a card for the full profile). Verdicts below use Q4_K_M, the community-default quant.
Runs comfortably on the most capable 6GB setup (Nvidia GeForce RTX 2060 (6GB), ~5 GB usable) at ~3.8 GB. Check it against your exact device on its model page.
Models ranked for 6GB
- Gemma 4 E2B5.1B · ~4.4 GB at Q4_K_M
- Qwen3-VL 4B4.44B · ~4.4 GB at Q4_K_M
- Gemma 3 4B4B · ~3.8 GB at Q4_K_M · Elo 1303
- NENemotron 3 Nano 4B4B · ~3.9 GB at Q4_K_M
- Phi-3.5-mini 3.8B3.82B · ~3.7 GB at Q4_K_M
- Phi-4-mini 3.8B3.8B · ~3.8 GB at Q4_K_M
- Phi-4-mini-reasoning3.8B · ~3.6 GB at Q4_K_M
- Qwen2.5-VL 3B3.75B · ~4.4 GB at Q4_K_M
- Granite 4.1 3B3.4B · ~3.3 GB at Q4_K_M
- Qwen2.5 3B3.09B · ~3.3 GB at Q4_K_M
- Qwen2.5 Coder 3B3.09B · ~3 GB at Q4_K_M
- Llama 3.2 3B3B · ~3.2 GB at Q4_K_M · Elo 1166
- SmolLM3 3B3B · ~3 GB at Q4_K_M
- OPApple OpenELM 3B3B · ~3 GB at Q4_K_M
- Ministral 3 3B3B · ~3.2 GB at Q4_K_M
- Granite 4.2 3B3B · ~3.3 GB at Q4_K_M
- Gemma 2 2B2.61B · ~2.9 GB at Q4_K_M
- Granite 3.1 2B2.53B · ~2.8 GB at Q4_K_M
- SSarvam-1 2B2B · ~2.7 GB at Q4_K_M
- SmolLM2 1.7B1.7B · ~2.2 GB at Q4_K_M · Elo 1114
- Qwen3 1.7B1.7B · ~2.4 GB at Q4_K_M
- Qwen2.5 1.5B1.54B · ~2.2 GB at Q4_K_M
- Qwen2.5 Coder 1.5B1.54B · ~2 GB at Q4_K_M
- MIMiniCPM-V 4.61.3B · ~1.6 GB at Q4_K_M
- LFLFM2.5 1.2B1.17B · ~1.8 GB at Q4_K_M
- LFLFM2.5 1.2B Thinking1.17B · ~1.8 GB at Q4_K_M
- TLTinyLlama 1.1B1.1B · ~1.8 GB at Q4_K_M
- OPApple OpenELM 1.1B1.1B · ~1.7 GB at Q4_K_M
- Llama 3.2 1B1B · ~1.8 GB at Q4_K_M · Elo 1110
- Gemma 3 1B1B · ~1.8 GB at Q4_K_M
- Qwen3 0.6B0.6B · ~1.5 GB at Q4_K_M
- Qwen2.5 0.5B0.494B · ~1.5 GB at Q4_K_M
- Qwen2.5 Coder 0.5B0.494B · ~1.4 GB at Q4_K_M
- SmolLM2 360M0.362B · ~1.2 GB at Q4_K_M
- Gemma 3 270M0.27B · ~1.1 GB at Q4_K_M
- SmolLM2 135M0.135B · ~1 GB at Q4_K_M
Each chip links to the full breakdown for that model on a real 6GB device. "Tight" means it fits but with little headroom, close other apps.
The ceiling, per memory type
Nvidia GeForce RTX 2060 (6GB) (~5 GB usable)
Runs up to Nemotron 3 Nano 4B (4B) comfortably at Q4_K_M. Larger models either sit tight or spill past the ~5 GB it can give a model.
Too large for any 6GB device
FAQ
How much of 6GB can a model actually use?
It depends on the memory type. GPU VRAM: about 5 GB (Nvidia GeForce RTX 2060 (6GB)). The rest is reserved for the OS, display and runtime overhead.
What is the best local LLM for 6GB?
Gemma 3 4B (4B) is the strongest model that runs comfortably at Q4_K_M on the most capable 6GB setup (Nvidia GeForce RTX 2060 (6GB), ~5 GB usable). On a tighter 6GB device the ceiling is lower, shown per row above.
Sources
-
en.wikipedia.org · 1 source
-
gorilla.cs.berkeley.edu · 1 source
-
huggingface.co · 1 source
-
lmarena.ai · 1 source
-
ollama.com · 2 sources
-
techspot.com · 1 source
-
videocardz.net · 1 source
Memory figures are estimates at Q4_K_M with a small context. See methodology.