60 modelos en Q4 · presupuesto de 16 GB
Modelos de IA local para 16GB de VRAM
16 GB es el presupuesto cómodo para portátiles y equipos de sobremesa de gama media, incluyendo muchos Mac con Apple Silicon. Los modelos densos de 20B–27B caben en Q4, y los modelos de 14B pueden correr con mayor calidad.
Encaje típico: 20B–27B en Q4, o un 14B cómodo con mayor calidad. · Ejemplo:Apple M4
- Qwen 3 0.6BAlibaba · 0.6B · 0.8 GB Q4
- Qwen 3.5 0.8BAlibaba · 0.8B · 0.9 GB Q4
- Llama 3.2 1BMeta · 1B · 1 GB Q4
- Gemma 3 1BGoogle · 1B · 1 GB Q4
- Wan 2.1 T2V 1.3BAlibaba · 1.3B · 1.2 GB Q4
- Qwen 2.5 Coder 1.5BAlibaba · 1.5B · 1.3 GB Q4
- DeepSeek R1 1.5BDeepSeek · 1.5B · 1.3 GB Q4
- Qwen 3 1.7BAlibaba · 1.7B · 1.4 GB Q4
- Qwen 3.5 2BAlibaba · 2B · 1.5 GB Q4
- Llama 3.2 3BMeta · 3B · 2 GB Q4
- SmolLM3 3BHuggingFace · 3B · 2 GB Q4
- Granite 4.1 3BIBM · 3B · 2 GB Q4
- Ministral 3 3BMistral AI · 3B · 2 GB Q4
- Phi-4 Mini ReasoningMicrosoft · 3.8B · 2.4 GB Q4
- Gemma 3 4BGoogle · 4B · 2.5 GB Q4
- Qwen 3.5 4BAlibaba · 4B · 2.5 GB Q4
- FLUX.2 Klein 4BBlack Forest Labs · 4B · 2.5 GB Q4
- Qwen3-VL 4BAlibaba · 4.4B · 2.8 GB Q4
- Gemma 4 E2B ITGoogle · 5B · 3.1 GB Q4
- Wan 2.2 TI2V 5BAlibaba · 5B · 3.1 GB Q4
- Z-Image TurboAlibaba · 6B · 3.6 GB Q4
- Qwen 2.5 Coder 7BAlibaba · 7B · 4.1 GB Q4
- DeepSeek R1 Distill 7BDeepSeek · 7B · 4.1 GB Q4
- Gemma 4 E4B ITGoogle · 8B · 4.6 GB Q4
- Llama 3.1 8BMeta · 8B · 4.6 GB Q4
- Qwen 3 8BAlibaba · 8B · 4.6 GB Q4
- Granite 4.1 8BIBM · 8B · 4.6 GB Q4
- Ministral 8BMistral AI · 8B · 4.6 GB Q4
- HunyuanVideo 1.5Tencent · 8.3B · 4.8 GB Q4
- Qwen3-VL 8BAlibaba · 8.8B · 5 GB Q4
- GLM-4 9BZhipu AI · 9B · 5.1 GB Q4
- Nemotron Nano 9B v2NVIDIA · 9B · 5.1 GB Q4
- Qwen 3.5 9BAlibaba · 9B · 5.1 GB Q4
- Ornith 1.0 9BDeepReinforce · 9B · 5.1 GB Q4
- FLUX.2 Klein 9BBlack Forest Labs · 9B · 5.1 GB Q4
- Gemma 3 12BGoogle · 12B · 6.6 GB Q4
- Mistral Nemo 12BMistral AI · 12B · 6.6 GB Q4
- Gemma 4 12B ITGoogle · 12B · 6.6 GB Q4
- Phi-4 14BMicrosoft · 14B · 7.7 GB Q4
- Qwen 3 14BAlibaba · 14B · 7.7 GB Q4
- DeepSeek R1 Distill 14BDeepSeek · 14B · 7.7 GB Q4
- Ministral 3 14BMistral AI · 14B · 7.7 GB Q4
- LTX 2.3Lightricks · 19B · 10.2 GB Q4
- Qwen Image 2512Alibaba · 20B · 10.7 GB Q4
- GPT-OSS 20BOpenAI · 3.6B active · 11.3 GB Q4
- LFM2 24BLiquid AI · 2.3B active · 12.8 GB Q4
- Devstral Small 2 24BMistral AI · 24B · 12.8 GB Q4
- Mistral Small 3.1 24BMistral AI · 24B · 12.8 GB Q4
- DiffusionGemma 26B-A4B ITGoogle · 4B active · 13.8 GB Q4
- Gemma 4 26B-A4B ITGoogle · 4B active · 14.3 GB Q4
- Qwen 3.8 27BAlibaba · 27B · 14.3 GB Q4
- Wan 2.2 T2V A14BAlibaba · 14B active · 14.3 GB Q4
- Qwen 3.5 27BAlibaba · 27.8B · 14.7 GB Q4
- Qwen 3.6 27BAlibaba · 27.8B · 14.7 GB Q4
- Qwen 3 30B-A3BAlibaba · 3.3B active · 15.9 GB Q4
- Nemotron 3 Nano 30BNVIDIA · 3B active · 15.9 GB Q4
- Granite 4.1 30BIBM · 30B · 15.9 GB Q4
- North Mini CodeCohere · 3B active · 15.9 GB Q4
- Qwen 3 Coder 30B-A3BAlibaba · 3B active · 15.9 GB Q4
- Muse Glimmer 30BMeta · 30B · 15.9 GB Q4
Estos tamaños asumen Q4_K_M más un pequeño overhead de runtime.Califica el catálogo completo en tu máquinaoelige una GPU concreta.
Preguntas frecuentes
- ¿16GB de VRAM son suficientes para un LLM local?
- Sí. Cubre los modelos que la mayoría de la gente realmente quiere ejecutar a diario: buenos checkpoints de chat y código de 14B–27B, además de generación de imagen de tamaño medio.
- ¿Puede un Mac de 16GB ejecutar IA local?
- Un Mac de la serie M con 16 GB de memoria unificada puede ejecutar la misma clase de modelos que una GPU de 16 GB, con la velocidad dependiendo del chip (base, Pro o Max).