42 modelos en Q4 · presupuesto de 8 GB
Modelos de IA local para 8GB de VRAM
8 GB es el presupuesto de GPU de consumo más habitual. En Q4 puedes ejecutar cómodamente modelos de chat de 3B–9B, además de los checkpoints de imagen más pequeños. Las mezclas de expertos siguen cargando todos los expertos, así que los archivos MoE grandes no caben.
Encaje típico: Modelos de chat de 3B–9B en Q4, además de modelos de imagen muy pequeños. · Ejemplo:RTX 4060
- Qwen 3 0.6BAlibaba · 0.6B · 0.8 GB Q4
- Qwen 3.5 0.8BAlibaba · 0.8B · 0.9 GB Q4
- Llama 3.2 1BMeta · 1B · 1 GB Q4
- Gemma 3 1BGoogle · 1B · 1 GB Q4
- Wan 2.1 T2V 1.3BAlibaba · 1.3B · 1.2 GB Q4
- Qwen 2.5 Coder 1.5BAlibaba · 1.5B · 1.3 GB Q4
- DeepSeek R1 1.5BDeepSeek · 1.5B · 1.3 GB Q4
- Qwen 3 1.7BAlibaba · 1.7B · 1.4 GB Q4
- Qwen 3.5 2BAlibaba · 2B · 1.5 GB Q4
- Llama 3.2 3BMeta · 3B · 2 GB Q4
- SmolLM3 3BHuggingFace · 3B · 2 GB Q4
- Granite 4.1 3BIBM · 3B · 2 GB Q4
- Ministral 3 3BMistral AI · 3B · 2 GB Q4
- Phi-4 Mini ReasoningMicrosoft · 3.8B · 2.4 GB Q4
- Gemma 3 4BGoogle · 4B · 2.5 GB Q4
- Qwen 3.5 4BAlibaba · 4B · 2.5 GB Q4
- FLUX.2 Klein 4BBlack Forest Labs · 4B · 2.5 GB Q4
- Qwen3-VL 4BAlibaba · 4.4B · 2.8 GB Q4
- Gemma 4 E2B ITGoogle · 5B · 3.1 GB Q4
- Wan 2.2 TI2V 5BAlibaba · 5B · 3.1 GB Q4
- Z-Image TurboAlibaba · 6B · 3.6 GB Q4
- Qwen 2.5 Coder 7BAlibaba · 7B · 4.1 GB Q4
- DeepSeek R1 Distill 7BDeepSeek · 7B · 4.1 GB Q4
- Gemma 4 E4B ITGoogle · 8B · 4.6 GB Q4
- Llama 3.1 8BMeta · 8B · 4.6 GB Q4
- Qwen 3 8BAlibaba · 8B · 4.6 GB Q4
- Granite 4.1 8BIBM · 8B · 4.6 GB Q4
- Ministral 8BMistral AI · 8B · 4.6 GB Q4
- HunyuanVideo 1.5Tencent · 8.3B · 4.8 GB Q4
- Qwen3-VL 8BAlibaba · 8.8B · 5 GB Q4
- GLM-4 9BZhipu AI · 9B · 5.1 GB Q4
- Nemotron Nano 9B v2NVIDIA · 9B · 5.1 GB Q4
- Qwen 3.5 9BAlibaba · 9B · 5.1 GB Q4
- Ornith 1.0 9BDeepReinforce · 9B · 5.1 GB Q4
- FLUX.2 Klein 9BBlack Forest Labs · 9B · 5.1 GB Q4
- Gemma 3 12BGoogle · 12B · 6.6 GB Q4
- Mistral Nemo 12BMistral AI · 12B · 6.6 GB Q4
- Gemma 4 12B ITGoogle · 12B · 6.6 GB Q4
- Phi-4 14BMicrosoft · 14B · 7.7 GB Q4
- Qwen 3 14BAlibaba · 14B · 7.7 GB Q4
- DeepSeek R1 Distill 14BDeepSeek · 14B · 7.7 GB Q4
- Ministral 3 14BMistral AI · 14B · 7.7 GB Q4
Estos tamaños asumen Q4_K_M más un pequeño overhead de runtime.Califica el catálogo completo en tu máquinaoelige una GPU concreta.
Preguntas frecuentes
- ¿Qué LLM puedo ejecutar con 8GB de VRAM?
- Los modelos densos de 7B–9B en Q4 son el punto óptimo. Los modelos más pequeños de 1B–4B se sentirán más rápidos. Evita los checkpoints densos de 14B o más y los archivos MoE grandes salvo que hagas offload a la RAM del sistema (mucho más lento).
- ¿8GB son suficientes para generar imágenes en local?
- Sí, para modelos compactos como FLUX Klein 4B o similares. FLUX.2 Dev completo y los modelos de vídeo grandes no caben.