FLUX.2 Klein 4B
Apache 2.0Black Forest Labs · 4B · Apache 2.0
Fastest open FLUX.2 — sub-second text-to-image and multi-reference editing on consumer GPUs
Detectamos tu GPU o Mac y clasificamos los modelos abiertos que realmente encajan.
Los mejores modelos abiertos para tu dispositivo
Chat, código y razonamiento
Genera imágenes localmente
Genera vídeo localmente
En el dispositivo, 4B o menos
Este dispositivo es muy limitado
Nada corre cómodamente todavía. Cambia a Ver todos para ver las opciones más ligeras.
Black Forest Labs · 4B · Apache 2.0
Fastest open FLUX.2 — sub-second text-to-image and multi-reference editing on consumer GPUs
Alibaba · 5B · Apache 2.0
Unified text/image-to-video — the local sweet spot under Apache 2.0
Alibaba · 6B · Apache 2.0
8-step distilled image model — photorealism and bilingual text on 16GB cards
Tencent · 8.3B · Tencent Hunyuan Community
Compact cinematic video model — strong faces and motion on a single 4090
Alibaba · 8.8B · Apache 2.0
The community-favourite local VLM — superb OCR, receipts & captioning
Alibaba · 9B · Apache 2.0
Multimodal Qwen 3.5 mid-size
Lightricks · 19B · LTX-2 Community
Open 4K video with native stereo audio — text, image and video-to-video
Alibaba · 20B · Apache 2.0
Open text-to-image with strong English and Chinese typography
OpenAI · 21B · Apache 2.0
OpenAI's open-weight MoE with configurable reasoning
Google · 27B · Gemma
Gemma 4 MoE instruct model (official)
Alibaba · 27B · Apache 2.0
Flagship dense Qwen 3.8 — native multimodal all-rounder with video understanding
Alibaba · 27B · Apache 2.0
Flagship open Wan 2.2 — 14B-active MoE for photoreal text-to-video
Meta · 30B · Apache 2.0
Open agentic 30B distilled from Muse Spark — tool use, vision and local recovery on a single GPU
Alibaba · 31B · Apache 2.0
Efficient vision MoE — 3B active, strong temporal & document understanding
Black Forest Labs · 32B · FLUX Non-Commercial
Flagship open-weight FLUX.2 — text-to-image and multi-reference editing up to 4MP
MiniMax · 33B · MiniMax Community
Open video generation — text/image to 2K video with native stereo audio
InternScience · 35B · Apache 2.0
Efficient multimodal agentic MoE for long-horizon search, engineering and scientific research
DeepReinforce · 35B · MIT
Agentic coding MoE with a 3B active working set and self-improving training
Alibaba · 36B · Apache 2.0
Big-model quality at 3B-active speed — the mid-hardware sweet spot
Tencent · 80B · Tencent Hunyuan Community
Reasoning image model — prompt rewrite, chain-of-thought and image-to-image editing
Meta · 109B · Llama 4 Community
MoE with 16 experts, 17B active params
OpenAI · 117B · Apache 2.0
OpenAI's flagship open-weight MoE — 52.6% SWE-bench
Mistral AI · 119B · Apache 2.0
Sparse Mistral Small 4 — 6.5B active, strong local all-rounder
Alibaba · 235B · Apache 2.0
Flagship vision-language MoE — frontier multimodal reasoning and agentic GUI control
Tencent · 295B · Apache 2.0
Production-focused agentic MoE with strong coding, tool use and long-context reasoning
MiniMax · 428B · MiniMax Community
Native multimodal MoE — understands text, image and long video with 1M context
Z.ai · 753B · MIT
Same 753B / 40B-active base as GLM-5.2 — post-training lifts coding and long-horizon agents, 1M context
Meituan · 1.6T · MIT
Frontier-scale agentic and coding MoE with sparse attention and native 1M context
DeepSeek · 1.6T · MIT
Flagship V4 MoE — 49B active, 1M context
Alibaba · 2.4T · Qwen
Frontier Qwen 3.8 MoE — 95B active, 1M context
Moonshot AI · 2.8T · Kimi
Frontier 2.8T multimodal MoE — 104B active, native video understanding, 1M context
Alibaba · 0.6B · Apache 2.0
Ultra-light Qwen 3 model for constrained devices
Alibaba · 0.8B · Apache 2.0
Ultra-tiny model for embedded and edge
Meta · 1B · Llama 3.2 Community
Meta's smallest Llama for edge devices
Google · 1B · Gemma
Google's tiny Gemma for on-device
Alibaba · 1.3B · Apache 2.0
Tiny open text-to-video — 480p clips on 8GB consumer GPUs
Alibaba · 1.5B · Apache 2.0
Ultra-lightweight coding model
DeepSeek · 1.5B · MIT
Tiny reasoning model distilled from R1
Alibaba · 1.7B · Apache 2.0
Compact multilingual Qwen 3
Alibaba · 2B · Apache 2.0
Small multimodal Qwen 3.5
Meta · 3B · Llama 3.2 Community
Lightweight Llama for mobile and edge
HuggingFace · 3B · Apache 2.0
Lightweight multilingual reasoning
IBM · 3B · Apache 2.0
Compact enterprise model for edge and constrained environments
Mistral AI · 3B · Apache 2.0
Current-gen tiny Ministral — edge chat with 256K context
Microsoft · 3.8B · MIT
Lightweight reasoning model
Google · 4B · Gemma
Multimodal Gemma with 128K context
Alibaba · 4B · Apache 2.0
Small multimodal Qwen 3.5
Alibaba · 4.4B · Apache 2.0
Compact dedicated vision-language model — OCR & image chat on edge
Google · 5B · Gemma
Gemma 4 efficient instruct model (official)
Alibaba · 7B · Apache 2.0
Dedicated coding model
DeepSeek · 7B · MIT
R1 reasoning distilled into Qwen 7B
Google · 8B · Gemma
Gemma 4 balanced instruct model (official)
Meta · 8B · Llama 3.1 Community
Meta's versatile 8B — great quality/speed ratio
Alibaba · 8B · Apache 2.0
Qwen 3 with thinking mode support
IBM · 8B · Apache 2.0
Balanced general-purpose enterprise model
Mistral AI · 8B · MRL
Mistral's efficient 8B model
Zhipu AI · 9B · GLM-4
Multilingual model supporting 26 languages with 128K context
NVIDIA · 9B · NVIDIA Open
Hybrid Mamba2 architecture for reasoning
DeepReinforce · 9B · MIT
Self-improving agentic coding model optimized for terminal and software engineering tasks
Black Forest Labs · 9B · FLUX Non-Commercial
Higher-quality distilled FLUX.2 — sub-second generation and multi-reference editing
Google · 12B · Gemma
Multimodal Gemma with 128K context
Mistral AI · 12B · Apache 2.0
Multilingual 12B with 128K context
Google · 12B · Apache 2.0
Gemma 4 mid-size instruct — multimodal any-to-any
Microsoft · 14B · MIT
Microsoft's reasoning-focused model
Alibaba · 14B · Apache 2.0
Strong all-rounder with thinking mode
DeepSeek · 14B · MIT
R1 reasoning distilled into Qwen 14B
Mistral AI · 14B · Apache 2.0
Current-gen Ministral mid-size — local assistant with 256K context
Liquid AI · 24B · Liquid AI
Hybrid MoE with convolution+attention layers — 2.3B active
Mistral AI · 24B · Apache 2.0
Coding-focused model with 256K context — 68% SWE-bench
Mistral AI · 24B · Apache 2.0
Multimodal Mistral with vision support
Google · 26B · Apache 2.0
Discrete diffusion MoE — 1100+ tok/s on H100, multimodal (text/image/video)
Alibaba · 27.8B · Apache 2.0
Flagship native multimodal Qwen 3.5
Alibaba · 27.8B · Apache 2.0
Flagship dense Qwen 3.6 — native multimodal all-rounder
Alibaba · 30B · Apache 2.0
MoE with only 3.3B active — extremely efficient
NVIDIA · 30B · NVIDIA Open
MoE with 1M context and 3B active
IBM · 30B · Apache 2.0
High-capacity enterprise model for complex reasoning and tool use
Cohere · 30B · Apache 2.0
Open agentic coding MoE with 3B active — built for software engineering and terminal tasks
Alibaba · 30B · Apache 2.0
Efficient agentic coding MoE — 3B active, 256K context
Alibaba · 32B · Apache 2.0
Qwen 3 flagship dense model
DeepSeek · 32B · MIT
R1 reasoning distilled into Qwen 32B — sweet spot
Allen AI · 32B · Apache 2.0
Fully open research model by Allen AI
Google · 33B · Gemma
Gemma 4 flagship instruct model (official)
Google · 33B · Gemma
Gemma 4 flagship base model (official)
Cohere · 35B · CC BY-NC 4.0
Optimized for retrieval-augmented generation
Alibaba · 35B · Apache 2.0
Efficient multimodal MoE with 3B active
Mistral AI · 47B · Apache 2.0
MoE with 12.9B active params
Meta · 70B · Llama 3.3 Community
Best open model at 70B class
Alibaba · 80B · Apache 2.0
High-sparsity MoE — extreme low activation ratio for fast inference at 80B scale
Alibaba · 80B · Apache 2.0
Ultra-efficient agentic coding MoE optimized for tool-calling coding agents
Tencent · 80B · Tencent Hunyuan Community
Largest open image MoE — 13B active, strong long-prompt generation
Z.ai · 106B · MIT
Consumer-friendly GLM MoE — 12B active, strong agentic & tool use
Alibaba · 122B · Apache 2.0
Large multimodal MoE
DeepSeek · 158B · MIT
Efficient long-context V4 — 13B active, 1M context
Alibaba · 235B · Apache 2.0
Massive MoE with 22B active — frontier quality
Z.ai · 357B · MIT
Large GLM MoE with strong coding and 200K context
Alibaba · 397B · Apache 2.0
Largest multimodal Qwen 3.5 MoE
Meta · 400B · Llama 4 Community
Multimodal MoE with 128 experts — 17B active, 1M context
Alibaba · 480B · Apache 2.0
Largest open coding MoE — 35B active
DeepSeek · 671B · MIT
Massive MoE reasoning model — 37B active
DeepSeek · 685B · MIT
State-of-the-art MoE — 37B active params
Zhipu AI · 744B · MIT
MoE with 256 experts, 40B active — frontier-class agentic coding
Z.ai · 753B · MIT
Frontier open-weight coder — top SWE-bench, 1M context
Zhipu AI · 754B · MIT
Improved agentic coding — SOTA SWE-bench Pro, long-horizon tasks
Moonshot AI · 1.06T · Kimi
Natively multimodal 1T MoE — 32B active, frontier agentic
No se encontraron modelos
Prueba a ajustar tu búsqueda o filtros
104 modelos · 284 dispositivos · 22 laboratorios
Detectamos tu GPU o memoria unificada y clasificamos modelos abiertos que puedes ejecutar localmente: chat, código, imagen y vídeo. Un modelo de 9B cabe en una RTX 4060; una M4 Max admite modelos más grandes. Consulta el método de puntuación, la documentación o instala runai.
01
Abre LocalAI
Visita la página principal desde un navegador de escritorio. No hace falta cuenta ni extensión.
02
Detecta o elige tu hardware
Deja que la página lea tu GPU y memoria, o explora la lista de dispositivos si la detección no identifica tu chip.
03
Compara los modelos recomendados
Revisa los mejores modelos abiertos de texto, código, imagen y vídeo que caben en la VRAM o memoria unificada detectada.
04
Ejecuta un modelo en local
Abre la página de un modelo y ejecútalo con runai, Ollama o LM Studio usando la cuantización sugerida.
Las cifras asumen Q4_K_M más un pequeño overhead de runtime. Los modelos de mezcla de expertos cargan igualmente todos los expertos en memoria, aunque solo unos pocos estén activos por token.
| Memoria | Qué suele caber | Dispositivo de ejemplo |
|---|---|---|
| 8 GB | Modelos de chat de 3B–9B en Q4, además de modelos de imagen muy pequeños. | RTX 4060 |
| 12 GB | Modelos densos de 12B–14B, o mezclas de expertos más pequeñas. | RTX 4070 |
| 16 GB | 20B–27B en Q4, o un 14B cómodo con mayor calidad. | Apple M4 |
| 24 GB | Modelos densos de 30B, MoE de tamaño medio, o vídeo local. | RTX 4090 |
| 32 GB+ | MoE abiertos más grandes y generación de imagen de alta calidad. | RTX 5090 |
Una selección breve de modelos de chat, imagen y vídeo. La lista de arriba sigue clasificando lo que quepa en el hardware detectado en esta página.
Si buscas el vocabulario o las matemáticas de la puntuación, estas dos páginas lo cubren.
Un modelo de chat de 7B–9B normalmente cabe en 8 GB de VRAM con cuantización Q4. Entre 12 y 16 GB cubre la mayoría de modelos de 12B–27B. A partir de 24 GB se abren modelos densos de 30B, mezclas de expertos de tamaño medio y generación de imagen o vídeo local. En Apple Silicon el límite es la memoria unificada, no un framebuffer de GPU independiente.
Sí. Los Mac con Apple Silicon comparten RAM entre CPU y GPU, así que un M4, M4 Pro o M4 Max puede ejecutar modelos abiertos que de otro modo necesitarían una tarjeta gráfica discreta. El ancho de banda sigue importando: un chip Max genera tokens más rápido que un chip base de la misma serie M con la misma memoria.
Los modelos locales corren en tu máquina. Los prompts nunca salen del dispositivo, no hay medidor de suscripción y puedes seguir trabajando sin conexión. Los asistentes en la nube suelen ser más potentes en las tareas más difíciles, pero necesitan red y envían tus datos a un proveedor. LocalAI es para los modelos de pesos abiertos que puedes descargar y ejecutar tú mismo.
La cuantización almacena los pesos del modelo en menos bits, así el archivo es más pequeño y usa menos memoria. Q4_K_M es el punto óptimo habitual para chat local: mucho más pequeño que la precisión completa, con solo una pérdida de calidad moderada. Formatos superiores como Q8 o F16 se acercan más al modelo original pero necesitan más VRAM.
El sitio lee indicios de GPU, RAM y CPU desde el navegador, los compara con una base de datos de hardware y luego puntúa cada modelo abierto según la velocidad estimada, el margen de memoria y la calidad. También puedes saltarte la detección y abrir la página de un dispositivo concreto: una GPU, un chip Apple, un teléfono o una Raspberry Pi.
Abre la página de cualquier modelo y copia su comando runai, o usa Ollama o LM Studio con los mismos pesos GGUF. runai elige una cuantización para tu máquina, descarga el archivo e inicia un chat local con llama.cpp.