¿Puedo ejecutar IA localmente?

Detectamos tu GPU o Mac y clasificamos los modelos abiertos que realmente encajan.

GPUVRAMBWRAMNúcleos

Los mejores modelos abiertos para tu dispositivo

¿Puedo ejecutar modelos de código?

Chat, código y razonamiento

¿Puedo ejecutar modelos de imagen?

Genera imágenes localmente

¿Puedo ejecutar modelos de vídeo?

Genera vídeo localmente

¿Puedo ejecutar modelos pequeños?

En el dispositivo, 4B o menos

104 modelos · 284 dispositivos · 22 laboratorios

Ejecuta modelos de IA abiertos en tu propio hardware

Detectamos tu GPU o memoria unificada y clasificamos modelos abiertos que puedes ejecutar localmente: chat, código, imagen y vídeo. Un modelo de 9B cabe en una RTX 4060; una M4 Max admite modelos más grandes. Consulta el método de puntuación, la documentación o instala runai.

  1. 01

    Abre LocalAI

    Visita la página principal desde un navegador de escritorio. No hace falta cuenta ni extensión.

  2. 02

    Detecta o elige tu hardware

    Deja que la página lea tu GPU y memoria, o explora la lista de dispositivos si la detección no identifica tu chip.

  3. 03

    Compara los modelos recomendados

    Revisa los mejores modelos abiertos de texto, código, imagen y vídeo que caben en la VRAM o memoria unificada detectada.

  4. 04

    Ejecuta un modelo en local

    Abre la página de un modelo y ejecútalo con runai, Ollama o LM Studio usando la cuantización sugerida.

¿Cuánta VRAM necesitas?

Las cifras asumen Q4_K_M más un pequeño overhead de runtime. Los modelos de mezcla de expertos cargan igualmente todos los expertos en memoria, aunque solo unos pocos estén activos por token.

Tamaños aproximados de modelos de IA locales según la memoria de GPU disponible
MemoriaQué suele caberDispositivo de ejemplo
8 GBModelos de chat de 3B–9B en Q4, además de modelos de imagen muy pequeños.RTX 4060
12 GBModelos densos de 12B–14B, o mezclas de expertos más pequeñas.RTX 4070
16 GB20B–27B en Q4, o un 14B cómodo con mayor calidad.Apple M4
24 GBModelos densos de 30B, MoE de tamaño medio, o vídeo local.RTX 4090
32 GB+MoE abiertos más grandes y generación de imagen de alta calidad.RTX 5090

Una selección breve de modelos de chat, imagen y vídeo. La lista de arriba sigue clasificando lo que quepa en el hardware detectado en esta página.

Guías

Si buscas el vocabulario o las matemáticas de la puntuación, estas dos páginas lo cubren.

Preguntas frecuentes sobre IA local

¿Cuánta VRAM necesito para ejecutar un modelo de IA local?

Un modelo de chat de 7B–9B normalmente cabe en 8 GB de VRAM con cuantización Q4. Entre 12 y 16 GB cubre la mayoría de modelos de 12B–27B. A partir de 24 GB se abren modelos densos de 30B, mezclas de expertos de tamaño medio y generación de imagen o vídeo local. En Apple Silicon el límite es la memoria unificada, no un framebuffer de GPU independiente.

¿Puedo ejecutar modelos de IA local en un Mac sin GPU dedicada?

Sí. Los Mac con Apple Silicon comparten RAM entre CPU y GPU, así que un M4, M4 Pro o M4 Max puede ejecutar modelos abiertos que de otro modo necesitarían una tarjeta gráfica discreta. El ancho de banda sigue importando: un chip Max genera tokens más rápido que un chip base de la misma serie M con la misma memoria.

Modelos M4M4 ProM4 Max

¿Cuál es la diferencia entre ejecutar IA en local y usar ChatGPT?

Los modelos locales corren en tu máquina. Los prompts nunca salen del dispositivo, no hay medidor de suscripción y puedes seguir trabajando sin conexión. Los asistentes en la nube suelen ser más potentes en las tareas más difíciles, pero necesitan red y envían tus datos a un proveedor. LocalAI es para los modelos de pesos abiertos que puedes descargar y ejecutar tú mismo.

¿Qué es la cuantización y por qué importa?

La cuantización almacena los pesos del modelo en menos bits, así el archivo es más pequeño y usa menos memoria. Q4_K_M es el punto óptimo habitual para chat local: mucho más pequeño que la precisión completa, con solo una pérdida de calidad moderada. Formatos superiores como Q8 o F16 se acercan más al modelo original pero necesitan más VRAM.

Guía de cuantización

¿Cómo sabe LocalAI qué modelos caben en mi hardware?

El sitio lee indicios de GPU, RAM y CPU desde el navegador, los compara con una base de datos de hardware y luego puntúa cada modelo abierto según la velocidad estimada, el margen de memoria y la calidad. También puedes saltarte la detección y abrir la página de un dispositivo concreto: una GPU, un chip Apple, un teléfono o una Raspberry Pi.

Metodología de puntuaciónExplorar dispositivos

¿Cómo descargo y ejecuto un modelo recomendado?

Abre la página de cualquier modelo y copia su comando runai, o usa Ollama o LM Studio con los mismos pesos GGUF. runai elige una cuantización para tu máquina, descarga el archivo e inicia un chat local con llama.cpp.

Instalar runai

Todos los nombres de producto, logos y marcas son propiedad de sus respectivos dueños. Apple, NVIDIA, AMD, Intel, Qualcomm y todos los nombres de modelos de IA mencionados en este sitio son marcas registradas de sus titulares. Este sitio no está afiliado ni respaldado por ninguna de estas empresas.