Meta · 3B · Densa

Lightweight Llama for mobile and edge Comprueba si tu GPU o Mac puede ejecutar Llama 3.2 3B localmente — 1.7 GB mínimo, 2.8 GB recomendado.

2024-09128K contexto

Opciones de cuantización

CuantBitsVRAMCalidadEstado
Q2_K21.5 GBlow
Q3_K_M31.8 GBmoderate
Q4_K_M42 GBgood
Q5_K_M52.4 GBgood
Q6_K62.8 GBexcellent
Q8_083.6 GBexcellent
F16166.6 GBlossless

Sobre este modelo

The Meta Llama 3.2 collection of multilingual large language models (LLMs) is a collection of pretrained and instruction-tuned generative models in 1B and 3B sizes (text in/text out). The Llama 3.2 instruction-tuned text only models are optimized for multilingual dialogue use cases, including agentic retrieval and summarization tasks. They outperform many of the available open source and closed chat models on common industry benchmarks.

Sizes

3B parameters (default)

The 3B model outperforms the Gemma 2 2.6B and Phi 3.5-mini models on tasks such as:

  • Following instructions
  • Summarization
  • Prompt rewriting
  • Tool use
ollama run llama3.2

1B parameters

The 1B model is competitive with other 1-3B parameter models. It’s use cases include:

  • Personal information management
  • Multilingual knowledge retrieval
  • Rewriting tasks running locally on edge
ollama run llama3.2:1b

Benchmarks

Llama 3.2 instruction-tuned benchmarks

Supported Languages: English, German, French, Italian, Portuguese, Hindi, Spanish, and Thai are officially supported. Llama 3.2 has been trained on a broader collection of languages than these 8 supported languages.

¿Puedo ejecutar Llama 3.2 3B localmente?

¿Puedo ejecutar Llama 3.2 3B localmente?
Llama 3.2 3B necesita alrededor de 1.7 GB de memoria como mínimo y 2.8 GB recomendados. Abre esta página para evaluarlo con tu GPU o Mac, y luego ejecútalo con runai, Ollama o LM Studio.
¿Cuánta VRAM necesita Llama 3.2 3B?
En Q4_K_M, Llama 3.2 3B usa aproximadamente 2 GB de VRAM. Cuantizaciones más altas necesitan más memoria; las más bajas caben en tarjetas más ajustadas con una pérdida de calidad.