Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Modelos locales

Qué significa ejecutar IA en tu equipo: parámetros, pesos, cuantización, RAM, VRAM, contexto, KV cache, CPU/GPU y offload.

7B parámetros no significa automáticamente 7 GB: pesos ≈ parámetros × bits por peso / 8 es solo una parte. Se suma metadata, overhead del runtime, buffers y KV cache (que crece con el contexto). Estimá memoria.

Modelos del catálogo que pueden analizarse (1)

Sin ranking: aparecen porque permiten uso local confirmado y tienen parámetros verificados. Cada uno explica por qué aparece, qué se conoce y qué falta verificar.

  • Mistral Large 3 — aparece porque permite uso local confirmado. Se conoce: 675B parámetros, contexto 256.000, Mixture-of-Experts. Falta verificar: runtime, cuantización disponible, KV cache real y velocidad en tu hardware. [estimar memoria]

Modelos locales con datos insuficientes (4)

Permiten uso local pero sin parámetros verificados: no se estima memoria (datos insuficientes no producen cero).

  • DeepSeek R1 — parámetros no verificados.
  • Llama — parámetros no verificados.
  • Llama 4 — parámetros no verificados.
  • Qwen3 — parámetros no verificados.

Runtimes y formatos (editorial)

  • GGUF + llama.cpp: formato cuantizado de referencia para CPU/GPU local. Los códigos Q4_K_M/Q5_K_M/Q6_K/Q8_0 pertenecen a este ecosistema.
  • Ollama: distribución simple sobre GGUF para probar modelos locales sin compilar.
  • Transformers / vLLM: ecosistemas Python/servidor, generalmente con más VRAM y otros formatos.

Sin afirmaciones de compatibilidad universal: la relación runtime/modelo solo se afirma con datos confirmados.

CPU y GPU / Offload

Caber en RAM no equivale a tener buena velocidad (memoria ≠ rendimiento; no se estiman tokens/segundo). Offload: CPU only (todo en RAM), GPU full offload (todo en VRAM) o partial (reparto RAM/VRAM aproximado).

Calculadora de memoria Comparar cuantizaciones