Modelos locales
Qué significa ejecutar IA en tu equipo: parámetros, pesos, cuantización, RAM, VRAM, contexto, KV cache, CPU/GPU y offload.
7B parámetros no significa automáticamente 7 GB: pesos ≈ parámetros × bits por peso / 8 es solo una parte. Se suma metadata, overhead del runtime, buffers y KV cache (que crece con el contexto). Estimá memoria.
Modelos del catálogo que pueden analizarse (1)
Sin ranking: aparecen porque permiten uso local confirmado y tienen parámetros verificados. Cada uno explica por qué aparece, qué se conoce y qué falta verificar.
- Mistral Large 3 — aparece porque permite uso local confirmado. Se conoce: 675B parámetros, contexto 256.000, Mixture-of-Experts. Falta verificar: runtime, cuantización disponible, KV cache real y velocidad en tu hardware. [estimar memoria]
Modelos locales con datos insuficientes (4)
Permiten uso local pero sin parámetros verificados: no se estima memoria (datos insuficientes no producen cero).
- DeepSeek R1 — parámetros no verificados.
- Llama — parámetros no verificados.
- Llama 4 — parámetros no verificados.
- Qwen3 — parámetros no verificados.
Runtimes y formatos (editorial)
- GGUF + llama.cpp: formato cuantizado de referencia para CPU/GPU local. Los códigos Q4_K_M/Q5_K_M/Q6_K/Q8_0 pertenecen a este ecosistema.
- Ollama: distribución simple sobre GGUF para probar modelos locales sin compilar.
- Transformers / vLLM: ecosistemas Python/servidor, generalmente con más VRAM y otros formatos.
Sin afirmaciones de compatibilidad universal: la relación runtime/modelo solo se afirma con datos confirmados.
CPU y GPU / Offload
Caber en RAM no equivale a tener buena velocidad (memoria ≠ rendimiento; no se estiman tokens/segundo). Offload: CPU only (todo en RAM), GPU full offload (todo en VRAM) o partial (reparto RAM/VRAM aproximado).