Comparador de cuantizaciones
Mayor cuantización generalmente reduce memoria, pero el impacto en calidad y velocidad depende del modelo, runtime, hardware y método.
¿Qué significa Q4_K_M?
Q4 = ~4 bits por peso; K = cuantización mixta por grupos (K-quant); M = variante media (equilibrio entre las variantes S y L). No son 4,000 bits exactos: hay metadata y escalas por grupo.
Ver todas las cuantizaciones
- FP32 (≈32–32 bits): Punto flotante 32 bits: máxima precisión, mayor memoria. [Estándar IEEE 754 (exacto).]
- FP16 (≈16–16 bits): Punto flotante 16 bits (BF16 similar): base habitual de pesos abiertos. [Estándar IEEE 754 (exacto).]
- Q8_0 (≈8–9 bits): Cuantización 8 bits (GGUF): buena fidelidad, ~mitad de FP16. [Aproximación orientativa formato GGUF/llama.cpp.]
- Q6_K (≈6–6,9 bits): Cuantización 6 bits mixta (GGUF K-quant): equilibrio calidad/tamaño. [Aproximación orientativa formato GGUF/llama.cpp.]
- Q5_K_M (≈5–5,9 bits): Cuantización 5 bits mixta (GGUF K-quant, variante M): recomendada para uso general. [Aproximación orientativa formato GGUF/llama.cpp.]
- Q4_K_M (≈4–4,9 bits): Cuantización 4 bits mixta (GGUF K-quant, variante M): menor memoria, mayor pérdida posible. [Aproximación orientativa formato GGUF/llama.cpp.]
GGUF es el formato de modelos cuantizados de llama.cpp/Ollama. No todos los runtimes usan exactamente las mismas cuantizaciones.