Calculadora de VRAM y Ajuste de Hardware para LLM
Compruebe si su GPU o Mac puede ejecutar LLM locales: estimaciones de VRAM por tamaño de modelo, cuantización y longitud de contexto.
| Modelo | Memoria | Veredicto | Velocidad est. (tok/s) | Pool usado |
|---|---|---|---|---|
Se ejecuta en GPU | 9.41 GB | Ajuste perfecto | 132 | 59% |
Gemma 3 12BTamaño medio · General Se ejecuta en GPU | 7.25 GB | Ajuste perfecto | 26.4 | 45% |
Mistral Nemo 12BTamaño medio · General Se ejecuta en GPU | 7.36 GB | Ajuste perfecto | 26.0 | 46% |
Phi-4 14BTamaño medio · Razonamiento Se ejecuta en GPU | 8.33 GB | Ajuste perfecto | 22.6 | 52% |
Qwen3 14BTamaño medio · General Se ejecuta en GPU | 8.76 GB | Ajuste perfecto | 21.4 | 55% |
Mistral 7B v0.3Ligero · General Se ejecuta en GPU | 4.62 GB | Ajuste perfecto | 44.0 | 29% |
Qwen2.5 7BLigero · General Se ejecuta en GPU | 4.84 GB | Ajuste perfecto | 41.7 | 30% |
Qwen2.5 Coder 7BLigero · Programación Se ejecuta en GPU | 4.84 GB | Ajuste perfecto | 41.7 | 30% |
DeepSeek-R1 Distill 7BLigero · Razonamiento Se ejecuta en GPU | 4.84 GB | Ajuste perfecto | 41.7 | 30% |
Llama 3.1 8BLigero · General Se ejecuta en GPU | 5.06 GB | Ajuste perfecto | 39.6 | 32% |
Ministral 8BLigero · General Se ejecuta en GPU | 5.06 GB | Ajuste perfecto | 39.6 | 32% |
Qwen3 8BLigero · General Se ejecuta en GPU | 5.17 GB | Ajuste perfecto | 38.6 | 32% |
GLM-4 9BLigero · General Se ejecuta en GPU | 5.61 GB | Ajuste perfecto | 35.2 | 35% |
Gemma 2 9BLigero · General Se ejecuta en GPU | 5.72 GB | Ajuste perfecto | 34.4 | 36% |
Qwen3 1.7BMini · General Se ejecuta en GPU | 1.54 GB | Ajuste perfecto | 186 | 10% |
Llama 3.2 3BMini · General Se ejecuta en GPU | 2.40 GB | Ajuste perfecto | 99.0 | 15% |
Phi-4-miniMini · General Se ejecuta en GPU | 2.73 GB | Ajuste perfecto | 83.4 | 17% |
Gemma 3 4BMini · General Se ejecuta en GPU | 2.85 GB | Ajuste perfecto | 79.2 | 18% |
Qwen3 4BMini · General Se ejecuta en GPU | 2.85 GB | Ajuste perfecto | 79.2 | 18% |
Descarga de expertos MoE | 17.2 GB | Funciona bien | 76.8 | 49% |
Descarga de expertos MoE | 25.8 GB | Funciona bien | 19.6 | 73% |
Qwen3 32BPro · General Descarga parcial CPU+GPU | 18.4 GB | Funciona bien | 2.90 | 52% |
DeepSeek-R1 Distill 32BPro · Razonamiento Descarga parcial CPU+GPU | 18.4 GB | Funciona bien | 2.90 | 52% |
Gemma 3 27BPro · General Se ejecuta en GPU | 15.3 GB | Ajuste justo | 11.7 | 96% |
Mistral Small 3.1 24BTamaño medio · General Se ejecuta en GPU | 13.7 GB | Ajuste justo | 13.2 | 86% |
Llama 3.3 70BGama alta · General Se ejecuta en GPU | 38.4 GB | No cabe | — | 240% |
Qwen2.5 72BGama alta · General Se ejecuta en GPU | 39.5 GB | No cabe | — | 247% |
Se ejecuta en GPU | 58.5 GB | No cabe | — | 366% |
Se ejecuta en GPU | 124 GB | No cabe | — | 775% |
Se ejecuta en GPU | 348 GB | No cabe | — | 2178% |
Todas las cifras son estimaciones basadas en fórmulas, ancladas en el proyecto de código abierto llmfit. El rendimiento real varía según el runtime (Ollama, llama.cpp, LM Studio, MLX), la longitud del prompt y la calidad de los kernels. Para números medidos en tu máquina, ejecuta llmfit bench.
VRAM aproximada por tamaño de modelo
Estimaciones orientativas para ~8k de contexto: pesos Q4 más caché KV. El uso real varía según runtime, longitud de contexto y offload MoE.
| Clase de modelo | Cuantización | VRAM aprox. | Hardware típico |
|---|---|---|---|
| Denso 7–8B | Q4_K_M | 5–6 GB | GPU 8 GB o Mac 8–16 GB |
| Denso 7–8B | Q8_0 | 9–10 GB | GPU 12–16 GB |
| Denso 13–14B | Q4_K_M | 9–11 GB | GPU 12–16 GB |
| Denso 27–32B | Q4_K_M | 16–20 GB | GPU 24 GB (p. ej. RTX 4090) |
| Denso 70–72B | Q4_K_M | 35–42 GB | Multi-GPU o Mac 48–64 GB+ |
| MoE (~8×7B activos) | Q4_K_M | 20–28 GB* | 24–32 GB+; expertos pueden offload |
FAQ de hardware para LLM
¿Cuánta VRAM necesito para un LLM de 7B?
La mayoría de modelos 7–8B en Q4 necesitan unos 5–6 GB de pesos más caché KV con contexto corto. Una GPU de 8 GB suele bastar; contextos largos o Q8 se acercan a 10 GB.
¿Puedo ejecutar un modelo de 70B en una sola GPU?
Normalmente no con pesos completos en una tarjeta de consumo. Los 70B en Q4 suelen pedir ~35–42 GB. Hacen falta multi-GPU, offload a RAM o un Mac con mucha memoria unificada.
¿Qué cuantización es mejor para un LLM local?
Q4_K_M es el estándar: buena relación calidad/tamaño. Use Q5/Q6 si le sobra VRAM; Q8 cuando priorice calidad y el modelo quepa.
¿Sirve la memoria unificada de Mac para inferencia LLM?
Sí. Apple Silicon puede ejecutar muchos modelos porque CPU y GPU comparten memoria. Un Mac de 32–64 GB suele alojar modelos medianos, limitados por el ancho de banda.
¿Un contexto más largo consume más VRAM?
Sí. La caché KV crece con la longitud de contexto y el batch. Un modelo que “cabe” a 4k tokens puede fallar a 32k: deje margen más allá de los pesos.