Skip to main content
Volver al Anterior

Calculadora de VRAM y Ajuste de Hardware para LLM

Compruebe si su GPU o Mac puede ejecutar LLM locales: estimaciones de VRAM por tamaño de modelo, cuantización y longitud de contexto.

Comprueba tu hardware
Selecciona tu hardware, la cuantización y la longitud de contexto. Los resultados se actualizan al instante — todo se ejecuta localmente en tu navegador.
Memoria disponible
16.0 GB
Ancho de banda de memoria
288 GB/s
Modelo más grande @ 85% del pool
≈ 23B · Q4_K_M
Compatibilidad de modelos
25 de 30 modelos pueden ejecutarse en este hardware
ModeloMemoriaVeredictoVelocidad est. (tok/s)Pool usado
DeepSeek Coder V2 LiteMoETamaño medio · Programación
Se ejecuta en GPU
9.41 GBAjuste perfecto132
59%
Gemma 3 12BTamaño medio · General
Se ejecuta en GPU
7.25 GBAjuste perfecto26.4
45%
Mistral Nemo 12BTamaño medio · General
Se ejecuta en GPU
7.36 GBAjuste perfecto26.0
46%
Phi-4 14BTamaño medio · Razonamiento
Se ejecuta en GPU
8.33 GBAjuste perfecto22.6
52%
Qwen3 14BTamaño medio · General
Se ejecuta en GPU
8.76 GBAjuste perfecto21.4
55%
Mistral 7B v0.3Ligero · General
Se ejecuta en GPU
4.62 GBAjuste perfecto44.0
29%
Qwen2.5 7BLigero · General
Se ejecuta en GPU
4.84 GBAjuste perfecto41.7
30%
Qwen2.5 Coder 7BLigero · Programación
Se ejecuta en GPU
4.84 GBAjuste perfecto41.7
30%
DeepSeek-R1 Distill 7BLigero · Razonamiento
Se ejecuta en GPU
4.84 GBAjuste perfecto41.7
30%
Llama 3.1 8BLigero · General
Se ejecuta en GPU
5.06 GBAjuste perfecto39.6
32%
Ministral 8BLigero · General
Se ejecuta en GPU
5.06 GBAjuste perfecto39.6
32%
Qwen3 8BLigero · General
Se ejecuta en GPU
5.17 GBAjuste perfecto38.6
32%
GLM-4 9BLigero · General
Se ejecuta en GPU
5.61 GBAjuste perfecto35.2
35%
Gemma 2 9BLigero · General
Se ejecuta en GPU
5.72 GBAjuste perfecto34.4
36%
Qwen3 1.7BMini · General
Se ejecuta en GPU
1.54 GBAjuste perfecto186
10%
Llama 3.2 3BMini · General
Se ejecuta en GPU
2.40 GBAjuste perfecto99.0
15%
Phi-4-miniMini · General
Se ejecuta en GPU
2.73 GBAjuste perfecto83.4
17%
Gemma 3 4BMini · General
Se ejecuta en GPU
2.85 GBAjuste perfecto79.2
18%
Qwen3 4BMini · General
Se ejecuta en GPU
2.85 GBAjuste perfecto79.2
18%
Qwen3 30B A3BMoEPro · General
Descarga de expertos MoE
17.2 GBFunciona bien76.8
49%
Mixtral 8x7BMoEPro · General
Descarga de expertos MoE
25.8 GBFunciona bien19.6
73%
Qwen3 32BPro · General
Descarga parcial CPU+GPU
18.4 GBFunciona bien2.90
52%
DeepSeek-R1 Distill 32BPro · Razonamiento
Descarga parcial CPU+GPU
18.4 GBFunciona bien2.90
52%
Gemma 3 27BPro · General
Se ejecuta en GPU
15.3 GBAjuste justo11.7
96%
Mistral Small 3.1 24BTamaño medio · General
Se ejecuta en GPU
13.7 GBAjuste justo13.2
86%
Llama 3.3 70BGama alta · General
Se ejecuta en GPU
38.4 GBNo cabe—
240%
Qwen2.5 72BGama alta · General
Se ejecuta en GPU
39.5 GBNo cabe—
247%
Llama 4 ScoutMoEGama alta · General
Se ejecuta en GPU
58.5 GBNo cabe—
366%
Qwen3 235B A22BMoEGama alta · General
Se ejecuta en GPU
124 GBNo cabe—
775%
DeepSeek-R1MoEGama alta · Razonamiento
Se ejecuta en GPU
348 GBNo cabe—
2178%

Todas las cifras son estimaciones basadas en fórmulas, ancladas en el proyecto de código abierto llmfit. El rendimiento real varía según el runtime (Ollama, llama.cpp, LM Studio, MLX), la longitud del prompt y la calidad de los kernels. Para números medidos en tu máquina, ejecuta llmfit bench.

VRAM aproximada por tamaño de modelo

Estimaciones orientativas para ~8k de contexto: pesos Q4 más caché KV. El uso real varía según runtime, longitud de contexto y offload MoE.

Clase de modeloCuantizaciónVRAM aprox.Hardware típico
Denso 7–8BQ4_K_M5–6 GBGPU 8 GB o Mac 8–16 GB
Denso 7–8BQ8_09–10 GBGPU 12–16 GB
Denso 13–14BQ4_K_M9–11 GBGPU 12–16 GB
Denso 27–32BQ4_K_M16–20 GBGPU 24 GB (p. ej. RTX 4090)
Denso 70–72BQ4_K_M35–42 GBMulti-GPU o Mac 48–64 GB+
MoE (~8×7B activos)Q4_K_M20–28 GB*24–32 GB+; expertos pueden offload

FAQ de hardware para LLM

¿Cuánta VRAM necesito para un LLM de 7B?

La mayoría de modelos 7–8B en Q4 necesitan unos 5–6 GB de pesos más caché KV con contexto corto. Una GPU de 8 GB suele bastar; contextos largos o Q8 se acercan a 10 GB.

¿Puedo ejecutar un modelo de 70B en una sola GPU?

Normalmente no con pesos completos en una tarjeta de consumo. Los 70B en Q4 suelen pedir ~35–42 GB. Hacen falta multi-GPU, offload a RAM o un Mac con mucha memoria unificada.

¿Qué cuantización es mejor para un LLM local?

Q4_K_M es el estándar: buena relación calidad/tamaño. Use Q5/Q6 si le sobra VRAM; Q8 cuando priorice calidad y el modelo quepa.

¿Sirve la memoria unificada de Mac para inferencia LLM?

Sí. Apple Silicon puede ejecutar muchos modelos porque CPU y GPU comparten memoria. Un Mac de 32–64 GB suele alojar modelos medianos, limitados por el ancho de banda.

¿Un contexto más largo consume más VRAM?

Sí. La caché KV crece con la longitud de contexto y el batch. Un modelo que “cabe” a 4k tokens puede fallar a 32k: deje margen más allá de los pesos.