¿Cuánta VRAM necesito para ejecutar este modelo?
Calcula el peso del modelo cuantizado, la caché KV según su contexto y el margen de trabajo, y te dice qué GPUs lo mueven.
Tu caso
Están en el config.json del modelo: num_hidden_layers y num_key_value_heads. Se asume head_dim 128.
Con varias GPUs el modelo se reparte por capas: suma la VRAM, pero no la velocidad.
Resultado
VRAM necesaria
—
En qué se va
Qué GPU te vale
| GPU | VRAM | Veredicto |
|---|
Slot de afiliación. Aquí va el enlace a Amazon / PcComponentes filtrado por las GPUs que han salido ✅, con tu tag. Es el punto de conversión: el usuario ya sabe qué necesita.
Slot de lead B2B. Formulario corto (email + presupuesto + uso) prerrellenado con el resultado del cálculo.
Cálculo orientativo para inferencia con llama.cpp/Ollama. La cifra real varía según runtime, flash attention y versión del driver.