Cerrar
Arma tu PC

RTX 5080 vs RTX 5090 vs Dual GPU: Qué VRAM Necesitas para Cada Modelo de IA

"¿Cuánta VRAM necesito?" es probablemente la pregunta que más se repite en cualquier foro o comunidad de IA local, y la respuesta correcta casi siempre es "depende del modelo y de la cuantización que uses". Esta guía va directo a los números: cuánta VRAM real necesita cada tamaño de modelo, qué tan lejos llega una sola RTX 5080 de 16GB, cuándo de verdad vale la pena subir a 32GB, y en qué punto una sola tarjeta ya no es suficiente y necesitas Dual GPU.

Esto es lo que vamos a cubrir:

Por qué la VRAM (y no los TFLOPS) es el límite real
Cuánta VRAM necesita cada tamaño de modelo (7B a 70B+)
RTX 5080 16GB: hasta dónde llega en la práctica
RTX 5090 32GB: qué desbloquea el doble de VRAM
Dual GPU: cuándo sí lo necesitas (y sus límites reales)
Tabla resumen y recomendación por caso de uso

Por Qué la VRAM (No los TFLOPS) es el Límite Real

Cuando corres un modelo de lenguaje de forma local, el modelo completo (sus pesos) tiene que caber en la memoria de video antes de que la GPU pueda hacer un solo cálculo. Si no cabe, no corre. Punto. No importa qué tan rápida sea la tarjeta en TFLOPS si el modelo simplemente no entra en la VRAM disponible.

La regla rápida para estimar cuánta VRAM ocupa un modelo es multiplicar el número de parámetros por el tamaño de cada parámetro según la precisión:

  • FP16 / BF16 (precisión completa): ~2 bytes por parámetro.
  • Q8 (cuantización de 8 bits): ~1 byte por parámetro.
  • Q4_K_M (cuantización de 4 bits, la más usada en la práctica): ~0.5-0.6 bytes por parámetro.

A eso hay que sumarle el KV cache (la memoria que usa el modelo para "recordar" el contexto de la conversación mientras genera texto), que crece con el largo del contexto que uses, y un margen extra del sistema operativo y el framework (Ollama, llama.cpp, vLLM, LM Studio). En la práctica, siempre conviene dejar un colchón de 10-20% sobre el cálculo teórico.

Cuánta VRAM Necesita Cada Tamaño de Modelo

Con esa regla en mente, así se ve la VRAM aproximada que necesitas para correr (inferencia) modelos de distintos tamaños en cuantización Q4, que es el estándar de facto para uso local:

  • 7B-8B parámetros (Llama 3 8B, Mistral 7B): ~5-6GB en Q4. Corre cómodo hasta en una tarjeta de 8GB.
  • 13B-14B parámetros: ~8-10GB en Q4. Aquí ya conviene tener 12-16GB para no ir al límite.
  • 30B-34B parámetros: ~18-20GB en Q4. Ya no entra en una tarjeta de 16GB; necesitas 24GB o más.
  • 70B parámetros (Llama 3.1 70B): ~40-42GB en Q4. Aquí es donde una sola tarjeta de consumo, incluso una RTX 5090, se queda corta por sí sola.
  • 100B+ parámetros: terreno de Dual GPU o clusters, salvo que uses cuantizaciones muy agresivas (Q2/Q3) que sacrifican calidad de respuesta.

Si además de correr el modelo quieres hacer fine-tuning con LoRA o QLoRA (la forma más común de ajustar un modelo con tus propios datos sin reentrenarlo desde cero), suma otro 30-50% de VRAM sobre el cálculo de inferencia, porque el proceso de entrenamiento necesita espacio extra para gradientes y optimizadores, incluso usando las técnicas de bajo consumo de memoria de QLoRA.

RTX 5080 16GB: Hasta Dónde Llega en la Práctica

Con 16GB de VRAM, la RTX 5080 es el punto dulce para trabajar cómodamente con modelos de hasta 14B parámetros en Q4, con margen de contexto razonable (8K-16K tokens). Es perfecta para:

  • Inferencia diaria con Ollama, LM Studio o llama.cpp de modelos 7B-14B.
  • Fine-tuning ligero con QLoRA sobre modelos de hasta ~7B sin apretar demasiado la memoria.
  • Generación de imágenes con Stable Diffusion (SDXL y modelos derivados corren perfectamente en 16GB).

Donde empieza a quedarse corta: modelos de 30B+ en Q4, fine-tuning de modelos medianos-grandes, o contextos muy largos (32K+ tokens), donde el KV cache empieza a comerse la VRAM disponible incluso con el modelo ya cargado.

RTX 5090 32GB: Qué Desbloquea el Doble de VRAM

El salto de 16GB a 32GB no es solo "correr modelos más grandes": es la diferencia entre estar constantemente cerca del límite y tener margen real de trabajo. Con 32GB puedes:

  • Correr modelos de hasta 30B-34B en Q4 con margen de contexto cómodo.
  • Hacer fine-tuning con QLoRA de modelos de 13B-14B sin tener que reducir el batch size al mínimo.
  • Mantener contextos largos (32K+ tokens) sin que el KV cache desplace al modelo.
  • Correr dos modelos más pequeños al mismo tiempo (por ejemplo, un modelo de lenguaje y uno de embeddings) sin descargar uno para cargar el otro.

En nuestro catálogo, esta cantidad de VRAM (32GB) se logra actualmente con nuestra configuración Athena Dual 80z AI (dos RTX 5080 de 16GB cada una).

Dual GPU: Cuándo Sí lo Necesitas (y Sus Límites Reales)

Aquí es donde muchos se equivocan: tener dos tarjetas de video no siempre significa que un modelo pueda usar toda esa VRAM combinada como si fuera una sola tarjeta gigante. Depende del framework:

  • Frameworks con soporte de tensor parallelism o pipeline parallelism (vLLM, algunas configuraciones de Text Generation WebUI, DeepSpeed) sí pueden repartir un modelo entre varias GPUs y sumar la VRAM disponible de forma efectiva.
  • Herramientas más simples (Ollama, LM Studio en su modo básico) suelen tratar cada GPU por separado, o mueven capas del modelo entre tarjetas de forma más rudimentaria (menos eficiente, pero funcional).
  • Las GPUs de consumo (RTX serie 50) no tienen NVLink, así que la comunicación entre tarjetas pasa por PCIe, más lento que la memoria interna de una sola GPU. Para inferencia esto casi no se nota; para entrenamiento distribuido sí puede ser un cuello de botella si no configuras bien el paralelismo.

Dicho esto, Dual GPU es la opción correcta cuando:

  • Necesitas correr o entrenar modelos de 30B+ que no caben en una sola tarjeta, sin importar la eficiencia de la comunicación entre GPUs.
  • Quieres servir varios modelos simultáneamente para distintos casos de uso o distintos usuarios de tu equipo.
  • Estás entrenando desde cero o haciendo fine-tuning pesado y el tiempo de entrenamiento importa más que el costo de la configuración.

Nuestra configuración Athena Dual 90z AI (dos RTX 5090 de 32GB cada una, 64GB combinados) es la que armamos específicamente para este escenario: entrenamiento serio y modelos que ninguna tarjeta individual del mercado de consumo puede mover por sí sola.

Tabla Resumen: VRAM y Recomendación por Caso de Uso

VRAM disponibleModelos que corres cómodo (Q4)Configuración Spartan Geek
16GBHasta 14B, contexto 8K-16KAthena 60z AI / Athena 70z AI / Athena 80z AI
32GB (dual)Hasta 30B-34B, contexto 32K+Athena Dual 80z AI
64GB (dual)70B+ con cuantización moderada, entrenamiento serioAthena Dual 90z AI

Puedes ver especificaciones completas y precios de toda la línea en nuestra sección de Workstations para Inteligencia Artificial. Si tu caso de uso específico no encaja exactamente en esta tabla (context length inusualmente largo, un modelo particular que quieres correr, un pipeline de fine-tuning específico), contáctanos y lo dimensionamos juntos.

Comparte este artículo

¿Buscas una PC Personalizada?

Arma tu Computadora gamer o worksation con nosotros.

Armar PC Gamer Configurar PC