Guía GPU 2026: ¿Qué gráfica para IA local?
Guía de GPU 2026: RTX 5090 vs. 4090 vs. 3090 vs. AMD RX 7900 XTX. Requisitos de VRAM para modelos de IA locales en comparación.
10 Min. Tiempo de lectura
La inferencia de IA local se convertirá en el flujo de trabajo estándar en 2026. Completado de código, reconocimiento de voz, generación de imágenes, experimentos con LLM: todo funciona más rápido y con mayor conformidad de privacidad en el propio hardware. Pero, ¿qué tarjeta gráfica se necesita realmente? VRAM es el factor decisivo, no la pura potencia de cálculo. Una comparación de NVIDIA RTX 5090, RTX 4090, RTX 3090 usada y AMD RX 7900 XTX, con recomendaciones concretas para diferentes presupuestos y casos de uso.
Lo más importante en resumen
- VRAM es el cuello de botella para modelos de IA locales. Regla general: 2 GB de VRAM por cada mil millones de parámetros con precisión FP16. Un modelo de 70B necesita al menos 24 GB.
- La RTX 5090 con 32 GB GDDR7 es la única tarjeta de consumo que ejecuta modelos de 70B en cuantización Q4 completa localmente. Precio: a partir de alrededor de 1.742 euros.
- La RTX 4090 con 24 GB sigue siendo la mejor relación calidad-precio para un trabajo serio de IA local. Puede manejar modelos de 8B con 128 tokens por segundo.
- Una RTX 3090 usada con 24 GB de VRAM por menos de 800 euros ofrece la misma capacidad de modelo que la RTX 4090 a un tercio del precio.
- Las GPUs en la nube valen la pena para un uso esporádico. A partir de 4 horas de uso diario de la GPU, el hardware local es más barato que cualquier proveedor en la nube.
Por qué VRAM es más importante que TFLOPS
En los benchmarks de juegos, cuenta la potencia bruta de cálculo. En la inferencia de IA, cuenta primero la memoria. Un Large Language Model como Llama 3 70B necesita unos 40 GB de memoria en cuantización Q4. Si el modelo no cabe completamente en la VRAM, debe ser desplazado al RAM de la CPU. Esto ralentiza la inferencia por un factor de 10 a 20. En la práctica, esto significa: un modelo de 70B en una tarjeta de 24 GB funciona, pero con tanto desplazamiento que los tiempos de respuesta apenas son útiles.
El ancho de banda de la memoria determina qué tan rápido el modelo puede mover datos entre la memoria de la GPU y las unidades de cálculo. La RTX 5090 alcanza aquí 1,79 TB/s, un 78 por ciento más que la RTX 4090 con alrededor de 1 TB/s. Para modelos que caben completamente en la VRAM, esto se traduce directamente en una generación de tokens más rápida. La RTX 5090 logra 185 tokens por segundo en modelos de 8B, la RTX 4090 está en 128. En modelos de 70B en Q4, la RTX 5090 entrega entre 15 y 20 tokens por segundo, lo cual es suficiente para aplicaciones de chat interactivas.
NVIDIA RTX 5090: La referencia con 32 GB
La RTX 5090 se basa en la arquitectura Blackwell de NVIDIA, fabricada en el proceso TSMC 4NP. 21.760 núcleos CUDA, 680 Tensor Cores de quinta generación, 32 GB GDDR7 en un bus de 512 bits. El precio oficial es de alrededor de 1.742 euros, pero en la realidad, las tarjetas rara vez se encuentran por menos de 2.500 euros desde su lanzamiento en enero de 2025.
Para el trabajo local de IA, la RTX 5090 es la única tarjeta de consumo que ejecuta modelos de 70B en cuantización Q4 completa sin desplazamiento. Esto la convierte en el equipo de referencia para desarrolladores que experimentan regularmente con grandes modelos de lenguaje. Llama 3 70B funciona de manera fluida, Whisper Large transcribe audio en tiempo real y Stable Diffusion XL genera imágenes en menos de 5 segundos.
El inconveniente: 575 vatios de TDP. Esto requiere una fuente de alimentación adecuada (se recomienda al menos 1.000 vatios), una buena ventilación del chasis y mayores costos de electricidad. A lo largo de un año, el consumo de electricidad con cuatro horas de uso diario se suma a unos 200 a 250 euros. Esto relativiza la ventaja de costo frente a las GPUs en la nube, pero no la elimina.
RTX 4090: La mejor relación calidad-precio
La RTX 4090 con 24 GB GDDR6X sigue siendo la opción más razonable para trabajos serios de inteligencia artificial local a principios de 2026. La tarjeta logra 128 tokens por segundo en modelos de 8B y 52 tokens por segundo en Llama 3.1 70B en Q4. Desde el lanzamiento de la RTX 5090, los precios de las nuevas RTX 4090 han caído a entre 1.400 y 1.600 euros. Los ejemplares usados están disponibles a partir de 1.100 euros.
24 GB de VRAM son suficientes para la mayoría de los casos prácticos: los modelos de 8B y 13B funcionan sin problemas, los modelos de 30B en Q4 caben justo, y los de 70B requieren una cuantización agresiva en Q2 o descarga. Quien trabaje principalmente con modelos de hasta 30B, genere imágenes con Stable Diffusion XL o utilice Whisper para transcribir, no necesita los 32 GB de la RTX 5090. Los 24 GB de la RTX 4090 cubren esta necesidad completamente.
Consejo de presupuesto: RTX 3090 usada por menos de 800 euros
La RTX 3090 ofrece los mismos 24 GB de VRAM que la RTX 4090, pero con un rendimiento de cálculo significativamente menor. En el mercado de segunda mano, se encuentra por entre 600 y 800 euros. La tasa de tokens en modelos de 8B es de aproximadamente 112 tokens por segundo, y en 70B Q4, de alrededor de 35 tokens por segundo. Esto es más lento que la 4090, pero suficiente para muchos flujos de trabajo.
El caso empresarial está claro: por un tercio del precio, se obtiene la misma capacidad de modelo. Quien no necesite una velocidad de inferencia máxima, sino que utilice modelos de inteligencia artificial locales para procesamiento por lotes, transcripción füra de línea o experimentos ocasionales con LLM, se beneficiará más de una 3090 usada. El mayor consumo de energía (350W TDP frente a 450W en la 4090) es negligible con un uso esporádico.
Una nota sobre la durabilidad: las tarjetas de minería, que a menudo se ofrecen usadas, no están necesariamente desgastadas, contrariamente a la opinión generalizada. La minería somete las GPU a una carga constante y moderada con temperaturas estables. Esto es menos estresante que las sesiones de juego con cambios constantes de carga. Sin embargo, se recomienda una tarjeta con un historial comprobable y, idealmente, con garantía restante.
Alternativa AMD: RX 7900 XTX con 24 GB
La RX 7900 XTX de AMD ofrece 24 GB de VRAM por menos de 900 euros y es, por lo tanto, la tarjeta con mejor relación VRAM-euro en la oferta actual. El rendimiento de inferencia es de aproximadamente 78 tokens por segundo en Llama 3 8B. Esto es más lento que las tarjetas de NVIDIA, pero suficiente para muchos flujos de trabajo.
La restricción radica en el ecosistema de software. CUDA domina el panorama de la inteligencia artificial. La mayoría de los frameworks están optimizados para NVIDIA. ROCm, el equivalente de AMD a CUDA, ha hecho progresos significativos en los últimos meses, pero aún no está al mismo nivel de compatibilidad. PyTorch funciona estable en ROCm, pero herramientas especializadas como TensorRT y algunos frameworks de cuantización requieren soluciones alternativas o no funcionan. Quien trabaje principalmente con Ollama y llama.cpp encontrará un entorno usable en AMD. Quien dependa del ecosistema completo de NVIDIA debería quedarse con GeForce.
La próxima RX 9070 XT de AMD se basa en la nueva arquitectura RDNA-4 con un rendimiento de inteligencia artificial mejorado. Se espera que la tarjeta tenga 16 GB de VRAM, lo que la posiciona para modelos de hasta 13B. Como entrada de presupuesto en la inferencia de inteligencia artificial local, podría ser interesante, aunque su utilidad práctica dependerá de lo rápido que evolucione el ecosistema ROCm. Para los desarrolladores que deben comprar hoy, la RX 7900 XTX es la opción segura de AMD.
GPU en la nube frente a hardware local: la ecuación FinOps
Las GPU en la nube tienen un coste que varía entre 0,50 y 3,50 euros por hora, según el proveedor y el modelo. Una instancia con RTX 4090 en Lambda Labs cuesta aproximadamente 0,75 euros por hora, mientras que una A100 de 80 GB ronda los 2,00 euros. El hardware local implica un coste de adquisición inicial, pero no tiene tarifas recurrentes por alquiler.
El cálculo del punto de equilibrio es sencillo: una RTX 4090 por 1.500 euros se amortiza tras unos 500 días –casi 1,5 años– si se utiliza 4 horas diarias al precio de la nube (0,75 €/h). Si el uso es esporádico, inferior a una hora diaria, la nube resulta más rentable. Quien trabaje varias horas al día con modelos locales ahorra considerablemente con hardware propio. Además, hay una ventaja clave en privacidad: la inferencia local evita que los datos vayan a la nube, elimina dependencias de API y no genera costes adicionales al aumentar el uso.
Un factor a menudo subestimado es la disponibilidad. Las instancias de GPU en la nube no siempre están disponibles inmediatamente, especialmente con modelos populares como la A100 o la H100. Esperas de minutos a horas no son infrecuentes. El hardware local está siempre listo, sin tiempos de aprovisionamiento. Para equipos de desarrollo que experimentan de forma iterativa con distintos modelos y necesitan ciclos rápidos de retroalimentación, este aspecto es clave para la productividad.
El análisis del coste total de propiedad (TCO) a tres años: una RTX 4090 cuesta 1.500 euros de compra más unos 400 euros en electricidad con un uso diario de 4 horas. El equivalente en la nube, con el mismo uso, sería 0,75 € × 4 horas × 365 días × 3 años = 3.285 euros. La opción local ahorra alrededor de 1.400 euros en tres años. La RTX 5090, con un coste inicial más elevado, se amortiza tras unos dos años, pero luego genera ahorros aún mayores.
Recomendación según caso de uso
Para desarrolladores que usan Llama 3 8B o modelos comparables para autocompletado de código o chat, una tarjeta con 16 GB de VRAM es suficiente. La RTX 4070 Ti Super (16 GB), desde 650 euros, es aquí el punto óptimo. Whisper funciona en tiempo real localmente, Stable Diffusion genera imágenes en un tiempo aceptable y los LLM más pequeños responden con fluidez.
Quien trabaje habitualmente con modelos de 30B a 70B o mantenga configuraciones con múltiples modelos necesitará 24 GB de VRAM. Las opciones son la RTX 4090 (nueva o usada) o la AMD RX 7900 XTX. La 4090 es más rápida, la AMD más económica.
Para usuarios avanzados que quieran ejecutar modelos de 70B localmente sin compromisos de cuantización o que trabajen con varios modelos en paralelo, la RTX 5090 con 32 GB es la única opción disponible para consumidores. Quien necesite más VRAM deberá recurrir a tarjetas profesionales como la NVIDIA A6000 (48 GB) o a Macs con Apple Silicon y memoria unificada. Un MacBook Pro M5 Max con 128 GB de memoria unificada podría cargar teóricamente modelos de hasta 405B, aunque con una velocidad de inferencia claramente inferior a la de una GPU dedicada.
Un consejo práctico para equipos: no todos los desarrolladores necesitan una GPU de gama alta. Una configuración de equipo con una o dos RTX 4090/5090 como servidores compartidos de inferencia (mediante Ollama o vLLM en red) y estaciones de trabajo estándar para el trabajo diario suele ser más eficiente económicamente que equipar cada puesto con una tarjeta de gama alta. Esto ahorra presupuesto, centraliza la gestión de las GPU y simplifica las actualizaciones. Los modelos se actualizan una vez en el servidor central, en lugar de en cada estación individual.
Preguntas frecuentes
¿Puedo ejecutar un modelo 70B en una tarjeta de 24 GB?
Sí, pero con limitaciones. Con cuantización Q4, Llama 3 70B necesita unos 40 GB. En una tarjeta de 24 GB, parte del modelo se desplaza al RAM de la CPU (Offloading), lo que reduce la velocidad de inferencia a 5-10 tokens por segundo. Esto es límite para uso interactivo, pero aceptable para procesamiento por lotes.
¿Vale la pena una GPU de minería usada para inferencia de IA?
En principio, sí. El mining mantiene las GPUs a una carga constante y moderada, lo cual es menos exigente que el gaming con cambios constantes de carga. Una RTX 3090 usada de mining ofrece 24 GB de VRAM por 600 a 800 Euros. Asegúrate de comprobar su origen, garantía restante y realizar un test de estrés antes de comprar.
¿Son suficientes 8 GB de VRAM para modelos locales de IA?
Para modelos pequeños de hasta 7B parámetros en cuantización Q4, sí. Llama 3 8B funciona con cuantización agresiva en 8 GB. Whisper Small también. Para trabajos serios con modelos más grandes, generación de imágenes o configuraciones multi-modelo, 8 GB no son suficientes. 16 GB deberían ser el mínimo.
¿Es un Mac con Apple Silicon una alternativa a una GPU dedicada?
Para inferencia, sí, con limitaciones. Apple Silicon usa Unified Memory, compartida entre CPU y GPU. Un M5 Max con 128 GB puede cargar modelos muy grandes teóricamente. Sin embargo, la velocidad de inferencia es notablemente inferior a una GPU NVIDIA dedicada debido a la menor banda ancha de memoria. Es una solución práctica para uso ocasional de LLM, pero no un sustituto para flujos de trabajo profesionales de IA.
Lecturas recomendadas
MacBook Pro M5 en prueba: Chip ARM contra Windows on ARM
La IA serverless está sobrevalorada: aquí está lo que realmente importa
CES 2026: Las novedades tecnológicas más emocionantes para profesionales de IT
Más del MBF Media Netzwerk
Data Act: Lo que los fabricantes de IoT en la mediana empresa deben saber (MyBusinessFuture)
Fuente de la imagen de portada: Pexels / Elias Gamez (px:10558582)

