AWS y Nvidia: la apuesta por millones de GPUs obliga a…
AWS, Microsoft y Google implementan GPUs Vera Rubin y Blackwell. Lo que los equipos de plataforma presupuestan ahora y qué estrategia de inferencia está…
AWS y Nvidia anunciaron el 21 de mayo una ampliación de su colaboración: Más de un millón de GPUs Blackwell y Rubin estarán disponibles a partir de 2026 en las regiones de AWS. Microsoft está construyendo en paralele racks Vera-Rubin-NVL72 para la próxima generación Fairwater. Esto cambia lo que los equipos de plataforma deben presupuestar en los próximos doce meses.
Lo más importante en resumen
- Un millón de GPUs es disponibilidad, no un chollo: Más infraestructura de hardware reduce los cuellos de botella de Spot y la lotería regional, pero los precios bajo demanda para Blackwell y Rubin en 2026 seguirán en el segmento premium. Quien planifique sin estrategias de Reserved o Capacity Block pagará más por esta ola.
- Vera Rubin NVL72 acerca más la hardware Multi-Cloud: Microsoft para Fairwater, AWS para sus propias regiones, Google Cloud y OCI según Nvidia también. Lambda, Crusoe, CoreWeave y Nebius se unirán desde el primer trimestre. Las arquitecturas Multi-Cloud pueden por primera vez orientarse a una generación de hardware uniforme en lugar de a tres.
- Inferencia, no entrenamiento, sigue siendo el bloque costoso: La FinOps Foundation localiza entre el 80 y el 90 por ciento de los gastos de IA en la Inferencia. Las nuevas tarjetas desplazan el indicador de rendimiento, no el problema de costes. Esto radica en la utilización, el enrutamiento y la elección del modelo.
RelacionadoFinOps para Inferencia de IA / Platform Engineering se convierte en ruta de producción
Lo que AWS y Nvidia se han comprometido específicamente
En el centro del anuncio del 21 de mayo hay tres puntos. En primer lugar: AWS quiere traer hasta 2026 más de un millón de GPUs Nvidia de las generaciones Blackwell y Rubin a sus propias regiones. Esto no es un pedido puro por adelantado, sino una garantía de disponibilidad para los clientes más grandes de AWS, que hasta ahora han empujado regularmente sus cargas de trabajo de inferencia contra el muro de los límites de capacidad.
En segundo lugar: Amazon EC2 recibe como primera gran nube la Nvidia RTX PRO 4500 Blackwell Server Edition. Esta es la variante de inferencia por debajo de la clase H100/H200 y la futura GB200. Menor rendimiento absoluto, pero una relación significativamente mejor entre throughput y precio por token. Exactamente la tarjeta que a menudo se convierte en un cuello de botella para la inferencia de producción con modelos grandes hoy en día.
En tercer lugar: Vera Rubin NVL72 está confirmado como sistema a escala de rack. Microsoft se ha comprometido con la integración en los próximos sitios Fairwater, AWS, Google Cloud y Oracle Cloud están listados como primeros socios de nube. Además vienen los proveedores especializados de nube de IA: CoreWeave, Lambda, Nebius y Nscale. Ya no atacan a los Hyperscalers solo a través de precios Spot, sino a través de paridad de hardware en la misma ola.
Vera Rubin cambia la lógica de hardware Multi-Cloud
Hasta ahora, Multi-Cloud para cargas de trabajo de IA era un compromiso entre tres generaciones de hardware muy diferentes. AWS Trainium e Inferentia en un mundo, Google TPUs en otro, Microsoft con mezcla de Nvidia y sus propios aceleradores Maia. Quien distribuía modelos en varias nubes, operaba en paralelo tres pistas de ajuste, una para cada cadena de herramientas de compilación y cuantificación.
Con la ola Vera-Rubin, esto se vuelve más sencillo para parte de las cargas de trabajo. Tres de las cuatro grandes nubes públicas despliegan la misma generación de Nvidia. Misma versión CUDA, mismas pipelines de TensorRT-LLM, misma topología NCCL a nivel de rack NVL72. Los equipos de plataforma que trabajan en pipelines de inferencia multi-nube desde hace dos años obtienen por primera vez una capa de hardware consistente.
Esto no significa que Multi-Cloud de IA se vuelva de repente trivial. La latencia entre regiones, la soberanía de datos y los costos de Egress siguen siendo los mismos dolores. Pero el argumento de que no se puede migrar de todos modos porque los perfiles de hardware son demasiado diferentes pierde sustancia.
Lo que la ola de hardware promete en cifras y lo que no
La Fundación FinOps ha incluido en su informe State-of-FinOps-2026 lo que los profesionales saben desde hace meses: el 73% de las organizaciones encuestadas reportan costos de IA que superan el presupuesto, el presupuesto promedio de IA empresarial ha crecido de 1,2 millones de dólares en 2024 a unos 7 millones en 2026. El 98% de los equipos de FinOps gestionan activamente el gasto en IA, hace dos años eran el 31%.
La nueva ola de hardware aborda parte de esto. Según Google, Trillium ofrece hasta 1,4 veces más rendimiento de inferencia por dólar en comparación con la generación anterior. Rubin y Blackwell Ultra están en la misma liga. Pero: estas ganancias de eficiencia se disipan si la utilización de GPU en producción sigue estando entre el 15 y el 30%, un valor que la Fundación considera típico. Las tarjetas más rápidas en estado medio lleno son más caras, no más baratas.
El segundo punto ciego son los tiempos de entrega. Un millón de GPUs distribuidas a lo largo del año suena como un exceso, pero con las actuales tasas de crecimiento en cargas de trabajo de inferencia, ya es escaso sin nuevos casos de uso generativos importantes.
Tres consecuencias antes del próximo commit de inferencia
- Recalcular Capacity Blocks y Reserved Instances. Quien planee el salto a Blackwell o Rubin, no debería cubrir los próximos doce meses mediante On-Demand. La disponibilidad de Spot mejorará a corto plazo, pero la tarifa On-Demand seguirá siendo el formato más caro. AWS Capacity Blocks y Nvidia DGX Cloud Lepton son los dos caminos que se están imponiendo en clientes prácticos.
- Construir enrutamiento de inferencia entre nubes, no solo planificarlo. Con una generación de hardware consistente, vale la pena invertir en un router que decida entre AWS, Google y Microsoft según latencia, precio y utilización. Herramientas como LiteLLM, vLLM Production Stack o Bedrock Cross-Region Inference han madurado en los últimos meses para este propósito.
- Tomar en serio la selección de modelos como palanca de FinOps. La Fundación sigue enumerando el tamaño del modelo y la cuantización como las principales palancas de coste, por delante de la generación de hardware. Un modelo 70B bien cuantizado en RTX PRO 4500 puede ser más barato por token que un modelo 70B no optimizado en H100. La ola de hardware hace que esta decisión sea más importante, no indiferente.
Preguntas frecuentes
¿Significa un millón de GPUs que las escaseces desaparecerán en 2026?
No automáticamente. El número se refiere a toda la flota de hiperescala de AWS distribuida a lo largo del año. Qué región recibe qué generación cuándo no es público. Quien planifique cargas de trabajo críticas debería asegurar esto a través de Capacity Blocks o contratos reservados, de lo contrario seguirá en modo de lotería.
¿Vale la pena cambiar de H100 a Blackwell para inferencia ya hoy?
Para inferencia pura con modelos grandes, normalmente sí, para modelos medianos no necesariamente. El salto en tokens por segundo es significativo en contextos muy grandes, pero en cargas de trabajo más pequeñas a menudo no es un argumento. Un benchmark con la aplicación concreta debe preceder a cada migración, la generalización de «nuevo es mejor» se aplica aquí con menos frecuencia de lo que las diapositivas sugieren.
¿Qué significa esta ola para los proyectos de soberanía DACH?
Los proveedores europeos, OVHcloud, IONOS, Open Telekom Cloud, plusserver, recibirán la hardware Vera-Rubin más tarde y en menor volumen que los grandes hipescaladores. Quien deba mantener cargas de trabajo de inferencia por razones regulatorias en entornos soberanos de la UE, debería analizar las hojas de ruta con antelación y planificar estrategias híbridas en las que el entrenamiento en soberanía de la UE y la inferencia en nube pública estén claramente separados.
¿Qué papel juegan las neoclouds como Lambda, CoreWeave y Crusoe?
Son la carta comodín. Con la misma generación de hardware, un nivel de precios significativamente más agresivo y menos estructura de vinculaciones, son en 2026 un candidato serio para cargas de trabajo de inferencia pura sin argumentos de soberanía de datos. En la práctica, vemos configuraciones de proveedores múltiples, en las que un hipescalador asume la parte regulatormente delicada y una neocloud el estallido de escalabilidad.
¿Qué pasa con los aceleradores propios: Trainium, TPU, Maia?
No desaparecerán. AWS Trainium 2 y Google TPU v7 permanecerán en el portfolio, especialmente para el entrenamiento cuestan por token sosteniblemente menos que los equivalentes de Nvidia. Pero en el mainstream de inferencia, Nvidia estará presente en todas las nubes con la generación Vera-Rubin. Una determinación prematura sobre un único acelerador en 2026 es un mayor riesgo que la complejidad multi-proveedor.
Más del MBF Media Netzwerk
- Digital ChiefsCriptografía post-cuántica: La cuenta atrás para la TI corporativa corre
- MyBusinessFutureGartner: 2,52 billones de dólares estadounidenses en gastos de IA hasta 2026
- SecurityTodayIdentidades de máquina: las cuentas que nadie cuenta
También disponible en

