Inferencia con IA en la nube: ¿cómo los costes de GPU…
&8211; Una NVIDIA H100 cuesta 3,90 dólares estadounidenses por hora en AWS. En Azure, 6,98 dólares estadounidenses. En proveedores especializados, desde 1,49 dólares estadounidenses. Para un modelo de IA de tamaño medio …
Una NVIDIA H100 cuesta 3,90 dólares estadounidenses por hora en AWS. En Azure, 6,98 dólares estadounidenses. En proveedores especializados, desde 1,49 dólares estadounidenses. Para un modelo de IA de tamaño medio con 10 peticiones de inferencia por segundo, esto se acumula en 2.800 a 5.000 euros mensuales por GPU. Con diez GPUs, son 28.000 a 50.000 euros. Cada mes. La inferencia con IA es el nuevo impulsor de costes en la nube, y la mayoría de los equipos de TI no tienen ni idea de cómo controlarlo.
En resumen
- AWS H100 a 3,90 dólares estadounidenses por hora tras una reducción de precios del 44 % en junio de 2025. Azure se mantiene en 6,98 dólares estadounidenses. Proveedores especializados desde 1,49 dólares estadounidenses (Lambda Labs, RunPod, Vast.ai).
- Ahorro de costes del 40 al 85 % mediante proveedores «Neo-Cloud» frente a los hyperscalers, con disponibilidad de GPU comparable (GMI Cloud, Coreweave, Together AI).
- Precios spot: descuento del 60 al 90 %, pero con un plazo de cancelación de 2 minutos. Adecuado para inferencia por lotes y entrenamiento, no para cargas de trabajo productivas sensibles a la latencia.
- La inferencia domina la demanda de GPU: mientras que el entrenamiento es único, la inferencia se ejecuta de forma permanente. Al aumentar su uso, los costes de inferencia crecen linealmente; los del entrenamiento, no.
- Inferencia serverless como alternativa: AWS SageMaker, Google Vertex AI y los puntos finales de inferencia de Hugging Face ofrecen modelos de pago por petición que resultan más económicos que las GPU dedicadas cuando las cargas de trabajo son variables.
Por qué los costes de las GPU hacen explotar la factura de la nube
La mayoría de los presupuestos en la nube se planificaron para cargas de trabajo basadas en CPU. Una instancia EC2 estándar cuesta entre 0,10 y 2 dólares estadounidenses por hora. Una instancia con GPU equipada con NVIDIA H100 cuesta entre 2,80 y 5,00 euros por hora. Para un modelo de IA de tamaño medio con 10 peticiones de inferencia por segundo, esto se acumula en 2.800 a 5.000 euros mensuales por GPU. Con diez GPUs, son 28.000 a 50.000 euros. Cada mes. La inferencia con IA es el nuevo impulsor de costes en la nube, y la mayoría de los equipos de TI no tienen ni idea de cómo controlarlo.
Perspectiva DACH: protección de datos y soberanía de las GPU
Para las empresas de la región DACH (Alemania, Austria y Suiza) se añade un factor adicional: ¿dónde están físicamente las GPU? Las cargas de trabajo de inferencia sujetas al Reglamento General de Protección de Datos (RGPD) (consultas de clientes, aplicaciones de RR.HH., datos médicos) exigen una infraestructura de GPU ubicada en la UE. AWS ofrece instancias H100 en Fráncfort (eu-central-1). Google Cloud, en regiones de la UE. Azure, en Europa Occidental.
En los proveedores «Neo-Cloud», la disponibilidad en la UE es limitada. Lambda Labs opera centros de datos en Estados Unidos y Reino Unido. Vast.ai es un mercado con ubicaciones variables. Para cargas de trabajo críticas desde el punto de vista de la privacidad, a menudo solo queda la opción entre un hyperscaler con región en la UE o un proveedor europeo como OVHcloud, Hetzner (ampliación de capacidades GPU en 2026) o proveedores especializados conformes con NIS2.
La trampa de la soberanía de costes: las GPU basadas en la UE son un 10 al 30 % más caras que las basadas en Estados Unidos. Para las empresas que deben optimizar tanto los costes como la protección de datos, un modelo híbrido es la solución más pragmática: cargas de trabajo sin datos personales en GPU estadounidenses económicas, y datos personales en infraestructura de la UE.
Conclusión
Los costes de las GPU son el punto ciego en la mayoría de los presupuestos de la nube. Quien opere modelos de IA en producción debe tratar los costes de inferencia como una línea presupuestaria independiente, no como parte de la factura general de la nube. La buena noticia es que el mercado nunca ha sido tan competitivo. Los precios de la H100 cayeron en 2025 hasta un 44 %, los proveedores «Neo-Cloud» ofrecen alternativas y los modelos de inferencia serverless reducen la barrera de entrada. Cinco palancas marcan la diferencia: compresión de modelos, instancias spot, serverless para cargas variables, estrategia multi-proveedor y instancias reservadas. La cuestión no es si los costes de las GPU aumentarán, sino si el equipo los controlará o será arrasado por ellos.
Preguntas frecuentes
¿Cuánto cuesta una NVIDIA H100 por hora?
Entre 1,49 dólares estadounidenses (Vast.ai spot) y 6,98 dólares estadounidenses (Azure a petición). AWS se sitúa en unos 3,90 dólares estadounidenses tras la reducción de precios de junio de 2025. Proveedores especializados como Lambda Labs o GMI Cloud ofrecen precios a petición entre 2,10 y 2,99 dólares estadounidenses por hora.
¿Cuándo merece la pena la inferencia serverless?
Cuando la utilización de la GPU esté por debajo del 30 al 50 %. En cargas variables (chatbot con picos diurnos, inactividad nocturna), serverless es más económico que una instancia GPU en funcionamiento continuo. En cargas constantes y altas, las GPUs dedicadas son más rentables.
¿Son lo suficientemente fiables los proveedores «Neo-Cloud» para producción?
Sí, para entrenamiento e inferencia por lotes. Para inferencia productiva sensible a la latencia, depende del proveedor. Coreweave y Lambda Labs ofrecen acuerdos de nivel de servicio (SLA) empresariales. Vast.ai y RunPod son más adecuados para cargas de trabajo flexibles. Regla general: cuanto más crítica sea la carga de trabajo, mayor será el requisito en cuanto a SLA y garantías de ubicación.
¿Cuánto ahorra la compresión de modelos?
La cuantización de FP32 a INT8 reduce la necesidad de memoria GPU hasta un 75 %. Un modelo de 7 mil millones de parámetros que funciona en una H100 cabe, tras cuantización INT8, en una A10G (aproximadamente 1,00-1,50 dólares estadounidenses por hora frente a 3,90). La precisión disminuye mínimamente, imperceptible para la mayoría de los casos de uso productivos.
¿Dónde hay GPUs H100 en la UE?
AWS Fráncfort (eu-central-1), regiones de la UE de Google Cloud y Azure Europa Occidental ofrecen instancias H100 en la UE. OVHcloud y Hetzner están ampliando sus capacidades GPU en Europa. La mayoría de los proveedores «Neo-Cloud» tienen sus centros de datos en Estados Unidos. Para cargas de trabajo críticas bajo el RGPD, la disponibilidad en la UE es el factor de filtrado más importante en la elección del proveedor.
Seguir leyendo
FinOps: cómo las empresas finalmente logran controlar sus costes en la nube
Sovereignty-Washing: por qué los centros de datos de la UE no garantizan la soberanía de los datos
Más contenido de la red MBF Media
Digital Chiefs: Digitalisierung Mittelstand 2026
MyBusinessFuture: KI im Mittelstand
SecurityToday: Cloud Security como artículo de exportación alemán
Fuente de imagen: Pexels / Markus Winkler (px:4604607)

