lunes, 17 agosto 2026 · Sem. 34 DE · EN · FR · ES Oscuro
Centros de datosIA

Inferencia disgregada: Por qué AWS y Cerebras separan la GPU

La inferencia en la nube se está desglosando: AWS y Cerebras separan Prefill y Decode en chips independientes.

Por Alec Chizhik 13 junio 2026 5 min de lectura
Inferencia disgregada: Por qué AWS y Cerebras separan la GPU

AWS y Cerebras están descomponiendo la inferencia de IA. En lugar de una GPU que lo hace todo, un chip se encarga de la entrada y un segundo de la salida. El paso suena a detalle de hardware, pero desplaza la pregunta que todo equipo cloud se plantea ante cargas de IA crecientes: ¿qué capacidad de cómputo compro para qué, y dónde pago por reservas que nunca voy a usar?

Lo más importante en resumen

  • Trabajo dividido, hardware dividido: AWS y Cerebras separan la inferencia en dos fases. Los chips AWS Trainium se encargan del prefill, es decir, el procesamiento de la entrada; los sistemas Cerebras, del decode, la generación de la respuesta.
  • La velocidad es la promesa: Según los fabricantes, la arquitectura debería trabajar significativamente más rápido que la inferencia existente en Amazon Bedrock. Los datos proceden de benchmarks del fabricante y deben interpretarse en consecuencia.
  • Para los equipos cloud importa la lógica subyacente: Los chips especializados para distintas fases son una señal. Quien se tome en serio los costes de inferencia planificará en el futuro las cargas de trabajo por fase, no según una GPU de uso genérico.

Relacionado:Apple divide la inferencia de IA: dispositivo frente a nube  /  OpenTofu vs. Terraform: qué herramienta IaC aguanta

Lo que AWS y Cerebras han anunciado

¿Qué es la inferencia disagregada? La inferencia disagregada descompone la respuesta a una solicitud de IA en fases separadas y asigna cada una a un hardware propio optimizado para ella. En lugar de un único acelerador que gestiona todo el proceso, chips especializados asumen cada parte para la que están mejor adaptados.

En marzo de 2026, AWS y Cerebras anunciaron una colaboración que implementa exactamente este principio. Según la descripción de los fabricantes, los chips AWS Trainium se encargan del prefill -el procesamiento del mensaje de entrada- y el hardware de Cerebras del decode -la generación de la respuesta token a token-. Ambos se conectan mediante una conexión de red rápida. El conjunto se ofrecerá como una capa de inferencia adicional dentro de Amazon Bedrock, sin que los clientes necesiten nuevos tipos de instancia ni interfaces propias.

Sobre la velocidad, los fabricantes citan valores concretos. Según los benchmarks del fabricante publicados, el sistema Cerebras alcanza con un modelo abierto de gran tamaño un múltiplo de la tasa de tokens de las GPU actuales, y la arquitectura combinada debería ser varias veces más rápida que la inferencia actual de Bedrock. Estas cifras provienen del fabricante y deben verificarse con cargas propias antes de su uso en producción.

Por qué el prefill y el decode necesitan hardware diferente

Las dos fases de una solicitud plantean exigencias opuestas al hardware. Precisamente por eso tiene sentido separarlas.

El prefill procesa toda la entrada de una vez. Es intensivo en cómputo, pero requiere poco ancho de banda de memoria. El decode, en cambio, genera la respuesta palabra por palabra y para ello debe cargar el modelo desde la memoria en cada token individual. Esta fase es hambrienta de ancho de banda y utiliza una GPU clásica de forma muy distinta. Una sola pieza de hardware para ambas tareas implica siempre un compromiso: lo que es adecuado para el prefill suele quedar ocioso durante el decode.

Característica Prefill Decode
Tarea Procesar la entrada Generar la respuesta token por token
Cuello de botella Potencia de cómputo Ancho de banda de memoria
Perfil Breve, paralelizable Secuencial, intensivo en memoria
En el modelo AWS-Cerebras AWS Trainium Sistema Cerebras

Qué significa esto para la estrategia de GPU de los equipos cloud

La mayoría de empresas del espacio DACH no utilizarán esta arquitectura directamente. Aun así, el principio que la sustenta les afecta. Demuestra que una única GPU de propósito general para cualquier carga de IA se convierte cada vez más en un compromiso, al menos donde el rendimiento y los costes realmente importan.

En concreto, esto implica tres cosas. En primer lugar, vale la pena analizar las cargas de trabajo de inferencia por fase en lugar de reservar tiempo de cómputo de forma genérica. En segundo lugar, la cuestión de costes cambia de enfoque: quien reserva una GPU cara para una fase de decode intensiva en ancho de banda está pagando por potencia de cómputo que permanece ociosa. En tercer lugar, hay que vigilar la dependencia. Una etapa de inferencia vinculada en exclusiva a una plataforma cloud aporta velocidad, pero aumenta la dependencia de ese proveedor concreto.

Para los equipos que hoy operan modelos en entornos propios o a través de Kubernetes, esto apunta en una dirección clara. La planificación de scheduling y recursos se volverá más granular. Quien comprenda a tiempo qué fase de sus cargas de trabajo consume qué recurso podrá orientar las decisiones de compra a partir del uso real, no de suposiciones genéricas.

Preguntas frecuentes

¿Qué significa inferencia desagregada en términos sencillos?

La respuesta a una solicitud de IA se divide en fases que se ejecutan en hardware diferente. En el caso de AWS y Cerebras, un chip se encarga del procesamiento de la entrada y otro de la generación de la respuesta. Cada fase se ejecuta en el hardware que mejor se adapta a ella.

¿En qué se diferencian Prefill y Decode?

Prefill procesa la entrada y es principalmente intensivo en cómputo. Decode genera la respuesta token por token y requiere para ello un gran ancho de banda de memoria, ya que el modelo se carga desde la memoria en cada paso. Los perfiles opuestos son el motivo de la separación.

¿Son fiables los valores de velocidad mencionados?

Las cifras provienen de benchmarks de los fabricantes AWS y Cerebras. Indican la dirección, pero no sustituyen a pruebas propias. Quien valore esta arquitectura debería evaluarla con sus propios modelos y perfiles de carga antes de fiarse de esos valores.

¿Necesita mi equipo de cloud cambiar algo ahora mismo?

A corto plazo, no. La arquitectura se ofrecerá inicialmente de forma exclusiva a través de Amazon Bedrock. La respuesta más sensata es comprender las propias cargas de trabajo de inferencia por fases y cuellos de botella, para que las futuras decisiones de compra se basen en la utilización real.

¿Qué riesgos conlleva una capa de inferencia especializada?

Principalmente la dependencia del proveedor. Una capa de inferencia que solo funciona en una plataforma cloud aporta velocidad, pero vincula la carga a ese proveedor. Esta dependencia debe incluirse en cualquier análisis de viabilidad económica, junto con la ganancia pura en velocidad.

Imagen de portada: generada por IA (junio de 2026)

Fuente de la imagen: generada por IA (Juli 2026)

También disponible en

FrançaisEnglishDeutsch
MBF Media Newsletter

El briefing mensual para decisores

Una vez al mes, la newsletter de MBF Media reúne lo esencial de cloudmagazin, MyBusinessFuture, Digital Chiefs y SecurityToday, seleccionado por la redacción.

25 000 responsables de IT y negocio leen esta newsletter. Únase.

Suscríbase gratis
MBF Media Newsletter, aktuelle Ausgabe auf dem iPhone
Una revista de Evernine Media GmbH