Apple divide la inferencia de IA: dispositivo contra nube
Apple separa la inteligencia artificial en dispositivo y en la nube en la WWDC 2026: 12 GB de RAM como puerta de acceso de borde, Private Cloud Compute…
La diapositiva más discutida de la WWDC 2026 fue una simple lista de dispositivos. Con la nueva Siri tenía poco que ver. Apple trazó una línea clara el 8 de junio: el modelo de lenguaje más potente solo funciona en dispositivos con 12 gigabytes de memoria de trabajo, todo lo intensivo en cálculos se traslada a su propia nube de servidores. Quien planea inferencia, mira mejor esta división que a la asistente en sí misma.
Lo más importante en resumen
- La RAM se convierte en una frontera dura: El modelo on-device más avanzado requiere 12 GB de memoria unificada. Solo el iPhone 17 Pro, 17 Pro Max y el iPhone Air cumplen con esto, el iPhone 17 regular con 8 GB se queda fuera.
- Private Cloud Compute soporta la carga máxima: Las tareas pesadas se ejecutan en el lado del servidor a través de los modelos de nube propios de Apple. Los desarrolladores alcanzan ambos niveles a través de una sola interfaz Swift.
- La arquitectura es la verdadera lección: Siri AI no se inicia inicialmente en la UE. El patrón detrás de esto sigue siendo el ejemplo más limpio de inferencia híbrida que actualmente se encuentra en el mercado.
Relacionado:La soberanía de la IA comienza en la infraestructura / FinOps ve todo, pero no puede hacer nada
Dos modelos, una interfaz
En la sala de Cupertino, se desarrolló el flujo habitual: nuevas animaciones, una Siri más conversacional, un puñado de trucos fotográficos. Más interesante fue la justificación que Apple proporcionó de inmediato. La nueva Siri y el Apple Intelligence revisado se basan en nuevos modelos de Apple Foundation. Estos modelos funcionan en dos lugares al mismo tiempo: localmente en el dispositivo y en los servidores de Apple a través de Private Cloud Compute.
Para los desarrolladores, la parte interesante es el soporte que hay encima. Ambos niveles, el modelo on-device y el modelo de servidor, están conectados a una sola interfaz Swift. Una aplicación habla con la misma interfaz y puede utilizar modelos locales y de servidor, sin tener que mantener dos integraciones separadas. La arquitectura, según Apple, fue desarrollada en conjunto con Google, y una parte de las respuestas de Siri en el lado del servidor se basa en Gemini de Google.
¿Qué es la inferencia de IA híbrida? La inferencia es el momento en que un modelo entrenado responde a una solicitud. Híbrido significa: una parte de las solicitudes se ejecuta localmente en el dispositivo terminal, el resto intensivo en cálculos se ejecuta en servidores. Un enrutador decide por solicitud qué camino es más barato, más rápido o conforme a la protección de datos.
Este número es el verdadero mensaje para cualquiera que planee inferencia en dispositivos terminales. Aquí limita la memoria de trabajo, mucho antes de que se agote la potencia de cálculo. Un gran modelo de lenguaje debe mantener sus pesos en la memoria de trabajo, de lo contrario, simplemente no funciona. Apple traza la línea en 12 GB y acepta que incluso el iPhone 17 propio con 8 GB se queda fuera. Para iPad, se aplica M4 o más nuevo con 12 GB, para Mac M3 o más nuevo con el mismo límite de memoria.
Quién paga la carga máxima
La división tiene una economía. La carga estándar, es decir, las pequeñas solicitudes constantes, debe ejecutarse localmente: gratis para Apple, rápido para el usuario y sin que los datos abandonen el dispositivo. La carga máxima es cara. Las nuevas herramientas de foto lo muestran claramente. El reencuadre espacial, que cambia la perspectiva de una imagen posteriormente, y la herramienta Extend, que rellena los bordes de la imagen, funcionan a través de Private Cloud Compute.
Ahí está la palanca. La inferencia en la nube de esta magnitud cuesta dinero real por solicitud, y Apple limita las funciones pesadas con límites de uso. Quien necesite más regularmente será remitido a un paquete de iCloud superior después de las impresiones de la keynote. Los niveles de entrada en Alemania son de 0,99 euros al mes por 50 GB y 2,99 euros por 200 GB. La nube limitada se convierte en una línea de ingresos.
Para la propia planificación, esta es la lección más honesta que cualquier punto de referencia de modelo. Una arquitectura híbrida es principalmente una decisión de costos. La división tiene poco que ver con la calidad del modelo. El nivel privado barato maneja la masa, el nivel caro se reserva para el pico y se raciona conscientemente. En una pila propia, se construye el mismo control de cantidad, solo sin la capa de iCloud como capa de cobro.
Qué pueden aprender los equipos DACH de la división
Una cosa por adelantado: Siri AI no llega a la UE por ahora. Apple se refiere al Digital Markets Act y proporciona la función solo en mercados de habla inglesa, con inicio como beta en otoño. Para un equipo alemán, la función terminada no es facturable por ahora. La interfaz de Foundation-Models local para desarrolladores está disponible de forma independiente, pero la parte del servidor a través de Private Cloud Compute depende de la disponibilidad y aprobación por mercado.
Se pueden transferir directamente tres puntos. Primero: el almacenamiento es la puerta de enlace del Edge. Quien quiera trasladar la inferencia a dispositivos o nodos de Edge, calcula primero la memoria RAM disponible por clase de dispositivo, porque la potencia de cálculo rara vez es el límite. Segundo: una capa como Private Cloud Compute es principalmente una arquitectura de privacidad. Permite modelos pesados sin que los datos crudos se encuentren permanentemente en una nube ajena, y eso es precisamente lo que suele ser el punto crítico en el entorno DACH. Tercero: la interfaz unificada sobre ambas capas oculta la complejidad. El verdadero arte está en el enrutamiento, que decide cuándo se calcula localmente y cuándo de forma remota, mientras que el modelo en sí es la parte más fácil.
Apple vende la división como comodidad. Para los equipos que deciden sobre On-Device frente a Cloud, es una plantilla con etiqueta de precio. El nivel caro se raciona, el barato soporta la carga, y todo el aparato depende de una interfaz que toma esta decisión. Esto se puede replicar mucho antes de que llegue la primera respuesta alemana de Siri.
Preguntas frecuentes
¿Qué distingue a la inferencia en dispositivo de la inferencia en la nube?
La inferencia en dispositivo ejecuta el modelo de forma local en el dispositivo final. Esto es rápido, no cuesta nada al proveedor por solicitud y mantiene los datos en el dispositivo. La inferencia en la nube se ejecuta en servidores, permite modelos mucho más grandes, pero genera costos continuos y envía datos fuera del dispositivo.
¿Por qué Apple solicita exactamente 12 GB de memoria RAM?
Un modelo de lenguaje potente debe mantener sus pesos completamente en la memoria RAM. Si la RAM no es suficiente, el modelo no se ejecuta o solo se ejecuta de manera muy limitada. 12 GB es el umbral a partir del cual Apple libera el modelo local más potente, por lo que el iPhone 17 con 8 GB queda excluido.
¿Qué es Private Cloud Compute en este contexto?
Private Cloud Compute es la capa de servidores de Apple para tareas de inteligencia artificial que son demasiado grandes para el dispositivo. Está diseñada como una arquitectura de privacidad: los datos se procesan para el cálculo, pero no se almacenan ni se evalúan de forma permanente. Soporta la carga máxima que no se puede manejar localmente.
¿Llegará la nueva Siri a la UE?
No, al menos inicialmente. Apple se refiere al Digital Markets Act y solo lanzará Siri AI en mercados de habla inglesa a partir del otoño. Una fecha para la UE es incierta. Sin embargo, la interfaz de desarrollador subyacente para los modelos de base no se ve afectada.
¿Qué se puede deducir para tu propio conjunto de herramientas?
Tres cosas: planificar la RAM como un límite estricto para la inferencia en el borde, prever una capa de nube privada como un componente de privacidad para modelos pesados y, sobre todo, construir el mecanismo de enrutamiento que decide entre local y remoto para cada solicitud. Este último es el verdadero factor decisivo para los costos y la privacidad.
Más del network de MBF Media
Fuente de la imagen: Pexels / Jakub Zerdzicki (px:32583519)

