Scheele, responsable de Kubermatic: operar modelos de IA como software
Cambiar de modelo puede alterar los procesos de IA. Los equipos de plataformas necesitan responsabilidades claras para las actualizaciones.
En algunas empresas, los equipos de IA financian su propia plataforma, mientras que la experiencia para operarla de forma continuada está en otros equipos. Por eso, Sebastian Scheele, responsable de Kubermatic, aboga por incorporar a los equipos de plataformas existentes a la operación de los modelos.
Lo más importante en resumen
- Los modelos tienen un ciclo de vida. Sebastian Scheele pide una gestión ordenada de las versiones y la sustitución controlada de las antiguas.
- La operación de los modelos necesita responsabilidades claras. Los equipos de plataformas existentes pueden aportar su experiencia con contenedores a la infraestructura de IA.
- La utilización relativa depende del flujo de trabajo. Las tareas por lotes que se pueden aplazar permiten aprovechar la capacidad libre por la noche. La utilidad del resultado sigue siendo decisiva.
Relacionado:MLOps en la nube: llevar modelos de aprendizaje automático a producción de forma fiable / Pequeños modelos consumen grandes presupuestos de GPU mediante preallocación

El trabajo de operación empieza con el primer modelo
Sebastian Scheele considera la IA local una opción realista para las empresas. Los modelos son cada vez más capaces y menos costosos de operar, afirma el CEO y cofundador de Kubermatic en una conversación durante los ContainerDays de Hamburgo. Su exigencia principal es: «Tengo que operar esto como software». Así centra la atención en el trabajo posterior a la instalación.
En el proceso que describe, un equipo compra hardware potente, instala un modelo grande y desarrolla procesos que lo utilizan. Cuando aparece una nueva versión, esas aplicaciones deben seguir funcionando. Por tanto, un cambio de modelo también afecta a los equipos que utilizan sus respuestas en sus procesos. El operador necesita conocer esas dependencias.
«Necesito realmente una gestión de las versiones y de los despliegues de estos modelos». Para Scheele, esto incluye operar varios modelos en paralelo, desplegar nuevas versiones y retirar las antiguas. Como ejemplo, menciona un breve periodo de transición para un equipo que todavía utiliza una versión anterior. La duración necesaria depende de las aplicaciones afectadas.
// Definición
¿Qué es la gestión de versiones de los modelos de IA? Es la operación organizada de los modelos después de su instalación. Incluye operar varios modelos en paralelo, desplegar nuevas versiones y retirar las antiguas con un periodo de transición para los equipos que todavía las utilizan.
El presupuesto de IA no sustituye la experiencia operativa
Según las observaciones de Scheele, los equipos de IA o de desarrollo han recibido a menudo el presupuesto para una plataforma. Sin embargo, la experiencia para operarla de forma continuada suele estar en otro lugar. De ahí pueden surgir entornos adicionales cuyo mantenimiento debe organizarse por separado de la infraestructura existente.
Scheele aboga por incorporar a los equipos de plataformas existentes. Ya operan contenedores y pueden estudiar cómo integrar las cargas de trabajo de IA en su entorno. Los equipos de negocio y de desarrollo utilizarían entonces los modelos disponibles, mientras que los equipos responsables de la operación gestionarían la infraestructura. «Sigue siendo simplemente software que hay que operar».
Este reparto de tareas también hace visible el mantenimiento de los demás componentes. Scheele describe el ritmo acelerado de los cambios de software en la IA: algunas versiones antiguas dejan de recibir desarrollo o parches después de unos pocos meses. Para la operación, importa saber qué componentes se utilizan realmente y durante cuánto tiempo reciben mantenimiento.
Las ejecuciones nocturnas pueden aprovechar la capacidad GPU libre
Al hablar de utilización relativa, Scheele relaciona la infraestructura con los procesos de negocio. Mientras los desarrolladores utilizan sus entornos durante el día, aumenta la carga. Es posible que las tareas adicionales sin necesidad de un resultado inmediato se puedan desplazar a otro horario. Cita el procesamiento por lotes, es decir, ejecuciones agrupadas sin interacción continua con los usuarios, como ejemplo de trabajo nocturno.
La decisión exige que el operador conozca las necesidades de los equipos. Algunos resultados se necesitan a diario; otros, semanal o mensualmente. Un análisis que solo tiene que estar listo a la mañana siguiente tiene requisitos temporales distintos a los de una solicitud interactiva. Esta distinción ayuda a utilizar el hardware disponible de forma más uniforme.
El argumento de Scheele se refiere a la planificación: el hardware costoso genera costes incluso cuando no está en funcionamiento. Que una ejecución nocturna adicional tenga sentido económico depende también de lo que produzca.
La utilidad debe justificar la operación del modelo
Por eso, Scheele pide comparar el consumo de tokens con el valor del resultado. Generar muchas respuestas no puede considerarse un éxito, del mismo modo que tampoco puede serlo mantener una GPU ocupada de forma permanente. La cuestión es si una ejecución produce el resultado deseado o si ayudaría formular la tarea de otra manera.
Para los equipos de plataformas, esto supone un conjunto conectado de responsabilidades operativas: deben saber qué equipos utilizan un modelo, cuándo su trabajo necesita potencia de cálculo y cómo mantener la posibilidad de cambiar de versión. Una oferta gestionada de forma centralizada puede reunir esas decisiones. El ahorro de capacidad tiene que demostrarse en cada entorno operativo.
Preguntas frecuentes
¿Qué significa la operación posterior a la instalación?
Los modelos y su entorno de software necesitan actualizaciones organizadas, responsabilidades claras y una transición controlada desde las versiones antiguas. Scheele describe este trabajo como operación Day-2.
¿Qué tareas de IA son adecuadas para las ejecuciones nocturnas?
Tareas por lotes que se puedan aplazar y dispongan de tiempo suficiente hasta que se necesite el resultado. No pueden sustituir las solicitudes interactivas.
¿Qué indica el número de tokens sobre la utilidad?
Describe el volumen de texto que procesa un modelo. Que una ejecución en el hardware tenga sentido económico depende también de que su resultado cumpla la tarea requerida.
Tobias Massow realizó la entrevista el 3 de septiembre de 2026 en el stand de Kubermatic durante los ContainerDays de Hamburgo.
Selección editorial
cloudmagazinClaude Code ya ejecuta también Qwen de AlibabacloudmagazinDescargable no significa operablecloudmagazinAWS deja que un agente de IA busque junto al equipo en las incidenciasMás de la red MBF Media
MyBusinessFutureCuándo realmente merece la pena un modelo de IA alemánDigital ChiefsCuatro piedras de tropiezo: Por qué los proyectos de IA no alcanzan la operación regularSecurityTodayNvidia frenará agentes de IA con hardwareFuente de la imagen: generada por IA (septiembre de 2026), retrato: Kubermatic
Traducido del original en alemán con inteligencia artificial. La versión alemana es la de referencia.

