Soofi S: soberanía no significa victoria
Soofi S lidera en benchmarks alemanes y mantiene alto rendimiento en contextos largos. Qwen3.5 supera en razonamiento. Análisis técnico de desempeño.
Soofi S 30B-A3B alcanza los valores más altos en los benchmarks alemanes entre los modelos europeos actuales. La arquitectura híbrida MoE-Mamba mantiene, con un contexto de 40K, un mayor rendimiento de decodificación que los modelos Attention puros de la misma categoría de tamaño. Para un equipo de infraestructura, la decisión de adopción se reduce a una pregunta directa: ¿Compensan estas características el estado beta y la ausencia de procesos operativos?
Lo más importante en resumen
- Fuerte en alemán, débil a nivel internacional. Según los datos del proyecto, Soofi lidera en el agregado alemán (79,1) y en código alemán, pero pierde claramente contra Qwen3.5 en inglés y en razonamiento.
- La arquitectura es la palanca. El componente Mamba mantiene alto el throughput de decodificación con contexto largo, donde los modelos de atención completa fallan con el KV-Cache.
- Beta sin SLA. No existe soporte comercial. Los parches, el monitoreo y las interrupciones dependen completamente del operador.
Relacionado:Casi al nivel de élite, entrenado de forma más económica / La nube soberana no termina en la ubicación del servidor
Comparación de rendimiento con Qwen y los modelos europeos
Soofi alcanza 79,1 puntos en los agregados alemanes y se sitúa así por delante de Nemotron con 74,9. En código alemán la distancia se amplía. MBPP-DE llega a 84,2 y marca allí el mejor valor entre los modelos comparados. Estas cifras son datos del fabricante y se basan en datos de entrenamiento con un fuerte peso alemán.
Qwen3.5 35B supera a Soofi en el agregado en inglés con 74,6 frente a 70,1. En benchmarks de razonamiento como GPQA y BBH la diferencia también resulta clara. Las cargas de trabajo con alto contenido de inglés o tareas de razonamiento abstracto muestran así una desventaja notable frente al modelo chino. La tabla recoge los valores de comparación directa en todos los campos de prueba.
Benchmark en comparación entre pares
Soofi S 30B-A3B frente a la competencia abierta
Cinco familias de modelos, campos de prueba agregados más benchmarks especializados en alemán. Negrita = mejor valor de la fila, subrayado = segundo mejor. Soofi destaca sobre todo donde cuenta el alemán.
| Benchmark | Soofi S30B-A3B | Nemotron 3Nano 30B-A3B | Qwen3.535B-A3B | Ministral 314B | Gemma 327B |
|---|---|---|---|---|---|
| Aggregates | |||||
| English aggregate | 70.1 | 68.3 | 74.6 | 70.3 | 70.3 |
| German aggregate | 79.1 | 74.9 | 81.6 | 78.3 | 78.4 |
| Held-out (EN) | 41.4 | 34.7 | 47.8 | 40.0 | 35.5 |
| Held-out (DE) | 41.8 | 39.8 | 46.0 | 42.2 | 38.3 |
Mostrar todos los benchmarks individuales (código, matemáticas, conocimiento, razonamiento y más)
| Benchmark | Soofi S30B-A3B | Nemotron 3Nano 30B-A3B | Qwen3.535B-A3B | Ministral 314B | Gemma 327B |
|---|---|---|---|---|---|
| Code (pass@1) | |||||
| HumanEval | 73.8 | 72.2 | 67.1 | 60.9 | 60.2 |
| MBPP | 70.2 | 67.5 | 65.8 | 58.8 | 66.7 |
| LBPP | 31.0 | 38.1 | 32.4 | 27.0 | 22.4 |
| HumanEval-DE | 65.5 | 68.8 | 59.5 | 55.5 | 57.7 |
| MBPP-DE | 84.2 | 79.9 | 79.0 | 72.0 | 75.6 |
| Mathematik | |||||
| GSM8K | 86.1 | 86.5 | 82.6 | 83.7 | 79.9 |
| GSM8K-Platinum-DE | 87.1 | 87.7 | 91.2 | 81.3 | 80.7 |
| Minerva 500 | 79.4 | 64.0 | 83.0 | 61.8 | 75.7 |
| Minerva Math-EN | 81.0 | 64.2 | 82.4 | 61.3 | 73.7 |
| Minerva MATH-DE | 56.0 | 58.1 | 76.5 | 55.1 | 65.6 |
| Wissen | |||||
| MMLU stem | 75.9 | 74.8 | 81.9 | 76.4 | 74.7 |
| MMLU-Pro | 51.4 | 51.6 | 60.3 | 53.3 | 50.7 |
| MMLU-Pro-DE | 49.4 | 47.1 | 56.6 | 50.2 | 47.2 |
| INCLUDE-DE | 61.2 | 59.7 | 61.2 | 60.4 | 57.6 |
| NaturalQuestions (acc) | 79.0 | 80.3 | 81.0 | 77.1 | 83.5 |
| Commonsense & Leseverständnis | |||||
| PIQA | 85.7 | 84.8 | 84.9 | 82.9 | 84.9 |
| PIQA-DE | 91.5 | 85.7 | 87.6 | 81.3 | 86.7 |
| SocialIQA | 60.5 | 57.6 | 58.0 | 53.9 | 56.2 |
| SocialIQA-DE | 87.6 | 82.7 | 87.2 | 83.0 | 86.7 |
| SQuAD (EM) | 87.5 | 87.3 | 80.4 | 82.7 | 85.1 |
| DROP (EM) | 66.5 | 64.2 | 62.6 | 62.9 | 65.0 |
| Reasoning & Naturwissenschaft | |||||
| BBH (CoT) | 78.8 | 77.8 | 84.2 | 79.6 | 77.8 |
| AGIEval | 66.9 | 65.1 | 71.7 | 67.0 | 68.3 |
| GPQA-Diamond | 43.4 | 33.8 | 50.0 | 40.9 | 35.9 |
| GPQA-Diamond-DE | 41.9 | 37.4 | 46.4 | 42.5 | 31.8 |
| ARC-Challenge | 90.6 | 89.4 | 93.1 | 91.6 | 91.6 |
| Deutsche Sprachkompetenz | |||||
| GLP-DE | 88.8 | 73.7 | 94.0 | 89.5 | 88.3 |
| ARC-Challenge-DE | 92.3 | 91.4 | 96.6 | 93.5 | 93.3 |
Soofi S – el modelo del consorcio alemán
Nemotron 3 Nano – la referencia arquitectónica más cercana
Fett bester, unterstrichen zweitbester Wert je Zeile.
Quelle: Soofi Pretraining Tech Report (Soofi-Project)
Los modelos europeos Teuken-7B, Apertus, EuroLLM y Salamandra quedan más atrás en los agregados. Teuken-7B aparece en el gráfico en la zona inferior izquierda. Aleph Alpha fue adquirida por Cohere en abril de 2026. Según los benchmarks disponibles, Soofi es actualmente el modelo europeo abierto más potente de este tamaño que no pertenece a una empresa no europea.
Lo que significa en la práctica el diseño híbrido MoE-Mamba
Soofi utiliza en total 30 mil millones de parámetros, pero activa por token solo alrededor de tres mil millones. El componente Mamba sustituye partes de la Attention clásica y escala de forma lineal con la longitud del contexto. Gracias a ello, la velocidad de decodificación en tokens por segundo y GPU se mantiene alta incluso con un contexto de 40K. Los modelos de Attention completa luchan aquí con el creciente KV-Cache, que consume el ancho de banda de memoria y reduce el tamaño de batch posible. En cambio, el componente Mamba mantiene un estado constante y prescinde del KV-Cache.
Para un equipo de infraestructura, esto se traduce en menor latencia con documentos largos, historiales de chat extensos o contextos de recuperación. Es importante destacar una distinción que se cobra caro en la práctica si se pasa por alto: la proporción de parámetros activos reduce la carga computacional por token, no el almacenamiento de los pesos. En la VRAM siguen residiendo los 30 mil millones de parámetros completos; lo que se ahorra son FLOPs y memoria de activaciones. El coste adicional reside en la lógica de enrutamiento MoE. Esta genera sobrecarga en el batching, el balanceo de carga y la planificación de las activaciones de expertos, y en entornos multi-GPU añade también overhead de comunicación. El gráfico sitúa a Soofi según capacidad y rendimiento medido.
Capacidad frente a velocidad
Capability-Index vs. Decode-Speed con contexto de 40K
Cuanto más a la derecha, más rápido por GPU. Cuanto más arriba, más capaz. Soofi S se sitúa en la parte superior derecha, un lugar que hasta ahora ningún modelo europeo había ocupado.

Modelos europeos abiertos
Modelos internacionales
Modelo abierto no perteneciente a la UE
Referencia densa
Reproducción basada en el Informe técnico de preentrenamiento de Soofi – Valores redondeados, eje logarítmico
Muestra el modelo en la parte superior derecha, con alta capacidad y el mayor rendimiento medido. Hasta ahora ningún modelo europeo había ocupado esa posición. La ubicación resulta de la combinación de la selectividad MoE y la eficiencia de Mamba con contextos largos.
Necesidades de recursos y lo que es realista hoy
El entrenamiento consumió, según datos del fabricante, alrededor de 253.000 horas de GPU B200 en la Industrial AI Cloud de Deutsche Telekom en Múnich. Se utilizaron unos 27.000 mil millones de tokens de entrenamiento con un fuerte peso en alemán. La licencia es permisiva, aunque el acceso está actualmente limitado a una beta cerrada.
// activo por token
3 Mrd.
de los 30 mil millones de parámetros totales se calculan realmente por token. El esfuerzo computacional por token se acerca así al de un modelo de 3 mil millones. En cambio, la necesidad de VRAM para los pesos se mantiene en el nivel del modelo completo de 30B.
En la inferencia, el esfuerzo computacional por token se acerca por tanto al de un modelo con tres mil millones de parámetros activos. Un equipo ahorra así tiempo de cálculo, pero debe seguir reservando memoria para los pesos equivalente a un modelo de 30 mil millones. En la beta faltan versiones estables, rutas de actualización documentadas y datos claros sobre la compatibilidad con marcos de inferencia habituales como vLLM o TensorRT-LLM.
Hoy resultan realistas los estudios internos de viabilidad, los experimentos de contexto largo y los primeros ajustes finos con datos propios. Para sistemas productivos con SLA definidos de disponibilidad y latencia, el estado actual suele no ser suficiente. La integración en pipelines MLOps existentes exige trabajo adicional propio de desarrollo y validación.
El debate sobre la eficiencia del esfuerzo de entrenamiento
Los críticos de la comunidad especializada detectan una superposición de arquitectura y mixture de alrededor del 80 por ciento con el Nemotron 3 Nano de Nvidia. Según esta valoración, un Continual Pretraining sobre el modelo existente habría requerido considerablemente menos tiempo de cómputo. Las 253.000 B200-GPU-Stunden parecen elevadas desde este punto de vista. Además, la métrica Capability-Index definida por ellos mismos se considera exagerada por algunos observadores.
El equipo de Michael Fromm argumenta, sin embargo, que el objetivo no era lograr la cifra de evaluación más baja. Un modelo entrenado desde cero con su propia pipeline de datos se puede reproducir técnicamente mejor y desarrollar de forma más dirigida que un checkpoint ajeno sobre el que simplemente se construye.
Técnicamente, el trade-off sigue siendo claro. Quien necesita el control total sobre los datos de entrenamiento y su ponderación, acepta el mayor esfuerzo. Quien busca una baseline sólida con el menor esfuerzo adicional posible, opta más bien por Continual Pretraining o por un modelo ya terminado.
Quién asume la responsabilidad operativa
En producción, un equipo gestiona por sí mismo los parches, las actualizaciones de seguridad y la respuesta a incidentes. No existe ningún proveedor comercial que asuma SLA, monitorización o tiempos de respuesta fijos. Cualquier caída o brecha de seguridad recae íntegramente en el operador.
El entrenamiento procede de un consorcio de investigación. La evolución futura depende de la continuidad de ese proyecto. Quien despliega Soofi genera una dependencia de un proceso de desarrollo que no está orientado prioritariamente a la estabilidad operativa. Esto incrementa la carga de trabajo en observabilidad propia, estrategias de rollback y procedimientos de emergencia. Precisamente este aspecto sigue siendo la pregunta más difícil al pasar del benchmark al entorno de producción real.
¿Qué es un modelo híbrido MoE-Mamba? Mixture-of-Experts activa únicamente una parte de los parámetros por token; en Soofi, alrededor de tres de treinta mil millones. El componente Mamba sustituye secciones de la Attention clásica y escala de forma lineal con la longitud de la secuencia. El diseño híbrido combina la activación selectiva con un procesamiento eficiente de contextos largos, logrando así un alto rendimiento de decodificación sin la sobrecarga completa de Attention.
Preguntas frecuentes
¿Qué tareas son actualmente las más adecuadas para Soofi?
Los contenidos especializados en alemán, el código en alemán y las tareas de contexto largo con alta demanda de rendimiento se adaptan bien. En cargas de trabajo en inglés o con fuerte énfasis en razonamiento, Qwen3.5 35B destaca. La tabla y el diagrama del artículo muestran el perfil en detalle.
¿Qué implica la beta cerrada para su implementación en una organización?
El acceso está limitado y no hay garantía de versiones estables ni correcciones oportunas. Los equipos deben probar primero el modelo en entornos aislados y prever sus propios mecanismos de validación y respaldo antes de integrarlo en procesos críticos.
¿Quién se encarga de las actualizaciones y el mantenimiento después del entrenamiento?
El consorcio no proporciona actualmente procesos operativos listos para producción. Los operadores aplican los parches ellos mismos, gestionan las versiones y responden de forma autónoma a las nuevas versiones. Esta responsabilidad sigue siendo uno de los mayores obstáculos prácticos hacia el funcionamiento en tiempo real.
Selección editorial
cloudmagazinCasi a nivel de élite, más económico y entrenado en tres continentescloudmagazinLa nube soberana no termina en la ubicación del servidorcloudmagazinBSI C3A: la soberanía en la nube se vuelve verificableMás de la red MBF Media
MyBusinessFutureCuándo realmente compensa un modelo de IA alemánDigital ChiefsIA soberana: la responsabilidad se queda en casaSecurityTodayEl AI Act es en realidad una ley de seguridadFuente imagen de portada: Generada por IA (julio de 2026)

