Soofi S : souverain ne signifie pas vainqueur
Soofi S domine les benchmarks allemands et maintient une vitesse élevée en contexte long. Qwen3.5 excelle en raisonnement. Analyse technique.
Soofi S 30B-A3B atteint les plus hautes performances sur les benchmarks allemands parmi les modèles européens actuels. L’architecture hybride MoE-Mamba assure un débit de décodage supérieur à un contexte de 40K par rapport aux modèles Attention purs de même envergure. Pour une équipe d’infrastructure, le choix du déploiement repose sur une question pragmatique : ces atouts compensent-ils le statut bêta et l’absence de processus opérationnels ?
L’essentiel en bref
- Fort en allemand, faible à l’international. Soofi mène selon les indications du projet dans l’agrégat allemand (79,1) et pour le code allemand, mais perd clairement face à Qwen3.5 en anglais et en raisonnement.
- L’architecture est le levier. Le composant Mamba maintient le débit de décodage élevé pour un contexte long, là où les modèles à attention complète s’effondrent au niveau du KV-Cache.
- Bêta sans SLA. Il n’y a pas de support commercial. Les correctifs, la surveillance et les pannes incombent entièrement à l’opérateur.
Lié :Presque au niveau supérieur, entraîné à moindre coût / Le cloud souverain ne s’arrête pas à l’emplacement du serveur
Comparaison des performances avec Qwen et les modèles européens
Soofi atteint 79,1 points sur les agrégats allemands et devance ainsi Nemotron (74,9). Sur le code allemand, l’écart s’agrandit. MBPP-DE atteint 84,2 et signe là le meilleur score parmi les modèles comparés. Ces chiffres sont fournis par les constructeurs et reposent sur des données d’entraînement fortement pondérées en allemand.
Qwen3.5 35B devance Soofi sur l’agrégat anglais avec 74,6 contre 70,1. Sur les benchmarks de raisonnement comme GPQA et BBH, le retard est tout aussi net. Les charges de travail riches en anglais ou en tâches de raisonnement abstrait accusent donc un désavantage sensible face au modèle chinois. Le tableau présente les valeurs de comparaison directe sur l’ensemble des tests.
Benchmark en comparaison directe
Soofi S 30B-A3B face à la concurrence open source
Cinq familles de modèles, agrégats de tests et benchmarks allemands spécifiques. En gras = meilleur score de la ligne, souligné = deuxième meilleur. Soofi domine surtout là où l’allemand compte.
| Benchmark | Soofi S30B-A3B | Nemotron 3Nano 30B-A3B | Qwen3.535B-A3B | Ministral 314B | Gemma 327B |
|---|---|---|---|---|---|
| Agrégats | |||||
| English aggregate | 70.1 | 68.3 | 74.6 | 70.3 | 70.3 |
| German aggregate | 79.1 | 74.9 | 81.6 | 78.3 | 78.4 |
| Held-out (EN) | 41.4 | 34.7 | 47.8 | 40.0 | 35.5 |
| Held-out (DE) | 41.8 | 39.8 | 46.0 | 42.2 | 38.3 |
Afficher tous les benchmarks individuels (code, mathématiques, connaissances, raisonnement et autres)
| Benchmark | Soofi S30B-A3B | Nemotron 3Nano 30B-A3B | Qwen3.535B-A3B | Ministral 314B | Gemma 327B |
|---|---|---|---|---|---|
| Code (pass@1) | |||||
| HumanEval | 73.8 | 72.2 | 67.1 | 60.9 | 60.2 |
| MBPP | 70.2 | 67.5 | 65.8 | 58.8 | 66.7 |
| LBPP | 31.0 | 38.1 | 32.4 | 27.0 | 22.4 |
| HumanEval-DE | 65.5 | 68.8 | 59.5 | 55.5 | 57.7 |
| MBPP-DE | 84.2 | 79.9 | 79.0 | 72.0 | 75.6 |
| Mathématiques | |||||
| GSM8K | 86.1 | 86.5 | 82.6 | 83.7 | 79.9 |
| GSM8K-Platinum-DE | 87.1 | 87.7 | 91.2 | 81.3 | 80.7 |
| Minerva 500 | 79.4 | 64.0 | 83.0 | 61.8 | 75.7 |
| Minerva Math-EN | 81.0 | 64.2 | 82.4 | 61.3 | 73.7 |
| Minerva MATH-DE | 56.0 | 58.1 | 76.5 | 55.1 | 65.6 |
| Connaissances | |||||
| MMLU stem | 75.9 | 74.8 | 81.9 | 76.4 | 74.7 |
| MMLU-Pro | 51.4 | 51.6 | 60.3 | 53.3 | 50.7 |
| MMLU-Pro-DE | 49.4 | 47.1 | 56.6 | 50.2 | 47.2 |
| INCLUDE-DE | 61.2 | 59.7 | 61.2 | 60.4 | 57.6 |
| NaturalQuestions (acc) | 79.0 | 80.3 | 81.0 | 77.1 | 83.5 |
| Sens commun et compréhension écrite | |||||
| PIQA | 85.7 | 84.8 | 84.9 | 82.9 | 84.9 |
| PIQA-DE | 91.5 | 85.7 | 87.6 | 81.3 | 86.7 |
| SocialIQA | 60.5 | 57.6 | 58.0 | 53.9 | 56.2 |
| SocialIQA-DE | 87.6 | 82.7 | 87.2 | 83.0 | 86.7 |
| SQuAD (EM) | 87.5 | 87.3 | 80.4 | 82.7 | 85.1 |
| DROP (EM) | 66.5 | 64.2 | 62.6 | 62.9 | 65.0 |
| Raisonnement et sciences | |||||
| BBH (CoT) | 78.8 | 77.8 | 84.2 | 79.6 | 77.8 |
| AGIEval | 66.9 | 65.1 | 71.7 | 67.0 | 68.3 |
| GPQA-Diamond | 43.4 | 33.8 | 50.0 | 40.9 | 35.9 |
| GPQA-Diamond-DE | 41.9 | 37.4 | 46.4 | 42.5 | 31.8 |
| ARC-Challenge | 90.6 | 89.4 | 93.1 | 91.6 | 91.6 |
| Compétence linguistique allemande | |||||
| GLP-DE | 88.8 | 73.7 | 94.0 | 89.5 | 88.3 |
| ARC-Challenge-DE | 92.3 | 91.4 | 96.6 | 93.5 | 93.3 |
Soofi S – le modèle consortial allemand
Nemotron 3 Nano – la référence architecturale la plus proche
Gras meilleur, souligné deuxième meilleur score par ligne.
Source : Soofi Pretraining Tech Report (Soofi-Project)
Les modèles européens Teuken-7B, Apertus, EuroLLM et Salamandra restent en retrait dans les agrégats. Teuken-7B se situe en bas à gauche du graphique. Aleph Alpha a été rachetée par Cohere en avril 2026. Selon les benchmarks disponibles, Soofi est actuellement le modèle européen open source le plus performant de cette taille qui n’appartient pas à une entreprise non européenne.
Ce que le design hybride MoE-Mamba implique en pratique
Soofi utilise au total 30 milliards de paramètres, mais n’en active que environ trois milliards par token. Le composant Mamba remplace une partie de l’attention classique et s’échelonne linéairement avec la longueur du contexte. Ainsi, la vitesse de décodage en tokens par seconde et par GPU reste élevée à un contexte de 40K. Les modèles à attention complète peinent ici avec le KV-Cache qui grossit, lequel consomme la bande passante mémoire et réduit la taille de batch possible. Le composant Mamba maintient quant à lui un état constant et se passe de KV-Cache.
Pour une équipe infrastructure, cela se traduit par une latence plus faible face à de longs documents, à des historiques de conversation étendus ou à des contextes de récupération. Une distinction importante mérite d’être soulignée, car l’ignorer se révèle coûteux en pratique : la part active des paramètres réduit la charge de calcul par token, et non l’empreinte mémoire des poids. Les 30 milliards de paramètres restent intégralement en VRAM ; les économies portent sur les FLOPs et la mémoire d’activation. Le surcoût provient par ailleurs de la logique de routage MoE. Celle-ci génère un overhead lors du batching, de l’équilibrage de charge et de la planification des activations d’experts, ainsi qu’un surcoût de communication en environnement multi-GPU. Le graphique positionne Soofi selon ses capacités et son débit mesuré.
Capacité face à la vitesse
Capability-Index vs. Decode-Speed à un contexte de 40K
Plus on se déplace vers la droite, plus le modèle est rapide par GPU. Plus on monte, plus il est performant. Soofi S se trouve en haut à droite, là où aucun modèle européen n’avait encore été positionné.

Modèles européens ouverts
Modèles internationaux
Modèle ouvert hors UE
Référence dense
Reproduction d’après le Soofi Pretraining Tech Report – valeurs arrondies, axe logarithmique
Le graphique place le modèle en haut à droite, là où capacité et débit mesuré sont tous deux élevés. Aucun modèle européen n’occupait jusqu’ici cette zone. Cette position résulte de la combinaison entre la sélectivité MoE et l’efficacité de Mamba sur les longs contextes.
Besoins en ressources et ce qui est réaliste aujourd’hui
L’entraînement a consommé, selon les indications du fabricant, environ 253.000 heures GPU B200 sur l’Industrial AI Cloud de Deutsche Telekom à Munich. Environ 27.000 milliards de tokens d’entraînement avec une forte pondération allemande ont été utilisés. La licence est permissive, mais l’accès est actuellement limité à une bêta fermée.
// actif par token
3 Mrd.
sur 30 milliards de paramètres au total sont réellement calculés par token. La charge de calcul par token se rapproche ainsi d’un modèle de 3 milliards. En revanche, les besoins en VRAM pour les poids restent au niveau du modèle complet 30B.
Lors de l’inférence, la charge de calcul par token se rapproche donc d’un modèle avec trois milliards de paramètres actifs. Une équipe économise ainsi du temps de calcul, mais doit tout de même prévoir la mémoire d’un modèle de 30 milliards pour les poids. Dans la version bêta, il manque des versions stables, des chemins de mise à jour documentés et des indications claires sur la compatibilité avec les frameworks d’inférence courants comme vLLM ou TensorRT-LLM.
Sont réalistes aujourd’hui les études de faisabilité internes, les expériences Long-Context et les premiers ajustements fins sur données propres. Pour des systèmes productifs avec des SLA définis en matière de disponibilité et de latence, l’état actuel ne suffit généralement pas. L’intégration dans les pipelines MLOps existants nécessite un travail supplémentaire de développement et de validation en interne.
Le débat sur l’efficacité de l’effort d’entraînement
Les critiques de la communauté d’experts relèvent un chevauchement d’architecture et de Mixture d’environ 80 % avec le Nemotron 3 Nano de Nvidia. Selon cette lecture, un Continual Pretraining sur le modèle existant aurait nécessité nettement moins de temps de calcul. Les 253.000 heures GPU B200 apparaissent, sous cet angle, particulièrement élevées. La métrique Capability-Index définie en interne est également jugée exagérée par plusieurs observateurs.
L’équipe de Michael Fromm rétorque que l’objectif n’était pas d’obtenir le score Eval le plus bas possible. Un modèle entraîné entièrement à partir de zéro, avec sa propre pipeline de données, offre une meilleure reproductibilité technique et une évolution plus ciblée qu’un simple checkpoint étranger sur lequel on se contente de greffer.
Techniquement, le trade-off reste limpide. Ceux qui exigent un contrôle total sur les données d’entraînement et leur pondération acceptent le surcoût. Ceux qui recherchent une baseline performante avec un effort supplémentaire minimal se tournent plutôt vers le Continual Pretraining ou un modèle déjà disponible.
Qui assume la responsabilité de l’exploitation
En production, une équipe gère elle-même les correctifs, les mises à jour de sécurité et la réponse aux incidents. Aucun fournisseur commercial ne prend en charge les SLA, la supervision ni des temps de réponse garantis. Une panne ou une faille de sécurité relève intégralement de la responsabilité de l’exploitant.
Le travail d’entraînement provient d’un consortium de recherche. La poursuite du développement dépend de la pérennité de ce projet. En adoptant Soofi, on crée une dépendance à l’égard d’un processus de développement qui n’est pas conçu en priorité pour la stabilité opérationnelle. Cela accroît l’effort nécessaire en matière d’observabilité interne, de stratégies de rollback et de procédures d’urgence. C’est précisément ce point qui reste la question la plus délicate lors du passage du benchmark à l’exploitation réelle.
Qu’est-ce qu’un modèle hybride MoE-Mamba ? Mixture-of-Experts n’active qu’une partie des paramètres par token, chez Soofi environ trois sur trente milliards. Le composant Mamba remplace une partie de l’attention classique et s’adapte linéairement à la longueur de la séquence. Cette architecture hybride associe une activation sélective à un traitement efficace du contexte long, offrant ainsi un débit de décodage élevé sans supporter l’intégralité du surcoût de l’attention.
Questions fréquentes
Quelles tâches conviennent actuellement le mieux à Soofi ?
Les contenus spécialisés en allemand, le code en allemand et les tâches à long contexte à fort besoin de débit sont particulièrement adaptés. Sur les workloads en anglais ou fortement orientés raisonnement, Qwen3.5 35B prend l’avantage. Le tableau et le graphique de l’article détaillent ce profil.
Que signifie la bêta fermée pour un déploiement en entreprise ?
L’accès est limité et aucune garantie n’est donnée sur la stabilité des versions ni sur la rapidité des correctifs. Les équipes doivent d’abord tester le modèle dans des environnements isolés et mettre en place leurs propres mécanismes de validation et de repli avant de l’intégrer à des processus critiques.
Qui assure les mises à jour et la maintenance après l’entraînement ?
Le consortium ne fournit actuellement aucun processus d’exploitation prêt pour la production. Les opérateurs déploient eux-mêmes les correctifs, gèrent les versions et réagissent de manière autonome aux nouvelles releases. Cette responsabilité reste l’un des principaux freins pratiques à un passage en production.
Sélection de la rédaction
cloudmagazinPresque au niveau supérieur, moins cher et entraîné sur trois continentscloudmagazinLe cloud souverain ne s’arrête pas à l’emplacement du serveurcloudmagazinBSI C3A : la souveraineté du cloud devient vérifiablePlus du réseau MBF Media
MyBusinessFutureQuand un modèle d’IA allemand devient vraiment rentableDigital ChiefsIA souveraine : la responsabilité reste dans l’entrepriseSecurityTodayL’AI Act est en réalité une loi sur la sécuritéSource de l’image de couverture : générée par IA (juillet 2026)

