lundi 17 août 2026 · Sem. 34 DE · EN · FR · ES Sombre
IA

Inkling : ce que peut le nouveau modèle Open Weights

Par Alec Chizhik 16 juillet 2026 6 min de lecture
Inkling : ce que peut le nouveau modèle Open Weights

Le Thinking Machines Lab a publié Inkling, un modèle MoE à poids ouverts sous licence Apache 2.0, le 15 juillet 2026. Ce modèle traite le texte, les images et l’audio, génère du texte et offre, selon le fabricant, une fenêtre de contexte allant jusqu’à un million de tokens. Les poids sont disponibles sur Hugging Face, et le fine-tuning est possible via Tinker. Le fabricant précise qu’Inkling n’est pas présenté comme le modèle le plus performant en général ; pour les entreprises, l’adaptabilité, l’infrastructure, les coûts et les tests internes priment sur les classements génériques.

Les points clés en bref

  • Poids ouverts sous Apache 2.0. Selon le fabricant, Inkling compte 975 milliards de paramètres au total et 41 milliards de paramètres actifs.
  • Entrées texte, image et audio. La sortie est du texte ; la fenêtre de contexte maximale est indiquée à un million de tokens. Les poids sont disponibles sur Hugging Face, et le fine-tuning est possible via Tinker.
  • Les tests internes restent incontournables. Les benchmarks du fabricant ne sont que des déclarations. L’évaluation dans votre propre infrastructure, les coûts et le choix du déploiement adapté sont déterminants.

Articles associés :Quand les GPU dévorent le budget SaaS  /  Les campus IA en Allemagne : séparer construction et planification en temps réel

Ce que Inkling apporte sur le plan technique

Qu’est-ce qu’Inkling ? Inkling est un modèle à poids ouverts développé par le Thinking Machines Lab. L’entreprise publie les poids du modèle sous licence Apache 2.0, permettant aux équipes de les examiner, de les intégrer à leurs propres systèmes et de les affiner pour des tâches spécifiques.

Inkling s’inspire des grandes architectures Mixture-of-Experts : le nombre total de paramètres atteint 975 milliards, dont 41 milliards sont activés à chaque étape d’inférence, selon le fabricant. Cette approche sépare la taille du modèle en mémoire de la charge de calcul en temps réel, un aspect crucial pour l’achat et l’architecture, car la licence, les besoins en mémoire et en calcul représentent des leviers distincts.

En tant que modèle à poids ouverts sous Apache 2.0, les poids et les artefacts associés peuvent être téléchargés, vérifiés et intégrés dans vos propres pipelines, conformément aux conditions de licence. La publication des poids sur Hugging Face réduit la barrière à l’entrée pour les équipes déjà familiarisées avec les workflows Hugging Face, les catalogues de modèles internes ou les pipelines d’évaluation assistées par CI.

La multimodalité est largement prise en charge en entrée : texte, image et audio peuvent être combinés dans le contexte. La sortie est du texte. Pour des scénarios typiques en entreprise, cela permet par exemple la transcription de réunions, la recherche dans des documents et captures d’écran, l’analyse d’appels de support ou la combinaison de spécifications et de captures d’écran d’interfaces. La fenêtre de contexte maximale annoncée par le fabricant est d’un million de tokens. Cela permet de traiter de longs briefings, des historiques de tickets volumineux ou des documents de projet regroupés en une seule passe. Reste à vérifier en pratique si cette limite tient sous charge, avec des tokenisations réelles et les stacks de serveurs choisis.

Fonctionnement, adaptation et ce que le fabricant relativise lui-même

Le Thinking Machines Lab précise explicitement qu’Inkling n’est pas le modèle le plus performant en général. Il s’agit d’une clarification rare, mais utile : elle dissocie le marketing de la question de savoir si le modèle est économiquement et qualitativement viable dans votre propre cas d’usage. Les benchmarks des fabricants sont des données fournies par ces derniers. Ils peuvent servir de point de départ pour formuler des hypothèses, mais ne remplacent pas une évaluation indépendante basée sur vos propres données, vos propres prompts et vos exigences réelles en matière de latence, de débit et de sécurité.

Le fine-tuning est prévu via Tinker. Pour les entreprises souhaitant adapter le modèle au langage de leur domaine, à leurs formats internes ou à leur ton conforme aux exigences réglementaires, c’est le levier pratique à côté du prompting pur et du retrieval. Les poids ouverts (Open Weights) et une voie de fine-tuning signifient que les équipes peuvent versionner les modèles, réaliser des tests A/B et définir des chemins de retour arrière, à condition que la gouvernance, l’accès aux données et les traces d’audit soient pris en compte.

Sur le plan infrastructurel, l’auto-hébergement, les clusters GPU gérés et les configurations hybrides sont envisageables. Les 41 milliards de paramètres actifs par requête définissent la classe de calcul approximative, tandis que les 975 milliards de paramètres totaux déterminent les besoins en mémoire et en distribution. Quiconque envisage sérieusement d’utiliser Inkling devrait clarifier tôt avec les équipes financières et de plateforme les coûts liés à la quantification, au parallélisme d’experts, au batching et au stockage. La licence Apache 2.0 facilite juridiquement l’utilisation interne et le partage dans le cadre des conditions connues de la licence, mais l’autorisation juridique au sein de chaque groupe reste une étape distincte.

Ce que les décideurs doivent vérifier

Pour le cas d’affaires, quatre critères comptent davantage que tout classement public : l’adaptabilité aux données et processus métiers, l’infrastructure disponible et le modèle opérationnel, les coûts récurrents d’inférence et de stockage, ainsi que la qualité évaluée dans votre propre environnement. Les poids ouverts (Open Weights) déplacent le budget des simples abonnements API vers le temps GPU, l’ingénierie et le monitoring. Ce n’est pas une solution miracle, mais c’est planifiable si les prix des tokens, l’utilisation et les files d’attente sont modélisés de manière transparente.

Les entrées multimodales augmentent la charge d’intégration : les pipelines d’images et d’audio nécessitent des règles claires en matière de protection des données et de conservation, notamment pour les enregistrements clients et les captures d’écran internes. Une grande fenêtre de contexte peut inciter à tout intégrer dans un seul prompt. Il est préférable de concevoir une architecture avec retrieval, segmentation et sources vérifiables, afin de mieux maîtriser les coûts et les risques d’hallucinations.

Une approche pragmatique consiste à lancer un pilote restreint avec des tâches mesurables, à établir une ligne de base par rapport au modèle actuellement utilisé, à utiliser les mêmes jeux de tests pour évaluer la qualité et les coûts, puis à décider du fine-tuning via Tinker et du chemin de déploiement. Ainsi, Inkling reste un outil avec des indicateurs clairs plutôt qu’un pari global sur une plateforme.

Foire aux questions

Qu’est-ce qu’Inkling ?

Inkling est un modèle MoE à poids ouverts (Open Weights) publié le 15 juillet 2026 par le Thinking Machines Lab sous licence Apache 2.0. Il traite le texte, les images et l’audio pour générer du texte.

Quelle est la taille du modèle ?

Selon le fabricant, Inkling compte 975 milliards de paramètres au total et 41 milliards de paramètres actifs par étape d’inférence. La fenêtre de contexte maximale est indiquée à 1 million de tokens.

Où se trouvent les poids et comment les adapter ?

Les poids sont disponibles sur Hugging Face. Le fine-tuning est possible via Tinker. Ces deux éléments facilitent l’intégration pour les équipes disposant déjà de processus MLOps et d’évaluation.

Inkling est-il, selon le fabricant, le modèle le plus performant ?

Non. Le fabricant précise explicitement qu’Inkling n’est pas le modèle le plus performant en général. Les benchmarks publics fournis par le fabricant doivent être considérés comme des données internes et complétés par vos propres tests.

À quoi les entreprises doivent-elles prêter attention ?

À l’adaptabilité, aux options d’infrastructure, aux coûts récurrents et à une évaluation interne dans le cas d’usage cible. Ces facteurs sont plus pertinents pour l’exploitation que les affirmations génériques de classements.

Nos conseils de lecture

Plus de notre réseau MBF Media

Source de l’image : générée par IA (juillet 2026)

Aussi disponible en

EspañolEnglishDeutsch
MBF Media Newsletter

Le briefing mensuel pour les décideurs

Une fois par mois, la newsletter MBF Media réunit l'essentiel de cloudmagazin, MyBusinessFuture, Digital Chiefs et SecurityToday, sélectionné par la rédaction.

25 000 décideurs IT et métiers lisent cette newsletter. Rejoignez-les.

S'abonner gratuitement
MBF Media Newsletter, aktuelle Ausgabe auf dem iPhone
Un magazine d'Evernine Media GmbH