Points Clés

  • Débuts techniques : Thinking Machines Lab dévoile Inkling, un modèle open-weight totalisant 975 milliards de paramètres, dont seulement 41 milliards actifs lors de l'inférence grâce à une architecture MoE.
  • Positionnement concurrentiel : 41ᵉ place dans l'Artificial Analysis Intelligence Index, première position parmi les modèles open-weight américains, devançant Nvidia Nemotron 3 Ultra.
  • Efficacité opérationnelle : Consommation moyenne de 25 000 tokens en sortie contre 37 000 à 43 000 pour les modèles concurrents, sous licence Apache 2.0 sans restriction commerciale.

Une entrée sur le marché à une échelle de paramètres inédite

Thinking Machines Lab, dirigée par l'ancienne CTO d'OpenAI Mira Murati, a lancé le 15 juillet 2026 Inkling, le modèle open-weight comptant le plus grand nombre de paramètres jamais produit sur le sol américain. Le chiffre de 975 milliards de paramètres totaux place ce système dans une catégorie qui exige des infrastructures de calcul dédiées, mais l'élément déterminant ne réside pas dans la taille brute, plutôt dans l'efficacité d'activation.



Inkling : le modèle open-weight de 975 milliards de param... - Foto 1

Architecture MoE : le rapport entre échelle et coût computationnel

Le transformateur decoder-only d'Inkling fonctionne sur 66 couches avec un mécanisme de routage qui sélectionne 6 experts sur 256 pour chaque token, complétés par 2 experts partagés toujours actifs. Résultat opérationnel : le système ne mobilise que 41 milliards de paramètres actifs par requête, un rapport de parcimonie qui réduit la charge computationnelle tout en conservant la capacité représentative de l'échelle totale. La fenêtre de contexte atteint 1 million de tokens, tandis que la quantification en NVFP4 permet l'exécution sur huit accélérateurs Nvidia B300 ou seize H200, une spécification qui fixe le seuil matériel minimal pour le déploiement.

Ingestion multimodale, sortie monomodale

L'entraînement a traité 45 billions de tokens mêlant texte, images, audio et vidéo. Les images et vidéos sont traitées via un encodeur hiérarchique de patchs, l'audio via un codage discret de tokens, avec projection de toutes les modalités dans un espace latent partagé traité par le décodeur. La contrainte architecturale impose une sortie exclusivement textuelle : code, documents structurés, données. La licence Apache 2.0 lève toute restriction sur le téléchargement, l'exécution et la personnalisation, une condition qui facilite l'adoption en entreprise sans négociation de licence.

Métriques de benchmark : où le modèle dépasse ses concurrents directs

La 41ᵉ place dans l'Artificial Analysis Intelligence Index fait d'Inkling le modèle open-weight américain au score le plus élevé, devançant Nemotron 3 Ultra bloqué à 38 points. Sur SWE-bench Verified, le score atteint 77,6 % contre 71,9 % pour le concurrent Nvidia. Sur VoiceBench, il enregistre 91,4 %. Dans l'indice GDPval-AA v2, l'Elo de 1238 dépasse à la fois Kimi K2.6 (1190) et DeepSeek v4 Flash (1189), établissant un avantage mesurable sur deux benchmarks distincts de raisonnement appliqué.



Inkling : le modèle open-weight de 975 milliards de param... - Foto 2

L'efficacité des tokens comme mesure du coût opérationnel

La consommation moyenne de 25 000 tokens en sortie par tâche dans l'Intelligence Index se compare aux 43 000 de GLM-5.2, aux 38 000 de Kimi K2.6 et aux 37 000 de DeepSeek v4 Pro. Sur Terminal Bench 2.1, Inkling égale Nemotron 3 Ultra en utilisant environ un tiers des tokens, une donnée qui pèse directement sur les coûts d'inférence à l'échelle de production. Le « controllable thinking effort » permet d'ajuster le compromis vitesse/précision, tandis que le mécanisme de signalement de l'incertitude réduit l'incidence des sorties hallucinées.

Des dettes techniques envers la recherche externe

Thinking Machines a confirmé que l'architecture d'Inkling dérive de DeepSeek-V3, et que la phase de post-entraînement a utilisé des données générées par Kimi K2.5 de Moonshot AI. Ce constat documente la circulation des méthodologies entre laboratoires indépendamment de leur origine géographique, un facteur technique que l'entreprise déclare ouvertement dans sa documentation de lancement.



Inkling : le modèle open-weight de 975 milliards de param... - Foto 3

Perspective : une base de personnalisation, pas un modèle de pointe absolu

La déclaration officielle de Thinking Machines circonscrit les ambitions de ce lancement : « Inkling n'est pas le modèle globalement le plus puissant disponible aujourd'hui, ouvert ou fermé. C'est en revanche une excellente base open-weight pour la personnalisation ». Le positionnement stratégique ne vise pas la suprématie absolue dans les classements, mais la création d'une infrastructure de base modulaire sous licence permissive. L'impact immédiat sur le marché open-weight américain se traduit par l'apparition d'un standard technique au rapport efficacité/performance supérieur à ce qui existait jusqu'ici, une condition qui redéfinit le benchmark concurrentiel pour les prochaines sorties du secteur.