Puntos Clave

  • Debut técnico: Thinking Machines Lab lanza Inkling, modelo open-weight con 975 mil millones de parámetros totales, con solo 41 mil millones activos por inferencia gracias a una arquitectura MoE.
  • Posicionamiento competitivo: Puesto 41 en el Artificial Analysis Intelligence Index, primero entre los modelos open-weight estadounidenses, por delante de Nvidia Nemotron 3 Ultra.
  • Eficiencia operativa: Consumo medio de 25.000 tokens en salida frente a los 37.000-43.000 de los modelos competidores, con licencia Apache 2.0 sin restricciones comerciales.

Entrada al mercado con parámetros de escala inédita

Thinking Machines Lab, dirigida por la ex CTO de OpenAI Mira Murati, lanzó el 15 de julio de 2026 Inkling, el modelo open-weight con el mayor número de parámetros jamás producido en territorio estadounidense. La cifra de 975 mil millones de parámetros totales coloca al sistema en un rango dimensional que requiere infraestructuras de cómputo dedicadas, pero el dato relevante no reside en el tamaño bruto sino en la eficiencia de activación.



Inkling: el modelo open-weight de 975 mil millones de par... - Foto 1

Arquitectura MoE: la relación entre escala y coste computacional

El transformador decoder-only de Inkling opera en 66 capas con un mecanismo de enrutamiento que selecciona 6 expertos de 256 por cada token, integrados por 2 expertos compartidos siempre activos. El resultado operativo es que el sistema movilita solo 41 mil millones de parámetros activos por solicitud, una proporción de dispersión que reduce la carga computacional manteniendo la capacidad representativa de la escala total. La ventana de contexto alcanza 1 millón de tokens, mientras que la cuantización en NVFP4 permite la ejecución en ocho aceleradores Nvidia B300 o dieciséis H200, una especificación que fija el requisito mínimo de hardware para el despliegue.

Ingesta multimodal, salida monomodal

El entrenamiento procesó 45 billones de tokens entre texto, imágenes, audio y video. Las imágenes y videos se tratan mediante un codificador jerárquico de parches, el audio mediante codificación discreta de tokens, con proyección de todas las modalidades en un espacio oculto compartido procesado por el decoder. La restricción arquitectónica impone que la salida sea exclusivamente textual: código, documentos estructurados, datos. La licencia Apache 2.0 elimina toda restricción sobre descarga, ejecución y personalización, condición que habilita la adopción empresarial sin negociación de licencia.

Métricas de referencia: dónde el modelo supera a los competidores directos

El puesto 41 en el Artificial Analysis Intelligence Index convierte a Inkling en el modelo open-weight estadounidense con la puntuación más alta, superando a Nemotron 3 Ultra, que se sitúa en 38 puntos. En SWE-bench Verified la puntuación es de 77,6% frente al 71,9% del competidor Nvidia. En VoiceBench registra 91,4%. En el índice GDPval-AA v2 el Elo de 1238 supera tanto a Kimi K2.6 (1190) como a DeepSeek v4 Flash (1189), estableciendo una ventaja cuantificable en dos benchmarks distintos de razonamiento aplicado.



Inkling: el modelo open-weight de 975 mil millones de par... - Foto 2

Eficiencia de tokens como métrica de coste operativo

El consumo medio de 25.000 tokens en salida por tarea del Intelligence Index se compara con los 43.000 de GLM-5.2, los 38.000 de Kimi K2.6 y los 37.000 de DeepSeek v4 Pro. En Terminal Bench 2.1 Inkling iguala a Nemotron 3 Ultra empleando alrededor de un tercio de los tokens, un dato que incide directamente en los costes de inferencia a escala de producción. El "controllable thinking effort" permite ajustar el equilibrio entre velocidad y precisión, mientras que el mecanismo de señalización de incertidumbre reduce la incidencia de salidas alucinadas.

Deudas técnicas hacia la investigación externa

Thinking Machines confirmó que la arquitectura de Inkling deriva de DeepSeek-V3, y que la fase de post-entrenamiento empleó datos generados por Kimi K2.5 de Moonshot AI. El dato documenta la circulación de metodologías entre laboratorios independientemente de su procedencia geográfica, un factor técnico que la propia empresa declara abiertamente en la documentación de lanzamiento.



Inkling: el modelo open-weight de 975 mil millones de par... - Foto 3

Proyección: base de personalización, no modelo de vértice absoluto

La declaración oficial de Thinking Machines circunscribe las ambiciones del lanzamiento: "Inkling no es el modelo global más potente disponible hoy, ni open ni closed. Es, en cambio, una excelente base open-weight para la personalización". El posicionamiento estratégico no apunta al primado absoluto en la clasificación, sino a la creación de una infraestructura de base modular y de licencia permisiva. El impacto inmediato en el mercado open-weight estadounidense es la aparición de un estándar técnico con una relación eficiencia/rendimiento superior a la disponible hasta ahora, condición que redefine el benchmark competitivo para los próximos lanzamientos del sector.