Inkling: el modelo de ~975.000M de parámetros que sólo activa 41.000M por token

🕒 Publicado en Zendoric: 23 de julio de 2026 · 00:24
El artículo describe Inkling, un modelo de lenguaje que conviene entender no como un único cerebro de 975.000 millones de parámetros que se activa por completo en cada inferencia, sino como un enorme almacén de capacidad especializada del que sólo se usa una fracción pequeña en cada paso.
Por TheSequence · 22 de julio de 2026.
El artículo describe Inkling, un modelo de lenguaje que conviene entender no como un único cerebro de 975.000 millones de parámetros que se activa por completo en cada inferencia, sino como un enorme almacén de capacidad especializada del que sólo se usa una fracción pequeña en cada paso. La pieza central de esta arquitectura es un "router" (enrutador) que, para cada token, selecciona un subconjunto reducido de esa capacidad total. Esto hace que el cálculo efectivo (la aritmética que se ejecuta) sea disperso, aunque el almacenamiento, la infraestructura de red y el despliegue del modelo sigan requiriendo una escala muy grande.
El dato que encabeza la descripción de Inkling es su tamaño total: 975.000 millones de parámetros, una cifra que, según el propio texto, está lo bastante cerca del billón como para que la diferencia sólo le importe a los contables. El dato más relevante, sin embargo, es el que lo acompaña: apenas 41.000 millones de parámetros se activan por cada token procesado. Dicho de otro modo, el modelo posee una capacidad total enorme, pero cualquier palabra individual que atraviesa la red sólo llega a tocar en torno al 4,2% de esa capacidad.
Para explicar cómo funciona este mecanismo, el correo recurre a una analogía: imaginar una universidad con 256 departamentos especializados en cada planta relevante. Cuando llega un token, no se convoca a toda la universidad para atenderlo. En su lugar, un "despachador" (dispatcher) elige seis departamentos que parecen útiles para ese token concreto, añade dos departamentos de propósito general que intervienen siempre, combina el trabajo de todos ellos y continúa con el siguiente token. Como ejemplo de esta especialización dinámica, el texto menciona que una línea de código en Python podría convocar a un conjunto de especialistas distinto al que convocaría una frase en griego, la etiqueta de un diagrama o un fragmento de audio.
El cuerpo del correo recibido está incompleto (corta justo después de estos ejemplos, antes de continuar la explicación técnica), por lo que no se dispone de más detalles sobre la arquitectura, el rendimiento en benchmarks, el laboratorio o equipo detrás de Inkling, ni sobre comparativas con otros modelos de mezcla de expertos (MoE) como los de la competencia. En general, este tipo de diseño de "mixture-of-experts" con enrutamiento por token es una tendencia consolidada en el sector para modelos de gran escala, ya que permite escalar la capacidad total del modelo sin disparar proporcionalmente el coste computacional por inferencia, aunque esto es contexto general del sector y no una afirmación específica hecha en el correo sobre Inkling.
🔗 Relacionadas en Zendoric
- Thinking Machines, el laboratorio de Mira Murati, lanza Inkling: un modelo abierto de 975.000 millones de parámetros · 2026-07-17
- El nuevo cuello de botella de la IA no está en el modelo: está en lo que somos capaces de imaginarle · 2026-06-24
- Anthropic acusa a Alibaba de clonar Claude: la propiedad del talento de la IA entra en disputa geopolítica · 2026-06-26


