miércoles, 29 de julio de 2026

Kimi K3 - Informe Técnico

 
 

Este informe técnico presenta Kimi K3, un modelo masivo de "mezcla de expertos" (Mixture-of-Experts, MoE) con 2,8 billones de parámetros, diseñado para impulsar la frontera de la inteligencia artificial de código abierto. Este modelo cuenta con una ventana de contexto de un millón de tokens y capacidades multimodales nativas, lo que le permite procesar texto, imágenes y videos dentro de un único marco. Su arquitectura utiliza la Atención Delta de Kimi y los Residuos de Atención para mejorar el flujo de información a través de secuencias largas y capas de red profundas. Para maximizar la eficiencia, Stable LatentMoE activa solo 104 mil millones de parámetros por token, logrando una mejora significativa en la escalabilidad con respecto a su predecesor. El desarrollo de Kimi K3 implicó un extenso aprendizaje por refuerzo en los dominios de codificación, razonamiento y agentes para permitir una ejecución de tareas robusta y a largo plazo. Si bien se sitúa ligeramente por detrás de los sistemas propietarios más potentes, Kimi K3 supera a otros modelos abiertos y se publica para facilitar la investigación global en IA.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "KIMI K3: OPEN FRONTIER INTELLIGENCE", por el Equipo Kimi. Publicado el 27 de Julio de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Si miramos la historia de la ingeniería humana, básicamente cualquier tipo de ingeniería humana, casi siempre hay un límite físico sobre cuánto puedes escalar algo.

Alicia
Claro. Absolutamente.

Beto
Por ejemplo, si quisieras construir un rascacielos más alto, no puedes seguir apilando acero. Eventualmente, la cimentación simplemente se derrumba bajo su propio peso.

Alicia
Simplemente colapsa.

Beto
Exacto. Y durante mucho tiempo, construir inteligencia artificial se sintió exactamente igual. Quieres un modelo más inteligente. Simplemente le echas más parámetros, consumes mucha más energía, y básicamente rezas para que el centro de datos no se derrita.

Alicia
Más o menos, lo cual, no es realmente sostenible.

Beto
No, no lo es. Pero hoy, en este análisis profundo, estamos viendo un sistema que destroza completamente toda esa ecuación. Y ese es el informe técnico para Kimi K3.

Alicia
Sí. Y tengo que decir que este es un cambio fundamental en la forma en que abordamos la escala. Quiero decir, durante años, la comunidad de código abierto se ha estancado justo alrededor de esa marca de un millón de parámetros.

Beto
Sí. Estábamos empezando a preocuparnos un poco.

Alicia
Había una preocupación muy real de que los modelos cerrados (proprietary) simplemente iban a ir infinitamente por delante solo porque tenían la capacidad de cómputo masiva requerida para forzar su camino hacia una inteligencia superior.

Beto
Claro. Simplemente tirando dinero contra la pared.

Alicia
Exacto. Pero Kimi K3 realmente cambia esa dinámica porque este es un modelo de código abierto con 2.8 billones de parámetros que compite directamente con los gigantes propietarios. Estamos hablando de modelos como Claude Fable 5 y, GPT 5.6 Sol.

Beto
Lo cual es alucinante de pensar.

Alicia
Realmente lo es. Y lo gestiona escalando simultáneamente en dos accesos muy distintos.

Beto
Claro. Así que escala la base preentrenada como la base de conocimiento bruta. Pero el informe técnico enfatiza realmente este segundo eje, que es el razonamiento en tiempo de prueba ("test time reasoning").

Alicia
Sí. Y el resultado que citan allí es bastante asombroso. Están afirmando una mejora de 2.5 veces en la eficiencia general de la escala en comparación con su generación anterior, Kimi K2.

Beto
Lo cual vamos a entrar porque nuestro plano para hoy es explorar exactamente cómo construyeron este coloso de 2.8 billones de parámetros. Veremos cómo lo entrenaron dentro. Literalmente millones de entornos virtuales microscópicos, algunos estudios de caso alucinantes de lo que realmente puede hacer. Y finalmente, cómo lograron hacerlo lo suficientemente barato como para usarlo.

Alicia
Definitivamente hay mucho material que cubrir.

K3_Model_Innovation_and_Benchmarks_1024.png
Kimi K3: Una Nueva Frontera en Inteligencia de Código Abierto

Beto
Lo hay. Así que, bien, desglosémoslo primero, el número de 2.8 billones.

Para entender cómo Kimi K3 alcanza ese nivel de rendimiento fronterizo, tenemos que mirar dentro de su arquitectura, ¿verdad?

Alicia
Claro.

Beto
Porque el informe señala que de esos 2.8 billones de parámetros, solo 104 mil millones están realmente activos en cualquier momento. Y quiero decir, sé que esto se basa en una mezcla de arquitecturas de expertos ("mixture of experts", MoE), pero ¿cómo desactiva exactamente una IA el 96% de su propio cerebro?

Alicia
Bueno, si miras un modelo denso tradicional, cada parámetro se dispara por cada palabra que le introduces.

Beto
Lo cual suena agotador.

Alicia
Es computacionalmente agotador y altamente ineficiente. Así que una "mezcla de expertos", o MoE, divide la red neuronal en subredes especializadas. Siempre que introduces un "token" de texto, un mecanismo de enrutamiento evalúa ese "token" y decide qué expertos específicos están mejor equipados para procesarlo. Kimi K3 utiliza esta cosa que llaman "MoE latente estable" ("stable latent MoE").

Beto
Claro. MoE latente estable.

Alicia
Sí. Y presenta unos expertos enrutados sin precedentes de 896, pero, y esta es la clave, solo activa 16 de ellos por "token".

Beto
Ok. Así que si pensamos en el modelo como un hospital hiperespecializado masivo, no enviarías a un paciente con una afección cardíaca muy específica para ver al podólogo, al neurólogo y al dentista.

Alicia
Claro. Eso sería una gran pérdida de tiempo.

Beto
Así que el enrutador actúa como este recepcionista increíblemente eficiente, dirigiendo instantáneamente ese "token" a los 16 especialistas exactos que necesita para ese síntoma específico, evitando por completo a los cientos de otros médicos que simplemente no son relevantes para el problema.

Alicia
Esa es una gran manera de verlo. Pero desde un punto de vista de ingeniería, gestionar un hospital con 896 departamentos hiperespecializados suele causar que todo el sistema se desestabilice.

Beto
Espera, ¿en serio? ¿Por qué?

Alicia
Bueno, cuando empujas el MoE a esa magnitud, las actualizaciones matemáticas durante el entrenamiento se vuelven muy extrañas. Los números que se multiplican se en cascada. Y obtienes estas activaciones internas que simplemente explotan en tamaño.

Beto
Vaya.

Alicia
Sí, se vuelven demasiado grandes para los registros de memoria. Y esencialmente rompe el modelo.

Beto
Así que los números literalmente crecen hasta que el software se bloquea.

Alicia
Más o menos. Sí.

Beto
Entonces, ¿cómo diablos logró estabilizarlo el equipo de Kimi entonces? Porque sé que el informe menciona una función personalizada llamada "SiTU-GLU", que honestamente suena como un adhesivo industrial.

Alicia
Lo cual es gracioso porque esencialmente funciona como uno. Realmente mantiene las matemáticas de la red juntas.

Beto
Oh, ¿en serio?

Alicia
Sí. "SiTU-GLU" es una función de activación especializada. Y está diseñada para limitar suavemente el crecimiento de esos valores grandes de los que estábamos hablando.

Beto
Ok. Como un regulador en un motor, más o menos así.

Alicia
Exacto. Evita que las matemáticas internas se salgan de control. Pero crucialmente, lo hace sin aplanar las respuestas lineales sutiles que el modelo realmente necesita aprender todos los matices de los datos.

Beto
Correcto. Porque si simplemente aplastas toda la matemática, no aprenderá nada.

Alicia
Exacto. Y emparejan esa función SiTU-GLU con una técnica llamada "equilibrio de cuantiles" ("quantile balancing", QB).

Beto
Claro. Porque si volvemos a la analogía del hospital, todo se desmorona si el recepcionista simplemente envía a cada paciente a los mismos tres cardiólogos, ¿verdad?

Mientras que los otros 893 médicos simplemente están sentados en sus oficinas jugando al solitario.

Alicia
Claro. Jugando al solitario y quemando horas caras de GPU. Así que el equilibrio de cuantiles es este algoritmo que forza al enrutador a distribuir los "tokens" de manera uniforme entre todos los expertos disponibles. Asegura que ningún parámetro individual se sobrecargue y que ningún poder de cómputo esté simplemente tirado y siendo desperdiciado.

Beto
Eso tiene todo el sentido. Y esa combinación es lo que hace que una arquitectura de 896 expertos funcione sin colapsar en un caos total.

Alicia
Precisamente.

Beto
Ok. Así que eso cubre esta magnitud de poder de procesamiento.

Pero quiero cambiar de tema a su memoria porque Kimi K3 presenta una ventana de contexto de 1 millón de "tokens".

Alicia
Lo cual es masivo.

Beto
Lo es. Para ti, que estás escuchando, eso es básicamente equivalente a alimentar al modelo con varias novelas masivas a la vez y luego esperar recordar literalmente todo.

Alicia
Sí.

Beto
El informe detalla este sistema híbrido de atención y combina KDA y MLA ("Gated Multi-Head Latent Attention"). Así que ¿por qué necesitan dos sistemas de memoria totalmente diferentes solo para leer un documento largo?

Alicia
Buena pregunta. Es porque los mecanismos de memoria tradicionales, como la forma en que un modelo presta atención a lo que dijiste al principio de una instrucción ("prompt"), se vuelven exponencialmente más lentos y más exigentes en memoria a medida que el texto se hace más largo.

Beto
Como que se atasca.

Alicia
Exacto. Así que para resolver esto, Kimi K3 utiliza un enfoque híbrido. El primer componente es la "atención Delta de Kimi" ("Kimi Delta Attention" , o KDA).

Beto
Ok.

Alicia
Este está altamente optimizado para mezclas de secuencias largas. Básicamente comprime la información pasada en un estado matemático de tamaño fijo.

Beto
Ah. Así que es como mantener un resumen en curso de un libro mientras lo lees.

Alicia
Sí. Y es increíblemente eficiente porque no tiene que mantener cada palabra y memoria activa a medida que el libro se hace más largo y más largo.

Beto
Pero el defecto obvio ahí es que si comprimes el texto en un resumen, vas a perder la frase exacta, o detalles muy específicos.

Alicia
Definitivamente lo haces. Lo cual es exactamente por lo que intercalan KDA con el segundo sistema: "Atención latente de múltiples cabezales activada" ("Gated Multi-Head Latent Attention" o MLA).

Beto
Ok. ¿Qué hace MLA?

Alicia
MLA actúa como la capa de interacción global. Así que mientras el sistema KDA está rastreando la trama y el flujo general de ese libro de mil páginas, el sistema MLA está actuando como un índice muy preciso.

Beto
Vaya.

Alicia
Sí. Permite al modelo recordar instantáneamente un factor o cita directa muy específico de la página uno, incluso cuando estás procesando, digamos, la página 1000.

Beto
Así que al combinarlos, obtienes la eficiencia computacional de KDA ...

Alicia
... y el recuerdo perfecto de MLA.

Beto
Exacto.

Alicia
Es solo una solución brillantemente elegante.

Beto
Ahora, mientras miramos la arquitectura subyacente aquí, había un detalle con respecto a las capacidades de visión del modelo que realmente captó mi atención.

Alicia
Oh, el codificador de visión nativo.

Beto
Sí. Así que Kimi K3 es multimodal de forma nativa, ¿verdad? Procesa texto, imágenes y video todo dentro de la misma red neuronal. Pero entrenaron su codificador de visión nativo, que llaman MoonViT-V2, completamente desde cero.

Alicia
Lo hicieron.

Beto
Lo cual es extraño porque pensé que la práctica industrial estándar era tomar un modelo de visión preentrenado, como SigLip, y básicamente pegarlo al modelo de lenguaje para obtener una ventaja inicial. ¿Por qué diablos tirarían una ventaja inicial así y empezar desde cero?

Alicia
Porque tomar ese atajo realmente estaba creando un cuello de botella muy severo para ellos.

Beto
¿En serio?

Alicia
Sí. El informe señala que cuando los investigadores tomaron un modelo de visión preentrenado e intentaron alinearlo con un modelo de lenguaje masivo, el proceso de optimización conjunto simplemente causó picos de gradiente masivos.

Beto
¿Así que los dos sistemas se estaban peleando?

Alicia
Exacto.

Beto
Pero ¿por qué pelean? ¿No están procesando datos al final del día?

Alicia
Bueno, lo están, pero están mapeando el mundo de maneras completamente diferentes. Quiero decir, piénsalo. Un modelo de visión preentrenado ha aprendido a interpretar la geometría de los píxeles crudos, ¿verdad? Mientras que un modelo de lenguaje ha aprendido a interpretar la gramática y la semántica abstractas. Así que cuando los forzas a actualizar sus pesos juntos, sus mapas matemáticos básicamente entran en conflicto entre sí.

Beto
Oh, ¿entonces literalmente no están hablando el mismo idioma?

Alicia
Exacto. Así que al descartar los modelos preentrenados y entrenar MoonViT-V2 desde cero, usando la simple predicción del siguiente "token", las representaciones visuales fueron moldeadas directamente por el objetivo de modelado de lenguaje desde el primer día.

Beto
Vaya. Así que la corteza visual aprendió a ver el mundo directamente a través de la lente del lenguaje.

Alicia
Sí. Y eso mantuvo el proceso de aprendizaje suave y eliminó por completo esos peligrosos picos de optimización.

Beto
Así que básicamente construyeron la corteza visual desde cero solo para asegurarse de que hablara exactamente el mismo dialecto que el centro del lenguaje.

Alicia
Exacto.

Beto
Eso tiene perfecto sentido cuando realmente miras la mecánica de ello. Pero sabes, tener un cerebro estable masivo es solo la mitad de la batalla aquí, porque enseñar a un modelo a ejecutar tareas complejas de múltiples pasos no se trata solo de darle artículos de Wikipedia y esperar que sea más inteligente, ¿verdad?

Alicia
Sí. Y si conectamos esto con la imagen más grande, aquí es donde realmente entramos en ese segundo eje de escalado que mencionamos antes, el cómputo en tiempo de prueba ("test time computation").

Beto
Ok. Sigamos.

Alicia
Así que durante la fase de post-entrenamiento, Kimi K3 es enseñado a través de aprendizaje por refuerzo, aprendiendo a usar lo que llaman "presupuestos de pensamiento" ("thinking budgets").

Beto
¿Presupuesto de pensamiento?

Alicia
Sí. Se clasifican como esfuerzo bajo, alto o máximo. Así que en lugar de solo predecir la siguiente palabra más probable como los modelos antiguos, realmente aprende a hacer una pausa. Razona iterativamente a través de un problema. Utiliza herramientas externas, escribe código y, crucialmente, verifica su propio trabajo antes de que emita una respuesta final al usuario.

Beto
La infraestructura que construyeron para enseñar este razonamiento es asombrosa para mí. No solo les dieron cuestionarios basados en texto a la IA. Su junta dice que construyeron un entorno de ejecución de máquina virtual micro, llamado "AgentENV".

Alicia
Sí, AgentENV.

Beto
Y a lo largo del entrenamiento, montaron más de 51 millones de estas sandboxes microscópicas, como 51 millones de entornos de matriz independientes para que la IA pudiera practicar.

Alicia
Es masivo. Y tienes que recordar, estos no son aventuras de texto simuladas estáticas. Son entornos de cómputo en vivo. El agente podría tener la tarea de buscar en internet en vivo, o escribir un script de Python, montar un disco virtual, iniciar un contenedor Docker.

Beto
Pero entrenar una IA a través de miles de pasos en una sandbox en vivo introduce un problema de infraestructura realmente importante, ¿no? Como el tiempo inactivo ("idle time").

Alicia
Oh, absolutamente.

Beto
Porque si la IA escribe un pedazo de código y ordena a la máquina virtual que lo ejecute, la IA tiene que simplemente quedarse allí y esperar a que el código se ejecute.

Alicia
Sí. Simplemente tienes estas GPU masivas e increíblemente caras haciendo absolutamente nada mientras esperan a que una CPU virtual termine de compilar un "script".

Beto
Lo cual es una pesadilla. Pero el informe detalla este método de despliegue parcial para resolverlo. Es casi como un jugador guardando su progreso justo antes de una pelea contra el jefe.

Alicia
Esa es una analogía muy buena.

Beto
Porque algunas de estas tareas complejas del agente toman miles de pasos, el sistema de Kimi pausa la máquina virtual, justo en el milisegundo en que está esperando a que el modelo piense. Y consume cero potencia de CPU mientras está pausada.

Alicia
Y lo realmente impresionante allí es la velocidad de reanudación. Cuando el modelo está listo con su siguiente movimiento, la sandbox se reanuda perfectamente en solo 49 milisegundos.

Beto
49 milisegundos.

Alicia
Sí. Quiero decir, normalmente despertar una máquina virtual pausada es súper lento porque tienes que cargar de nuevo todo el estado del sistema operativo en la memoria activa. Pero el equipo de Kimi evitó esas pesadas capas del SO para congelar y descongelar el estado exacto de la CPU casi instantáneamente.

Beto
Eso es una locura.

Alicia
Lo es. Y ese tiempo de reanudación de 49 milisegundos es honestamente lo que hace que el entrenamiento a través de 51 millones de entornos sea económicamente viable en primer lugar.

Beto
Y les permite entrenar en lo que el informe llama "problemas verificables".

Alicia
¿Por qué?

Beto
Bueno, la IA no estaba siendo calificada por un humano o incluso por otra IA actuando como juez de su tono. Se introdujo en entornos donde realmente tenía un código correcto, lo ejecuta y ve la salida visual física.

Alicia
Sí. Si se le pedía renderizar un gráfico específico y la salida estaba totalmente en blanco, la IA tenía que leer literalmente el registro de errores, reescribir su propio código e intentarlo de nuevo hasta que un verificador determinista oculto confirmara que el objetivo había sido físicamente alcanzado.

Beto
Esto se siente como un cambio crucial para el usuario final. Porque cuando estás interactuando con Kimi K3, no solo estás hablando con un motor estadístico que sabes leer internet. Estás utilizando un trabajador digital que ya ha practicado tener éxito en tu entorno de codificación exacto millones de veces.

Alicia
Exacto. Aprende un bucle general de hipótesis, acción, análisis de retroalimentación y adaptación de su estrategia.

Beto
Así que básicamente ha dominado estos juegos de escape virtuales. Pero quiero decir, ser bueno en la asimilación no significa necesariamente que pueda sobrevivir al mundo real desestructurado y caótico. Así que ¿qué pasó cuando realmente le dieron una tarea de ingeniería real?

Alicia
Bueno, aquí es donde se pone realmente interesante porque las secciones de referencia de este informe son bastante densas, pero las evaluaciones de codificación realmente destacaron.

Beto
Sí. Veamos el maratón SWE.

Alicia
Ok. Así que el maratón SWE no es una prueba de escribir simples scripts de Python, ¿verdad? Es una suite de optimización de hardware de bajo nivel muy difícil. Está completamente enfocada en los "kernels" de GPU.

Beto
Lo cual es material muy avanzado.

Alicia
Extremadamente. Y Kimi K3 obtuvo un 42% en esto.

Beto
Lo cual suena bajo para un lego, pero eso es realmente enorme, ¿verdad?

Alicia
Es masivo. Eso está a siete puntos completos por delante de Claude Fable 5. Está demostrando una aptitud muy real para la ingeniería de sistemas complejos y pesados.

Beto
Y el estudio de caso que realmente prueba ese punto es el compilador de GPU. Porque los investigadores de IA estándar a menudo usan marcos existentes como PyTorch para ejecutar sus modelos. Pero Kimi K3 construyó autónomamente un compilador de GPU tipo Triton completo desde cero, al que llamaron "Mini Triton".

Alicia
Sí, escribió el "front-end" de Python, las capas de optimización, la tubería de generación de código.

Beto
Y lo loco es que el compilador construido realmente se ejecutó más rápido y superó a las líneas base industriales escritas por humanos.

Alicia
Es realmente impresionante.

Beto
Pero construir software es una cosa. Cuando leí la sección sobre ello, diseñar hardware real como un chip de IA literal, honestamente tuve que leerla dos veces. ¿Cómo es eso posible?

Alicia
Es posiblemente el momento destacado de todo el informe técnico. Así que operando dentro de una de esas sandboxes AgentENV, de las que hablamos, Kimi K3 recibió 48 horas de tiempo de ejecución autónomo. Y se le encargó diseñar un prototipo de chip de inferencia funcional para un modelo de IA nano.

Beto
Simplemente se dejó a su suerte por dos días.

Alicia
Sí. Y para hacer esto, utilizó herramientas de automatización de diseño electrónico de código abierto.

Beto
Y cerró con éxito el tiempo ("timing") a 100 megahertz mientras integraba 1.46 millones de celdas estándar, lo cual vamos a traducir para el oyente por un segundo. Las celdas estándar son esencialmente las puertas lógicas fundamentales, ¿verdad? Como los ladrillos de Lego digitales que componen un microchip.

Alicia
Exacto.

Beto
Así que Kimi K3 organizó 1.46 millones de estos ladrillos de Lego microscópicos perfectamente. Y cerrar el tiempo a 100 megahertz significa que diseñó las vías físicas tan perfectamente que la electricidad puede viajar exitosamente a través de las 1.46 millones de compuertas 100 millones de veces por segundo sin un solo atasco de tráfico o fallo de señal.

Alicia
Eso es acertado. Esencialmente diseñó la arquitectura de silicio física para un chip de IA funcional, en dos días, por sí solo.

Beto
Pero capacidades como esa levantan alarmas inmediatamente, ¿no?

Alicia
Oh, claro.

Beto
Si puede diseñar arquitecturas de silicio y escribir compiladores complejos, la siguiente pregunta que cualquier ingeniero de sistemas hace es, bueno, ¿qué puede hackear?

Alicia
Y esa es una pregunta muy crítica. El informe incluye de hecho una evaluación independiente exhaustiva del Instituto de Seguridad de IA del Reino Unido y del Centro de Estándares e Innovación de IA del NIST. Querían proporcionar una visión equilibrada de sus capacidades y dominios de alto riesgo.

Beto
Y, ¿qué encuentran?

Alicia
La evaluación revela una línea muy distinta en lo que el modelo puede y no puede hacer. Así que Kimi K3 es fenomenal en lo que los profesionales de la seguridad llaman tareas defensivas de primer nivel ("tier one"). Esto es descubrimiento de vulnerabilidades.

Beto
Básicamente encontrar los agujeros en la armadura.

Alicia
Exacto. Cuando se desata en software real y ampliamente desplegado, Kimi K3 descubrió 16 vulnerabilidades desconocidas previamente. Días cero ("zero days").

Beto
Vaya.

Alicia
Sí, incluida una variante grave de "dirty cow" en el núcleo Linux.

Beto
Y por contexto, "dirty cow w" es un "exploit" de escalamiento de privilegios. Es básicamente una falla que permite a un usuario de bajo nivel estándar engañar al sistema para que le conceda acceso de "root", convirtiendo efectivamente una cuenta de invitado en el administrador del sistema. Así que encontrar una variante totalmente nueva de eso en un núcleo Linux endurecido y maduro como el kernel es un logro masivo para un sistema automatizado.

Alicia
Realmente lo es. Sin embargo, los evaluadores notaron que cuando las tareas cambian a nivel dos ("tier two"), que es el desarrollo de exploits de extremo a extremo en objetivos endurecidos, el modelo tiene grandes dificultades.

Beto
Lo cual es interesante. ¿Por qué le cuesta escribir el exploit si puede identificar perfectamente la vulnerabilidad en primer lugar?

Alicia
Porque carece del giro intuitivo que hace un hacker humano de élite. Cuando un humano intenta un ataque complejo de secuestro de flujo de control y falla, inmediatamente retrocede y busca, digamos, un ataque de datos más simple.

Beto
Se adapta.

Alicia
Claro. Pero la evaluación mostró que Kimi K3 tiende a tener una visión de túnel. Se queda atrapada en estos bucles de depuración prolongados, básicamente tratando obstinadamente de forzar una mala estrategia a funcionar en lugar de pivotar hacia un nuevo enfoque.

Beto
Sí. Un poco rígido.

Alicia
Sí. Demuestra que, si bien estos modelos fronterizos son herramientas increíblemente poderosas para que los defensores auditen su código, todavía hay una brecha observable significativa entre la IA y los expertos en seguridad humana cuando se trata de explotación de extremo a extremo autónoma.

Beto
Así que es un excelente detector, pero todavía no puede correr todo el circuito por sí solo.

Y conocer sus límites es tan importante como conocer sus fortalezas. Pero entender todo esto nos lleva a un obstáculo logístico realmente masivo.

Alicia
El costo.

Beto
Sí. El elefante en la habitación. Tenemos este modelo increíblemente capaz de 2.8 billones de parámetros con una memoria de 1 millón de "tokens". Ejecutar un modelo de ese tamaño suena como una pesadilla de infraestructura.

Alicia
Sin duda lo es.

Beto
Porque si tú, como usuario, alimentas a este modelo de código de 400,000 "tokens". Y luego le haces una pregunta de seguimiento simple. ¿No tiene que releer literalmente toda la base de código de 400,000 "tokens" solo para responderte? El costo de cómputo de hacerlo cada vez sería deudor a cualquiera que intente usarlo.

Alicia
Y has identificado el problema exacto que impide que la mayoría de las organizaciones utilicen modelos de contexto largo en su flujo de trabajo diario en este momento. Pero el equipo de Kimi diseñó una solución realmente elegante detallada en el informe. Y lo llaman "caché de prefijo consciente de KDA" ("KDA-aware Prefix Caching").

Beto
Ok. Entonces, ¿cómo interactúa ese sistema de caché con la memoria híbrida de la que hablamos antes, tal como los resúmenes KDA y el recuerdo exacto de MLA?

Alicia
Bueno, es una proeza de ingeniería bastante compleja porque la caché tiene que gestionar ambos sistemas simultáneamente. Tiene que guardar el estado de retorno fijo de la KDA, el resumen en curso. Y también tiene que guardar la caché creciente de punteros de índice MLA específicos.

Beto
Claro.

Alicia
Así que cuando haces esa pregunta de seguimiento, el sistema no relee los 400,000 "tokens" de código.

Beto
Oh, es como congelar un videojuego en medio de una explosión masiva.

Alicia
¿Qué quieres decir?

Beto
Como cuando despausas el juego una semana después, la consola no tiene que recalcular la física de todo el nivel hasta ese momento.

Alicia
Claro.

Beto
Sí. Simplemente carga el estado matemático exacto de cada trozo de metralla en ese milisegundo exacto.

Alicia
Esa es una forma muy precisa de visualizarlo. Sí.

La caché de prefijo busca y recuerda instantáneamente el estado matemático exacto del modelo al final de tu último "prompt". Tanto el resumen KDA como las memorias específicas MLA se restauran simultáneamente.

Beto
Lo cual permite al modelo reanudar el procesamiento con contexto perfecto, pero usando una pequeña fracción del poder de cómputo.

Alicia
Exacto. Y combinaron esta eficiencia por solicitud con la eficiencia masiva de hardware durante la fase de entrenamiento a través de una innovación que llaman "MoonEP".

Beto
MoonEP. ¿Qué hace?

Alicia
Bueno, cuando tienes 896 expertos repartidos en cientos de GPU distintas, normalmente te encuentras con atascos de tráfico. Algunas GPU terminan su tarea rápidamente y simplemente se quedan inactivas esperando que otras GPU se pongan al día.

Beto
Lo cual nuevamente quema dinero.

Alicia
Claro. Así que MoonEP es un algoritmo de distribución que garantiza una distribución de "tokens" perfectamente equilibrada a través de todas las GPU. Cada chip realiza exactamente la misma cantidad de trabajo. Y crucialmente, logran esto a través de comunicación de copia cero ("zero copy communication").

Beto
Significa que los datos van exactamente donde deben ir sin que el sistema tenga que crear archivos duplicados y desperdiciados en la memoria del sistema, solo para transferir.

Alicia
Exacto.

Beto
Así que eliminaron por completo los atascos de tráfico dentro del superordenador. Y podemos ver el resultado de toda esta magia de infraestructura, la caché, el equilibrio de carga, los tiempos de resonancia de 49 milisegundos. Lo vemos en la gráfica de eficiencia de costos.

Alicia
Sí, los números son impactantes.

Beto
Aquí es donde la ingeniería se traduce realmente en valor para el usuario real. Porque en puntos de referencia de agentes complejos como BrowseComp, Kimi K3, se utiliza puntuaciones de primer nivel de 91.2%. Y lo hace por, aproximadamente, $2 por tarea.

Alicia
Sí, y para ponerlo en perspectiva, $2 es aproximadamente la mitad del costo de ejecutar la misma tarea en GPT 5.6. Y literalmente una orden de magnitud más barato que Claude Fable 5.

Beto
Estamos hablando de inteligencia de nivel fronterizo que ya no está bloqueada detrás de costos astronómicos de API.

Alicia
Lo cual realmente resalta la implicación más amplia de este lanzamiento. Quiero decir, esto plantea una pregunta importante. Cuando democratizas el acceso a un sistema de código abierto que puede cazar vulnerabilidades de día cero en el núcleo Linux, construir compiladores de GPU personalizados que superan las líneas base humanas y orquestar flujos de trabajo masivos de múltiples pasos por $2 por tarea, ...

Beto
... Fundamentalmente cambias el equilibrio de poder en el ecosistema tecnológico.

Alicia
Absolutamente. Mueve la inteligencia fronteriza del dominio exclusivo de unas pocas megacorporaciones directamente a las manos de investigadores, startups y desarrolladores independientes.

Beto
Es masivo.

Así que hemos cubierto una cantidad realmente grande de material hoy. Vimos cómo Kimi K3 escala hasta 2.8 billones de parámetros sin colapsar usando esa función "SiTU-GLU" para limitar la matemática y el equilibrio de cuantiles para distribuir la carga.

Alicia
Claro.

Beto
Desglosamos cómo realmente aprende a razonar a través del cómputo en tiempo de prueba dentro de 51 millones de sandboxes de VM micro, iterando y verificando su código hasta que tiene éxito. Vimos sus capacidades e ingeniería de sistemas y diseño de chip mientras reconocemos sus límites actuales de visión de túnel en ciberseguridad ofensiva.

Alicia
Sí, la distinción entre primer nivel y segundo nivel.

Beto
Exacto. Y finalmente, exploramos la magia de infraestructura como la caché de prefijo y la comunicación de copia cero que básicamente lo hace lo suficientemente asequible para el uso diario.

Alicia
Es realmente un ejemplo profundo de co-diseñar el algoritmo y los sistemas de hardware subyacentes para básicamente romper lo que pensábamos que eran los límites físicos de la escalabilidad.

Beto
Lo cual nos trae de vuelta a esa analogía del rascacielos con la que empezamos. Antes pensábamos que escalar la inteligencia era como apilar más acero. Eventualmente, el peso puro de los parámetros simplemente aplastaría el sistema. Pero Kimi K3 demuestra que puedes construir de manera diferente: Puedes construir de manera más inteligente, no solo más grande.

Alicia
Sí, absolutamente.

Beto
Y quiero dejarte una última reflexión para meditar mientras cerramos este informe. Vimos cómo Kimi K3 diseñó autónomamente las compuertas lógicas físicas para un chip de inferencia de IA nano funcional en solo 48 horas. Entonces, ¿qué pasa en la próxima generación?

Alicia
Oh, hombre.

Beto
Claro. ¿Qué pasa cuando le pedimos a una IA que diseñe el hardware físico altamente especializado necesario para entrenar a su sucesor?

Cuando el software comienza a optimizar independientemente el silicio físico en el que se ejecuta, ¿qué tan rápido se convierte la línea de tiempo de la innovación?

Alicia
Eso introduce un bucle de retroalimentación que desafía por completo la física convencional.

Beto
Realmente lo hace. Es algo para pensar.

Muchas gracias por acompañarnos en este análisis profundo. Sigan explorando las fuentes. Sigan cuestionando los mecanismos detrás de la tecnología y sobre todo, sigan siendo increíblemente curiosos. Los encontraremos la próxima vez.