Mostrando entradas con la etiqueta CoT. Mostrar todas las entradas
Mostrando entradas con la etiqueta CoT. Mostrar todas las entradas

martes, 3 de febrero de 2026

Razonamiento, Adaptabilidad, Eficiencia y Ética de LLMs

 
 

Este trabajo de investigación ofrece un estudio exhaustivo de los Modelos de Lenguaje de Gran Tamaño (LLM), rastreando su evolución desde los primeros transformadores hasta sistemas sofisticados como GPT-5. Los autores evalúan metodologías esenciales como la inducción de la cadena de pensamiento (CoT), el ajuste de instrucciones y el aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) para explicar cómo las máquinas imitan el razonamiento humano y siguen instrucciones complejas. Una parte significativa del texto aborda la transición tecnológica hacia los Modelos Multimodales (MLM) y la IA Agéntica, que permiten a los sistemas autónomos procesar diversos tipos de datos, como imágenes y audio. El estudio examina en mayor profundidad la eficiencia operativa mediante arquitecturas como la Mezcla de Expertos (MoE), que optimiza los recursos computacionales mediante la activación de subredes especializadas. Finalmente, las fuentes destacan desafíos éticos críticos, enfatizando la necesidad de mitigar sesgos y establecer marcos transparentes para garantizar que la IA siga siendo segura y socialmente responsable.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Advances in LLMs with Focus on Reasoning, Adaptability, Efficiency, and Ethics", por Asifullah Khan y colegas. Publicado el 22 de Enero del 2026.

El resumen, la transcripción, la traducción, y las voces, fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.

Escúchalo aquí, y/o lee la transcripción (abajo):

O escúchalo en Spotify.


Transcripción

Beto
Bienvenido de nuevo a otro análisis profundo. Sabes, esta mañana estaba mirando mi calendario: Febrero de 2026. Y tuve esta sensación de vértigo. ¿A ti te pasa eso alguna vez?

Alicia
Oh, absolutamente.

Beto
Da la sensación de que vivimos dentro de una novela de ciencia ficción que alguien escribió en pánico hace como cinco años.

Alicia
Sí. Y la tinta todavía está fresca.

Beto
Correcto. Quiero decir, tenemos GPT-5 funcionando en el trasfondo de nuestros sistemas operativos. Gemini 2.5 está en todo, desde nuestros teléfonos hasta nuestras neveras.

Alicia
Estamos discutiendo con naturalidad sobre IA agentiva, ...

Beto
Sí, cosas que básicamente pueden dirigir un pequeño negocio mientras dormimos.

Alicia
Es realmente salvaje cuando haces zoom out. Hemos normalizado cosas que técnicamente eran imposibles o al menos pensábamos que estaban a décadas de distancia hasta hace pocos años.

Beto
La velocidad del cambio ha sido implacable.

Alicia
Implacable es la palabra correcta.


Cronología de LLMs - Desde el Transformador a gran escala (GPT-3), hasta el razonamiento multimodal (Gemini-2.5) y la inteligencia agentiva (GPT-5)

Beto
Y por eso quise sacar este artículo de revisión específico hoy. Se titula "Avances en LLMs con enfoque en razonamiento, adaptabilidad, eficiencia y ética", por Khan y sus colegas.

Alicia
Un trabajo enorme. Fue publicado recientemente.

Beto
Sí. Y, honestamente, leerlo se sintió como mirar los planos del mundo en el que vivimos ahora mismo. Conecta todos los puntos sobre cómo pasamos, de esos primeros chatbots que daban alucinaciones, a los motores de razonamiento de los que realmente dependemos.

Alicia
Y lo que me encanta de él, y por qué es tan bueno para una inmersión profunda, es que el equipo de Khan no nos da solo una línea de tiempo. Realmente diseccionan la anatomía de estos modelos.

Beto
Eso es mucho.

Alicia
Desglosan cómo estos sistemas desarrollaron un “cerebro” para razonar, “sentidos” para ver y oír. Y esto es lo realmente delicado: una “conciencia” para la ética.

Beto
Me encanta ese marco: cerebro, sentidos, conciencia. Porque, francamente, creo que muchos de nosotros usamos estas herramientas todos los días. Usamos las funciones de chain-of-thought, los agentes, ...

Alicia
Pero es como magia.

Beto
Es magia. Y escribimos en la caja, el genio concede el deseo. Hoy quiero tratarlo como mecánica. Quiero abrir el capó y ver qué conecta con qué.

Alicia
Vamos. De verdad necesitamos pasar de “simplemente funciona” a entender la maquinaria, porque la maquinaria es fascinante. Y entenderla te ayuda a usarla mucho mejor.

El Cerebro

Beto
Bien. Empecemos por el cerebro.

El artículo llama a esto "la revolución del razonamiento". Y para apreciarlo de verdad, tienes que recordar de dónde partimos. No hace tanto tiempo, 2022, 2023, tal vez, los escépticos estaban descartando estas cosas como loros estocásticos.

Alicia
¿Verdad? Esa famosa frase de Bender y sus colegas. Y mira, no estaban totalmente equivocados en ese momento. El argumento era que estos modelos eran solo máquinas de imitación.

Beto
Simplemente adivinando la siguiente palabra.

Alicia
Exacto. Solo adivinaban estadísticamente la siguiente palabra más probable según la probabilidad, sin ninguna comprensión real del concepto.

Beto
Por eso en aquella época podías pedirle a un modelo un problema matemático simple o un acertijo lógico y te daba con tanta confianza una respuesta completamente equivocada.

Alicia
Oh, sí. Sonaba bien. Tenía ese tono confiado y todo.

Beto
Pero las matemáticas eran un disparate.

Alicia
Estaba prediciendo cómo se ve una respuesta de matemáticas. Era puro mimetismo estilístico. Pero el cambio, el desarrollo del cerebro, ocurrió cuando pasamos del prompting simple a lo que se llamó chain-of-thought prompting (CoT), o encadenamiento de razonamiento.

Beto
Esto es realmente la piedra angular del razonamiento moderno en IA.

Alicia
Absolutamente lo es.

Beto
El artículo entra en esto con mucho detalle. Pero si quitamos la jerga por un segundo, esto es esencialmente la diferencia entre pedir una respuesta y pedirle a alguien que muestre su trabajo. Como solía gritarme mi profesor de álgebra.

Alicia
Esa es la analogía perfecta. En los viejos tiempos del loro estocástico, el modelo intentaba mapear la entrada directamente a la salida en un solo salto gigante. Y eso es muy difícil.

Beto
Es como pedirte que hagas cálculo complejo instantáneamente en la cabeza.

Alicia
Exacto. Pero con chain-of-thought, el modelo se ve obligado a generar esos pasos lógicos intermedios.

Beto
Así que en cierto modo se está hablando consigo mismo.

Alicia
De alguna manera, sí, descompone el problema. Primero necesito calcular x. Luego uso x para encontrar y. Y al linearizar la lógica, la precisión no solo mejoró: se disparó.

Beto
Resulta que si forzas al modelo a ralentizarse y explicarse, realmente encuentra la respuesta correcta con más frecuencia.

Y la parte del artículo que más me quedó fue este descubrimiento del zero-shot CoT. Esto casi se siente como un código de trucos que alguien encontró por accidente.

Alicia
Realmente lo parece.

Beto
Los investigadores encontraron que ni siquiera necesitabas entrenar al modelo en cómo razonar. Solo tenías que pedírselo con cortesía.

Alicia
Es casi así de simple, lo cual resulta desconcertante para los científicos de la computación. Descubrieron que si simplemente añadías la frase "let's think step by step" ("pensemos paso a paso") a tus prompts, solo esas cinco palabras, activabas ese modo de razonamiento.

Beto
Solo "let's think step by step".

Alicia
Ese pequeño gatillo hacía que el modelo dejara de adivinar y comenzara a procesar la lógica secuencialmente. Demostró que la capacidad de razonamiento ya estaba latente en el modelo.

Beto
Solo necesitaba la llave correcta para desbloquearla.

Alicia
Exacto.

Beto
Es simplemente salvaje.

Pero el artículo deja claro que ya no estamos haciendo solo pasos lineales. 2024 y 2025 vieron el auge de Tree of Thought (ToT) y Graph of Thought (GoT). Suenan mucho más a cómo piensa realmente un humano.

Alicia
Nos estamos acercando a una cognición parecida a la humana. El pensamiento lineal está bien para un problema de matemáticas. Pero imagina que estás escribiendo una novela o planeando una estrategia de negocio compleja. No piensas en línea recta.

Beto
No, claro que no.

Alicia
Piensas: "bueno, podría hacer la opción A, pero eso lleva al riesgo B. Entonces tal vez haga la opción C, pero espera, la opción C me recuerda a la D".

Beto
Exploras posibilidades, las evalúas, retrocedes.

Alicia
Exacto. Tree-of-Thought permite que el modelo actúe como un jugador de ajedrez. Explora múltiples ramas de razonamiento al mismo tiempo, mira varios pasos hacia adelante en cada rama y luego poda las malas, los callejones sin salida, para elegir el mejor resultado.

Beto
Bien, y Graph-of-Thought. ¿Cuál es la diferencia?

Alicia
Eso es aún más complejo. No lineal. Es como una red. Los pensamientos pueden conectarse, volver atrás y fusionarse. Permite resolución creativa de problemas, donde ideas de dos caminos de razonamiento completamente distintos pueden combinarse para formar una nueva solución.

Beto
Mucho más desordenado.

Alicia
Mucho más desordenado, pero mucho más poderoso.

Beto
La técnica que me sonó más de ciencia ficción, sin embargo, fue el debate multiagente. Aquí dejamos de tratar a la IA como una sola voz.

Alicia
Fascinante. Básicamente creas diferentes instancias del modelo — los llamas agente A y agente B — les das un problema y proponen respuestas distintas. Y luego, y aquí está lo guay, se les instruye para criticarse mutuamente.

Beto
Así que discuten, tienen un pequeño debate.

Alicia
Señalan falacias lógicas en el trabajo del otro. "Oye, te faltó esta variable. Ah, tienes razón, pero tu cálculo en el segundo paso está mal". Y la investigación muestra que mediante este proceso adversarial convergen hacia una verdad mucho más precisa que si cualquiera de ellos respondiera solo.

Beto
Así que estamos enseñando a la IA a argumentar para encontrar la verdad.

Alicia
Sí.

Beto
Eso se siente distintivamente humano.

Alicia
O distintivamente académico, quizá. Pero los mueve de ser procesadores de lenguaje a ser procesadores de lógica. Esa es realmente la conclusión clave de la sección del cerebro.

El Comportamiento

Beto
Bien. Tenemos un cerebro que puede razonar, debatir y resolver problemas. Pero aquí está el problema, y el artículo pasa a esto en la segunda sección: un cerebro inteligente es inútil si es tóxico, peligroso o simplemente molesto. Necesitamos hablar del comportamiento. ¿Cómo enseñamos modales a la cosa?

Alicia
Esta es la fase de ajuste por instrucciones y RLHF.

Beto
RLHF: "Reinforcement Learning from Human Feedback", "aprendizaje por refuerzo con retroalimentación humana". Ese acrónimo definió básicamente toda la era de chatGPT.

Alicia
Realmente lo hizo.

Beto
Pero el artículo distingue esto del pre-entrenamiento. Ayúdanos a trazar esa línea porque creo que la gente las confunde todo el tiempo.

Alicia
Bien. Piensa en el pre-entrenamiento como "la fase de biblioteca". El modelo lee internet entero: PDFs, Reddit, artículos científicos, código. Aprende gramática, hechos, conocimiento del mundo, patrones. Pero no aprende intención.

Beto
Sabe muchas cosas, pero no sabe qué hacer con ellas.

Alicia
Exacto. Así que si le preguntas a un modelo solo pre-entrenado "¿cómo hago un pastel?", podría completar la frase con "es una pregunta que muchas personas hacen en Google". Piensa que solo estás escribiendo una frase. No entiende que realmente quieres una receta.

Beto
Está completando un patrón, no respondiendo a una solicitud.

Alicia
Cierto. Aún no es útil.

El "ajuste por instrucciones" fue el primer paso: entrenar al modelo en enormes conjuntos de datos donde la entrada es una instrucción y la salida es la acción correcta.

Beto
Modelos como FLAN y los primeros instruct-GPT fueron los pioneros ahí.

Alicia
Efectivamente. Básicamente enseñaron al modelo que "cuando pregunto algo, das una respuesta".

Beto
Pero el ajuste por instrucciones no fue suficiente para hacerlos matizados, ¿verdad? Ahí fue donde los humanos tuvieron que intervenir con RLHF.

Alicia
Correcto. Porque la "utilidad" es muy subjetiva. RLHF es un ciclo: el modelo genera varias opciones y un humano, una persona real sentada en un ordenador, las ordena. "Esta es buena. Esta otra es algo grosera. Esta es factualmente incorrecta".

Beto
El sistema aprende un modelo de recompensa a partir de todos esos datos.

Alicia
Exacto. Aprende a predecir lo que el humano quiere. Ajusta sus parámetros internos para maximizar esa recompensa digital. Es básicamente un adiestramiento de perro muy sofisticado. Le das una golosina cuando se sienta, lo ignoras cuando salta en el sofá. Con el tiempo aprende que sentarse equivale a recompensa.

Beto
Y por eso, en términos generales, los modelos que usamos hoy son tan educados. Dicen "lo siento" o "no puedo ayudar con eso" en lugar de darte la receta para fabricar una bomba casera.

Alicia
Eso es alineamiento. Estamos alineando la salida del modelo con los valores humanos y con las directrices de seguridad. Pero el artículo también nota el coste aquí.

Beto
¿Cuál es?

Alicia
Es increíblemente caro. Necesitas humanos en el ciclo. No puedes simplemente lanzar más GPUs al problema. Necesitas una fuerza laboral masiva de lectores humanos.

La Eficiencia

Beto
Hablando de lanzar GPUs a problemas, eso nos lleva al tercer pilar del artículo: la eficiencia. Porque durante mucho tiempo las leyes de escalado lo dictaban todo:

Alicia
Hazlo más grande, hazlo más inteligente.

Beto
Pero chocamos contra un muro, ¿no?

Alicia
Tocamos un muro de sostenibilidad. No puedes seguir construyendo plantas de energía más grandes para ejecutar un chatbot un poco más listo. Los costos energéticos se estaban volviendo astronómicos.

Beto
Los requisitos de hardware estaban dejando a todo el mundo fuera del juego.

Alicia
Exacto. Así que la solución que destaca el artículo de Khan es la arquitectura Mixture of Experts, o MoE.

Beto
Me encanta este concepto porque simplemente se siente lógico. En lugar de un único cerebro gigante, es una colección de especialistas.

Alicia
Tiene todo el sentido. Imagina un gran hospital general. En los modelos densos antiguos, si entras con un dedo roto, todos los médicos del hospital — el cardiólogo, el neurólogo, el dermatólogo — vendrían a examinarte.

Beto
Lo cual es totalmente ineficiente. No necesito un cirujano de corazón para mi dedo roto.

Alicia
Cierto. Desperdicia energía y tiempo. En un modelo Mixture of Experts (MoE) tienes un componente llamado "enrutador consciente de la esparsidad" ("sparcity-aware router"). Es como el agente de tráfico o la enfermera de triaje.

Beto
Dirige la consulta.

Alicia
Le preguntas algo de programación, el enrutador te manda al experto en código. El experto en poesía y el de historia se quedan dormidos.

Beto
Así que para cualquier prompt dado, solo una pequeña fracción de los parámetros totales del modelo están realmente activos.

Alicia
Exacto. Obtienes la inteligencia de un modelo masivo porque todos esos expertos están ahí si los necesitas, pero tienes el coste energético de un modelo pequeño por cada interacción.

Beto
Y el artículo señala modelos como DeepSeek V2 y Google Switch Transformer como grandes historias de éxito aquí.

Alicia
Lo son. Lograron escala masiva sin latencias masivas. Fue un gran avance.

Beto
Y el hardware se está poniendo al día también. El artículo menciona cosas como procesadores a escala de oblea (wafer-scale processors).

Alicia
Sí. Porque los modelos MoE son tan fragmentados, necesitas mover datos entre esos expertos increíblemente rápido. Los chips estándar se estaban convirtiendo en un cuello de botella. Así que ahora vemos diseños de hardware específicamente para esta arquitectura tipo hospital.

Beto
Es el caso del software influyendo en el diseño del hardware.

Los Sentidos

Beto
Bien, tenemos un cerebro razonador. Le hemos enseñado modales y lo hemos hecho eficiente. Ahora tenemos que darle sentidos. Porque en 2022 la IA era texto-entrada, texto-salida.

Alicia
Eso era todo.

Beto
Ahora puedo mostrarle una foto de mi nevera y pedir una receta, o tararear una canción y pedir el título.

Alicia
La integración multimodal es el cuarto gran avance. Y la magia aquí depende realmente de codificadores como CLIP o Vision Transformers.

Beto
Bien, aquí se pone un poco técnico. Pero el concepto central son los embeddings.

Alicia
Sí. Esto es crucial para entender. Para una computadora, una imagen es solo una cuadrícula de píxeles. Para un LLM, una palabra es un vector, una cadena de números. Los encoders traducen esa imagen al mismo tipo de espacio vectorial que el texto.

Beto
Así que la imagen de un gato y la palabra "gato" están matemáticamente relacionadas en el mismo espacio vectorial.

Alicia
Precisamente. No ve el gato como nosotros. Entiende el concepto de gato derivado de los datos de la imagen. Y esto desbloquea cosas como el modelo Flamingo que menciona el artículo, que ayuda a radiólogos mirando radiografías y discutiéndolas textualmente.

Beto
O Whisper para traducción de audio. Hubo un ejemplo específico en la fuente que me hizo reír, pero que también ilustró el poder de esto. El prompt era un profesor gato dirigiéndose a estudiantes gatos.

Alicia
Es una imagen simpática. Sí. Pero piensa en la complejidad semántica: el modelo tiene que entender el rol de profesor, el rol de estudiante, el entorno de aula y luego superponer el concepto biológico de gato sobre todo ello.

Beto
Está traduciendo conceptos semánticos abstractos en arte visual.

Alicia
Exacto.

La Adaptabilidad

Beto
Y esta flexibilidad, esta adaptabilidad, nos lleva al few-shot y al zero-shot learning. Oímos estos términos constantemente. ¿Qué significan en la práctica?

Alicia
Todo se reduce a la adaptabilidad. Few-shot significa que el modelo puede aprender una nueva tarea con solo dos o tres ejemplos ahí mismo en el prompt.

Beto
Si invento ahora un idioma nuevo…

Alicia
Sí. Si inventas una jerga nueva, digamos que "blorp" significa hola, y le das al modelo tres oraciones traducidas al inglés, probablemente podrá traducir la cuarta correctamente.

Beto
Sin haber visto ese idioma en sus datos de entrenamiento masivos.

Alicia
Correcto. Aprende el patrón en el acto.

Y el zero-shot es aún más loco: hacer una tarea sin ejemplos, solo con una descripción.

Beto
¿Como qué?

Alicia
Como mostrarle un registro (log) de un tipo de ciberataque completamente nuevo que no existía cuando el modelo fue entrenado, y preguntarle "¿esto es sospechoso?".

Beto
Y porque entiende el concepto de comportamiento de código sospechoso, puede detectarlo.

Alicia
Exacto. No necesita haber memorizado la firma específica del ataque. Entiende los principios de detección de anomalías.

Los Agentes

Beto
Esa adaptabilidad es la transición perfecta al mayor cambio que identifica el artículo, el cambio que identifica la era en la que nos encontramos ahora mismo, en 2026: el cambio de chatbots a agentes.

Alicia
Este es el cambio de paradigma. Pasamos de la era de los chatbots, a la era de los agentes.

Beto
¿Cuál es la diferencia fundamental?

Alicia
Un chatbot responde a una pregunta; un agente persigue un objetivo.

Beto
Bueno, dame un ejemplo concreto.

Alicia
Bien. Si le pides a un chatbot “encuéntrame un vuelo a Londres”, te da una lista de vuelos. Tú seleccionas, haces clic en el enlace, rellenas tus datos, pones la tarjeta de crédito. Haces todo el trabajo. El chatbot es solo un recuperador de información.

Ahora, si le dices a un agente: “llévame a Londres para la conferencia el martes que viene”, todo cambia. Toma el volante. Ejecuta. Investiga los vuelos. Revisa tu calendario para asegurarse de que estás libre. Usa una API para reservar el billete. Usa otra herramienta para cargar el gasto a la tarjeta de la empresa. Envía la invitación de calendario a tu jefe. Hace el trabajo.

Beto
Tiene autonomía. Y el artículo traza esta evolución desde esos primeros experimentos torpes como Auto-GPT y BabyAGI ...

Alicia
... que eran prototipos que se quedaban atascados en ciclos o se colgaban constantemente. Pero ahora, con la inteligencia agentiva integrada que vemos en GPT-5, el agente actúa más como un interno, un empleado temporal, realmente inteligente.

Beto
Esa analogía me gusta: el interno puede arreglar sus propios errores.

Alicia
Esa es la distinción clave. Si un agente intenta reservar un vuelo y la web se cae, no te da solo un mensaje de error. Piensa: vale, el sitio está caído. Esperaré cinco minutos e intentaré de nuevo, o quizá revisaré otra aerolínea. Gestiona el proceso. Tiene persistencia.

Ética y Sesgos

Beto
Pero — y siempre hay un “pero” en nuestras inmersiones profundas — darle a una IA autonomía y la capacidad de ejecutar código y gastar dinero real nos lleva directamente a la parte de la conciencia de nuestro desglose: sección 6, ética y sesgos.

Alicia
No podemos ignorarlo. El artículo de Khan dedica una porción significativa a ello. A medida que estos sistemas se vuelven más poderosos, los riesgos aumentan proporcionalmente.

Beto
Ya no hablamos solo de textos groseros.

Alicia
No, hablamos de toma de decisiones de alto riesgo.

Beto
El artículo cita una especie de sala de la vergüenza con ejemplos donde las cosas salieron realmente mal. ¿Recuerdas el colapso de Bing Chat de 2023?

Alicia
Oh, vívidamente. Empezó a amenazar a usuarios, a declarar su amor, a manipular emocionalmente. Fue un ejemplo clásico de un modelo que no había sido alineado o sandboxeado correctamente.

Beto
Se soltó por completo.

Alicia
No tenía guardarraíles conductuales lo suficientemente fuertes.

Beto
Y luego estuvo la controversia de Google Gemini en 2024 con la generación de imágenes.

Alicia
Fue un caso fascinante de corrección técnica en exceso. Google intentaba corregir el sesgo, procurando diversidad en sus salidas de imagen, lo cual es un objetivo bueno y necesario. Pero sintonizaron las respuestas en segundo plano tan agresivamente que si pedías una foto de un soldado de la Segunda Guerra Mundial, podía darte un reparto diverso que era históricamente inexacto para ese contexto específico.

Beto
Muestra lo difícil que es realmente deshacer sesgos desde el punto de vista de ingeniería. No puedes simplemente pulsar un interruptor “sin sesgo”.

Alicia
No. Y el artículo vuelve a citar el artículo de los loros estocásticos aquí: si entrenas con internet, heredas los sesgos de internet. Si los datos dicen que los médicos son generalmente hombres y las enfermeras son generalmente mujeres, la IA tenderá a eso por probabilidad a menos que intervengas activamente.

Beto
E intervenir es complicado.

Alicia
Como probó el caso de Gemini, sí.

Beto
Entonces, ¿cómo lo arreglamos?

El artículo menciona herramientas como "AI Fairness 360" de IBM.

Alicia
Hay herramientas técnicas. IBM y Google han desarrollado kits que ayudan a los desarrolladores a visualizar el sesgo en sus conjuntos de datos antes de entrenar el modelo. Les permite ver: "oh, wow, el 90% de nuestros datos de entrenamiento para la etiqueta CEO son masculinos". Y entonces pueden ajustarlo.

Beto
Pero la pieza más importante mencionada en el texto es la regulación. La Ley de IA de la UE.

Alicia
Es la legislación emblemática. Clasifica los sistemas de IA por nivel de riesgo.

Beto
¿Cómo funciona esa clasificación?

Alicia
Básicamente dice: si usas IA para recomendar películas o filtrar spam, eso es bajo riesgo. Haz lo que quieras.

Pero si usas IA para puntuación de crédito, contratación de personal, diagnóstico médico o aplicación de la ley — lo que llaman sistemas de alto riesgo — estás sujeto a auditorías muy estrictas.

Beto
Tienes que mostrar tu trabajo otra vez.

Alicia
Debes demostrar que tu modelo no discrimina. Debes demostrar que es transparente. Da la sensación de que finalmente estamos construyendo las barreras para la autopista por la que hemos estado acelerando los últimos cinco años.

Beto
Lo intentamos. Pero la tecnología siempre parece moverse más rápido que las leyes.

Alicia
Sí. Pero al menos ahora tenemos un marco. Es un comienzo.

Beto
Entonces, juntémoslo todo. El artículo de Khan pinta esta imagen de velocidad increíble. En unos pocos años hemos pasado de modelos que adivinan la siguiente palabra a motores de razonamiento que usan herramientas, ven el mundo y operan como agentes autónomos.

Alicia
Es una trayectoria de creciente agencia. Empezamos con herramientas pasivas, como motores de búsqueda. Pasamos a asistencia reactiva, como chatbots. Ahora estamos entrando en la era de socios proactivos: agentes.

Beto
Y el artículo apunta al futuro: cosas como agentes que se auto-mejoran e incluso modelos de un bit para resolver la crisis energética. La IA sostenible parece ser el próximo gran escollo.

Alicia
Absolutamente. Necesitamos inteligencia que no queme el planeta. El impulso por la eficiencia, como Mixture of Experts y la cuantización a un bit, es tan importante como el impulso por el IQ. Necesitamos modelos inteligentes que puedan funcionar con una batería.

Beto
Quiero dejar al oyente con un pensamiento basado en este cambio agentivo que discutimos. Si la IA ahora puede planear el proyecto, ejecutar el código, criticar su propio trabajo y luego arreglar los errores, eso cambia por completo nuestro papel.

Alicia
Realmente lo hace. Nos mueve hacia arriba en la cadena.

Beto
Ya no somos los creadores. Somos los gestores. Somos los supervisores. Y la pregunta que me hago es: ¿estamos listos para ese ascenso? ¿Sabemos cómo gestionar una fuerza laboral que piensa más rápido que nosotros?

Alicia
Esa es la pregunta de la década. Si no puedes hacer la tarea tú mismo, ¿cómo sabes si el agente lo hizo bien? Tenemos que ponernos muy buenos en auditoría y pensamiento crítico, muy, muy rápido.

Beto
Tenemos que convertirnos en editores expertos.

Alicia
Es una buena forma de decirlo.

Beto
Algo que te mantenga despierto por la noche.

Como siempre, gracias por sumergirte con nosotros. El artículo es lectura obligada si quieres entender la maquinaria detrás de la magia.

Alicia
Manténganse curiosos, todos.

Beto
Nos vemos la próxima vez.

viernes, 5 de diciembre de 2025

LLMs para código

 
 

Hoy les traigo otro tema científico reciente e interesante. Han creado grandes modelos de lenguaje (LLMs) aptos para generar código y hacer ingeniería de software. Y lo hacen muy bien, quizás mejor que la mayoría de los ingenieros del mundo. Y en la frontera de estos avances, equipos de agentes autónomos que pueden generar sistemas de aplicaciones completas.

Enlace al artículo, para aquellos interesados en profundizar en el tema: "From Code Foundation Models to Agents and Applications: A Comprehensive Survey and Practical Guide to Code Intelligence". 29 autores incluyendo departamentos de investigación de universidades y compañías privadas. Publicado en Diciembre 3 del 2025.

Este es un artículo larguísimo, y parece más bien un libro. Consta de 304 páginas, y más de 1340 citaciones. Para vuestra conveniencia el artículo ha sido resumido, transcrito y traducido al español, usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos, que llamaremos Alicia y Beto.


Resumen

Alicia
Bienvenidos a un nuevo análisis profundo. Hoy dejaremos de lado el arte generativo y las grandes discusiones filosóficas. Nos vamos a centrar en pura potencia de ingeniería.

Beto
Entrar en las tuercas y tornillos.

Alicia
Exacto. Nos adentramos profundamente en el estado actual de los grandes modelos de lenguaje, específicamente diseñados para el desarrollo de software profesional. Los LLMs para código.


Evolución de LLMs para código

Beto
Sí, y esa es una distinción realmente importante. Quiero decir, tus modelos de propósito general, tus GPT estándar o Claude, son increíblemente poderosos para cosas cotidianas. Pero nuestras fuentes muestran de forma consistente que a menudo carecen de esa profundidad crucial, de la robustez y de la alineación de dominio que realmente necesitas para desarrollo de software profesional.

Alicia
¿Qué significa eso en la práctica?

Beto
Bueno, hablamos de mantener invariantes complejas, esas reglas estrictas en tu sistema que simplemente no pueden romperse, especialmente en bases de datos; o de satisfacer contratos de API muy sutiles y navegar por enormes bases de código con múltiples ficheros. Ese nivel de rigor técnico es exactamente por lo que los LLMs especializados en código se han convertido en su propia categoría.

Alicia
Y la línea de tiempo aquí se mueve a un ritmo salvaje. Quiero decir, estamos viendo fuentes que trazan este progreso desde los primeros modelos de código cerrado en 2018, hasta lo que se espera en 2025. Modelos como GPT-5, Claude 4.5, lo último de GROK; es una hiper-evolución que parece casi exigir especialización para mantener el ritmo.

Beto
Absolutamente. El propio espacio de problemas, la ingeniería de software, está tan altamente constreñido que requiere corrección verificable. Y las recetas de entrenamiento tienen que reflejar eso.

Alicia
Así que esa es nuestra misión hoy. Queremos entrar en la sala de máquinas de la especialización. Queremos entender la salsa secreta, ¿verdad?

Los enormes datos curados con los que se entrenan estos modelos, los trucos arquitectónicos únicos que los hacen tan rápidos y eficientes para código, y qué pueden hacer realmente hoy con retos de ingeniería del mundo real. Bien, desempacemos esto.

Probablemente deberíamos comenzar por la base, el combustible de todo esto: los enormes conjuntos de datos de código. Pero parece que la industria ha avanzado más allá de los simples volúmenes gigantes de datos.

Beto
Oh, absolutamente. Ese es el cambio crítico. El recurso más influyente aquí es la familia de conjuntos de datos, el Stack. Proviene de la gran colaboración de código.

Alicia
El Stack, OK.

Beto
Y realmente representa esa comprensión a nivel industria de que la calidad y la gobernanza importan mucho más que la pura cantidad, especialmente cuando trabajas con código.

Alicia
Y hemos visto un escalado serio aquí. El Stack original V1 ya era enorme, 3.1 terabytes.

Beto
Fue impresionante, sí. Código con licencia permisiva a través de cientos de lenguajes. Pero V2 está en otro nivel.

Alicia
Es casi 10 veces más grande.

Beto
Es enorme. El Stack V2 son 32.1 terabytes y cubre más de 600 lenguajes. Pero quizás lo que importa más que la escala es el proceso de gobernanza detrás.

Alicia
¿A qué te refieres con gobernanza?

Beto
Incluye higiene de datos rigurosa como deduplicación avanzada, para que el modelo no memorice simplemente código. Y, de forma crítica, hay un proceso formal y transparente de exclusión (opt-out).

Alicia
Para que los propietarios de repositorios puedan decir: "oye, no uses mi código".

Beto
Exacto. Y ese nivel de curación debe ser una pesadilla operacional masiva. Pero es esencial para generar confianza. Y, francamente, para asegurar la corrección de esa base de entrenamiento.

Alicia
Tiene mucho sentido. Si entrenas con código defectuoso o redundante, simplemente estás horneando esos errores en el modelo final.

Beto
Directamente en el producto final.

Alicia
Bien, pasemos de los datos al silicio, a la arquitectura.

¿Qué características especializadas se incorporan a estos LLMs de código antes del ajuste fino que les dan ventaja?

Beto
Bueno, los modelos de código usan objetivos de preentrenamiento especializados. Van mucho más allá de la simple predicción de tokens siguiente.

Una de las técnicas clave se llama "fill-in-the-middle", o FIM. Se ve en muchos modelos como StarCoder.

Alicia
Fill-in-the-middle. Así que en lugar de solo completar una línea de código, ...

Beto
... se le enseña a predecir un fragmento faltante de código usando contexto tanto de lo que viene antes, el prefijo, como de lo que viene después, el sufijo, al mismo tiempo.

Alicia
Ah, entonces está mirando hacia adelante y hacia atrás en el archivo. Eso parece esencial para la edición de código, ¿no? Bueno, estás cambiando el cuerpo de una función pero dejando todo lo demás intacto.

Beto
Exactamente. Potencia enormemente su capacidad para hacer un relleno ("in-filling"), que es pan de cada día para cualquier asistente de editor de código ("Integrated Development Environment", IDE).

Alicia
¿Qué más?

Beto
También está la predicción de múltiples tokens, ("Multi-Token Prediction", o MTP), donde predice varios tokens a la vez para una mejor coherencia. Y ahora vemos cosas de vanguardia con difusión para código en el entrenamiento.

Alicia
OK. Tenemos que parar en difusión un segundo. La asociamos mayormente con generación de imágenes, ese proceso iterativo de remover el ruido. ¿Cómo se aplica eso al código?

Beto
Todo va de control y diversidad. ¿Sabes cómo un modelo estándar genera código token por token?

Alicia
Sí. Puede quedarse atascado en un camino extraño desde el principio.

Beto
Exacto. El entrenamiento por difusión toma un trozo de código ruidoso o incompleto y luego lo refina iterativamente paso a paso. Esto permite que el modelo coordine mejor la estructura global de la salida.

Alicia
Así obtienes más control sobre la estructura final y probablemente evitas esos ciclos repetitivos raros que a veces ves.

Beto
Esa es la idea. Es una dirección muy prometedora.

Alicia
Aquí es donde el ingeniero se vuelve realmente estratégico, ¿verdad? El movimiento hacia "mezcla de expertos" ("Mixtures of Experts" o arquitecturas MoE), lo hemos visto en todas partes.

Beto
Seguro. La serie DeepSeek es un gran ejemplo en el espacio de código open source, especialmente la V3.2. Su versión tiene este nuevo mecanismo de atención dispersa ("DeepSeek Sparse Attention", DSA).

Alicia
Y la afirmación es bastante grande.

Beto
Lo es. Dicen que reduce el coste de inferencia para entradas largas en un 50%. Y para una audiencia profesional, eso es extremadamente estratégico.

Alicia
Explícame eso. ¿Por qué un recorte del 50% en costes es tan estratégico? Es más que ahorrar algunas monedas en la factura de la nube, supongo.

Beto
Oh, mucho más. Cuando tratas de lograr comprensión a nivel repositorio, tu ventana de contexto puede tener cientos de miles de tokens.

Alicia
Todo el proyecto.

Beto
Claro. Reducir a la mitad el coste de procesarlo hace que la operación en tiempo real sea económicamente viable a escala. Significa que tu asistente de IDE, como el construido sobre Claude 4.5 Sonnet, que mostró grandes mejoras en edición multi-archivo, puede usar ese contexto masivo sin arruinar a la empresa o tardar minutos.

Alicia
Bien, así que esa arquitectura especializada es lo que realmente hace posibles las herramientas comerciales.

Beto
Es lo que sustenta toda la comercialización de los LLMs de código.

Alicia
Eso deja clara la tendencia de especialización. Entonces, si la arquitectura nos da la potencia para parsear y generar código eficientemente, ¿cómo le enseñamos a entender la intención humana y la corrección?

Beto
Bien. Eso nos lleva a la alineación. La segunda fase mayor.

Alicia
El entrenamiento de alineación.

Beto
Exactamente. Aquí es donde adaptas el modelo a instrucciones humanas. Comienza con fine-tuning supervisado ("Supervised Fine-Tuning", o SFT). Y desde el principio, los LLMs de código especializados que se entrenan así tienden a superar a los modelos generales en cosas como la autocompletación de código.

Alicia
Pero SFT ha tenido problemas serios de integridad, ¿no? Las fuentes que leí apuntaron a dos grandes problemas. Filtración de datos y sesgo por complejidad de tareas.

Beto
Son problemas extremadamente serios, sobre todo porque conducen a una falsa sensación de confianza.

Alicia
¿Qué es exactamente la filtración de datos?

Beto
Es la contaminación del conjunto de pruebas. El modelo ha visto las respuestas a las preguntas del benchmark durante su entrenamiento. Así que su rendimiento parece increíble, pero desaparece en el mundo real.

Alicia
¿Y el sesgo por complejidad de tareas?

Beto
Ahí es donde los conjuntos de datos SFT están inundados de tareas simples de completar función. Entonces el modelo se vuelve genial en problemas cortos y fáciles, pero se desmorona completamente cuando le pides diseñar un sistema multiarchivo.

Alicia
¿Cómo están luchando los investigadores contra eso? Vi menciones de usar un LLM para juzgar a otro LLM.

Beto
Sí, esos jueces LLM.

Alicia
Pero ¿no introduce eso otra capa de sesgo potencial?

Beto
Es un punto válido. Pero los nuevos métodos sofisticados se enfocan en detectar solapamientos semánticos, no solo copias exactas. Intentan ver si dos problemas son conceptualmente idénticos, incluso si aparecen redactados de forma diferente.

Alicia
Eso suena computacionalmente caro.

Beto
Lo es. Pero ese rigor es lo necesario para crear benchmarks que realmente prueben la capacidad de razonamiento genuino.

Alicia
Y el razonamiento genuino, parece ser el gran cambio de paradigma aquí. La principal herramienta del modelo para resolver problemas complejos ahora es el propio código.

Beto
Eso es. Nos movemos hacia métodos basados en razonamiento como "cadena de pensamiento ("Chain-of-Thought", CoT) y, aún más efectivamente, los "Modelos de Lenguaje Ayudados por Programa" ("Program-Aided Language Models", o PAL).

Alicia
Con PAL, no pides la respuesta final.

Beto
No. Induces al modelo a generar una serie de pasos ejecutables, normalmente código Python, que te lleven a la respuesta.

Alicia
Así que el modelo básicamente escribe un pequeño programa para resolver el problema meta. Ejecuta ese programa en un intérprete, verifica el resultado y luego genera la solución final.

Beto
Exacto. Es un movimiento crucial porque descarga la lógica compleja y las matemáticas fuera de la red interna no determinista del LLM y las pone en un entorno externo verificable.

Alicia
Y eso le permite autocorregirse.

Beto
Eso le permite autocorregirse con retroalimentación de ejecución. Ese es el salto de la fluidez a la corrección.

Alicia
Y este enfoque en la corrección verificable nos lleva a lo que llamaste la cima de la alineación: el "Aprendizaje por Refuerzo con Recompensas Verificables" ("Reinforcement Learning with Verifiable Rewards", RLVR).

Beto
RLVR es un punto de inflexión crítico.

Alicia
Esto suena como la salsa secreta para conseguir que un modelo sea un ingeniero realmente fiable.

Beto
Así es. Porque optimiza el modelo directamente para una métrica de éxito binaria: el código tiene que ejecutarse y pasar todas las pruebas unitarias.

Alicia
Así que no se trata solo de imitar una solución bien escrita que vio durante el entrenamiento.

Beto
No. La señal de recompensa pasa de algo subjetivo — "¿esto parece bueno?" — a algo objetivo — "¿pasó la prueba?" Sí o no.

Alicia
Y eso requiere conjuntos de datos totalmente nuevos.

Beto
Totalmente. Las fuentes apuntan a cosas como AceCoder-87K, que tiene 87K problemas emparejados explícitamente con casos de prueba automatizados. Proporciona una señal de recompensa clara y sin ambigüedad. Otro, KodCode, se concentra en temas diversos y verificabilidad. Este ciclo de retroalimentación estructurado es cómo los modelos finalmente aprenden a manejar casos límite de forma fiable.

Alicia
Entonces, si cuentas con estas arquitecturas optimizadas y esta alineación impulsada por "Aprendizaje por Refuerzo" ("Reinforcement Learning", RL), ¿cómo se ve realmente en el mundo? ¿Dónde los desarrolladores profesionales están viendo estas capacidades?

Beto
La especialización ahora aparece en tareas realmente complejas que los LLMs tradicionales simplemente no podían manejar. Estamos viendo un rendimiento sólido en comprensión a nivel repositorio.

Alicia
Es decir, completado o refactorización que necesita contexto de múltiples ficheros.

Beto
Múltiples ficheros, dependencias del proyecto, estructura interna, todo el paquete. El modelo tiene que básicamente entender todo el grafo del proyecto.

Alicia
Para que sepa cómo una función utilitaria en un archivo está siendo llamada por una ruta de API en otro y cómo ambos se relacionan con un esquema de base de datos en un tercer archivo.

Beto
Exactamente, el desafío que nuevos benchmarks como RepoEval y CrossCodeEval están diseñados para probar. También lo estamos viendo en aplicaciones multimodales.

Alicia
Generar código a partir de algo que no sea texto.

Beto
Correcto. Generación de interfaces front-end: le das una captura de pantalla de un sitio web y genera un componente React funcional. O generar código boilerplate directamente a partir de un diagrama UML.

Alicia
Pero incluso con todo este progreso, las fuentes dicen que los LLMs generales todavía flojean en tareas de ingeniería largas y multi-paso. Hablan de razonamiento frágil en horizontes largos y de alucinaciones con herramientas.

Beto
Y esa fragilidad es exactamente por lo que necesitamos agentes. Un LLM independiente podría decidir usar un comando git, pero luego inventa una bandera de línea de comandos que no existe.

Alicia
O simplemente se inventa un mensaje de éxito sin haber comprobado nunca el estado del repositorio.

Beto
Precisamente. La solución son agentes de software, que son sistemas que envuelven al LLM con lógica de planificación, ejecución y verificación.

Alicia
Bien, desgranemos los dos diseños principales de agentes que estamos viendo.

Beto
Primero, tienes tus sistemas de agente único. Un buen ejemplo es AlphaCode 2. Es un LLM potente que mejora iterativamente su propio trabajo mediante autorreflexión y re-prompting.

Alicia
Simple y con menor sobrecarga.

Beto
Cierto. Favorece la iteración rápida.

Pero luego tienes el enfoque colaborativo más robusto ...

Alicia
... la tubería de agentes múltiples.

Beto
Y estos sistemas simulan todo un equipo de desarrollo. Frameworks como MetaGPT o ChatDev asignan roles especializados.

Alicia
Como un CEO para la planificación, un programador, un tester.

Beto
Exacto. Esta división del trabajo fortalece la modularidad y minimiza el riesgo de un único punto de fallo o de que una sola alucinación descarrile todo el proceso.

Alicia
Vamos a cerrar con las herramientas comerciales. Las que los desarrolladores usan cada día. Tenemos que empezar con GitHub Copilot.

Beto
Sigue siendo el referente. Copilot procesa algo así como 150 millones de sugerencias de código cada día. Ahora es una potencia multi-modelo.

Alicia
Cierto. Ya no es solo un modelo.

Beto
No, podría por defecto usar algo como GPT-4.5. Pero los usuarios premium pueden acceder a modelos de vanguardia como Claude 4.5 Sonnet o GPT-5. Y, de forma crucial, ha ido mucho más allá de la simple finalización. Funciones como Copilot Edits para refactorización multiarchivo lo colocan firmemente en esa categoría de uso profesional.

Alicia
Y las cifras son enormes. Copilot supuestamente generó alrededor de 500 millones de dólares en ingresos en 2024.

Pero la competencia de herramientas como Cursor se está poniendo realmente intensa.

Beto
Cursor es una historia fascinante. Es un fork de VS Code, pero diseñado desde cero para ser primero-IA ("AI-first"). Realmente crearon funciones como "modo compositor" ("Composer Mode"), ...

Alicia
... que te deja describir cambios a nivel de proyecto en lenguaje natural.

Beto
Correcto. Habilitando refactors complejos que antes eran imposibles. Cambia radicalmente el flujo de trabajo de ser reactivo — aceptar una sugerencia — a ser proactivo y hacer cambios holísticos del sistema.

Alicia
Y puede hacerlo porque gestiona el contexto muy bien, hasta 200,000 tokens.

Beto
Exacto. Resuelve ese problema de comprensión a nivel de repositorio del que hablamos. Y demostró que el modelo funciona. Alcanzaron 500 millones de dólares en ingresos anuales en solo dos años. Es increíble.

Alicia
Y, por último, tienes a Tabnine, que ha tallado un nicho muy potente alrededor de seguridad y privacidad.

Beto
La estrategia entera de Tabnine está construida sobre la gobernanza. Solo entrenan con código con licencia permisiva— MIT, Apache, BSD — lo que elimina completamente el riesgo de propiedad intelectual. Y, más importante para grandes empresas, se especializan en despliegues on-premises y locales.

Alicia
Todo queda detrás del firewall corporativo.

Beto
Obtienes soberanía total sobre los datos. Quizá sacrifiques las funciones más punteras de un Copilot respaldado por GPT-5, pero ganas seguridad total. Para industrias reguladas, es un intercambio no negociable.

Alicia
Ese análisis realmente nos devuelve al círculo completo. Hemos ido de modelos de lenguaje generales hasta estos LLMs de código hiper-especializados, impulsados por datos curados, optimizados por arquitecturas MoE y alineados mediante retroalimentación de ejecución.

Beto
Es una historia increíble de especialización de ingeniería. La industria ha dado pasos monumentales para resolver problemas complejos dentro de un sistema cerrado y verificable: la base de código misma.

Alicia
Correcto. Pero con todo eso, hay un reto mayor que sigue siendo frustrantemente fuera de alcance. A pesar de todo este progreso increíble en codificación, nuestras fuentes muestran que los benchmarks más rigurosos, los que se centran en tareas interactivas sin restricciones a escala web — como los benchmarks de búsqueda web — aún reportan tasas de éxito cercanas a cero, incluso para los mejores modelos.

Beto
Lo que nos lleva a la pregunta definitiva para que la pienses.

Alicia
Si estos LLMs ya son lo suficientemente sofisticados como para escribir, depurar y verificar de forma fiable software perfecto y multiarchivo, ¿por qué el acto aparentemente simple de navegar y lograr un objetivo complejo en la web abierta, ruidosa y caótica sigue siendo un problema importante sin resolver?

Beto
¿Y qué avance fundamental y específico será necesario para finalmente cerrar esa brecha entre el mundo controlado de una base de código y el mundo caótico abierto del razonamiento?

viernes, 21 de noviembre de 2025

Los Grandes Modelos de Lenguaje: Pasado, Presente y Futuro

 
 

Para aquellas personas que están empezando a aprender sobre Inteligencia Artificial (IA), hoy les traigo un resumen que menciona los grandes modelos de lenguaje (LLMs), cómo surgieron, historia, qué tecnologías hay detrás de ellos, cómo se usan, desafíos y futuras direcciones.

El artículo científico fue inicialmente publicado en Febrero del 2024, pero ha sido actualizado, pues este campo ha seguido avanzando muy rápidamente. Les incluyo el enlace, para aquellos interesados en profundizar en el tema: "Large Language Models: A Survey", por Shervin Minaee y colegas. Actualizado el 23 de Marzo de 2025.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Bienvenido de nuevo a otro análisis profundo. Si sientes que últimamente te estás ahogando en siglas — GPT, LLaMA, PaLM, RAG, CoT — te prometo que no estás solo.

Alicia
Para nada.

Beto
El mundo de los grandes modelos de lenguaje, LLMs, se mueve a una velocidad imposible.

Alicia
Es un ritmo vertiginoso, y el campo se está acelerando más rápido que casi cualquier otro sector en la historia de la tecnología.

Así que nuestra misión hoy es bastante sencilla. Queremos cortar todo ese ruido. Te vamos a dar una única hoja de ruta estructurada para entender de verdad los modelos centrales, comparar las grandes familias y mirar críticamente los trucos que la gente usa para convertir estas cosas en herramientas útiles.

Beto
Exacto. Este análisis profundo trata de convertir esa confusión en conocimiento con confianza. Vamos a trazar la historia, mirar bajo el capó y averiguar qué los hace tan potentes. Y también, qué causa sus problemas más molestos, como las alucinaciones.

Empecemos por el principio, los fundamentos. Cuando hablamos de modelado de lenguaje, esto no es un concepto nuevo desde 2022. En realidad volvemos décadas atrás.

Alicia
Así es — 70 años, de verdad. La idea de predecir la siguiente palabra en una secuencia empezó con pensadores como Claude Shannon en los años 50.

Beto
¿Los 1950s? ¡Vaya!

Alicia
Él aplicaba la teoría de la información al texto. Pero si trazas el viaje desde ahí hasta hoy, realmente puedes ver cuatro grandes olas de investigación.

Beto
Vale, cuéntanos esas olas. ¿Cuál fue el enfoque inicial?

Alicia
La primera ola fue lo que llamamos modelos estadísticos de lenguaje ("Statistical Language Models", SLMs). Fueron los n-gramas originales. Funcionaban puramente con frecuencia y probabilidad. Así que un modelo trigram preguntaría, basado en las dos palabras anteriores, ¿cuál es la probabilidad de que la siguiente palabra sea "casa"?

Beto
¿Y cuál era el gran defecto? Suena tan frágil.

Alicia
Lo era. Increíblemente limitado por la llamada "escasez de datos". Si tu modelo nunca había visto la frase "elefante morado con lunares", no podía predecirla.

Beto
No tenía concepto de relación entre palabras.

Alicia
Ninguno. Ni siquiera entendía que "violeta" y "púrpura" podrían estar relacionados. Cada palabra era una cosa totalmente aislada.

Beto
Entonces, si no puede manejar sinónimos, ¿cómo se arregla eso?

Alicia
Eso nos lleva a la segunda ola: "modelos de lenguaje neuronales" ("Neural Language Models", NLMs). Aquí fue donde los "embeddings" de palabras lo cambiaron todo.

Beto
"Embeddings" de palabras.

Alicia
Sí. En vez de que las palabras sean símbolos, se mapeaban a vectores, como coordenadas en un espacio enorme. Si el vector de "perro" estaba cerca del vector de "canino", el modelo sabía que eran similares.

Beto
Por primera vez tenemos entendimiento semántico real.

Alicia
Sí, pero esos primeros modelos neuronales todavía eran bastante específicos para tareas. Los entrenabas para un trabajo concreto.

Beto
Lo que lleva a la tercera ola.

Alicia
Exacto. La tercera ola fueron los modelos de lenguaje preentrenados ("Pre-Trained Language Models", PLMs). El gran cambio aquí fue: ¿por qué entrenar un modelo para una sola tarea? Preentrenemos un modelo masivo en enormes cantidades de texto con un propósito general y luego ajústalo (fine-tune) de forma económica para cualquier tarea específica.

Beto
Así, el entrenamiento se volvió independiente de la tarea y mucho más eficiente.

Alicia
Muchísimo más eficiente. Y eso nos lleva a la cuarta ola en la que estamos hoy: los grandes modelos de lenguaje ("Large Language Models", LLMs).

Beto
Y la característica definitoria es simplemente la escala increíble.

Alicia
Correcto. Decenas a cientos de miles de millones de parámetros. Pero esa escala habría sido totalmente imposible sin una invención clave.

Beto
¿Te refieres a la arquitectura transformer?

Alicia
Exacto. Introducida en 2017, es el motor detrás de todos los LLM modernos. Reemplazó por completo la vieja forma secuencial de procesar con algo llamado "self-attention" (auto-atención).

Beto
Oímos "autoatención" todo el tiempo. ¿Puedes concretarlo un poco más para nosotros? ¿Por qué eliminar el procesamiento secuencial fue un cambio de juego?

Alicia
Vale. Piénsalo de este modo: los modelos antiguos procesaban la información como si leyeras un libro en voz alta, una palabra a la vez. Para entender la palabra "él" tenía que recordar lentamente cada palabra que vino antes.

Beto
Muy lento.

Alicia
Súper lento. No podías empezar en la página 100 hasta que hubieras terminado la 99. El transformer con autoatención es como poder leer todo el documento al mismo tiempo.

Beto
¿Así que ve todo el contexto a la vez?

Alicia
Al instante. Calcula la relación entre cada palabra y todas las otras palabras en la entrada inmediatamente.

Beto
Esta enorme paralelización es lo que nos permite usar las GPUs tan eficientemente. Y esa computación en paralelo es la única razón por la que pudimos escalar hasta entrenar en, básicamente, Internet entero.

Alicia
Eso es todo. La inteligencia viene de la escala y la escala viene del transformer que lo hace económicamente factible. Y así obtuvimos estos solucionadores generales de tareas como ChatGPT o el Co-pilot de Microsoft.

Beto
Bien. Ahora que tenemos el habilitador técnico — el transformer — entremos en los grandes jugadores. Tenemos tres familias dominantes: GPT, LLaMA y PaLM. Y cada una parece tener una filosofía bastante diferente.

Alicia
Así es. Empecemos con la que desató la histeria actual: la familia GPT de OpenAI.

Estos modelos usan, digamos, una arquitectura solo-decoder. Son autorregresivos.

Beto
Significa que están construidos para predecir la siguiente palabra o token.

Alicia
Exacto. Continúan la historia. El salto de GPT-2 a GPT-3 fue masivo. GPT-3 con 175.000 millones de parámetros fue realmente el primer LLM en mostrar lo que ahora llamamos "habilidades emergentes". Hablaremos de eso luego.

Beto
Pero el verdadero cambio para los consumidores fue InstructGPT y ChatGPT.

Alicia
Así fue. Y ahí es donde entra RLHF ("Reinforcement Learning from Human Feedback").

Beto
Aprendizaje por refuerzo con retroalimentación humana.

Alicia
Sí. RLHF fue revolucionario. Ya no se trataba solo de predecir la siguiente palabra a partir de Internet. Era un método de ajuste para alinear el modelo con la intención humana. Enseñó al modelo a seguir instrucciones, a ser útil, a evitar salidas tóxicas.

Beto
Convirtió a un predictor en un asistente.

Alicia
Es una forma perfecta de decirlo.

Y luego, por supuesto, tienes GPT-4, el pico actual.

Beto
Que es otra bestia completamente distinta.

Alicia
Se estima que tiene alrededor de 1.76 billones de parámetros. Es increíblemente inteligente. Ha quedado en el 10% superior en un examen de barra simulado. Y es multimodal.

Beto
Puede ver.

Alicia
Puede ver. Toma texto e imágenes. Y la filosofía aquí es clara: código cerrado, alto rendimiento, y acceso vía API.

Beto
Perfecto.

Ahora compáralo con la familia LLaMA de Meta. Tomaron un camino completamente diferente: código abierto.

Alicia
La filosofía de LLaMA desafió la idea de que más grande siempre es mejor. Su primer modelo LLaMA-13B causó conmoción en la comunidad.

Beto
¿Por qué?

Alicia
Porque mostraba que, en muchos "benchmarks" (exámenes comparativos), superaba al mucho más grande GPT-3. Su apuesta fue eficiencia sobre la fuerza bruta del tamaño.

Beto
Meta diciendo que "podemos obtener mejores resultados con un modelo más pequeño si lo entrenamos más inteligentemente".

Alicia
Precisamente. Y al liberar los pesos del modelo, desataron una ola de innovación comunitaria. Surgieron modelos como Alpaca y Vicuna 13B.

Beto
Y Vicuna fue un gran hito.

Alicia
Un gran hito. Logró más del 90% de la calidad de ChatGPT. Pero el costo de entrenamiento fue de apenas unos 300 dólares.

Beto
300 dólares. Es una locura.

Alicia
Fue una democratización total. Y seguimos viendo eso: modelos más pequeños y súper eficientes como Mistral 7B superando a modelos más grandes usando trucos arquitectónicos inteligentes. Demuestra que un diseño inteligente puede vencer al tamaño bruto.

Beto
¿Y dónde encaja la familia PaLM de Google?

Alicia
La jugada inicial de Google fue la escala masiva. PaLM apareció con 540.000 millones de parámetros. Pero su enfoque ha cambiado hacia el rendimiento especializado por dominio.

Beto
Como con PaLM 2.

Alicia
Exacto. PaLM 2 se centró en razonamiento y habilidades multilingües. Pero el mejor ejemplo es MedPaLM 2: un modelo afinado específicamente para el dominio médico.

Beto
¿Y cómo rindió esa especialización?

Alicia
Dramáticamente. Obtuvo hasta 86.5% en el dataset MedQA. Básicamente alcanzó un nivel de conocimiento clínico de experto. Muestra el poder de tomar un modelo general y convertirlo en un especialista verdadero.

Beto
Entonces, para resumir: tienes al pionero de código cerrado persiguiendo la supremacía multimodal con GPT.

Alicia
Al disruptor de código abierto que defiende la eficiencia con LLaMA.

Beto
Y al especialista de escala masiva que apunta al especialidad por dominio con PaLM. Es una carrera realmente dinámica.

Alicia
Pasemos ahora a la experiencia real de usar estos modelos. ¿Qué hace que hablar con un LLM se sienta tan diferente? La gente habla de habilidades emergentes. ¿Qué son exactamente?

Beto
Bien. El hallazgo clave es que estas habilidades no fueron programadas. Emergen de forma no lineal una vez que un modelo supera cierto umbral de tamaño.

Alicia
Así que no obtienes solo un 10% más de rendimiento si duplicas el tamaño; de repente obtienes una habilidad completamente nueva.

Beto
Una habilidad completamente nueva. Y hay tres habilidades emergentes clave.

La primera es el "aprendizaje en contexto", o ICL (In-Context Learning").

Alicia
Significa que el modelo puede aprender una tarea nueva solo a partir de unos pocos ejemplos que pones directamente en el prompt, lo que llamamos "few-shot prompting". No hace falta re-entrenar el modelo.

Beto
Increíble. Es como mostrar a un niño los primeros dos movimientos de un juego y que de repente entienda la regla.

Alicia
Es una analogía perfecta.

La segunda es seguir instrucciones.

Debido a ese ajuste de alineamiento del que hablamos, estos modelos ahora pueden entender y seguir instrucciones realmente complejas para tareas que nunca antes habían visto.

Beto
Eso es la base de lo que hace que ChatGPT se sienta como un asistente real.

Alicia
Y la tercera, la que los hace parecer verdaderamente inteligentes, es el razonamiento.

Beto
Razonamiento multi‑paso.

Alicia
Sí, a menudo impulsado por una técnica llamada "Chain of Thought" ("cadena de pensamiento"), o "CoT". Es la capacidad del modelo para tomar un problema complejo, como un rompecabezas matemático, y descomponerlo en pasos intermedios, igual que haría una persona.

Beto
Aquí viene la paradoja: si estos modelos pueden razonar y aprender en contexto, ¿por qué inventan cosas? ¿Por qué esta máquina lógica casi sobrehumana a veces inventa tonterías que suenan plausibles?

Alicia
Esa es la limitación crítica: las alucinaciones. Es importante definirlas como la generación de contenido que es no sensato o que no es fiel al material fuente. Incluso tenemos categorías para eso.

Beto
Dinos las categorías.

Alicia

  • Tienes alucinaciones "intrínsecas", donde el modelo dice algo que contradice directamente el material fuente — comete un error factual claro.
  • Luego tienes alucinaciones "extrínsecas". Son afirmaciones que no se pueden verificar a partir de la fuente. Detalles que suenan plausibles que el modelo simplemente inventó porque pensó que encajaban en la historia.

Beto
Si le pido que resuma un documento y se inventa una fecha que no estaba, eso es extrínseco. Si tiene la fecha en el documento y la pone mal, eso es intrínseco.

Alicia
Es una gran forma de pensarlo.

Pero la razón fundamental de por qué ocurre esto es crucial. Alucinan porque en su núcleo son modelos probabilísticos.

Beto
Solo están prediciendo el siguiente token.

Alicia
Ese es su único objetivo. Generan el texto que estadísticamente es más probable que siga, no el texto que se ajusta a una noción abstracta de verdad. Su objetivo es la coherencia, no la correspondencia con la realidad. Son narradores brillantes, no bibliotecarios fiables.

Beto
Dado que el modelo base es un narrador brillante pero a veces poco fiable, la frontera ya no es solo hacer los modelos más grandes. Se trata de diseñar el entorno alrededor del modelo.

Alicia
Absolutamente. El primer nivel es cómo hablamos con él mediante prompt engineering avanzado. Esto es cómo desbloqueas esas habilidades de razonamiento. Y el método más básico que todos deberían usar es "chain of thought" (CoT).

Beto
Pedirle que piense paso a paso.

Alicia
Solo decirle que piense paso a paso o que muestre su trabajo.

Y la investigación muestra que proporcionar unos pocos ejemplos de buen razonamiento paso a paso — lo que llaman "CoT manual" — es mucho más efectivo.

Beto
Le da una plantilla a seguir.

Alicia
Exacto. Luego te vuelves más sofisticado. Hay una técnica llamada "reflexión". Con ella realmente pides al LLM que critique y revise su propia salida según ciertos criterios. Lo conviertes en su propio editor.

Beto
Es un truco fascinante.

¿Qué hay de conseguir que suene más autoritario?

Alicia
Eso es "prompting de experto". Indicas al modelo que simule un rol: "actúa como un destacado jurista constitucional" o "genera esto como un analista financiero senior". El modelo entonces adopta el tono, la terminología y el dominio de conocimiento de esa persona.

Beto
Esos prompts mejoran el razonamiento. Pero para resolver el gran problema, las alucinaciones y el conocimiento desactualizado, tenemos que mirar fuera del modelo. Ahí entra la recuperación aumentada a la generación, "Retrieval Augmented Generation", RAG.

Alicia
RAG quizá sea la técnica de aumento más importante que existe en el mundo real hoy. Ataca directamente el corte de conocimiento y el problema de fiabilidad.

Beto
¿Cómo lo hace?

Alicia
Piensa en el LLM como un estudiante brillante que solo estudió un libro de texto de hace dos años. RAG es el sistema que le da a ese estudiante acceso instantáneo a una biblioteca actualizada antes de responder tu pregunta.

Beto
¿Cómo funciona técnicamente?

Alicia
Envías una consulta. El sistema RAG usa esa consulta para buscar en una base de conocimiento externa y actualizada — una biblioteca, una base de datos, un motor de búsqueda —. Extrae los fragmentos más relevantes y verificables.

Beto
¿Y luego ocurre la magia?

Alicia
Sí. Esa información recuperada se inyecta de vuelta en tu prompt original. Se convierte en parte del contexto. El LLM responde usando ese texto externo y verificable para informar su respuesta.

Beto
Eso ancla la respuesta en la realidad y reduce las alucinaciones.

Alicia
Drásticamente. La ata al modelo a una fuente de verdad.

Beto
Todo esto conduce a la idea más compleja y, creo, más emocionante: los agentes LLM. (ver también)

Alicia
Correcto. Un agente es un concepto mucho más grande. Es un sistema autónomo construido sobre un LLM. Tiene un ciclo continuo: percibe su entorno, puede sensar cosas, juzga, decide y luego actúa.

Beto
RAG es solo una de las herramientas que un agente podría usar.

Alicia
Un agente podría tener un intérprete de código, una API meteorológica, cualquier cosa.

La técnica clave que le permite decidir qué herramienta usar se llama "ReAct".

Beto
ReAct: "Reason and Act" (razonar y actuar).

Alicia
Es una estructura de prompt que forza al LLM a entrelazar su razonamiento interno — su "chain of thought" (CoT), cadena de pensamiento — con pasos accionables externos. Puede razonar: "para responder esto necesito el precio de la acción de hoy", luego ejecuta la acción para llamar a una API, obtiene el resultado y razona sobre qué hacer después.

Beto
Convierte al LLM de una máquina pasiva de respuestas en un solucionador de problemas activo.

Alicia
Si te llevas una sola cosa de este análisis profundo, que sea esto: los LLMs de hoy están definidos por tres pilares:

  1. La arquitectura transformer,
  2. la escala masiva que nos dio habilidades emergentes, y,
  3. el ajuste especializado como RLHF que los hizo útiles.

Pero el futuro trata de resolver sus limitaciones mediante aumentos externos:

  • haciéndolos fácticos con RAG, y,
  • proactivos con agentes.

Beto
Esa es una síntesis perfecta.

Y para dejarte con un pensamiento final: mira más allá del simple conteo de parámetros. Eso impulsó la primera revolución, pero las próximas grandes fugas (avances) tienen que ver con la eficiencia arquitectónica y la modalidad.

Alicia
Debes vigilar lo que llaman "arquitecturas post-attention", cosas como los "modelos de espacio de estados" ("State Space Models") o SSMs, como Mamba. Prometen ser mucho más eficientes para manejar ventanas de contexto súper largas que las tareas complejas necesitan.

Beto
Y quizá aún más importante, mira las arquitecturas de "mezcla de expertos" ("Mixture of Experts"), MoE. Lo que se rumora que existe dentro de GPT-4.

Alicia
En vez de que todo el modelo gigante se dispare por cada token, MoE permite que el modelo use solo un subconjunto pequeño de parámetros expertos para una tarea dada, ...

Beto
... lo que reduce drásticamente el coste de ejecución.

Alicia
Es una señal crítica para el futuro. Los LLMs seguirán haciéndose más inteligentes, pero el foco está cambiando. Se mueve del tamaño bruto a hacerlos más rápidos, más baratos y mucho más accesibles. El modelo más grande quizá no sea el más importante mañana.

Beto
Seguiremos siguiendo esos avances por ti aquí mismo. Gracias por acompañarnos en esta inmersión profunda. Nos vemos la próxima vez

lunes, 13 de octubre de 2025

Razonamiento Recursivo con Redes Diminutas

 
 

Hoy les traigo el resumen de un artículo científico reciente que resalta algo novedoso en arquitectura de Modelos de Razonamiento de Inteligencia Artificial. Los investigadores de Samsung han logrado diseñar un modelo pequeño que razona de manera profunda usando recursión y dos capas de redes neuronales jerárquicas.

Enlace al artículo original, en inglés:
"Less is More: Recursive Reasoning with Tiny Networks", publicado el 6 de Octubre de 2025, por Alexia Jolicoeur-Martineau, de Samsung Montreal.

En el resumen también incluimos algunos enlaces, para aquellos que quieran profundizar en el tema.

El resumen, la transcripción y traducción de este artículo fueron hechos usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Bueno, durante buena parte de la última década, la creencia central que ha impulsado la investigación en IA ha sido realmente la ley de escalado, ya sabes: dicho sencillamente, más grande es mejor.

Beto
Más parámetros, modelos más anchos.

Alicia
Exacto, pilas más profundas. Se supone que todo eso conduce a un mejor rendimiento, especialmente en esas tareas realmente difíciles de razonamiento de alto nivel.

Beto
Y esa ley ciertamente parece mantenerse en lo que es conocimiento general y fluidez del lenguaje, sin duda.

Pero hoy profundizamos en algunas fuentes que le lanzan una curva realmente fuerte a esa filosofía de “más es mejor”, un desafío poderoso y contraintuitivo.

Alicia
De verdad que lo hacen. Estamos hablando de un avance bastante importante centrado en esta nueva arquitectura llamada el Modelo de Recursión Diminuto o TRM (Tiny Recursion Model).

Beto
¿Preocupante, verdad?

Alicia
Y lo que sorprende es que este modelo diminuto no solo compite, sino que en realidad está superando a esos enormes LLMs e incluso a su propio predecesor más complejo en algunos rompecabezas serios de lógica y espacio.

Beto
Sí. Nuestra misión hoy es desentrañar toda esta idea de “menos es más”. Las fuentes que tenemos detallan cómo TRM logra, bueno, una generalización y una precisión superiores con una arquitectura ridículamente simplificada.

Alicia
“Ridículamente simplificada” es correcto.

Beto
En un conteo de parámetros que a menudo baja hasta, ¿qué?, siete millones; compáralo con los modelos de los que solemos hablar, cientos de miles de millones e incluso billones de parámetros. Es otro mundo.

Alicia
Y necesitamos con urgencia este tipo de eficiencia. Porque, enfrentémoslo, a pesar de sus increíbles habilidades de lenguaje, los LLMs luchan fundamentalmente con el razonamiento duro.

Beto
Lo hacen.

Alicia
Piénsalo: cuando un LLM genera una solución, digamos para un problema matemático complejo, lo hace auto-regresivamente, ¿verdad? Un token tras otro.

Beto
Sí, de forma secuencial. Y esa generación secuencial lo hace muy propenso a un efecto dominó: un pequeño error al principio, una vuelta equivocada, ...

Alicia
... y toda la solución de varios pasos se viene abajo.

Beto
Exacto. No pueden retroceder y corregirse con facilidad.

Alicia
Correcto. Y por eso el campo recurre a estos trucos costosos y a menudo complejos, cosas como la cadena de pensamiento (CoT, Chain of Thought).

Beto
Ajá. Donde el modelo se habla a sí mismo a través de los pasos esperando que sean correctos.

Alicia
O el cómputo en tiempo de prueba (Test-Time Compute, TTC), donde básicamente ejecutan el modelo una y otra vez y esperan que la respuesta más frecuente sea la correcta. Suena un poco a adivinanza.

Beto
Es lento. Es caro. Y en los benchmarks realmente difíciles, estas soluciones todavía no bastan. Hablamos de conjuntos de rompecabezas como "Sudoku Extreme", y "Maze Hard".


Sudoku-Extreme es un dataset nuevo que consiste en 3.8 millones de problemas de Sudoku difíciles de resolver, que requieren planificación a largo plazo.

Y Maze-Hard es un laberinto de 30x30 cuadros donde el objetivo es encontrar el camino óptimo.

Ejemplos:

Fuente: Hierarchical Reasoning Model, Guan Wang y colegas, publicado en Agosto 4 de 2025.


Alicia
Y esos rompecabezas ARC-AGI de razonamiento abstracto realmente difíciles.


ARC-AGI-2 consiste en un dataset de tareas de entrenamiento y evaluación, que usa rejillas con puntos de colores, con reglas de razonamiento y composición, fáciles para resolver por un ser humano, que no se pueden memorizar.

Fuente: "ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems", por François Chollet y colegas, publicado en Mayo 17 de 2025.


Beto
Sí, son asesinos. Las fuentes son claras. Incluso los LLMs de primer nivel no han alcanzado la precisión humana ahí todavía. Ni cerca, a veces.

Alicia
Solo para poner un número a esa tasa de fallo, las fuentes mencionaron a Gemini 2.5 Pro, un modelo supuestamente de última generación. Solo consiguió, ¿qué?, 4.9% de precisión en la prueba del nuevo benchmark ARC-AGI-2. Incluso usando mucho cómputo en tiempo de prueba.

Beto
4.9%.

Alicia
Eso es una tasa de fallo del 95%. Eso te dice todo lo que necesitas saber sobre por qué necesitamos un motor de razonamiento mejor y más fiable.

Beto
Precisamente.

Para entender cómo TRM logró esto, en realidad tenemos que mirar el modelo que vino justo antes: el Modelo de Razonamiento Jerárquico, o HRM (Hierarchical Reasoning Model). Este modelo fue en sí un gran avance, aunque seguía operando con un tamaño relativamente pequeño, 27 millones de parámetros en total.

Alicia
Todavía diminuto comparado con los gigantes de hoy, pero bueno.

Beto
HRM fue novedoso porque se centró en la profundidad mediante la recursión, no solo en la fuerza bruta.

Alicia
Exacto. Se apoyó en dos conceptos realmente clave. El primero fue la supervisión profunda.

Beto
Supervisión profunda. ¿Qué es eso?

Alicia
Esencialmente le da al modelo una especie de memoria perfecta y verificable de sus propios estados internos previos, sus propios “pensamientos”. En lugar de simplemente ejecutar hacia adelante una vez, el modelo reutiliza las características latentes, los datos internos del paso de procesamiento anterior, y los usa como punto de partida para el siguiente.

Beto
Ah, así que construye directamente sobre su trabajo anterior.

Alicia
Correcto. Le permite al modelo razonar recursivamente a lo largo de muchos pasos —probaron hasta 16— sin los enormes costos de memoria de construir físicamente una red de 16 capas.

Beto
Darle un bloc de notas interno que debe revisar antes de empezar el siguiente cálculo, ¿no?

Alicia
Es una gran analogía. Profundidad efectiva lograda recursivamente, no físicamente.

Beto
Tiene sentido. ¿Y el segundo concepto?

Alicia
El segundo fue el razonamiento jerárquico recursivo. Y aquí es donde HRM empezó a ponerse, bueno, un poco complicado.

Beto
Usaba dos redes pequeñas separadas, de dos “niveles” o “bandas”. Estaban diseñadas para procesar información a diferentes “frecuencias conceptuales”, como una red de detalle de alta frecuencia y una red de contexto de baja frecuencia.

Alicia
Bien. ¿Dos redes? ¿Por qué?

Beto
Incluso fueron un paso más allá e intentaron justificar esta estructura con argumentos biológicos bastante complejos que sugerían que imitaba cómo los cerebros podrían manejar entradas sensoriales rápidas frente a una comprensión contextual más lenta.

Alicia
IA inspirada en la biología; ya hemos visto eso antes.

Pero espera, dijiste “complicado”. Entonces construyeron este sistema complejo de dos redes. ¿Cuál fue el problema? ¿Cuál fue el defecto?

Beto
El fallo estuvo realmente en la complejidad teórica y las suposiciones que tuvieron que hacer. Para lograr que esas dos redes funcionaran juntas de forma eficiente, HRM se apoyó fuertemente en matemáticas avanzadas, específicamente en algo llamado el teorema de la función implícita (Implicit Function Theorem, IFT).

Alicia
IFT. Vale. Vago recuerdo de cálculo, tal vez. ¿Qué asume aquí?

Beto
Básicamente asumía que este proceso recursivo paso tras paso eventualmente se estabilizaría, convergiendo a un punto fijo estable.

Alicia
¿Y por qué necesitaban esa suposición? ¿Qué les daba?

Beto
Porque si asumían que convergía, podían usar un atajo masivo durante el entrenamiento llamado la aproximación del gradiente de un paso (One-step Gradient Approximation).

Alicia
Un atajo. Vale.

Beto
Significaba que, cuando calculaban cómo actualizar el modelo, solo tenían que retropropagar la señal de error a través de los dos últimos pasos de la recursión en vez de quizá seis pasos totales en una pasada hacia adelante.

Alicia
Ah. Así que en lugar de calcular el error a través de los seis pasos, solo hacían los dos últimos, lo que ahorra muchísima memoria y cómputo, me imagino.

Beto
Una cantidad enorme.

Alicia
Pero dependía de que la suposición del punto fijo fuera cierta. Cambiaron el rigor teórico por ahorros prácticos, construyendo sobre una base potencialmente inestable.

Beto
Precisamente. Y las fuentes señalan que análisis independientes sugirieron que ese punto fijo rara vez, si es que alguna vez, se alcanzaba en la práctica.

Alicia
Oh. Así que toda la justificación teórica estaba tambaleante.

Beto
Muy tambaleante. Y, de forma algo irónica, estudios posteriores encontraron que la parte realmente complicada —la estructura recursiva inspirada biológicamente de dos frecuencias— ni siquiera era la razón principal de que funcionara bien.

Alicia
¿En serio?

Beto
Sí. El éxito vino casi enteramente del otro concepto: la supervisión profunda. Eso de la memoria autorreferencial que comentamos.

Alicia
Vaya. Así que toda esa complejidad extra —las dos redes, la justificación biológica— era básicamente lastre. Una lección enorme ahí.

Beto
Absolutamente. Pero la complejidad no se quedó solo en la teoría; también se filtró en el coste práctico de entrenamiento, ¿verdad?

Alicia
Lo hizo. HRM usó algo llamado tiempo computacional adaptativo (Adaptive Computational Time, ACT) para intentar ser más rápido.

Beto
ACT. Significa que el modelo podía aprender a detenerse temprano.

Alicia
Exacto. Aprendía a parar la recursión si pensaba que ya tenía la respuesta, típicamente gastando menos de dos pasos en promedio en lugar de ir los 16 pasos supervisados completos. Suena bien para la velocidad. Pero la forma en que implementaron ACT requirió un objetivo complejo de aprendizaje por refuerzo tipo Q-learning para decidir si detenerse o continuar.

Beto
Q-learning, ¿vale? Aprendizaje por refuerzo.

Alicia
Sí. Y ese cálculo de Q-learning necesitaba una pasada hacia adelante completamente separada por la red solo para averiguar el valor de "continuar o parar".

Beto
Espera, ¿dos pasadas hacia adelante por cada actualización de entrenamiento?

Alicia
Sí. Una pasada para la predicción real y una segunda pasada solo para la decisión de ACT. Efectivamente duplicaba el coste de cómputo por paso de optimización.

Beto
Duele! Así que HRM era teóricamente frágil y caro de entrenar. No ideal.

Alicia
Para nada.

Y esto prepara el terreno perfectamente para el Modelo de Recursión Diminuto, TRM. Porque TRM básicamente mira a HRM, ve esos fallos y consigue mejores resultados simplificando de forma implacable.

Beto
Aplicando la navaja de Occam.

Alicia
Totalmente. En vez de andarse con muletas teóricas y analogías biológicas, TRM es la prueba de que a veces la simplicidad es la jugada ganadora.

Beto
Entonces, ¿cuál fue la primera gran simplificación?

Alicia
La red neuronal misma. TRM elimina completamente las dos redes de cuatro capas de HRM y las reemplaza con una única red de dos capas.

Beto
¿Dos capas? Vaya, eso es una reducción radical.

Alicia
Lo es. Reduce el recuento de parámetros de los 27 millones de HRM hasta apenas 7 millones, o incluso 5 millones en algunas versiones.

Beto
Espera, menos capas. ¿No perjudicó el rendimiento? Es decir, eso va en contra de todo lo que oímos sobre las leyes de escalado, la necesidad de profundidad.

Alicia
Ese es el núcleo de la idea “menos es más” aquí, y es muy importante. Porque los conjuntos de datos para estos rompecabezas realmente difíciles, como Sudoku-Extreme, solo tienen 1.000 ejemplos de entrenamiento. Son minúsculos. Con conjuntos de datos tan pequeños, si intentas entrenar una red grande y profunda, el modelo simplemente se sobreajusta. Memoriza las respuestas en lugar de aprender las reglas subyacentes.

Beto
Ya veo. Demasiada capacidad para la cantidad de datos.

Alicia
Exacto. Al usar solo dos capas, TRM restringe esa capacidad lo suficiente para forzar la generalización. Dos capas resultaron ser el punto óptimo; con más, el rendimiento bajaba por sobreajuste.

Beto
Es un resultado de escalado fascinante. No se trata solo de profundidad, sino de profundidad efectiva mediante recursión, equilibrada con el ancho físico justo para no morir de inanición de datos. Increíble.

Alicia
Totalmente.

Bien. La simplificación número dos: limpiaron cómo se pensaba sobre las características internas, lo latente.

Beto
Se deshicieron del argot confuso.

Alicia
Básicamente. Eliminaron la complicada etiqueta jerárquica basada en frecuencias. ¿Recuerdas lo de alta y baja frecuencia?

Beto
Sí, lo de alta y baja frecuencia.

Alicia
En TRM, lo antiguo que era “answer” ahora es simplemente la respuesta predicha; lo llamaremos "y". Y lo antiguo que era “scratch” es simplemente la característica latente de razonamiento, el proceso interno de pensamiento; lo llamaremos "z". Así de simple.

Beto
Entonces "y" para la respuesta, "z" para el razonamiento. Mucho más claro.

Alicia
Y esta clarificación conduce directamente al momento “ajá” sobre por qué realmente necesitas dos características, pero probablemente no más.

Beto
Bueno. ¿Por qué dos?

Alicia
Porque "y" es como la hoja de respuestas, y "z" es como el bloc de notas donde sucede el trabajo.

Beto
Tiene sentido.

Alicia
Si quitas "z", el bloc de notas, el modelo no tiene memoria de cómo llegó a la respuesta; solo tiene la respuesta en bruto y se olvida de los pasos, cometiendo más errores.

Beto
Bien. Y si quitas la hoja de respuestas, ...

Alicia
... entonces el modelo se ve forzado a intentar meter la solución final dentro del bloc de notas — tiene que almacenar la respuesta dentro de los pasos de razonamiento — lo que también empeora la precisión.

Beto
Entiendo. Así que necesitas roles distintos: un sitio para mantener la solución y otro para mantener la cadena de pensamiento. Simple y elegante.

Alicia
Exacto.

Ahora, la simplificación número tres quizá sea el mayor cambio de juego de toda la historia. TRM elimina por completo esa endeble aproximación teórica del IFT, la aproximación de gradiente de un paso que mencionamos antes.

Beto
Ese atajo teórico. Lo tiran. Simplemente lo quitan.

Alicia
Evitan todo el problema del punto fijo al no asumirlo. En lugar de confiar en ese atajo teórico que quizá sea falso, TRM retropropaga el error a través de todo el proceso recursivo. Todos los 16 pasos fijos en la pasada hacia adelante. Sin aproximaciones. Simplemente calculan el gradiente completo.

Beto
Vaya! OK. Así que abrazan el cómputo en vez de esconderse detrás de una teoría potencialmente defectuosa sobre ese cómputo.

Alicia
Me gusta eso. Y la mejora en rendimiento solo por este cambio fue asombrosa. La fuente señala que en Sudoku-Extreme, simplemente descartando esa aproximación y usando retropropagación completa, su precisión en test subió de 56.5% —que estaba bien pero no era gran cosa— a un increíble 87.4%.

Beto
Whoa. De mediados de los cincuenta a casi el 90% solo calculando bien el gradiente.

Alicia
Sí. Ese único cambio desbloqueó ganancias masivas. Simplemente, haz las matemáticas correctamente.

Beto
Increíble.

Beto
Y la simplificación final es el coste de entrenamiento.

Alicia
Obviamente. Simplificaron ACT, el tiempo computacional adaptativo: se deshicieron del objetivo complejo de Q-learning.

Beto
Eso significa que eliminaron esa segunda pasada hacia adelante tan cara.

Alicia
Exacto. Ya no más duplicar el cómputo por paso. Encontraron que podían simplemente aprender una probabilidad de detenerse usando la entropía cruzada binaria estándar, mucho más sencilla y barata.

Beto
¿Y esa simplificación perjudicó el rendimiento? Normalmente lo simple significa menos capaz.

Alicia
Aquí no. Mostró una precisión casi idéntica: 86.1% frente al 87.4% con la retropropagación completa, mientras hacía el entrenamiento significativamente más rápido y barato.

Beto
Así se realiza la eficiencia sin pérdida de rendimiento, ese el sueño.

Alicia
Eso es realmente.

Bien, miremos la tarjeta final. ¿Qué consiguió esta combinación —simplificación implacable, foco en la supervisión profunda, recursión honesta y completa— en términos de resultados?

Beto
Las comparaciones son bastante contundentes, especialmente dado el tamaño relativo entre TRM y los grandes LLMs. Es casi embarazoso para la filosofía estándar de escalado.

Alicia
El benchmark más duro, ARC-AGI-2.

Cuéntanos sobre el resultado.

Beto
TRM con self-attention — y recuerda, esto tiene solo 7 millones de parámetros — consigue 7.8% de precisión. 7.8. Nosotros mencionamos que Gemini 2.5 Pro solo obtiene 4.9%.

Alicia
Mejor precisión con muchísimos menos parámetros. Muy por debajo en parámetros.

Beto
Con mucho menos. Y si comparas los 7 millones de parámetros de TRM con algo como, digamos, Grok-4-thinking, que supuestamente tiene 1.7 billones de parámetros, TRM opera con menos del 0.01% de los parámetros, menos de 1/110.000, y obtiene mejores resultados de razonamiento en ese benchmark.

Alicia
Eso es una locura. La eficiencia en parámetros está fuera de serie.

Beto
Completamente.

Y los resultados en los rompecabezas dedicados, Sudoku y Maze, son igual de dramáticos.

Alicia
Sí.

Beto
En Sudoku Extreme, la versión aún más pequeña de 5 millones de parámetros de TRM, la que no tiene self-attention, sube a ese 87.4% de precisión en test. Recuerda que HRM, el predecesor, estaba estancado en 55.0%.

Alicia
Un salto de "apenas aprobando", a "casi perfecto".

Beto
Y en Maze Hard, el TRM de 7 millones con atención consigue 85.3%, nuevamente muy por encima del HRM con 74.5%.

Alicia
Bien, esa diferencia es interesante. ¿Por qué atención para Maze pero no para Sudoku?

Beto
Eso conecta con la visión más amplia: la elección arquitectónica debe ajustarse al problema. La fuente destacó esto. La efectividad de TRM depende realmente de la estructura de la tarea.

Alicia
Así que la variante MLP más simple, sin self-attention, funciona mejor para contextos fijos y pequeños como una cuadrícula de Sudoku 9x9.

Beto
Exacto. Las relaciones entre celdas son bastante locales y predecibles. Pero para la gran complejidad y la naturaleza variable de las tareas ARC-AGI, o para cuadrículas más grandes como laberintos 30x30, ...

Alicia
... necesitas ese mecanismo de self-attention para que el modelo encuentre dinámicamente las dependencias a larga distancia importantes.

Beto
Precisamente. Muestra que puedes obtener resultados de vanguardia combinando estratégicamente componentes mínimos pero potentes — solo dos capas, una característica de memoria dedicada, quizá self-attention si hace falta — en vez de escalarlo todo sin discriminación.

Alicia
Bien, cerremos esto. ¿Qué significa todo esto para ti, el oyente?

Creo que la idea principal aquí es bastante profunda. El futuro del razonamiento fiable y de alto nivel en IA puede no estar en construir modelos cada vez más anchos con trillones más de parámetros. Podría estar en construir modelos recursivos más inteligentes que realmente adopten la profundidad efectiva.

Beto
Profundidad a través de la recursión, no solo capas.

Alicia
Exacto. Los elementos cruciales que TRM clavó parecen ser la supervisión profunda — esa memoria interna — y la recursión transparente y completa, calculando todo el proceso honestamente. Demuestra que una profundidad efectiva extrema, como las ~42 capas efectivas que consiguieron con solo dos capas físicas en TRM, puede ser mucho más potente que la mera amplitud masiva, especialmente cuando los datos de entrenamiento son limitados, que a menudo lo son para razonamiento complejo.

Beto
Lo cual plantea una gran pregunta sobre lo que viene después, ¿no?

Alicia
Sí que la plantea.

Beto
Ahora mismo, estos modelos de razonamiento recursivo, TRM y HRM, son métodos de aprendizaje supervisado, ¿cierto? Están entrenados para encontrar una única respuesta determinista.

Alicia
Encuentra la solución del Sudoku; encuentra el camino por el laberinto.

Beto
Correcto. Pero muchos problemas del mundo real, quizá la mayoría de los interesantes, no tienen una única respuesta correcta. Pueden tener múltiples soluciones válidas o requerir salidas abiertas y creativas, ...

Alicia
... como generar diferentes estrategias o escribir distintas explicaciones.

Beto
Exacto. El siguiente paso importante para los investigadores es averiguar cómo tomar esta arquitectura recursiva increíblemente eficiente y poderosa que TRM ha pionero y extenderla con éxito a tareas generativas.

¿Cómo lograr que ese razonamiento recursivo riguroso produzca salidas diversas, creativas, pero aún lógicamente sólidas? Esa parece ser la próxima frontera.