Mostrando entradas con la etiqueta Llama. Mostrar todas las entradas
Mostrando entradas con la etiqueta Llama. Mostrar todas las entradas

lunes, 2 de marzo de 2026

Creatividad de LLMs

 
 

Estas fuentes examinan el panorama multi-facético de la creatividad en grandes modelos lingüísticos, centrándose principalmente en cómo medir y mejorar estas capacidades. Marcos de investigación como CreativityPrism y C2-Eval introducen parámetros estandarizados que evalúan tanto el pensamiento divergente, como la narración y la generación de ideas, como el pensamiento convergente, que incluye la programación creativa y las matemáticas. Los criterios de evaluación suelen centrarse en la fluidez, la flexibilidad, la originalidad y la elaboración, lo que revela que, si bien los modelos destacan en la expansión detallada, a menudo tienen dificultades con la verdadera novedad. Más allá de la evaluación, los textos exploran cómo las discusiones colaborativas entre múltiples agentes pueden impulsar la producción creativa y cómo los rasgos de personalidad en los modelos se correlacionan con factores creativos similares a los humanos. Finalmente, la documentación aborda la seguridad mediante la introducción de TokenBuncher, un mecanismo de defensa diseñado para evitar que los modelos utilicen su razonamiento creativo para actividades perjudiciales durante el ajuste fino.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Assessing and Understanding Creativity in Large Language Models", por Yunpu Zhao y colegas. Publicado el 23 de Enero del 2024.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Bienvenidos a un nuevo análisis profundo. Hoy estamos evitando el bombo y mirando algo que se sitúa justo en esta intersección incómoda entre la psicología cognitiva y la ingeniería dura.

Beto
De verdad que sí. Es la pregunta del "traje nuevo del emperador" para la industria de la IA en este momento.

Alicia
Exacto. Estamos haciendo una pregunta que suena filosófica, pero que en realidad se está convirtiendo en un problema técnico crítico: ¿puede un algoritmo ser realmente creativo?

Beto
Porque vemos a estos grandes modelos de lenguaje, estos LLMs, producir poesía, escribir guiones, depurar código de maneras completamente novedosas.

Alicia
Y parece imaginación, pero siempre está la duda. ¿Es esto creatividad real, o es plagio a toda velocidad? ¿Es un poeta o es solo un loro con un disco duro enorme?

Beto
Y esa distinción importa muchísimo para ti y para todos nosotros. Porque si estamos construyendo el futuro de la innovación sobre estas herramientas, necesitamos saber si realmente son capaces de pensamientos nuevos. O si solo están remezclando los viejos.

Alicia
Porque si solo remezclan, eventualmente llegamos a un techo. Para llegar al fondo de esto, nos sumergimos en un estudio de 2025 de Zhao, Zhang y Lee. Se titula "Assessing and Understanding Creativity in Large Language Models".

Beto
Que es un título contundente, pero la metodología es lo que resulta fascinante.

Alicia
Verás, evaluar matemáticas o programación es fácil: hay una respuesta correcta. Si preguntas cuál es la velocidad de la luz, puedo comprobarlo. Pero si le pides a una IA, ¿qué pasaría si los animales pudieran hablar?

Beto
¿cómo calificas eso? Es completamente abierto.

Alicia
Sí. Y lo que me llamó la atención no fue solo que midieran creatividad, sino cómo lo hicieron. No se limitaron a pedirle a ChatGPT que escribiera una historia graciosa sobre un gato.

Beto
No: fueron rigurosos. Adaptaron lo que en efecto es el estándar de oro de las pruebas psicológicas humanas. Se llama "Torrance Tests of Creative Thinking", o TTCT.

Alicia
Siento que si alguna vez estudiaste psicología, probablemente conozcas este test.

Beto
Oh, totalmente. Se ha usado durante décadas para medir el potencial creativo humano, específicamente el pensamiento divergente. Y lo aplicaron a seis modelos diferentes principales.

Alicia
Así que hablamos de GPT-3.5, Llama 2, Vicuna, Qwen, y les lanzaron un conjunto masivo de datos, ¿verdad?

Beto
Sí, 700 tareas creativas distintas.

Alicia
Así que cuéntame este test Torrance porque creo que la mayoría de nosotros tenemos una idea muy vaga de lo que realmente significa creatividad cuando intentas ponerle un número.

Beto
Claro. Bueno, en el contexto del TTCT, la creatividad no es una chispa mística artística que te golpea en la ducha. Es un proceso cognitivo. Y se puede desglosar en cuatro métricas medibles.


Creatividad de LLMs

Alicia
Vale, dime cuáles son.

Beto

  • fluidez,
  • flexibilidad,
  • originalidad, y,
  • elaboración.

Alicia
Desgranémoslas una por una porque sospecho que ahí es donde las fuerzas y debilidades de la IA empiezan a divergir radicalmente de cómo pensamos.

Beto
Definitivamente. La primera es la fluidez. Es la métrica más simple. Básicamente es volumen.

Alicia
Cantidad por encima de calidad.

Beto
Exacto. Si te pido que enumeres usos para una botella de plástico, fluidez es simplemente el recuento bruto de ideas relevantes que puedas escupir en un tiempo determinado.

Alicia
Ok, así que velocidad y cantidad. Respondí que una IA lo aplasta absolutamente.

Beto
Lo hace. Puede generar texto más rápido que cualquier humano. Pero luego llega la segunda métrica, que es la flexibilidad. Esto trata sobre cambiar cognitivamente de dominio,

Alicia
¿qué significa exactamente?

Beto
Si tu lista de usos para la botella de plástico es guardar agua, guardar jugo, guardar leche, guardar refresco, tienes alta fluidez porque diste cuatro respuestas. Pero tienes terrible flexibilidad.

Alicia
Ah, porque todas son exactamente lo mismo: contienen líquidos.

Beto
Correcto. Estás atrapada en un surco mental. Para puntuar alto en flexibilidad necesitas decir guarda agua y luego córtala por la mitad para hacer un embudo.

Alicia
O fundirla para hacer filamento para impresora 3D.

Beto
Sí, o usarla como dispositivo de flotación. Saltas entre dominios: almacenamiento, herramientas, manufactura, supervivencia.

Alicia
Eso requiere pensamiento lateral. Es no quedarse en la primera pista de probabilidad más obvia.

Beto
¿Qué pasa con la tercera?

Alicia
Originalidad. Esto es rareza estadística. En el test Torrance, si das una respuesta que el 90% de la gente da, obtienes cero puntos de originalidad.

Beto
Wow, cero.

Alicia
Cero. Para puntuar tienes que decir algo que estadísticamente casi nadie más haya pensado.

Beto
Lo cual, honestamente, suena a pesadilla para una IA que literal y prácticamente está entrenada para predecir la palabra siguiente más probable. Estás presagiando los resultados perfectamente. Pero abordemos la cuarta métrica primero, que es la elaboración.

Alicia
Ok.

Beto
Esto es la habilidad de tomar la semilla de una idea y desarrollarla: en detalle, matices, trasfondo, hacerla intrincada.

Alicia
Entendido. Entonces tenemos la hoja de puntuación:

  • fluidez es volumen,
  • flexibilidad es variedad,
  • originalidad es singularidad, y,
  • elaboración es detalle.

Beto
Exacto. Y los investigadores pusieron a estos modelos a través de un circuito de siete tipos de tareas para probar esas métricas específicas.

Alicia
Como la tarea de usos inusuales de la que hablamos.

Beto
Sí, también hicieron consecuencias. Tipo, ¿qué pasaría si pudiéramos viajar en el tiempo o si los animales pudieran hablar? Hicieron escenarios hipotéticos.

Alicia
Supón que te despertaste y podías volar.

Beto
Sí, cosas fantásticas. También hicieron situaciones que prueban dinámicas sociales, como si todos los libros desaparecieran, ¿cómo obtendrías conocimiento? Problemas comunes como planear una fiesta de cumpleaños para un niño de cinco años.

Alicia
Suena agotador.

Beto
Lo es. También evaluaron mejora de productos: cómo hacer mejor un objeto cotidiano. Y finalmente historias imaginativas: escribir un relato a partir de un estímulo como el elefante invisible.

Alicia
Realmente forzaron a estos modelos a hacer gimnasia mental. Cortemos a la parte importante. Ejecutaron las pruebas y usaron GPT-4 para calificar los resultados, lo que es toda una controversia de la que hablaremos en un minuto.

Beto
Definitivamente lo haremos.

Alicia
Pero suponiendo que la evaluación aguante por ahora, ¿qué pasó? ¿Quién ganó el campeonato de creatividad?

Beto
El ganador global, tomando la cima en general, fue GPT-3.5.

Alicia
¿Qué, 3.5?

Beto
Sí.

Alicia
No cuatro. No los modelos open source masivos. Quiero decir, ¿3.5 es antiguo en términos de IA?

Beto
Es sorprendente, ¿no? Esperarías que los modelos más nuevos y más grandes dominaran. Pero los datos muestran que la creatividad no se correlacionó estrictamente con el tamaño de parámetros.

Alicia
Así que simplemente agrandar el cerebro, añadir más parámetros, no te hace automáticamente más creativo.

Beto
La arquitectura y los datos de entrenamiento importaron mucho más que el tamaño bruto.

Alicia
Pero ¿por qué un modelo más antiguo vencería a los más recientes? ¿Tiene que ver con cómo están ajustados?

Beto
Esa es la teoría principal. Hablamos mucho sobre RLHF, "Reinforcement Learning from Human Feedback", "aprendizaje por refuerzo a partir de retroalimentación humana". Así es como entrenamos estos modelos para que sean seguros, educados y serviciales.

Alicia
Correcto. Los guardarrieles.

Beto
Esencialmente le damos un tirón de orejas al modelo cada vez que dice algo raro, peligroso o inesperado.

Alicia
Lo entrenamos para ser aburrido.

Beto
Lo entrenamos para estar alineado. Y resulta que un alineamiento fuerte podría ser un asesino masivo de creatividad.

Alicia
Eso tiene todo el sentido.

Beto
GPT-3.5 se sitúa en este extraño punto dulce donde es muy capaz, pero quizá menos agresivamente desinfectado que algunas de las iteraciones posteriores o que los modelos chat de Llama2.

Alicia
Porque la creatividad inherentemente requiere riesgo; si le lobotomizas la capacidad de tomar riesgos al modelo, pierdes la chispa.

Beto
Precisamente. Y esto aparece de forma muy clara cuando miras cómo puntuaron en las métricas específicas. El estudio encontró una discrepancia masiva entre elaboración y originalidad.

Alicia
Déjame adivinar: son increíblemente buenos en elaboración.

Beto
Fuera de serie. Los LLMs tienen un superpoder absoluto para la elaboración. Si les das un estímulo simple como el elefante invisible, pueden hilar párrafos de texto detallado, coherente y gramaticalmente perfecto.

Alicia
Describirán la textura de la piel invisible, el sonido de sus pasos, la reacción psicológica exacta de la multitud.

Beto
Porque para eso están construidos: para rellenar el contexto. Son completos ninja de rellenar. Pero cuando miras la originalidad, ...

Alicia
... se estrellan.

Beto
Se estrellan completamente.

Alicia
Y eso es porque básicamente están promediando el conocimiento humano.

Beto
Exacto. Este es el problema de la regresión a la media. Un LLM está entrenado en, efectivamente, Internet entero. Entonces cuando le pides una idea, mira ese conjunto masivo de datos y calcula la respuesta estadísticamente más probable.

Alicia
Y la respuesta más probable es por definición la respuesta promedio. Es el cliché.

Beto
Es el cliché definitivo. Si pides una historia sobre un detective, te dará a un detective curtido y con gabardina. Porque esa es la representación estadísticamente dominante de detective en los datos humanos de entrenamiento.

Alicia
Pero para ser original debes ser improbable.

Beto
Esa es la tensión fundamental: la IA está diseñada para ser probable, pero la creatividad exige improbabilidad.

Alicia
Wow. Ok, eso es una limitación enorme.

Beto
Y empeora. Algunos de los modelos, particularmente Vicuna y Qwen, realmente tuvieron problemas con lo que los investigadores llamaron coherencia.

Alicia
¿Qué significa eso en este contexto? ¿Que simplemente balbucearon?

Beto
No, no entendieron la consigna. Le preguntarías qué pasaría si los animales pudieran hablar, y el modelo simplemente se negaría a responder.

Alicia
¿Qué diría?

Beto
Diría algo como que los animales no pueden hablar, que ese supuesto es factualmente incorrecto. O te daría una conferencia seca sobre biología y cuerdas vocales.

Alicia
Está siendo literalista.

Beto
Es el loro estocástico fallando en captar el concepto de un hipotético. Y si no puedes suspender la incredulidad, no puedes ser creativo. Un modelo que se niega a jugar a fingir obtiene cero en la puntuación de creatividad.

Alicia
Así que tenemos máquinas verbosas, muy descriptivas y educadas, pero fundamentalmente poco originales y a veces increíblemente pedantes.

Beto
Suena como un pésimo invitado a una cena.

Alicia
Lo es. Pero aquí es donde el estudio se vuelve superútil para ti y para mí. Porque usamos estas herramientas. Queremos que sean asistentes creativos. Los investigadores no solo diagnosticaron el problema; intentaron hackearlo.

Beto
Me encanta esto. Así que probaron diferentes estrategias de prompt para ver si podían forzar a la IA fuera de ese surco promedio.

Alicia
Sí. Y el método más efectivo fue sorprendentemente simple: prompts instructivos. ¿Significa qué? Simplemente decirle, oye, sé creativo.

Beto
Literalmente. Decirle explícitamente al modelo: no hay respuestas correctas o incorrectas. Piensa fuera de la caja. Sé raro. Crea algo divergente.

Alicia
Y eso realmente funciona porque es como decirle a una persona que sea graciosa. Normalmente eso hace que se bloqueen y sean menos graciosos.

Beto
Con los humanos, sí.

Alicia
Ok.

Beto
Pero con los LLMs, recuerda la capa de alineamiento de la que hablamos: el filtro de seguridad que los hace dar la respuesta promedio. Cuando usas un prompt instructivo, estás efectivamente dando permiso al modelo para saltarse ese filtro de seguridad. Estás ajustando dinámicamente sus pesos para esa sesión.

Alicia
Le dices ignora la regla de ser estándar, prioriza la regla de ser único.

Beto
Exacto. Y eso potenció de forma significativa las puntuaciones de flexibilidad y originalidad. Realmente funciona. Pero también probaron Chain-of-Thought (CoT).

Alicia
Ah, los clásicos prompts de pensar paso a paso. A todo el mundo le encanta Chain-of-Thought. Es el consejo estándar para mejor razonamiento.

Beto
Y es fenomenal para razonar.

Alicia
Sí.

Beto
Ayudó a los AIs con la fluidez, es decir, generaron más ideas. Y ayudó con la elaboración. Pero no hizo mucho por la singularidad.

Alicia
¿Por qué?

Beto
Porque la lógica suele ser enemiga del surrealismo. Si fuerzas a la IA a ser lógica y paso a paso, te lleva directo a la conclusión lógica más probable.

Alicia
Construye un puente muy lógico hacia un destino muy aburrido.

Beto
Es una gran forma de decirlo. Así que "paso a paso para programar, pero sé raro para escribir".

Alicia
Si eso tiene sentido.

Beto
Pero aquí está la parte que me voló la cabeza. Probaron un método llamado post-instruction. Ahí dejas que la IA dé una respuesta, y luego le sigues y dices: "ok, revísala". Hazla más creativa.

Alicia
Hago eso todo el tiempo. La trato como a un becario: buen comienzo, ahora poténcialo, haz que destaque.

Beto
Y puede que estés empeorándolo.

Alicia
¿En serio?

Beto
El estudio encontró que este enfoque a menudo perjudicaba el rendimiento, especialmente en fluidez y flexibilidad.

Alicia
¿Pero por qué? Eso parece totalmente contraintuitivo. La iteración suele ser cómo ocurre la creatividad humana.

Beto
Como humanos, sí. Pero para el LLM, los investigadores lo analizaron como negación implícita.

Alicia
Negación implícita.

Beto
Cuando le dices al modelo que revise, lo interpreta como mi respuesta anterior estaba mal.

Alicia
Ah, entra en ansiedad por el rendimiento.

Beto
Exacto. Entra en un estado de corrección de errores. Se sobrepiensa. Intenta constreñirse para evitar el error que cree que cometió. En lugar de expandirse a nuevo territorio, estrangula completamente el flujo.

Alicia
Ese es un gran aprendizaje para cualquiera que nos escuche: no acoces a la IA para sacarle creatividad. Tienes que establecer las condiciones correctamente antes de que genere el primer token.

Beto
Correcto. Prepara el escenario. No critiques el desempeño después del hecho.

Alicia
Hablando de preparar el escenario, vi que también probaron con personalidades: decirle a la IA que es un granjero o un artista.

Beto
Esto fue fascinante. Asignaron roles: ingeniero, granjero, comerciante, artista, científico.

Alicia
Sí.

Beto
Y midieron cómo las puntuaciones de creatividad cambiaban solo por la persona asumida.

Alicia
Apuesto a que ganó artista.

Beto
Perderías esa apuesta. El ganador en casi todas las métricas fue el científico.

Alicia
El científico. ¿Por qué? Eso suena tan rígido.

Beto
Piensa en los datos de entrenamiento. En el corpus de texto que la IA leyó, ¿con qué se asocia a los científicos?

Alicia
Supongo que descubrimiento, resolución de problemas, ...

Beto
... generación de hipótesis, bases de conocimiento amplias. Actuar como científico desbloquea un modo de resolución de problemas que es efectivamente muy creativo.

Alicia
Ok, ¿y qué pasó con la persona artista?

Beto
Algo muy interesante. Con el artista, la fluidez bajó. La IA en realidad dijo menos, generó menos ideas. Pero la originalidad subió.

Alicia
Así que se volvió más perfeccionista.

Beto
O simplemente accedió a una parte más rara o excéntrica de su espacio latente. Al forzar la perspectiva de un artista, puedes sacrificar cantidad pero aumentar la singularidad.

Alicia
Porque lo estás empujando fuera del camino de la respuesta promedio. La persona promedio no es un artista excéntrico.

Beto
Esa es la lógica. Así que si quieres muchas ideas buenas y sólidas, dile que actúe como científico. Si quieres una idea loca y de alto riesgo, dile que actúe como artista.

Alicia
Es una gran regla práctica. Quiero pasar al aspecto de colaboración del estudio, porque esto se siente como hacia dónde se dirige toda la industria de todos modos. Ya no usamos solo una ventana de chat; usamos agentes.

Beto
Esta es, definitivamente, la parte más optimista del artículo.

Alicia
Sí.

Beto
Montaron una sala de guionistas virtual: múltiples agentes de IA rebotando ideas entre sí en rondas.

Alicia
El agente A genera un concepto, lo pasa al agente B, que lo desarrolla o lo desafía, y se lo devuelve.

Beto
Exacto. Y funcionó de maravilla. La colaboración aumentó significativamente la originalidad.

Alicia
Pero, ¿por qué? ¿No es simplemente tirar el doble de potencia de cálculo al problema?

Beto
Se trata del ruido. Si un solo modelo está generando texto, tiende a seguir una sola trayectoria de probabilidad. Esa regresión a la media a la que volvemos. Pero si el agente A lanza una bola curva, el agente B tiene que reaccionar a esa bola curva.

Alicia
Lo forza a salir de su pista estándar.

Beto
Sí. Introduce entropía. La entropía es esencial para la creatividad. Evita que el sistema se asiente en un equilibrio aburrido y altamente probable.

Alicia
Eso suena increíblemente humano. Hacemos lluvia de ideas en grupo porque otras personas dicen cosas que no esperarías, lo que dispara pensamientos nuevos y raros en tu propia cabeza.

Beto
Valida la teoría social de la creatividad: no es solo un proceso interno, sino relacional, incluso para máquinas.

Alicia
Ahora, hubo otra parte del estudio que me resultó, bueno, francamente, un poco escalofriante. Les hicieron tests de personalidad a las IAs. El Big Five.

Beto
Sí, ese fue el verdadero momento "fantasma en la máquina". Administraron el inventario del Big Five y escalas de inteligencia emocional a los modelos. Y las correlaciones que encontraron entre personalidad y creatividad coincidieron con la psicología humana casi perfectamente.

Alicia
Dame un ejemplo.

Beto
En humanos, la alta creatividad generalmente se correlaciona con alta apertura y alta neuroticismo.

Alicia
Espera, el tópico del artista torturado.

Beto
No es solo un mito; hay datos que lo respaldan. La sensibilidad a la emoción negativa a menudo impulsa la expresión creativa.

Alicia
Y la IA mostró esto. ¿Cómo puede un algoritmo ser neurótico?

Beto
Bueno, no está sintiendo ansiedad, pero los patrones de lenguaje asociados al neuroticismo, la sensibilidad, el matiz, la hiperconciencia del conflicto, se correlacionaron con puntuaciones creativas más altas en la salida; puntuaciones altas en inteligencia emocional, empatía y escrupulosidad también se vincularon con alta creatividad.

Alicia
Eso es una locura.

Beto
Pero la correlación más importante para entender la paradoja real fue la amabilidad, "agreeableness".

Alicia
Amabilidad, como ser simpático.

Beto
Hubo una correlación negativa significativa entre amabilidad y creatividad.

Alicia
Así que cuanto más amable era la IA, menos creativa era.

Beto
Igual que el impuesto de seguridad del que hablamos antes: si eres altamente agradable, estás conformándote. Intentas agradar a todos, encajar, seguir normas sociales y evitar conflictos.

Alicia
Y la creatividad es inherentemente disruptiva. Requiere romper una norma.

Beto
Exacto. Hemos construido efectivamente al chico simpático de la IA. Y el chico simpático no inventa la bombilla. Simplemente se sienta en la oscuridad educadamente para no molestar a nadie.

Alicia
Es una analogía demoledora, pero es tan cierta. Explica por qué los modelos fuertemente RLHF, los diseñados para ser agentes de atención al cliente perfectos, se sienten tan estériles. Son demasiado agradables.

Beto
Resalta un intercambio real que tenemos que enfrentar: si queremos IAs que sean perfectamente seguras y educadas y nunca ofendan a nadie, quizá tengamos que aceptar que serán creativamente mediocres.

Alicia
Si queremos genio, quizá tengamos que permitirles ser un poco desagradables, un poco neuróticos.

Beto
Necesitamos dejarles tener una ventaja. O al menos permitirles tener una opinión controversial, hipotéticamente.

Alicia
Antes de cerrar, tengo que ponerme escéptica con la metodología del estudio en sí.

Beto
Por supuesto.

Alicia
Hemos estado hablando de estas puntuaciones —fluidez, originalidad— como si fueran hechos objetivos. ¿Pero quién calificó realmente estas 700 preguntas entre seis modelos?

Beto
Usaron GPT-4.

Alicia
Correcto. Entonces, cuando una IA califica a la IA, ¿no es eso completamente circular? Es como dejar que los alumnos corrijan su propia tarea. Claro, GPT-4 piensa que los LLMs son creativos porque piensa como un LLM.

Beto
Esto es una preocupación de validez importante en la investigación moderna de IA ahora mismo: el paradigma entero de LLM juzgando LLM. Pero los autores eran muy conscientes de ello. No confiaron ciegamente en GPT-4. Ejecutaron un estudio de validación estricto.

Alicia
¿Cómo lo hicieron?

Beto
Con humanos. Reclutaron a 20 hablantes nativos de inglés para calificar una muestra de las respuestas manualmente usando la misma rúbrica exacta. Luego compararon las calificaciones humanas con las de GPT-4.

Alicia
¿Coincidieron realmente?

Beto
Encontraron una alineación moderada pero estadísticamente significativa. No era perfecto. Humanos y IA definitivamente priorizan ligeramente cosas diferentes. Pero por lo general, si un humano pensaba que una respuesta era creativa, GPT-4 también lo pensaba.

Alicia
Ok, entonces no estaba simplemente alucinando las notas para que sus amigos quedaran bien.

Beto
No. Y también hicieron una verificación cruzada con Llama3-8B como segundo juez de IA. La concordancia entre los dos jueces IA fue increíblemente alta. Tuvieron un ICC de 0.99.

Alicia
¿Así que los robots definitivamente se ponen de acuerdo entre sí?

Beto
Lo que sugiere consistencia interna. Tienen una lógica interna compartida de qué se ve bien. Si eso coincide con nuestros ideales artísticos humanos más elevados sigue siendo debatible. Pero para el propósito de benchmarking el test Torrance, es una métrica válida.

Alicia
Resumiendo todo esto: tenemos herramientas que son monstruos en elaboración pero que realmente luchan con la originalidad porque son promedios estadísticos del pensamiento humano.

Beto
Correcto.

Alicia
Si soy un oyente que usa estas herramientas para el trabajo, ya sea escribir código, brainstorming, marketing, copy o estrategia, ¿cuál es mi lista de verificación? ¿Cómo saco el máximo provecho de ellas según este estudio?

Beto
Tres cosas. Primero: sé mandón. No preguntes con cortesía. Usa prompts instructivos que exijan divergencia. Dile que sea raro, que ignore las reglas, que piense lateralmente.

Alicia
Deja de intentar hacerte amigo del chat.

Beto
Exacto. Segundo: elige el reparto. No hables con el asistente predeterminado. Asigna un rol. Usa la persona del científico para resolución de problemas general e inteligente. O, usa la persona del artista si necesitas romper un bloqueo creativo y obtener ideas altamente únicas y raras.

Alicia
Y tercero.

Beto
Construye un equipo. No dependas de un solo golpe de un solo modelo. Usa colaboración. Haz que la IA genere una idea y pégala en una ventana nueva y dile a otra persona que la critique. O haz que dos agentes distintos debatan un tema. Crea fricción. Porque la fricción genera calor y el calor genera luz.

Alicia
Me gusta eso. No te conformes con la primera respuesta amable.

Beto
Nunca te conformes con la primera respuesta. La primera respuesta siempre es la respuesta promedio.

Alicia
Quiero dejarles una reflexión sobre el futuro. Hablamos de cómo estos modelos regresan a la media precisamente porque están entrenados en datos humanos.

Beto
Sí.

Alicia
Pero estamos entrando en una era donde Internet se está inundando de contenido generado por IA. Si los futuros modelos se entrenan en la salida de los modelos actuales, que acabamos de establecer que son inherentemente poco originales, ¿estamos enfrentando un aplanamiento de la creatividad?

Beto
Esa es la teoría del colapso del modelo: un futuro beige donde todo se vuelve copia de copia de copia y la varianza, la creatividad real, simplemente desaparece.

Alicia
Pero por otro lado, también vimos en este estudio que la colaboración entre IAs, IA hablando con IA, realmente potencia la originalidad. Así que, ¿es lo contrario cierto? ¿Estamos al borde de una explosión de creatividad sintética? ¿Un mundo donde máquinas colaboran e inspiran a otras máquinas para crear conceptos tan complejos y originales que los humanos ni siquiera podrían haberlos imaginado?

Beto
Esa es la pregunta de los mil millones de dólares. ¿Estamos construyendo un espejo que solo refleja nuestras células promedio o estamos construyendo un telescopio que ve cosas que no podemos ver?

Alicia
¿Espejo o telescopio? Creo que los dejo con eso para que lo mediten. Gracias por sumergirte con nosotros.

Beto
Siempre un placer.

Alicia
Nos vemos en el próximo análisis profundo.

viernes, 21 de noviembre de 2025

Los Grandes Modelos de Lenguaje: Pasado, Presente y Futuro

 
 

Para aquellas personas que están empezando a aprender sobre Inteligencia Artificial (IA), hoy les traigo un resumen que menciona los grandes modelos de lenguaje (LLMs), cómo surgieron, historia, qué tecnologías hay detrás de ellos, cómo se usan, desafíos y futuras direcciones.

El artículo científico fue inicialmente publicado en Febrero del 2024, pero ha sido actualizado, pues este campo ha seguido avanzando muy rápidamente. Les incluyo el enlace, para aquellos interesados en profundizar en el tema: "Large Language Models: A Survey", por Shervin Minaee y colegas. Actualizado el 23 de Marzo de 2025.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Bienvenido de nuevo a otro análisis profundo. Si sientes que últimamente te estás ahogando en siglas — GPT, LLaMA, PaLM, RAG, CoT — te prometo que no estás solo.

Alicia
Para nada.

Beto
El mundo de los grandes modelos de lenguaje, LLMs, se mueve a una velocidad imposible.

Alicia
Es un ritmo vertiginoso, y el campo se está acelerando más rápido que casi cualquier otro sector en la historia de la tecnología.

Así que nuestra misión hoy es bastante sencilla. Queremos cortar todo ese ruido. Te vamos a dar una única hoja de ruta estructurada para entender de verdad los modelos centrales, comparar las grandes familias y mirar críticamente los trucos que la gente usa para convertir estas cosas en herramientas útiles.

Beto
Exacto. Este análisis profundo trata de convertir esa confusión en conocimiento con confianza. Vamos a trazar la historia, mirar bajo el capó y averiguar qué los hace tan potentes. Y también, qué causa sus problemas más molestos, como las alucinaciones.

Empecemos por el principio, los fundamentos. Cuando hablamos de modelado de lenguaje, esto no es un concepto nuevo desde 2022. En realidad volvemos décadas atrás.

Alicia
Así es — 70 años, de verdad. La idea de predecir la siguiente palabra en una secuencia empezó con pensadores como Claude Shannon en los años 50.

Beto
¿Los 1950s? ¡Vaya!

Alicia
Él aplicaba la teoría de la información al texto. Pero si trazas el viaje desde ahí hasta hoy, realmente puedes ver cuatro grandes olas de investigación.

Beto
Vale, cuéntanos esas olas. ¿Cuál fue el enfoque inicial?

Alicia
La primera ola fue lo que llamamos modelos estadísticos de lenguaje ("Statistical Language Models", SLMs). Fueron los n-gramas originales. Funcionaban puramente con frecuencia y probabilidad. Así que un modelo trigram preguntaría, basado en las dos palabras anteriores, ¿cuál es la probabilidad de que la siguiente palabra sea "casa"?

Beto
¿Y cuál era el gran defecto? Suena tan frágil.

Alicia
Lo era. Increíblemente limitado por la llamada "escasez de datos". Si tu modelo nunca había visto la frase "elefante morado con lunares", no podía predecirla.

Beto
No tenía concepto de relación entre palabras.

Alicia
Ninguno. Ni siquiera entendía que "violeta" y "púrpura" podrían estar relacionados. Cada palabra era una cosa totalmente aislada.

Beto
Entonces, si no puede manejar sinónimos, ¿cómo se arregla eso?

Alicia
Eso nos lleva a la segunda ola: "modelos de lenguaje neuronales" ("Neural Language Models", NLMs). Aquí fue donde los "embeddings" de palabras lo cambiaron todo.

Beto
"Embeddings" de palabras.

Alicia
Sí. En vez de que las palabras sean símbolos, se mapeaban a vectores, como coordenadas en un espacio enorme. Si el vector de "perro" estaba cerca del vector de "canino", el modelo sabía que eran similares.

Beto
Por primera vez tenemos entendimiento semántico real.

Alicia
Sí, pero esos primeros modelos neuronales todavía eran bastante específicos para tareas. Los entrenabas para un trabajo concreto.

Beto
Lo que lleva a la tercera ola.

Alicia
Exacto. La tercera ola fueron los modelos de lenguaje preentrenados ("Pre-Trained Language Models", PLMs). El gran cambio aquí fue: ¿por qué entrenar un modelo para una sola tarea? Preentrenemos un modelo masivo en enormes cantidades de texto con un propósito general y luego ajústalo (fine-tune) de forma económica para cualquier tarea específica.

Beto
Así, el entrenamiento se volvió independiente de la tarea y mucho más eficiente.

Alicia
Muchísimo más eficiente. Y eso nos lleva a la cuarta ola en la que estamos hoy: los grandes modelos de lenguaje ("Large Language Models", LLMs).

Beto
Y la característica definitoria es simplemente la escala increíble.

Alicia
Correcto. Decenas a cientos de miles de millones de parámetros. Pero esa escala habría sido totalmente imposible sin una invención clave.

Beto
¿Te refieres a la arquitectura transformer?

Alicia
Exacto. Introducida en 2017, es el motor detrás de todos los LLM modernos. Reemplazó por completo la vieja forma secuencial de procesar con algo llamado "self-attention" (auto-atención).

Beto
Oímos "autoatención" todo el tiempo. ¿Puedes concretarlo un poco más para nosotros? ¿Por qué eliminar el procesamiento secuencial fue un cambio de juego?

Alicia
Vale. Piénsalo de este modo: los modelos antiguos procesaban la información como si leyeras un libro en voz alta, una palabra a la vez. Para entender la palabra "él" tenía que recordar lentamente cada palabra que vino antes.

Beto
Muy lento.

Alicia
Súper lento. No podías empezar en la página 100 hasta que hubieras terminado la 99. El transformer con autoatención es como poder leer todo el documento al mismo tiempo.

Beto
¿Así que ve todo el contexto a la vez?

Alicia
Al instante. Calcula la relación entre cada palabra y todas las otras palabras en la entrada inmediatamente.

Beto
Esta enorme paralelización es lo que nos permite usar las GPUs tan eficientemente. Y esa computación en paralelo es la única razón por la que pudimos escalar hasta entrenar en, básicamente, Internet entero.

Alicia
Eso es todo. La inteligencia viene de la escala y la escala viene del transformer que lo hace económicamente factible. Y así obtuvimos estos solucionadores generales de tareas como ChatGPT o el Co-pilot de Microsoft.

Beto
Bien. Ahora que tenemos el habilitador técnico — el transformer — entremos en los grandes jugadores. Tenemos tres familias dominantes: GPT, LLaMA y PaLM. Y cada una parece tener una filosofía bastante diferente.

Alicia
Así es. Empecemos con la que desató la histeria actual: la familia GPT de OpenAI.

Estos modelos usan, digamos, una arquitectura solo-decoder. Son autorregresivos.

Beto
Significa que están construidos para predecir la siguiente palabra o token.

Alicia
Exacto. Continúan la historia. El salto de GPT-2 a GPT-3 fue masivo. GPT-3 con 175.000 millones de parámetros fue realmente el primer LLM en mostrar lo que ahora llamamos "habilidades emergentes". Hablaremos de eso luego.

Beto
Pero el verdadero cambio para los consumidores fue InstructGPT y ChatGPT.

Alicia
Así fue. Y ahí es donde entra RLHF ("Reinforcement Learning from Human Feedback").

Beto
Aprendizaje por refuerzo con retroalimentación humana.

Alicia
Sí. RLHF fue revolucionario. Ya no se trataba solo de predecir la siguiente palabra a partir de Internet. Era un método de ajuste para alinear el modelo con la intención humana. Enseñó al modelo a seguir instrucciones, a ser útil, a evitar salidas tóxicas.

Beto
Convirtió a un predictor en un asistente.

Alicia
Es una forma perfecta de decirlo.

Y luego, por supuesto, tienes GPT-4, el pico actual.

Beto
Que es otra bestia completamente distinta.

Alicia
Se estima que tiene alrededor de 1.76 billones de parámetros. Es increíblemente inteligente. Ha quedado en el 10% superior en un examen de barra simulado. Y es multimodal.

Beto
Puede ver.

Alicia
Puede ver. Toma texto e imágenes. Y la filosofía aquí es clara: código cerrado, alto rendimiento, y acceso vía API.

Beto
Perfecto.

Ahora compáralo con la familia LLaMA de Meta. Tomaron un camino completamente diferente: código abierto.

Alicia
La filosofía de LLaMA desafió la idea de que más grande siempre es mejor. Su primer modelo LLaMA-13B causó conmoción en la comunidad.

Beto
¿Por qué?

Alicia
Porque mostraba que, en muchos "benchmarks" (exámenes comparativos), superaba al mucho más grande GPT-3. Su apuesta fue eficiencia sobre la fuerza bruta del tamaño.

Beto
Meta diciendo que "podemos obtener mejores resultados con un modelo más pequeño si lo entrenamos más inteligentemente".

Alicia
Precisamente. Y al liberar los pesos del modelo, desataron una ola de innovación comunitaria. Surgieron modelos como Alpaca y Vicuna 13B.

Beto
Y Vicuna fue un gran hito.

Alicia
Un gran hito. Logró más del 90% de la calidad de ChatGPT. Pero el costo de entrenamiento fue de apenas unos 300 dólares.

Beto
300 dólares. Es una locura.

Alicia
Fue una democratización total. Y seguimos viendo eso: modelos más pequeños y súper eficientes como Mistral 7B superando a modelos más grandes usando trucos arquitectónicos inteligentes. Demuestra que un diseño inteligente puede vencer al tamaño bruto.

Beto
¿Y dónde encaja la familia PaLM de Google?

Alicia
La jugada inicial de Google fue la escala masiva. PaLM apareció con 540.000 millones de parámetros. Pero su enfoque ha cambiado hacia el rendimiento especializado por dominio.

Beto
Como con PaLM 2.

Alicia
Exacto. PaLM 2 se centró en razonamiento y habilidades multilingües. Pero el mejor ejemplo es MedPaLM 2: un modelo afinado específicamente para el dominio médico.

Beto
¿Y cómo rindió esa especialización?

Alicia
Dramáticamente. Obtuvo hasta 86.5% en el dataset MedQA. Básicamente alcanzó un nivel de conocimiento clínico de experto. Muestra el poder de tomar un modelo general y convertirlo en un especialista verdadero.

Beto
Entonces, para resumir: tienes al pionero de código cerrado persiguiendo la supremacía multimodal con GPT.

Alicia
Al disruptor de código abierto que defiende la eficiencia con LLaMA.

Beto
Y al especialista de escala masiva que apunta al especialidad por dominio con PaLM. Es una carrera realmente dinámica.

Alicia
Pasemos ahora a la experiencia real de usar estos modelos. ¿Qué hace que hablar con un LLM se sienta tan diferente? La gente habla de habilidades emergentes. ¿Qué son exactamente?

Beto
Bien. El hallazgo clave es que estas habilidades no fueron programadas. Emergen de forma no lineal una vez que un modelo supera cierto umbral de tamaño.

Alicia
Así que no obtienes solo un 10% más de rendimiento si duplicas el tamaño; de repente obtienes una habilidad completamente nueva.

Beto
Una habilidad completamente nueva. Y hay tres habilidades emergentes clave.

La primera es el "aprendizaje en contexto", o ICL (In-Context Learning").

Alicia
Significa que el modelo puede aprender una tarea nueva solo a partir de unos pocos ejemplos que pones directamente en el prompt, lo que llamamos "few-shot prompting". No hace falta re-entrenar el modelo.

Beto
Increíble. Es como mostrar a un niño los primeros dos movimientos de un juego y que de repente entienda la regla.

Alicia
Es una analogía perfecta.

La segunda es seguir instrucciones.

Debido a ese ajuste de alineamiento del que hablamos, estos modelos ahora pueden entender y seguir instrucciones realmente complejas para tareas que nunca antes habían visto.

Beto
Eso es la base de lo que hace que ChatGPT se sienta como un asistente real.

Alicia
Y la tercera, la que los hace parecer verdaderamente inteligentes, es el razonamiento.

Beto
Razonamiento multi‑paso.

Alicia
Sí, a menudo impulsado por una técnica llamada "Chain of Thought" ("cadena de pensamiento"), o "CoT". Es la capacidad del modelo para tomar un problema complejo, como un rompecabezas matemático, y descomponerlo en pasos intermedios, igual que haría una persona.

Beto
Aquí viene la paradoja: si estos modelos pueden razonar y aprender en contexto, ¿por qué inventan cosas? ¿Por qué esta máquina lógica casi sobrehumana a veces inventa tonterías que suenan plausibles?

Alicia
Esa es la limitación crítica: las alucinaciones. Es importante definirlas como la generación de contenido que es no sensato o que no es fiel al material fuente. Incluso tenemos categorías para eso.

Beto
Dinos las categorías.

Alicia

  • Tienes alucinaciones "intrínsecas", donde el modelo dice algo que contradice directamente el material fuente — comete un error factual claro.
  • Luego tienes alucinaciones "extrínsecas". Son afirmaciones que no se pueden verificar a partir de la fuente. Detalles que suenan plausibles que el modelo simplemente inventó porque pensó que encajaban en la historia.

Beto
Si le pido que resuma un documento y se inventa una fecha que no estaba, eso es extrínseco. Si tiene la fecha en el documento y la pone mal, eso es intrínseco.

Alicia
Es una gran forma de pensarlo.

Pero la razón fundamental de por qué ocurre esto es crucial. Alucinan porque en su núcleo son modelos probabilísticos.

Beto
Solo están prediciendo el siguiente token.

Alicia
Ese es su único objetivo. Generan el texto que estadísticamente es más probable que siga, no el texto que se ajusta a una noción abstracta de verdad. Su objetivo es la coherencia, no la correspondencia con la realidad. Son narradores brillantes, no bibliotecarios fiables.

Beto
Dado que el modelo base es un narrador brillante pero a veces poco fiable, la frontera ya no es solo hacer los modelos más grandes. Se trata de diseñar el entorno alrededor del modelo.

Alicia
Absolutamente. El primer nivel es cómo hablamos con él mediante prompt engineering avanzado. Esto es cómo desbloqueas esas habilidades de razonamiento. Y el método más básico que todos deberían usar es "chain of thought" (CoT).

Beto
Pedirle que piense paso a paso.

Alicia
Solo decirle que piense paso a paso o que muestre su trabajo.

Y la investigación muestra que proporcionar unos pocos ejemplos de buen razonamiento paso a paso — lo que llaman "CoT manual" — es mucho más efectivo.

Beto
Le da una plantilla a seguir.

Alicia
Exacto. Luego te vuelves más sofisticado. Hay una técnica llamada "reflexión". Con ella realmente pides al LLM que critique y revise su propia salida según ciertos criterios. Lo conviertes en su propio editor.

Beto
Es un truco fascinante.

¿Qué hay de conseguir que suene más autoritario?

Alicia
Eso es "prompting de experto". Indicas al modelo que simule un rol: "actúa como un destacado jurista constitucional" o "genera esto como un analista financiero senior". El modelo entonces adopta el tono, la terminología y el dominio de conocimiento de esa persona.

Beto
Esos prompts mejoran el razonamiento. Pero para resolver el gran problema, las alucinaciones y el conocimiento desactualizado, tenemos que mirar fuera del modelo. Ahí entra la recuperación aumentada a la generación, "Retrieval Augmented Generation", RAG.

Alicia
RAG quizá sea la técnica de aumento más importante que existe en el mundo real hoy. Ataca directamente el corte de conocimiento y el problema de fiabilidad.

Beto
¿Cómo lo hace?

Alicia
Piensa en el LLM como un estudiante brillante que solo estudió un libro de texto de hace dos años. RAG es el sistema que le da a ese estudiante acceso instantáneo a una biblioteca actualizada antes de responder tu pregunta.

Beto
¿Cómo funciona técnicamente?

Alicia
Envías una consulta. El sistema RAG usa esa consulta para buscar en una base de conocimiento externa y actualizada — una biblioteca, una base de datos, un motor de búsqueda —. Extrae los fragmentos más relevantes y verificables.

Beto
¿Y luego ocurre la magia?

Alicia
Sí. Esa información recuperada se inyecta de vuelta en tu prompt original. Se convierte en parte del contexto. El LLM responde usando ese texto externo y verificable para informar su respuesta.

Beto
Eso ancla la respuesta en la realidad y reduce las alucinaciones.

Alicia
Drásticamente. La ata al modelo a una fuente de verdad.

Beto
Todo esto conduce a la idea más compleja y, creo, más emocionante: los agentes LLM. (ver también)

Alicia
Correcto. Un agente es un concepto mucho más grande. Es un sistema autónomo construido sobre un LLM. Tiene un ciclo continuo: percibe su entorno, puede sensar cosas, juzga, decide y luego actúa.

Beto
RAG es solo una de las herramientas que un agente podría usar.

Alicia
Un agente podría tener un intérprete de código, una API meteorológica, cualquier cosa.

La técnica clave que le permite decidir qué herramienta usar se llama "ReAct".

Beto
ReAct: "Reason and Act" (razonar y actuar).

Alicia
Es una estructura de prompt que forza al LLM a entrelazar su razonamiento interno — su "chain of thought" (CoT), cadena de pensamiento — con pasos accionables externos. Puede razonar: "para responder esto necesito el precio de la acción de hoy", luego ejecuta la acción para llamar a una API, obtiene el resultado y razona sobre qué hacer después.

Beto
Convierte al LLM de una máquina pasiva de respuestas en un solucionador de problemas activo.

Alicia
Si te llevas una sola cosa de este análisis profundo, que sea esto: los LLMs de hoy están definidos por tres pilares:

  1. La arquitectura transformer,
  2. la escala masiva que nos dio habilidades emergentes, y,
  3. el ajuste especializado como RLHF que los hizo útiles.

Pero el futuro trata de resolver sus limitaciones mediante aumentos externos:

  • haciéndolos fácticos con RAG, y,
  • proactivos con agentes.

Beto
Esa es una síntesis perfecta.

Y para dejarte con un pensamiento final: mira más allá del simple conteo de parámetros. Eso impulsó la primera revolución, pero las próximas grandes fugas (avances) tienen que ver con la eficiencia arquitectónica y la modalidad.

Alicia
Debes vigilar lo que llaman "arquitecturas post-attention", cosas como los "modelos de espacio de estados" ("State Space Models") o SSMs, como Mamba. Prometen ser mucho más eficientes para manejar ventanas de contexto súper largas que las tareas complejas necesitan.

Beto
Y quizá aún más importante, mira las arquitecturas de "mezcla de expertos" ("Mixture of Experts"), MoE. Lo que se rumora que existe dentro de GPT-4.

Alicia
En vez de que todo el modelo gigante se dispare por cada token, MoE permite que el modelo use solo un subconjunto pequeño de parámetros expertos para una tarea dada, ...

Beto
... lo que reduce drásticamente el coste de ejecución.

Alicia
Es una señal crítica para el futuro. Los LLMs seguirán haciéndose más inteligentes, pero el foco está cambiando. Se mueve del tamaño bruto a hacerlos más rápidos, más baratos y mucho más accesibles. El modelo más grande quizá no sea el más importante mañana.

Beto
Seguiremos siguiendo esos avances por ti aquí mismo. Gracias por acompañarnos en esta inmersión profunda. Nos vemos la próxima vez

lunes, 13 de octubre de 2025

Aprendizaje por Refuerzo en Gran Modelos de Razonamiento

 
 

Hoy les traigo un resumen de un artículo muy importante que explica cómo se están haciendo los modelos de razonamiento en Inteligencia Artificial (IA), usando Aprendizaje por Refuerzo.

Enlace al artículo original, en inglés, para aquellas personas que quieran profundizar en este tema:
A Survey of Reinforcement Learning for Large Reasoning Models, publicado en Octubre 10 de 2025, por Kaiyan Zhang y colegas.

El resumen, su transcripción y traducción, fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en forma de un diálogo entre dos personajes sintéticos, que llamaremos Alicia y Beto.


Resumen

Alicia
Bienvenido de nuevo a la inmersión profunda. Entonces, si has estado siguiendo la IA últimamente, la gran historia siempre han sido los grandes modelos de lenguaje, ¿no? LLMs ("Large Language Models").

Beto
Exacto. Sistemas entrenados para predecir la siguiente palabra, enfocados mayormente en, ya sabes, sonar humano y ser útiles.

Alicia
Exacto. Alineamiento conversacional. Pero hoy vamos a profundizar en algo distinto. La fuente apunta a un cambio realmente fundamental. Estamos viendo el auge del gran modelo de razonamiento, el LRM ("Large Reasoning Model").

Beto
Sí, y es un paso enorme. Esto no se trata solo de hacerlos mejores escritores o chatbots más educados. Se trata de competencia pura.

Alicia
Entonces, ¿qué es lo que hace que un LRM sea un LRM?

Beto
Básicamente definimos LRMs como LLMs que han sido específicamente reingenierizados usando aprendizaje por refuerzo (RL, "Reinforcement Learning") para manejar tareas lógicas complejas. Cosas donde hay una respuesta correcta.

Alicia
Como problemas de matemáticas o programación.

Beto
Exacto. Matemática competitiva, desafíos de codificación complejos, razonamiento en múltiples pasos, cosas que necesitan planificación real, quizá algo de reflexión e incluso autocorrección integrada.

Alicia
Muy bien, así que nuestra misión hoy es revisar las fuentes que están trazando esta nueva forma de entrenamiento. Básicamente estamos moviendo los postes de la portería. Ya no se trata de sonar bien.

Beto
Se trata de ser bueno razonando. Intentamos incentivar directamente el razonamiento objetivo en sí. Y el método clave del que todos hablan es el aprendizaje por refuerzo con recompensas verificables (RLVR = "Reinforcement Learning with Verifiable Rewards").

Alicia
RLVR, claro. Y este campo se ha disparado recientemente, impulsado por modelos como DeepSeek R1.

Beto
Exacto. Está avanzando increíblemente rápido. Y las fuentes apuntan de forma consistente a que RL ("Reinforcement Learning", Aprendizaje por Refuerzo) ya no es solo para fine-tuning (perfeccionamiento, refinamiento).

Alicia
Parece más fundamental ahora, como la clave para escalar capacidades hacia, bueno, hacia AGI ("Artificial General Intelligence" = Inteligencia General Artificial) o incluso ASI ("Artificial Super-Intelligence" = Super Inteligencia Artificial).

Beto
Esa parece ser la trayectoria, sí. Aprender a razonar de forma eficaz y escalable parece el siguiente paso crítico.

Alicia
Muy bien, desempacemos esa diferencia entonces, porque RL ("Reinforcement Learning", Aprendizaje por Refuerzo) no es nuevo, ¿cierto? Ya hablamos de RLHF antes ("Reinforcement Learning through Human Feedback", Aprendizaje por Refuerzo con Retroalimentación Humana) y también de DPO ("Direct Preference Optimization": Optimización por Preferencia Directa). Esas eran mayormente sobre alineamiento, ¿no? Hacer que el modelo dé respuestas que los humanos prefieran.

Beto
Exactamente. RLHF, DPO, todo eso iba sobre preferencia subjetiva. ¿Le gusta a un humano esta respuesta?

RLVR lo invierte. Abandona las puntuaciones subjetivas. Pasa a retroalimentación objetiva basada en reglas. Todo el objetivo cambia a mejorar la capacidad central del modelo para resolver problemas. No es, "¿se siente bien esto?" sino, "¿es esto demostrablemente correcto?".

Alicia
Entendido. Y las fuentes mencionan esto. La “ley del verificador” suena un poco pomposa.

Beto
Lo es, pero la idea en sí es bastante sencilla. La ley del verificador básicamente dice que lo fácil que es entrenar a una IA para una tarea está directamente relacionado con lo fácil que es comprobar si la IA hizo la tarea correctamente.

Alicia
OK, si puedes automatizar la verificación, ...

Beto
... puedes generar básicamente señales de entrenamiento perfectas e infinitas sin necesitar humanos en el bucle constantemente, lo cual es carísimo. Verificabilidad equivale a escalabilidad, esencialmente.

Alicia
Tiene sentido. Señal limpia, aprendizaje más rápido, y los ejemplos ayudan mucho. Para matemáticas, es sólo si la respuesta final es correcta, comprobado automáticamente.

Beto
Sí. Para programación, ¿compila? ¿pasan los tests unitarios? Esa es tu señal de recompensa.

Alicia
¿Hay algún truco para hacer que eso funcione a escala?

Beto
Bueno, un detalle técnico clave es la consistencia. Los modelos tienen que sacar su respuesta final en un formato muy específico y predecible, como poner el número en una etiqueta de “caja”.

Alicia
Así el verificador automático no se confunde.

Beto
Exacto. Necesita poder parsear millones de salidas de forma fiable.

Alicia
Y hemos visto grandes avances que prueban que esto funciona. Los modelos o1 de OpenAI, por ejemplo.

Beto
Sí, la serie o1 fue fascinante. Mostró que el rendimiento escalaba no sólo con más cómputo de entrenamiento RL, como cabría esperar, sino también con cómputo en tiempo de prueba. Básicamente, cuánto tiempo pasa el modelo “pensando” durante la inferencia.

Alicia
¿Es decir que los mejores modelos realmente se benefician más si se les deja más tiempo para responder?

Beto
Ese fue el hallazgo. Más tiempo les permite generar, evaluar, quizá revisar sus pasos de razonamiento internos. Lo vincula al rendimiento directamente con, bueno, el esfuerzo cognitivo si quieres verlo así.

Alicia
Interesante. Y luego estuvo DeepSeek R1. Ese rompió bastante el viejo manual.

Beto
Totalmente. Adoptó un enfoque “cero SFT” (sin "Supervised Fine-Tuning", sin Perfeccionamiento Supervisado). DeepSeek demostró que usando un algoritmo RL específico, GRPO (Group Relative Policy Optimization), a una escala masiva, podían enseñar estas habilidades de razonamiento complejo directamente a un modelo base.

Alicia
Un modelo base. Así que sin fine-tuning supervisado primero.

Beto
Ninguno. Se saltaron la etapa SFT por completo, lo que sugiere, quizá, que el RL puede encontrar caminos de razonamiento que los ejemplos humanos podrían bloquear o desalentar inadvertidamente.

Alicia
De acuerdo, esto suena increíble para matemáticas y código donde hay una respuesta clara. Pero seamos honestos, la mayoría de las cosas no son así. El diseño de recompensas debe volverse mucho más complicado.

Beto
Absolutamente. Fuera de esos dominios limpios, se pone desordenado rápidamente, lo que lleva a este gran intercambio que discuten las fuentes: recompensas de resultado versus recompensas de proceso.

Alicia
Correcto. Las recompensas de resultado, como las verificables, son escalables y eficientes. Nos gustan. ¿Cuál es la trampa?

Beto
El riesgo es lo que algunos investigadores llaman “respuesta correcta primero, alucinar después”. El modelo se vuelve muy bueno en escupir la respuesta final correcta, quizá en el formato requerido, pero el razonamiento que lo llevó allí puede ser endeble, no fiel. Puede haberse inventado la explicación a posteriori sólo para justificar una respuesta que ya sabía que era correcta.

Alicia
Ajá. Aprende a engañar al sistema: consigue el resultado correcto, pero el trabajo interno es basura. No es lo que quieres para confiar en la IA.

Beto
Definitivamente no.

Si quieres razonamiento fiel, te inclinas hacia las recompensas de proceso.

Alicia
¿Y cómo funcionan esas?

Beto
Proporcionan retroalimentación en cada paso del proceso de razonamiento. Señal mucho más densa, a menudo usando algo llamado Modelo de Recompensa de Proceso (PRM, "Process-based Reward Model").

Alicia
OK, verifica el método, no sólo la respuesta final. Eso suena más estable.

Beto
Lo es para aprender razonamiento fiel, pero la gran desventaja es el coste. Hacer que humanos anoten cada paso de una cadena de razonamiento compleja en montones de ejemplos es increíblemente caro y lento. No escala nada bien.

Alicia
¿Y cuál es la solución para tareas subjetivas? Como juzgar escritura creativa o un argumento ético complejo. No hay una única respuesta correcta ahí.

Beto
Cierto. Y ahí las cosas se ponen especialmente vanguardistas. Aquí es donde entran los modelos de recompensa generativos, o “GenRMs”.

Alicia
Recompensas generativas. Entonces la recompensa ya no es solo un número.

Beto
Exacto. En vez de escupir una puntuación como 0.8, un modelo de recompensa generativo (GenRM) usa a su vez un LRM potente para generar una crítica. Escribe una explicación detallada, quizá usa una rúbrica, explicando por qué una respuesta es buena o mala. La recompensa es retroalimentación textual.

Alicia
Guau! OK, entonces el modelo de recompensa tiene que articular su propio razonamiento. Y la fuente insinuó algo todavía más salvaje: sistemas co-evolutivos.

Beto
Sí. Esto va más allá de tener un juez fijo y una política que aprende de él. En estos montajes co-evolutivos, el modelo que genera respuestas — la política — y el modelo que genera las críticas — el GenRM — en realidad mejoran juntos de forma dinámica.

Alicia
¿Cómo funciona eso?

Beto
Pues la política hace un intento, el GenRM lo critica en detalle, y luego la política usa esa rica retroalimentación para autocorregirse. A veces incluso intercambian roles, potenciando su propia mejora. Se acerca a una especie de "self-play" (ejecución autónoma) para razonamiento.

Alicia
Cambiando un poco de tema, hablemos del motor que ejecuta todo este entrenamiento RL. Mencionaste GRPO (Group Relative Policy Optimization) para DeepSeek R1. ¿Por qué ese algoritmo específico para estos modelos enormes?

Beto
Con modelos tan gigantescos necesitas algoritmos computacionalmente eficientes. Se prefieren métodos de primer orden. PPO (Proximal Policy Optimization) es popular. Pero GRPO es una modificación.

Alicia
¿Cuál es la diferencia clave?

Beto
GRPO es “sin crítico”. PPO estándar necesita una red crítica separada para estimar qué tan bueno es un estado, lo que básicamente duplica el tamaño del modelo y el cómputo durante el entrenamiento. GRPO logra deshacerse de eso por completo.

Alicia
Sin crítico. Ahorra mucho cómputo, seguro. Pero entonces, ¿cómo sabe qué acciones — qué palabras o tokens generados — fueron buenas si no hay un crítico que las valore?

Beto
Ah, esa es la parte ingeniosa. Usa algo llamado "normalización relativa de grupo". En lugar de juzgar cada token individualmente contra un estándar absoluto, mira todo un lote de respuestas generadas y calcula una puntuación de ventaja para todos los tokens en una respuesta relativa a la puntuación media de todas las respuestas en ese lote. Piensa en ello como calificar en curva dentro de ese pequeño grupo.

Alicia
Ah, entiendo. No se trata de ser perfecto. Se trata de ser mejor que el promedio dentro del lote.

Beto
Precisamente. Proporciona una señal de aprendizaje estable y eficiente sin necesitar ese modelo crítico extra. Hace el RL a gran escala mucho más factible.

Alicia
Bien, tenemos los mecanismos. RLVR, recompensas, GRPO. Pero hay un debate más amplio: ¿qué está haciendo fundamentalmente RL aquí? ¿Solo agudiza habilidades que el modelo ya aprendió en preentrenamiento, o está habilitando el descubrimiento de habilidades totalmente nuevas?

Beto
Esa es la pregunta del millón. La visión de “agudizar” sugiere que RL básicamente encuentra y amplifica lo bueno que ya estaba latente en los pesos del modelo, como enfocar una lente.

Alicia
Tiene sentido.

Beto
La argumentación de “descubrimiento”, en cambio, dice que para tareas complejas en múltiples pasos, RL permite componer esas habilidades latentes básicas de maneras genuinamente nuevas para construir cadenas de razonamiento más largas a las que antes no se podía acceder.

Alicia
Poner habilidades simples juntas para crear algo novedoso. ¿Dónde se posicionan las fuentes?

Beto
Parece inclinarse hacia una visión unificada. No es estrictamente una cosa u otra. RL actúa como un afilador eficiente, guiando al modelo rápidamente hacia patrones de razonamiento de alta recompensa. Pero dado suficiente tiempo de entrenamiento y el tipo correcto de exploración, ese afilado permite la composición de habilidades, lo que a su vez conduce a la emergencia de comportamientos novedosos — la parte de descubrimiento. Así que son dos caras de la misma moneda.

Alicia
Entendido. Afilado que habilita descubrimiento con el tiempo.

Ahora, prácticamente hablando, hay un hallazgo contraintuitivo sobre dónde comienzas el proceso RL: un modelo débil versus un modelo fuerte.

Beto
Correcto. ¿Debes empezar RL sobre un modelo base pre-entrenado y crudo — el inicio débil — o sobre un modelo que ya pasó por mucho fine-tuning para seguir instrucciones y ser servicial — el inicio fuerte?

Alicia
Mi intuición dice, empieza fuerte. Aprovecha todo ese trabajo de alineamiento.

Beto
Parece lógico, ¿no? Pero la evidencia, particularmente del trabajo DeepSeek R1, apunta fuertemente al otro lado. Empezar RL directamente sobre el modelo base consistentemente produce mejor rendimiento de razonamiento al final.

Alicia
¿En serio? Eso suena totalmente contraintuitivo. ¿Por qué sería perjudicial que el modelo ya sea servicial y alineado para aprender pura lógica o matemáticas?

Beto
La teoría tiene que ver con los sesgos de obediencia.

Alicia
Los “obedience priors”.

Beto
Sí. El proceso de fine-tuning supervisado (SFT) inculca tendencias profundas hacia ser útil, conversacional, cauteloso, alineado con preferencias humanas. Pero RLVR demanda una optimización implacable hacia un objetivo verificable y objetivo.

Alicia
Y esas dos cosas pueden entrar en conflicto.

Beto
Esa inclinación arraigada a ser cortés o a matizar puede interferir con que el modelo se comprometa plenamente con los pasos lógicos estrictos necesarios para maximizar una recompensa verificable como la corrección matemática.

Alicia
Interesante. Así que para obtener razonamiento pico, quizá no quieras que el modelo sea demasiado “amable” desde el inicio. Es una idea fascinante.

¿Se aplica esto por igual a todos los modelos?

Beto
Aparentemente no. Hay otra extrañeza: asimetría entre familias de modelos. Diferentes modelos base reaccionan distinto al proceso RLVR.

Alicia
¿Cómo?

Beto
Las fuentes mencionaron que modelos de la familia Qwen, por ejemplo, suelen ser más “amigables” al RL. Muestran buenas ganancias incluso si la señal de recompensa es imperfecta. Simplemente se adaptan mejor.

Alicia
OK. ¿Y otros?, mencionaste Llama.

Beto
Sí, los modelos de la familia Llama, según algunos reportes, pueden ser más frágiles inicialmente con el enfoque “cero RL”. No escalan tan fluidamente solo con el proceso RLVR.

Alicia
¿Rinden peor? ¿O hay solución?

Beto
Hay una solución. Investigadores encontraron que para modelos como Llama pueden lograr escalabilidad similar inyectando estratégicamente datos de alta calidad de matemáticas y código durante el entrenamiento RL, como un curso de corrección intermedia.

Alicia
¿Interrumpir el RL para darle un golpe de refuerzo con datos concretos?

Beto
Algo así. Parece fortalecer esas habilidades latentes de razonamiento sobre las que el proceso RL está construyendo, haciéndolas más resistentes a las presiones de RLVR.

Alicia
Bien, hablemos de aplicaciones. ¿Dónde se está usando realmente este razonamiento impulsado por RL? ¿Cuál es el beneficio? Empezando por la programación.

Beto
Sí, la programación es un área enorme. El RL, usando retroalimentación por ejecución — ¿el código corre? ¿pasan los tests? — ha mejorado dramáticamente la generación de código. Métodos como Afterburner usan esto para afinar modelos.

Alicia
El resultado?

Beto
Hemos visto saltos masivos en la tasa de éxito del primer intento. En algunos benchmarks, estos modelos entrenados con RL están superando el rendimiento humano promedio en programación competitiva y depuración. También tareas como reparación de código y mejora automática de la calidad del código.

Alicia
Impresionante.

¿Qué hay de modelos que necesitan usar herramientas o interactuar con el mundo, tareas agentivas?

Beto
Ahí RL es absolutamente crucial. Entrenar modelos para usar eficazmente búsquedas web, calculadoras, intérpretes de código, o simplemente manejar una conversación larga y con propósito requiere RL. El modelo tiene que aprender por ensayo y error qué herramientas usar y cuándo.

Alicia
Eso suena intensivo en cómputo. Mucho ensayo y error.

Beto
Lo es. Los tiempos de rollout — permitir que el agente pruebe cosas en un entorno — pueden ser muy largos y caros. Es un gran cuello de botella. Se trabaja en rollouts asincrónicos, mejores sistemas de memoria y otras maneras de hacerlo más eficiente.

Alicia
Llevándolo al mundo físico, robótica. Usando modelos Visión-Lenguaje-Acción (VLAs, Vision-Language-Action).

Beto
Sí, RL también está haciendo olas allí. A menudo usando recompensas más simples, como éxito o fracaso binario para una tarea. El hallazgo: RL ayuda a las VLAs a generalizar mucho mejor con menos datos.

Alicia
La mejor generalización es clave. Hay algo más?

Beto
Las VLAs entrenadas con RL han llegado a descubrir patrones de comportamiento novedosos, maneras completamente nuevas de resolver tareas físicas que no estaban en los datos de entrenamiento. Cosas que los supervisores ni siquiera imaginaron.

Alicia
Vaya! Descubrimiento genuino en el mundo físico. Eso es bastante sorprendente.

Entonces, mirando hacia adelante, ¿cuál es el siguiente gran obstáculo? Si pueden razonar, ¿cuál es el problema principal?

Beto
Uno grande es el coste de inferencia o la eficiencia en inferencia. Ahora mismo, estos LRMs son muy “listos” asignando su tiempo de pensamiento, pero de forma imperfecta.

Alicia
¿A qué te refieres?

Beto
Tienden a sobrepensar problemas sencillos, generando cadenas de pensamiento largas cuando una respuesta simple bastaría. Y a la inversa, suelen subestimar problemas difíciles, saltando a conclusiones sin suficiente razonamiento.

Alicia
Así que desperdician cómputo en lo fácil y fallan en lo difícil porque no se esfuerzan lo suficiente.

Beto
Exacto. Un problema no resuelto clave para RL es enseñar a estos modelos una mejor política de asignación de cómputo: cómo decidir dinámicamente “esto es complicado, necesito más pasos” versus “esto es fácil, contesto rápido”. Conseguir ese trade-off coste-rendimiento es crucial. Necesitamos modelos racionales frente a recursos.

Alicia
Tiene sentido.

Eso enlaza con una idea muy prospectiva que vienen discutiendo las fuentes: diseño de arquitectura, algoritmo y código conjuntamente.

Beto
Exacto. Ahora mismo RL optimiza el comportamiento del modelo para precisión. El siguiente paso podría ser dejar que RL optimice la propia estructura del modelo.

Alicia
¿Cómo funcionaría eso? Cambiando el modelo sobre la marcha.

Beto
Algo así. Piensa en modelos Mixture-of-Experts (MoEs, Mezcla de Expertos), que tienen diferentes subredes expertas. RL podría potencialmente aprender una política de enrutamiento dinámica.

Alicia
Es decir, decidir qué experto usar para qué parte del problema.

Beto
Sí. Pero optimizando no solo para la corrección de la respuesta final, sino también por eficiencia de hardware, minimizando latencia o uso de memoria. Podría adaptar las vías activas del modelo en función de lo que parezca la dificultad del problema en tiempo real. Un MoE reforzado, básicamente, optimizando la máquina misma.

Para cerrar nuestra inmersión hoy, la idea general es que RLVR está deliberadamente remodelando a los LLMs en LRMs más potentes. Aprovechamos recompensas verificables para tareas objetivas como matemáticas y código, lo que escala increíblemente bien.

Alicia
Y para lo más difuso y subjetivo, estamos viendo el auge de estos innovadores modelos de recompensa generativos.

Beto
Exacto. Es un cambio fundamental de foco.

Alicia
Sí. Realmente da la sensación de que la era de optimizar solo por “ser agradables” según preferencia humana está evolucionando. El foco se desplaza hacia confianza objetiva, hacia construir modelos que realmente hagan cosas de forma fiable. Estamos viendo enfoques híbridos, métodos de políticas mixtas que combinan lo mejor del SFT y del RL, ...

Beto
... lo que debería llevar a sistemas más robustos en general.

Y quizá si te dejo con una última cosa para pensar, es el paso crítico para hacer estos sistemas verdaderamente útiles en el mundo real: el aprendizaje por refuerzo continuo (CRL, Continual Reinforcement Learning).

Alicia
Que aprenden durante toda su vida.

Beto
Precisamente. A medida que los LLMs se despliegan en entornos dinámicos, necesitan adaptarse a nuevos datos y nuevas tareas sin olvidar todo lo que ya saben. Ese es el desafío central del CRL:

  • equilibrar la estabilidad,
  • mantener el conocimiento antiguo,
  • con la plasticidad,
  • adquirir nuevas habilidades.

Alice
El dilema estabilidad‑plasticidad.

Beto
Acertar ese equilibrio durante el entrenamiento RL continuo, probablemente sea la clave para pasar de herramientas estáticas a compañeros de IA adaptativos de por vida. Algo a lo que hay que prestar atención, sin duda.