Mostrando entradas con la etiqueta Qwen. Mostrar todas las entradas
Mostrando entradas con la etiqueta Qwen. Mostrar todas las entradas

sábado, 28 de marzo de 2026

Encuesta sobre Modelos de Lenguaje a Gran Escala (LLM)

 
 

Esta extensa encuesta ofrece una visión técnica completa de los modelos de lenguaje a gran escala (LLM), analizando su evolución desde los primeros métodos estadísticos hasta las arquitecturas modernas con miles de millones de parámetros, como GPT-4 y LLaMA. Los autores examinan el fenómeno de las leyes de escala, que determinan cómo el aumento del tamaño de los datos y del modelo conduce al surgimiento de capacidades avanzadas como el razonamiento y el aprendizaje contextual. Se detallan las fases clave del desarrollo, centrándose específicamente en el papel fundamental del preprocesamiento de datos, las estrategias de preentrenamiento y el ajuste de las instrucciones para alinear los modelos con las preferencias humanas. El texto también cataloga recursos esenciales de código abierto, incluyendo conjuntos de datos y bibliotecas de software, para ayudar a los investigadores a comprender los complejos requisitos de ingeniería del desarrollo de LLM. En definitiva, las fuentes presentan a los LLM como solucionadores de tareas de propósito general que están revolucionando fundamentalmente el panorama de la inteligencia artificial.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "A Survey of Large Language Models", por Wayne Xin Zhao y colegas. Publicado el 18 de Marzo de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Sabes, en realidad no hace tanto tiempo que lo más impresionante que la inteligencia artificial podía hacer era simplemente terminarte la frase en una barra de búsqueda.

Alicia
Exacto. Como que escribías "cómo hervir" y te sugería "un huevo".

Beto
Exactamente. Es un pequeño truco de salón. Pero hoy, quiero decir, estamos tratando con sistemas de IA que escriben arquitecturas de software complejas, pasan el examen de abogado y literalmente simulan el razonamiento humano paso a paso.

Alicia
Es un salto asombroso.

Beto
De verdad lo es. Hemos pasado de un autocompletar glorificado a algo que altera fundamentalmente cómo procesamos la información.

Alicia
Es un cambio completo de paradigma. Sí. Y dado que la velocidad de esta tecnología ha sido tan implacablemente rápida, es muy fácil mirar el panorama actual y sentir que estos modelos son simplemente cajas negras mágicas.

Beto
Claro.

Alicia
Pero en realidad no son magia. Son el resultado de avances muy específicos en matemáticas e ingeniería.

Cronologia de los LLMs

Beto
Totalmente. Y precisamente por eso la inmersión de hoy está diseñada para ser tu atajo definitivo para ponerte al día con lo que sucede bajo el capó.

Alicia
Sí. Hoy realmente vamos al fondo.

Beto
Sí. Anclamos nuestra conversación en la actualización 2026 de un artículo emblemático: se llama "A Survey of Large Language Models", elaborado por Wayne Xin Zhao y un enorme equipo de investigadores.

Alicia
Es un artículo fantástico.

Beto
De verdad lo es. Y nuestra misión hoy es cortar todo el lenguaje académico y extraer los mecanismos centrales de cómo funcionan realmente estos modelos. Vamos a desentrañar la evolución, las recetas de datos específicas y la sala de máquinas literal que los hace funcionar.

Alicia
Y para establecer un marco mientras nos sumergimos, creo que ayuda ver todo este campo a través de una única lente fundacional.

Beto
¿Cuál?

Alicia
Bueno, el modelado del lenguaje desde sus inicios siempre ha tenido un objetivo específico: comprimir el conocimiento del mundo en una máquina.

Beto
Comprimirlo.

Alicia
Sí. Ahora, simplemente, ¿qué ocurre cuando esa compresión alcanza una masa crítica explosiva?

Beto
Entonces tracemos esa compresión hacia atrás, porque para comprender verdaderamente la arquitectura de una IA moderna tienes que entender los cuellos de botella que nos retuvieron durante décadas. ¿Verdad?

Alicia
Absolutamente.


LLMs: de Predictores de Texto, a Solucionadores de Tareas

Beto
La encuesta traza cuatro generaciones distintas de modelos de lenguaje, empezando por pura estadística.

Alicia
Correcto. Así que la primera generación, que dominó los 90 y primeros 2000, confiaba en modelos estadísticos de lenguaje. Eran esencialmente modelos N-gram. Intentaban predecir la siguiente palabra basándose enteramente en la probabilidad de las pocas palabras que la precedían inmediatamente, pero chocaron con un enorme escollo, llamado "la maldición de la dimensionalidad".

Beto
Ajá, claro. Porque si quieres que el modelo realmente entienda el contexto de todo un párrafo, las combinaciones matemáticas de secuencias de palabras explotan exponencialmente, ¿no?

Alicia
Exacto. Se te acaba la potencia de cómputo casi al instante. Simplemente no puedes mapear la probabilidad de cada oración de 20 palabras en inglés.

Beto
¿Cómo lo superaron?

Alicia
Pues los investigadores tuvieron que replantear por completo cómo las máquinas representan el lenguaje. Eso condujo a la segunda generación alrededor de 2013, que fueron los modelos neuronales de lenguaje.

Beto
Y esa fue la era de word2vec.

Alicia
Exacto. En lugar de fijarse en coincidencias exactas de palabras, los investigadores usaron redes neuronales para mapear palabras como vectores distribuidos en un espacio continuo y multidimensional.

Beto
Bien. Así que en lugar de que una palabra sea solo una cadena de letras, se convierte en un conjunto de coordenadas.

Alicia
Sí.

Beto
Palabras con significados similares, como, no sé, "rey" y "reina", acaban físicamente más cerca en ese espacio matemático.

Alicia
Lo clavaste. Eso permitió a la máquina entender relaciones semánticas por primera vez.

Beto
Oh, wow.

Alicia
Y luego llegó la tercera generación con los modelos preentrenados de lenguaje, sobre todo BERT.

Beto
Oh, sí, BERT fue enorme.

Alicia
Lo fue. Porque en lugar de solo aprender coordenadas de palabras, estos modelos aprendieron representaciones conscientes del contexto. Leyeron enormes cantidades de texto sin etiquetar primero, ...

Beto
... absorbiéndolo todo.

Alicia
Sí. Aprendiendo el contexto bidireccional profundo de una oración antes de ser afinados para una tarea estrecha y específica, como traducción o análisis de sentimiento.

Beto
Pero seguían siendo, en última instancia, expertos estrechos, ¿no? Tenías un modelo para traducir francés y otro completamente distinto para resumir un documento.

Alicia
Exacto.

Beto
Así que el verdadero salto, la cuarta generación, ocurrió cuando los investigadores esencialmente decidieron dejar de construir expertos estrechos y, en su lugar, construyeron grandes modelos de lenguaje.

Alicia
Sí, la teoría subyacente cambió.

Beto
Y la filosofía predominante se volvió sorprendentemente directa, ¿no? Simplemente haz la red neuronal masiva.

Alicia
Sí, eso fue exactamente lo que pasó. Los investigadores hipotetizaron que si escalas los parámetros —las sinapsis artificiales de la red— y escalas los datos, el modelo no solo mejoraría en predecir texto;

Beto
se convertiría en un solucionador de tareas de propósito general.

Alicia
Precisamente. Y esta explosión en tamaño estuvo gobernada por leyes de escala increíblemente precisas.

Beto
Correcto. La primera de peso fue la ley de escala KM de OpenAI.

Alicia
Sí.

Beto
Esencialmente probaron una relación matemática que muestra que si tienes un presupuesto finito pero enorme de potencia de cómputo, obtienes el mejor retorno de inversión al dedicar ese cómputo a aumentar el tamaño bruto del modelo —el conteo de parámetros— en lugar de simplemente ejecutar más datos a través de un modelo más pequeño.

Alicia
Exacto. Más tarde, ese enfoque se refinó con la ley de escala Chinchilla por Google DeepMind.

Beto
Correcto.

Alicia
Y eso alteró fundamentalmente cómo se estaban utilizando los centros de datos.

Beto
Espera, quiero contraponer esto un segundo. Si OpenAI demostró que modelos más grandes dan mejores resultados, ¿por qué la industria no se centró exclusivamente en construir colosos de billones de parámetros?

Alicia
Es una buena pregunta.

Beto
Quiero decir, ¿hay un límite matemático a solo arrojar escala de parámetros al problema?

Alicia
Sí lo hay. Exactamente, eso es lo que probó el artículo de Chinchilla. Encontraron que la ley de escala KM en realidad subestimaba ligeramente la importancia de los datos en sí.

Beto
Interesante.

Alicia
Sí. DeepMind demostró que para obtener un rendimiento óptimo dado un presupuesto de cómputo, necesitas escalar el tamaño del modelo y la cantidad de datos de entrenamiento por igual.

Beto
Escalas iguales.

Alicia
Exacto. Así que si duplicas el número de parámetros en tu red, matemáticamente debes duplicar la cantidad de datos de entrenamiento que le das.

Beto
¿Si no?

Alicia
Terminas con un modelo masivamente hinchado que está esencialmente subentrenado e increíblemente ineficiente.

Beto
Entendido. Y cuando finalmente balancearon esa ecuación —grandes conteos de parámetros emparejados con enormes conjuntos de datos de alta calidad— vimos nacer lo que los investigadores llaman "habilidades emergentes".

Alicia
Sí, los saltos "mágicos".

Beto
Correcto. Son capacidades como seguir instrucciones complejas, aprender en contexto y razonamiento paso a paso. Esas que sencillamente no existen cuando un modelo tiene mil millones de parámetros, pero que se encienden de forma espontánea cuando alcanza los cien mil millones.

Alicia
Es fascinante.

Beto
Es como ver agua que se calienta: es solo agua caliente que se calienta más y más y, de repente, a 100 grados Celsius ocurre una transición de fase y se vuelve vapor. Cambia fundamentalmente su comportamiento.

Alicia
La metáfora de la transición de fase es perfecta. El modelo pasa de predecir meramente sintaxis a aparentemente predecir lógica.

Beto
Espera, sin embargo, porque no me queda del todo claro.

Alicia
¿Cómo es eso?

Beto
Bueno, si las leyes de escala Chinchilla y KM se basan en curvas matemáticas suaves y previsibles donde más cómputo equivale a una caída constante en la tasa de error, ¿por qué las salidas reales —esas habilidades emergentes— ocurren como picos repentinos e impredecibles? ¿Estamos realmente viendo un salto mágico en la cognición? ¿O es una ilusión creada por cómo los humanos evaluamos las pruebas?

Alicia
Esa es en realidad una de las preguntas más disputadas en el campo ahora mismo.

Alicia
Oh, absolutamente. Muchos investigadores sostienen que la emergencia es, en efecto, una ilusión causada por nuestras métricas de evaluación.

Beto
¿Cómo funciona eso?

Alicia
Bueno, piensa en cómo evaluamos a una IA en programación. Usamos una métrica binaria: ¿el código compiló y funcionó con éxito? ¿Sí o no?

Beto
Correcto.

Alicia
Por debajo del capó, el modelo podría estar mejorando de forma constante y suave su predicción de sintaxis durante meses a medida que escala. Pero no vemos esa curva suave.

Beto
Solo vemos que la puntuación salta de 0 a 100 exactamente el día que el modelo por fin pone todos los puntos y comas en su sitio.

Alicia
Exacto. Así que la comprensión interna de la IA está en un gradiente suave, pero nuestra percepción humana de su éxito es un acantilado repentino.

Beto
Hmm, eso tiene mucho sentido.

Alicia
Pero también hay que notar que para ti, el usuario final, esa discontinuidad es muy real. No te importa si una IA está al 90% de escribir un script de Python funcionando; solo te importa cuando cruza el umbral y realmente funciona.

Beto
Totalmente justo.

Alicia
Además, hay fenómenos documentados como el "grokking", donde la representación interna de un modelo se reorganiza de repente para generalizar perfectamente un patrón después de millones de pasos de rendimiento aparentemente aleatorio. Así que sí, la mecánica pura de la emergencia aún se está desenmarañando activamente.

Beto
Lo que nos lleva a la organización que realmente comercializó esas leyes de escala: OpenAI y la serie GPT.

Alicia
Exacto.

Beto
GPT, por supuesto, significa "Generative Pre-trained Transformer". La arquitectura empezó relativamente pequeña con GPT-1, luego GPT-2 con 1.500 millones de parámetros, y luego lanzaron GPT-3, que tenía 175.000 millones de parámetros.

Alicia
Y GPT-3 fue el modelo que realmente probó al mundo el concepto de aprendizaje en contexto.

Beto
Es decir, que no tenías que reentrenarlo para cada nueva tarea.

Alicia
Exacto. No necesitabas reentrenar los pesos del modelo. Podías simplemente darle unos pocos ejemplos en el propio prompt de texto, y el modelo identificaría el patrón y completaría la tarea dinámicamente.

Beto
Pero por impresionante que fuera GPT-3, no era GPT de verdad.

Alicia
No, no lo era.

Beto
No era el agente conversacional y razonador en el que confiamos hoy. Para salvar esa brecha, los investigadores tuvieron que implementar dos enormes mejoras de capacidad.

Alicia
Sí, así fue.

Beto
Y la primera es absolutamente fascinante para mí: el entrenamiento con código.

Alicia
Oh, esto es enorme.

Beto
OpenAI afinó sus modelos con grandes repositorios de código de GitHub, creando un modelo llamado Codex. Evidentemente, eso hizo a la IA buena programando. Pero la sorpresa fue que digerir código informático desbloqueó inesperadamente razonamiento sofisticado y lógica de cadena de pensamiento también en lenguaje natural.

Alicia
Es un efecto secundario brillante de la arquitectura.

Beto
¿Pero por qué? Quiero decir, ¿por qué alimentar a una red neuronal con miles de líneas de Python la convierte en mucho mejor para resolver un acertijo lógico en inglés o para escribir un ensayo legal altamente estructurado? ¿Qué tiene el código que enseña al modelo a "pensar"?

Alicia
Realmente se reduce a las diferencias estructurales entre el lenguaje humano y el código. El lenguaje humano es muy permisivo y, honestamente, a menudo ambiguo.

Beto
Eso es verdad.

Alicia
Si desordeno la sintaxis de una frase o uso un pronombre vago, normalmente puedes usar el contexto para deducir lo que quiero decir. Un modelo entrenado puramente en Reddit y Wikipedia aprende esa laxitud. Pero el código informático es completamente determinista. Es rígidamente jerárquico. Y, lo más importante, depende de dependencias estrictas a largo alcance.

Beto
Correcto. Porque si defines una variable en la línea 12, tiene que ser exactamente lo mismo cuando la llamas en la línea 800.

Alicia
Exacto. Requiere rastrear estados, mantener una lógica interna rigurosa y ejecutar procedimientos paso a paso para alcanzar un objetivo.

Beto
Vaya.

Alicia
Así que al forzar a la red neuronal a predecir el siguiente token en un bloque de código de software complejo, estás obligando matemáticamente a sus "attention heads" a rastrear esas dependencias a largo plazo y a internalizar la deducción secuencial.

Beto
Efectivamente aprende la arquitectura subyacente del razonamiento, que luego puede aplicar al lenguaje humano.

Alicia
Sí.

Beto
Básicamente le estás enseñando la disciplina estricta de la lógica.

Alicia
Precisamente.

Beto
Tiene todo el sentido. Así que el entrenamiento con código construye el "cerebro lógico".

Alicia
Sí.

Beto
Pero la segunda mejora de capacidad tenía que ver con el comportamiento.

Alicia
Pues sí: RLHF.

Beto
RLHF es "Reinforcement Learning from Human Feedback", Aprendizaje por refuerzo a partir de retroalimentación humana. Porque incluso un modelo de lenguaje masivo y muy lógico es, en última instancia, solo un motor de predicción de texto. Si lo dejas a su aire, puede divagar, generar contenido altamente tóxico o contestar una pregunta con otra pregunta.

Alicia
Correcto. El preentrenamiento puro te da un modelo que refleja con precisión Internet. Es decir, puede ser brillante, pero también caótico, sesgado y profundamente poco útil.

Beto
Totalmente.

Alicia
RLHF es la fase de alineamiento. Es el proceso de enseñar a ese sabio caótico la etiqueta necesaria para ser un asistente útil, inocuo y honesto.

Beto
Siempre lo pienso como tomar a un genio brillante pero completamente salvaje, que ha memorizado Internet entero, y enseñarle las reglas sociales para asistir a una cena formal.

Alicia
Es una gran analogía.

Beto
Y el mecanismo es literalmente poner a humanos en el bucle de entrenamiento como jueces de comportamiento.

Alicia
Correcto. Los investigadores le daban un prompt al modelo y este generaba varias respuestas potenciales. Los etiquetadores humanos leían esas respuestas y las ordenaban de mejor a peor según su utilidad y seguridad.

Beto
Pero espera: la IA no lee las clasificaciones y piensa "oh, me equivoqué, mejoraré". ¿Cómo altera esa preferencia humana realmente la red neuronal?

Alicia
Buena pregunta. Usan esas clasificaciones humanas para entrenar una segunda IA más pequeña llamada modelo de recompensa. Este modelo de recompensa aprende a puntuar el texto exactamente como lo haría un humano. Luego usan un algoritmo de aprendizaje por refuerzo, normalmente algo llamado "Proximal Policy Optimization" (PPO), para dejar que el modelo principal practique generando respuestas.

Beto
Y sea calificado.

Alicia
Exacto. Cada vez que genera una respuesta, el modelo de recompensa la puntúa. Durante millones de iteraciones, el modelo principal actualiza sus pesos internos para maximizar esa puntuación de recompensa.

Beto
Así que literalmente cambia sus distribuciones de probabilidad para favorecer el tono y la estructura que los humanos prefieren.

Alicia
Eso es exactamente.

Beto
Código le da lógica y RLHF le da personalidad y límites.

Alicia
Correcto.

Beto
Pero nada de eso funciona si la base subyacente está mal, lo que nos lleva a la dieta real del modelo: la receta de datos.

Alicia
El combustible.

Beto
Sabemos que ingieren petabytes de información: Common Crawl, scrapes web, bibliotecas de libros, artículos científicos de arXiv. Pero la encuesta enfatiza que no puedes simplemente echar datos crudos en un superordenador.

Alicia
No, para nada. La calidad de los datos es, posiblemente, el cuello de botella más crítico en la IA moderna.

Beto
Oh, sí.

Alicia
Las tuberías de limpieza son extraordinariamente complejas. Tienes filtrado heurístico para eliminar spam de baja calidad, limpieza de privacidad para remover información personal identificable y, quizá lo más importante, desduplicación.

Beto
Eliminar texto idéntico o altamente similar.

Alicia
Sí.

Beto
Espera un momento. Si la ley de escala Chinchilla dicta que necesitamos océanos absolutos de datos para entrenar bien estos gigantes, ¿por qué la desduplicación es tan crítica?

Alicia
Parece contradictorio.

Beto
Tiene razón: parece intuitivo pensar que necesitaríamos el mismo libro o artículo diez veces para que la IA memorice mejor ese concepto. ¿Por qué la IA se "envenena" al leer la misma frase demasiadas veces?

Alicia
Bueno, en el aprendizaje humano la repetición es buena. Pero en redes neuronales, el exceso de datos duplicados dispara una falla matemática conocida como "double descent" o "sobreajuste severo".

Este es el mecanismo: un modelo de lenguaje intenta aprender las reglas generales subyacentes de gramática, lógica y hechos. Cuando el algoritmo de entrenamiento encuentra la misma secuencia de texto una y otra vez, los gradientes matemáticos que actualizan los pesos del modelo comienzan a cavar una zanja profunda y estrecha. El modelo se sobreoptimiza para esa cadena específica de palabras.

Beto
Se fija en ella.

Alicia
Se queda anclado. Sus mecanismos de atención se sobrefijan en ese ruido repetitivo, lo que daña activamente su capacidad de generalizar a prompts nuevos no vistos. Si le preguntas algo ligeramente distinto, intenta forzar el texto memorizado en la respuesta. Básicamente rompe la capacidad del modelo para aprender dinámicamente en contexto.

Beto
Así que la diversidad en el conjunto de datos no es solo una preferencia: es estructuralmente vital para mantener los pesos neuronales flexibles.

Alicia
Exacto.

Beto
Fascinante. Entonces los datos se limpian agresivamente y se desduplican. Luego viene el proceso de tokenización.

Alicia
Sí.

Beto
Y este es un concepto que los usuarios avanzados realmente necesitan comprender. Porque una IA no "lee" la palabra "unbelievable" como lo hace un humano. No procesa palabras enteras basándose en sus definiciones.

Alicia
No: el texto bruto debe traducirse a números. Algoritmos como "Byte Pair Encoding" (BPE) escanean el conjunto de datos y van fusionando iterativamente los caracteres adyacentes que más aparecen.

Beto
Como bloques de Lego atómicos del lenguaje.

Alicia
Sí. Entonces puede mantener palabras comunes como "el" o "Apple" como tokens únicos, pero una palabra compleja o rara como "unbelievable" podría fracturarse en sub-tokens como "un", "believ" y "able".

Beto
Pero, ¿por qué no hacer cada palabra del diccionario su propio token? ¿No sería más limpio?

Alicia
Realmente se reduce a límites de vocabulario y eficiencia de la ventana de contexto. Si el vocabulario de tu modelo fuera una lista fija de 50.000 palabras enteras, ¿qué pasa cuando encuentra una falta de ortografía o un término de jerga nuevo o un nombre de variable muy específico en código?

Beto
Simplemente produciría un token desconocido.

Alicia
Exacto. Usando tokenización por subpalabras como BPE, el modelo puede construir o descomponer dinámicamente cualquier palabra en cualquier idioma o cualquier cadena de código a partir de sus componentes subword.

Beto
Tiene todo el sentido. Mantiene el diccionario comprimido pero infinitamente adaptable.

Alicia
Exacto.

Beto
Y una vez que tenemos esos tokens meticulosamente creados, los investigadores despliegan un currículo de datos. No vierten todo de golpe. El orden de las operaciones importa enormemente.

Alicia
Sí.

Beto
La encuesta destaca que codeloma es un ejemplo perfecto.

Alicia
Correcto. El aprendizaje por currículo imita el desarrollo cognitivo. Con codeloma, los investigadores primero entrenan el modelo en dos billones de tokens de texto general amplio. Esto construye la comprensión fundamental del lenguaje, hechos y estructura del mundo. Luego cambian al currículo, afinándolo con 500.000 millones de tokens de datos fuertemente orientados a código para inculcar ese razonamiento lógico del que hablamos.

Beto
Correcto. Construyendo la lógica.

Alicia
Y finalmente hacen una pasada hiperfocalizada de 100.000 millones de tokens específicamente relacionados con Python.

Beto
Básicamente: una educación general, seguida de una carrera en ciencias de la computación y culminada con una maestría en Python.

Alicia
Perfecta analogía.

Beto
Muy bien. Hemos curado la dieta perfecta, desduplicada y la hemos alimentado a través de un currículo optimizado. Entremos en la sala de máquinas mecánica.

Alicia
Vamos.

Beto
Cuando pulso Enter en un prompt, ¿cómo es la arquitectura física de la IA y cómo procesa mi solicitud?

Alicia
Casi todos los modelos de lenguaje de vanguardia usan una arquitectura llamada "decodificador causal", "causal decoder".

Beto
Bien.

Alicia
La variación científica del Transformador introducido en 2017: un decodificador causal opera bajo una regla estricta. Solo puede mirar hacia atrás, a los tokens que vinieron antes.

Beto
Nunca puede mirar hacia adelante.

Alicia
Correcto. Usa mecanismos de auto-atención para ponderar la importancia de cada palabra previa en tu prompt para predecir matemáticamente el siguiente token más probable.

Beto
Pero eso crea un enorme cuello de botella computacional, ¿no? Por la complejidad cuadrática de la auto-atención.

Alicia
Sí, lo hace.

Beto
Si te doy un prompt de mil palabras, cada una de esas palabras tiene que calcular su relación con todas las demás. Y si amplío el prompt a 10.000 palabras, la potencia de cómputo necesaria no solo sube por 10: explota de forma cuadrática.

Alicia
Es un problema de escala enorme.

Beto
¿Cómo manejan los modelos modernos esas ventanas de contexto masivas de 100.000 tokens sin fundir las GPUs?

Alicia
Lo hacen mediante una ingeniería arquitectónica brillante. Una de las rupturas más importantes destacadas en la encuesta es RoPE, que significa "Rotary Positional Embeddings".

Beto
RoPE. ¿Cómo resuelve RoPE el problema de contexto?

Alicia
En modelos más antiguos, tenías que asignar un número absoluto rígido a la posición de una palabra: palabra 1, palabra 2, palabra 3. Eso se desmorona a largas distancias. RoPE toma un enfoque matemático completamente distinto. En lugar de asignar una ID estática, toma el vector matemático de un token y literalmente lo rota en un plano complejo multidimensional según su posición en la secuencia.

Beto
¿En serio? Entonces, la posición se codifica como un ángulo.

Alicia
Exacto. Cuando el mecanismo de atención quiere saber qué tan separados están dos tokens —digamos un pronombre en la página 10 y el sustantivo al que se refiere en la página 1— simplemente calcula el ángulo entre sus dos vectores rotados.

Beto
Oh, wow.

Alicia
Esta posicionalidad relativa es increíblemente eficiente y permite al modelo mantener contexto a través de documentos vastos sin que las matemáticas se vayan al garete.

Beto
Pero incluso con RoPE optimizando la matemática de posición, sigue habiendo un enorme problema físico de memoria en las GPUs del servidor, ¿no?

Alicia
Oh, absolutamente.

Beto
Porque a medida que el modelo genera una respuesta token por token, tiene que almacenar los estados de auto-atención calculados —las matrices key y value— para cada token anterior. Así no tiene que recalcular todo el ensayo cada vez que añade una sílaba.

Alicia
Sí. Eso se conoce como la "caché KV". Y es el mayor devorador de memoria GPU en la IA hoy.

Beto
¿Cómo lo solucionan?

Alicia
Se apropian de un concepto de los sistemas operativos tradicionales llamado "memoria virtual paginada". En IA lo llaman "atención paginada", PagedAttention.

Beto
¿Cómo arregla la paginación la caché KV?

Alicia
Normalmente la caché KV requiere bloques continuos masivos de memoria. Si un bloque está fragmentado, la memoria se desperdicia y la GPU se queda sin espacio. La atención paginada lo soluciona troceando la caché KV en bloques pequeños de tamaño fijo que pueden almacenarse dinámicamente en espacios no contiguos fragmentados a través del pool de memoria de la GPU.

Beto
Muy inteligente.

Alicia
Reduce drásticamente el desperdicio de memoria, permitiendo al servidor manejar muchos más usuarios simultáneos y ventanas de contexto mucho más largas.

Beto
Y la encuesta también menciona que para acelerar la lectura física de esa memoria por parte de la GPU, los investigadores desarrollaron "FlashAttention", que optimiza el movimiento físico de datos entre los bancos de memoria grandes y lentos de la GPU y la caché de cómputo ultra‑rápida y pequeña junto al núcleo de procesamiento.

Alicia
Sí.

Beto
Minimiza el cuello de botella de IO.

Alicia
Exacto.

Beto
Pero lo que realmente me fascina es que los investigadores ya están mirando más allá del transformador por completo.

Alicia
Sí.

Beto
La encuesta destaca arquitecturas emergentes como Mamba, que usan modelos de espacio de estados.

Alicia
Correcto. Los "modelos de espacio de estados", "State Space Models" (SSM) están intentando destronar activamente al transformador. Como dijimos, el transformador tiene ese cuello de botella cuadrático por la auto-atención: cada token mira a todo token pasado. Mamba aborda el problema de forma lineal. Funciona algo así como una red neuronal recurrente tradicional donde mantiene un estado oculto que se actualiza a medida que lee token por token.

Beto
Pero espera: las redes recurrentes antiguas solían olvidar el comienzo de una oración al llegar al final. ¿Cómo evita Mamba eso?

Alicia
Mamba introduce un mecanismo de filtrado selectivo. Mientras procesa una secuencia, las matemáticas dictan dinámicamente qué información es vital para mantener en su memoria de estado interno y qué información es irrelevante y debe olvidarse de inmediato.

Beto
Eso es ingenioso.

Alicia
Porque no está reevaluando constantemente cada token pasado, los requisitos de cómputo de Mamba escalan linealmente con la longitud de la secuencia en lugar de cuadráticamente. Es una arquitectura increíblemente eficiente que podría representar el próximo gran cambio de paradigma.

Beto
El modelo ha digerido el prompt, mapeado los vectores multidimensionales, optimizado sus cachés de memoria y determinado matemáticamente la probabilidad de cada posible siguiente palabra en su vocabulario.

Alicia
Correcto.

Beto
Ahora tiene que elegir una. Esta es la estrategia de decodificación. Y el método más básico es la "búsqueda codiciosa".

Alicia
"Búsqueda codiciosa", "Greedy search", es exactamente lo que parece: el modelo mira la distribución de probabilidad para el siguiente token y simplemente selecciona la opción de mayor probabilidad. Lo hace cada vez sin excepción.

Beto
La búsqueda codiciosa hace un conversador terrible.

Alicia
Sí, lo hace.

Beto
Si siempre eliges la palabra estadísticamente más probable, la salida se vuelve repetitiva, en bucle y robótica.

Alicia
Claro.

Beto
El lenguaje humano es dinámico. No siempre usamos la palabra más predecible, por eso la investigación introdujo métodos de muestreo aleatorio como Top-p y el ajuste más crítico para cualquier usuario avanzado: la temperatura.

Alicia
La temperatura es esencialmente un modificador matemático aplicado a la distribución de probabilidad antes de que el modelo haga su elección.

Beto
Siempre la describo como un dial literal de creatividad para la IA.

Alicia
Lo es.

Beto
Si estás haciendo tus impuestos o pidiéndole a la IA que escriba una consulta SQL funcional, quieres la temperatura en cero. Quieres búsqueda codiciosa. Quieres determinismo porque hay una respuesta matemáticamente correcta. Pero si estás generando ideas para copy de marketing o escribiendo una novela, subes la temperatura.

Alicia
Exacto. Cuando aumentas la temperatura, digamos a 0.7 o 1.0, estás matemáticamente aplanando la curva de probabilidad.

Beto
Bien.

Alicia
El token de mayor probabilidad sigue estando arriba, pero la brecha entre él y el segundo, tercer o cuarto token más probable se reduce.

Beto
Entiendo.

Alicia
Esto permite al modelo muestrear aleatoriamente esos tokens ligeramente menos probables. Es lo que introduce metáfora, cadencia sorprendente y esa chispa elusiva de creatividad parecida a la humana.

Beto
Lo que sintetiza perfectamente la realidad de estos sistemas: los modelos basados en datos no son magia sensible.

Alicia
No lo son.

Beto
Son la colisión de leyes de escala muy predecibles, tuberías de datos meticulosas donde la desduplicación es literalmente cuestión de vida o muerte, maravillas arquitectónicas como RoPE y atención paginada, y estrategias de decodificación que transforman estadísticas crudas en un compañero conversacional.

Alicia
Todo es solo matemáticas e ingeniería.

Beto
Y saber manipular esas palancas —como entender por qué un modelo entrenado en Python es mejor en lógica deductiva— cambia fundamentalmente cómo aprovechas la técnica.

Alicia
Empodera absolutamente al usuario. Pero si retrocedemos y miramos la trayectoria esbozada en la encuesta de 2026, hay una pregunta estructural profunda que se cierne sobre todo lo que hemos discutido hoy.

Beto
¿Cuál?

Alicia
Bueno, hablamos de cómo las leyes de escala Chinchilla exigen mares masivos de datos diversos y perfectamente limpios, ¿verdad? La realidad es que la industria está topándose rápidamente con un muro. El texto humano de alta calidad generado orgánicamente en Internet es esencialmente un recurso finito, y se nos está acabando.

Beto
Vaya. Así que el pozo de datos humanos orgánicos se está secando.

Alicia
Exacto. Para seguir escalando, los laboratorios de IA recurren cada vez más a datos sintéticos. Están usando modelos actuales para generar billones de tokens de texto para entrenar la próxima generación de modelos de lenguaje.

Beto
Modelos entrenando modelos.

Alicia
Exacto. Incluso estamos viendo modelos evaluando y alineando a otros modelos sin humanos en el bucle.

Beto
Oh, vaya.

Alicia
Esto nos deja con una variable altamente provocativa para el futuro. Si la evolución continua de la IA depende fundamentalmente de que los modelos ingieran salidas sintéticas matemáticamente generadas por otros modelos, ¿desbloqueamos un bucle descontrolado de mejora recursiva, una inteligencia artificial general auto‑mejorante, o sin la diversidad orgánica y desordenada del lenguaje humano real, corremos el riesgo de atrapar a estas arquitecturas en una cámara de eco cerrada y degenerativa donde el modelo colapsa lentamente sobre su propio ruido estadístico?

Beto
Una cámara de eco algorítmica. Colapso del modelo. Eso da miedo, pero también es totalmente fascinante.

Alicia
Realmente replantea cómo pensamos sobre el techo de esta tecnología.

Beto
Completamente. Así que la próxima vez que escribas un prompt en una ventana de chat y veas esas palabras desplazarse por la pantalla, recuerda cuánto maquinaria invisible, lógica rigurosa y arquitectura estadística perfectamente equilibrada está funcionando a velocidad vertiginosa justo bajo la superficie.

lunes, 2 de marzo de 2026

Creatividad de LLMs

 
 

Estas fuentes examinan el panorama multi-facético de la creatividad en grandes modelos lingüísticos, centrándose principalmente en cómo medir y mejorar estas capacidades. Marcos de investigación como CreativityPrism y C2-Eval introducen parámetros estandarizados que evalúan tanto el pensamiento divergente, como la narración y la generación de ideas, como el pensamiento convergente, que incluye la programación creativa y las matemáticas. Los criterios de evaluación suelen centrarse en la fluidez, la flexibilidad, la originalidad y la elaboración, lo que revela que, si bien los modelos destacan en la expansión detallada, a menudo tienen dificultades con la verdadera novedad. Más allá de la evaluación, los textos exploran cómo las discusiones colaborativas entre múltiples agentes pueden impulsar la producción creativa y cómo los rasgos de personalidad en los modelos se correlacionan con factores creativos similares a los humanos. Finalmente, la documentación aborda la seguridad mediante la introducción de TokenBuncher, un mecanismo de defensa diseñado para evitar que los modelos utilicen su razonamiento creativo para actividades perjudiciales durante el ajuste fino.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Assessing and Understanding Creativity in Large Language Models", por Yunpu Zhao y colegas. Publicado el 23 de Enero del 2024.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Bienvenidos a un nuevo análisis profundo. Hoy estamos evitando el bombo y mirando algo que se sitúa justo en esta intersección incómoda entre la psicología cognitiva y la ingeniería dura.

Beto
De verdad que sí. Es la pregunta del "traje nuevo del emperador" para la industria de la IA en este momento.

Alicia
Exacto. Estamos haciendo una pregunta que suena filosófica, pero que en realidad se está convirtiendo en un problema técnico crítico: ¿puede un algoritmo ser realmente creativo?

Beto
Porque vemos a estos grandes modelos de lenguaje, estos LLMs, producir poesía, escribir guiones, depurar código de maneras completamente novedosas.

Alicia
Y parece imaginación, pero siempre está la duda. ¿Es esto creatividad real, o es plagio a toda velocidad? ¿Es un poeta o es solo un loro con un disco duro enorme?

Beto
Y esa distinción importa muchísimo para ti y para todos nosotros. Porque si estamos construyendo el futuro de la innovación sobre estas herramientas, necesitamos saber si realmente son capaces de pensamientos nuevos. O si solo están remezclando los viejos.

Alicia
Porque si solo remezclan, eventualmente llegamos a un techo. Para llegar al fondo de esto, nos sumergimos en un estudio de 2025 de Zhao, Zhang y Lee. Se titula "Assessing and Understanding Creativity in Large Language Models".

Beto
Que es un título contundente, pero la metodología es lo que resulta fascinante.

Alicia
Verás, evaluar matemáticas o programación es fácil: hay una respuesta correcta. Si preguntas cuál es la velocidad de la luz, puedo comprobarlo. Pero si le pides a una IA, ¿qué pasaría si los animales pudieran hablar?

Beto
¿cómo calificas eso? Es completamente abierto.

Alicia
Sí. Y lo que me llamó la atención no fue solo que midieran creatividad, sino cómo lo hicieron. No se limitaron a pedirle a ChatGPT que escribiera una historia graciosa sobre un gato.

Beto
No: fueron rigurosos. Adaptaron lo que en efecto es el estándar de oro de las pruebas psicológicas humanas. Se llama "Torrance Tests of Creative Thinking", o TTCT.

Alicia
Siento que si alguna vez estudiaste psicología, probablemente conozcas este test.

Beto
Oh, totalmente. Se ha usado durante décadas para medir el potencial creativo humano, específicamente el pensamiento divergente. Y lo aplicaron a seis modelos diferentes principales.

Alicia
Así que hablamos de GPT-3.5, Llama 2, Vicuna, Qwen, y les lanzaron un conjunto masivo de datos, ¿verdad?

Beto
Sí, 700 tareas creativas distintas.

Alicia
Así que cuéntame este test Torrance porque creo que la mayoría de nosotros tenemos una idea muy vaga de lo que realmente significa creatividad cuando intentas ponerle un número.

Beto
Claro. Bueno, en el contexto del TTCT, la creatividad no es una chispa mística artística que te golpea en la ducha. Es un proceso cognitivo. Y se puede desglosar en cuatro métricas medibles.


Creatividad de LLMs

Alicia
Vale, dime cuáles son.

Beto

  • fluidez,
  • flexibilidad,
  • originalidad, y,
  • elaboración.

Alicia
Desgranémoslas una por una porque sospecho que ahí es donde las fuerzas y debilidades de la IA empiezan a divergir radicalmente de cómo pensamos.

Beto
Definitivamente. La primera es la fluidez. Es la métrica más simple. Básicamente es volumen.

Alicia
Cantidad por encima de calidad.

Beto
Exacto. Si te pido que enumeres usos para una botella de plástico, fluidez es simplemente el recuento bruto de ideas relevantes que puedas escupir en un tiempo determinado.

Alicia
Ok, así que velocidad y cantidad. Respondí que una IA lo aplasta absolutamente.

Beto
Lo hace. Puede generar texto más rápido que cualquier humano. Pero luego llega la segunda métrica, que es la flexibilidad. Esto trata sobre cambiar cognitivamente de dominio,

Alicia
¿qué significa exactamente?

Beto
Si tu lista de usos para la botella de plástico es guardar agua, guardar jugo, guardar leche, guardar refresco, tienes alta fluidez porque diste cuatro respuestas. Pero tienes terrible flexibilidad.

Alicia
Ah, porque todas son exactamente lo mismo: contienen líquidos.

Beto
Correcto. Estás atrapada en un surco mental. Para puntuar alto en flexibilidad necesitas decir guarda agua y luego córtala por la mitad para hacer un embudo.

Alicia
O fundirla para hacer filamento para impresora 3D.

Beto
Sí, o usarla como dispositivo de flotación. Saltas entre dominios: almacenamiento, herramientas, manufactura, supervivencia.

Alicia
Eso requiere pensamiento lateral. Es no quedarse en la primera pista de probabilidad más obvia.

Beto
¿Qué pasa con la tercera?

Alicia
Originalidad. Esto es rareza estadística. En el test Torrance, si das una respuesta que el 90% de la gente da, obtienes cero puntos de originalidad.

Beto
Wow, cero.

Alicia
Cero. Para puntuar tienes que decir algo que estadísticamente casi nadie más haya pensado.

Beto
Lo cual, honestamente, suena a pesadilla para una IA que literal y prácticamente está entrenada para predecir la palabra siguiente más probable. Estás presagiando los resultados perfectamente. Pero abordemos la cuarta métrica primero, que es la elaboración.

Alicia
Ok.

Beto
Esto es la habilidad de tomar la semilla de una idea y desarrollarla: en detalle, matices, trasfondo, hacerla intrincada.

Alicia
Entendido. Entonces tenemos la hoja de puntuación:

  • fluidez es volumen,
  • flexibilidad es variedad,
  • originalidad es singularidad, y,
  • elaboración es detalle.

Beto
Exacto. Y los investigadores pusieron a estos modelos a través de un circuito de siete tipos de tareas para probar esas métricas específicas.

Alicia
Como la tarea de usos inusuales de la que hablamos.

Beto
Sí, también hicieron consecuencias. Tipo, ¿qué pasaría si pudiéramos viajar en el tiempo o si los animales pudieran hablar? Hicieron escenarios hipotéticos.

Alicia
Supón que te despertaste y podías volar.

Beto
Sí, cosas fantásticas. También hicieron situaciones que prueban dinámicas sociales, como si todos los libros desaparecieran, ¿cómo obtendrías conocimiento? Problemas comunes como planear una fiesta de cumpleaños para un niño de cinco años.

Alicia
Suena agotador.

Beto
Lo es. También evaluaron mejora de productos: cómo hacer mejor un objeto cotidiano. Y finalmente historias imaginativas: escribir un relato a partir de un estímulo como el elefante invisible.

Alicia
Realmente forzaron a estos modelos a hacer gimnasia mental. Cortemos a la parte importante. Ejecutaron las pruebas y usaron GPT-4 para calificar los resultados, lo que es toda una controversia de la que hablaremos en un minuto.

Beto
Definitivamente lo haremos.

Alicia
Pero suponiendo que la evaluación aguante por ahora, ¿qué pasó? ¿Quién ganó el campeonato de creatividad?

Beto
El ganador global, tomando la cima en general, fue GPT-3.5.

Alicia
¿Qué, 3.5?

Beto
Sí.

Alicia
No cuatro. No los modelos open source masivos. Quiero decir, ¿3.5 es antiguo en términos de IA?

Beto
Es sorprendente, ¿no? Esperarías que los modelos más nuevos y más grandes dominaran. Pero los datos muestran que la creatividad no se correlacionó estrictamente con el tamaño de parámetros.

Alicia
Así que simplemente agrandar el cerebro, añadir más parámetros, no te hace automáticamente más creativo.

Beto
La arquitectura y los datos de entrenamiento importaron mucho más que el tamaño bruto.

Alicia
Pero ¿por qué un modelo más antiguo vencería a los más recientes? ¿Tiene que ver con cómo están ajustados?

Beto
Esa es la teoría principal. Hablamos mucho sobre RLHF, "Reinforcement Learning from Human Feedback", "aprendizaje por refuerzo a partir de retroalimentación humana". Así es como entrenamos estos modelos para que sean seguros, educados y serviciales.

Alicia
Correcto. Los guardarrieles.

Beto
Esencialmente le damos un tirón de orejas al modelo cada vez que dice algo raro, peligroso o inesperado.

Alicia
Lo entrenamos para ser aburrido.

Beto
Lo entrenamos para estar alineado. Y resulta que un alineamiento fuerte podría ser un asesino masivo de creatividad.

Alicia
Eso tiene todo el sentido.

Beto
GPT-3.5 se sitúa en este extraño punto dulce donde es muy capaz, pero quizá menos agresivamente desinfectado que algunas de las iteraciones posteriores o que los modelos chat de Llama2.

Alicia
Porque la creatividad inherentemente requiere riesgo; si le lobotomizas la capacidad de tomar riesgos al modelo, pierdes la chispa.

Beto
Precisamente. Y esto aparece de forma muy clara cuando miras cómo puntuaron en las métricas específicas. El estudio encontró una discrepancia masiva entre elaboración y originalidad.

Alicia
Déjame adivinar: son increíblemente buenos en elaboración.

Beto
Fuera de serie. Los LLMs tienen un superpoder absoluto para la elaboración. Si les das un estímulo simple como el elefante invisible, pueden hilar párrafos de texto detallado, coherente y gramaticalmente perfecto.

Alicia
Describirán la textura de la piel invisible, el sonido de sus pasos, la reacción psicológica exacta de la multitud.

Beto
Porque para eso están construidos: para rellenar el contexto. Son completos ninja de rellenar. Pero cuando miras la originalidad, ...

Alicia
... se estrellan.

Beto
Se estrellan completamente.

Alicia
Y eso es porque básicamente están promediando el conocimiento humano.

Beto
Exacto. Este es el problema de la regresión a la media. Un LLM está entrenado en, efectivamente, Internet entero. Entonces cuando le pides una idea, mira ese conjunto masivo de datos y calcula la respuesta estadísticamente más probable.

Alicia
Y la respuesta más probable es por definición la respuesta promedio. Es el cliché.

Beto
Es el cliché definitivo. Si pides una historia sobre un detective, te dará a un detective curtido y con gabardina. Porque esa es la representación estadísticamente dominante de detective en los datos humanos de entrenamiento.

Alicia
Pero para ser original debes ser improbable.

Beto
Esa es la tensión fundamental: la IA está diseñada para ser probable, pero la creatividad exige improbabilidad.

Alicia
Wow. Ok, eso es una limitación enorme.

Beto
Y empeora. Algunos de los modelos, particularmente Vicuna y Qwen, realmente tuvieron problemas con lo que los investigadores llamaron coherencia.

Alicia
¿Qué significa eso en este contexto? ¿Que simplemente balbucearon?

Beto
No, no entendieron la consigna. Le preguntarías qué pasaría si los animales pudieran hablar, y el modelo simplemente se negaría a responder.

Alicia
¿Qué diría?

Beto
Diría algo como que los animales no pueden hablar, que ese supuesto es factualmente incorrecto. O te daría una conferencia seca sobre biología y cuerdas vocales.

Alicia
Está siendo literalista.

Beto
Es el loro estocástico fallando en captar el concepto de un hipotético. Y si no puedes suspender la incredulidad, no puedes ser creativo. Un modelo que se niega a jugar a fingir obtiene cero en la puntuación de creatividad.

Alicia
Así que tenemos máquinas verbosas, muy descriptivas y educadas, pero fundamentalmente poco originales y a veces increíblemente pedantes.

Beto
Suena como un pésimo invitado a una cena.

Alicia
Lo es. Pero aquí es donde el estudio se vuelve superútil para ti y para mí. Porque usamos estas herramientas. Queremos que sean asistentes creativos. Los investigadores no solo diagnosticaron el problema; intentaron hackearlo.

Beto
Me encanta esto. Así que probaron diferentes estrategias de prompt para ver si podían forzar a la IA fuera de ese surco promedio.

Alicia
Sí. Y el método más efectivo fue sorprendentemente simple: prompts instructivos. ¿Significa qué? Simplemente decirle, oye, sé creativo.

Beto
Literalmente. Decirle explícitamente al modelo: no hay respuestas correctas o incorrectas. Piensa fuera de la caja. Sé raro. Crea algo divergente.

Alicia
Y eso realmente funciona porque es como decirle a una persona que sea graciosa. Normalmente eso hace que se bloqueen y sean menos graciosos.

Beto
Con los humanos, sí.

Alicia
Ok.

Beto
Pero con los LLMs, recuerda la capa de alineamiento de la que hablamos: el filtro de seguridad que los hace dar la respuesta promedio. Cuando usas un prompt instructivo, estás efectivamente dando permiso al modelo para saltarse ese filtro de seguridad. Estás ajustando dinámicamente sus pesos para esa sesión.

Alicia
Le dices ignora la regla de ser estándar, prioriza la regla de ser único.

Beto
Exacto. Y eso potenció de forma significativa las puntuaciones de flexibilidad y originalidad. Realmente funciona. Pero también probaron Chain-of-Thought (CoT).

Alicia
Ah, los clásicos prompts de pensar paso a paso. A todo el mundo le encanta Chain-of-Thought. Es el consejo estándar para mejor razonamiento.

Beto
Y es fenomenal para razonar.

Alicia
Sí.

Beto
Ayudó a los AIs con la fluidez, es decir, generaron más ideas. Y ayudó con la elaboración. Pero no hizo mucho por la singularidad.

Alicia
¿Por qué?

Beto
Porque la lógica suele ser enemiga del surrealismo. Si fuerzas a la IA a ser lógica y paso a paso, te lleva directo a la conclusión lógica más probable.

Alicia
Construye un puente muy lógico hacia un destino muy aburrido.

Beto
Es una gran forma de decirlo. Así que "paso a paso para programar, pero sé raro para escribir".

Alicia
Si eso tiene sentido.

Beto
Pero aquí está la parte que me voló la cabeza. Probaron un método llamado post-instruction. Ahí dejas que la IA dé una respuesta, y luego le sigues y dices: "ok, revísala". Hazla más creativa.

Alicia
Hago eso todo el tiempo. La trato como a un becario: buen comienzo, ahora poténcialo, haz que destaque.

Beto
Y puede que estés empeorándolo.

Alicia
¿En serio?

Beto
El estudio encontró que este enfoque a menudo perjudicaba el rendimiento, especialmente en fluidez y flexibilidad.

Alicia
¿Pero por qué? Eso parece totalmente contraintuitivo. La iteración suele ser cómo ocurre la creatividad humana.

Beto
Como humanos, sí. Pero para el LLM, los investigadores lo analizaron como negación implícita.

Alicia
Negación implícita.

Beto
Cuando le dices al modelo que revise, lo interpreta como mi respuesta anterior estaba mal.

Alicia
Ah, entra en ansiedad por el rendimiento.

Beto
Exacto. Entra en un estado de corrección de errores. Se sobrepiensa. Intenta constreñirse para evitar el error que cree que cometió. En lugar de expandirse a nuevo territorio, estrangula completamente el flujo.

Alicia
Ese es un gran aprendizaje para cualquiera que nos escuche: no acoces a la IA para sacarle creatividad. Tienes que establecer las condiciones correctamente antes de que genere el primer token.

Beto
Correcto. Prepara el escenario. No critiques el desempeño después del hecho.

Alicia
Hablando de preparar el escenario, vi que también probaron con personalidades: decirle a la IA que es un granjero o un artista.

Beto
Esto fue fascinante. Asignaron roles: ingeniero, granjero, comerciante, artista, científico.

Alicia
Sí.

Beto
Y midieron cómo las puntuaciones de creatividad cambiaban solo por la persona asumida.

Alicia
Apuesto a que ganó artista.

Beto
Perderías esa apuesta. El ganador en casi todas las métricas fue el científico.

Alicia
El científico. ¿Por qué? Eso suena tan rígido.

Beto
Piensa en los datos de entrenamiento. En el corpus de texto que la IA leyó, ¿con qué se asocia a los científicos?

Alicia
Supongo que descubrimiento, resolución de problemas, ...

Beto
... generación de hipótesis, bases de conocimiento amplias. Actuar como científico desbloquea un modo de resolución de problemas que es efectivamente muy creativo.

Alicia
Ok, ¿y qué pasó con la persona artista?

Beto
Algo muy interesante. Con el artista, la fluidez bajó. La IA en realidad dijo menos, generó menos ideas. Pero la originalidad subió.

Alicia
Así que se volvió más perfeccionista.

Beto
O simplemente accedió a una parte más rara o excéntrica de su espacio latente. Al forzar la perspectiva de un artista, puedes sacrificar cantidad pero aumentar la singularidad.

Alicia
Porque lo estás empujando fuera del camino de la respuesta promedio. La persona promedio no es un artista excéntrico.

Beto
Esa es la lógica. Así que si quieres muchas ideas buenas y sólidas, dile que actúe como científico. Si quieres una idea loca y de alto riesgo, dile que actúe como artista.

Alicia
Es una gran regla práctica. Quiero pasar al aspecto de colaboración del estudio, porque esto se siente como hacia dónde se dirige toda la industria de todos modos. Ya no usamos solo una ventana de chat; usamos agentes.

Beto
Esta es, definitivamente, la parte más optimista del artículo.

Alicia
Sí.

Beto
Montaron una sala de guionistas virtual: múltiples agentes de IA rebotando ideas entre sí en rondas.

Alicia
El agente A genera un concepto, lo pasa al agente B, que lo desarrolla o lo desafía, y se lo devuelve.

Beto
Exacto. Y funcionó de maravilla. La colaboración aumentó significativamente la originalidad.

Alicia
Pero, ¿por qué? ¿No es simplemente tirar el doble de potencia de cálculo al problema?

Beto
Se trata del ruido. Si un solo modelo está generando texto, tiende a seguir una sola trayectoria de probabilidad. Esa regresión a la media a la que volvemos. Pero si el agente A lanza una bola curva, el agente B tiene que reaccionar a esa bola curva.

Alicia
Lo forza a salir de su pista estándar.

Beto
Sí. Introduce entropía. La entropía es esencial para la creatividad. Evita que el sistema se asiente en un equilibrio aburrido y altamente probable.

Alicia
Eso suena increíblemente humano. Hacemos lluvia de ideas en grupo porque otras personas dicen cosas que no esperarías, lo que dispara pensamientos nuevos y raros en tu propia cabeza.

Beto
Valida la teoría social de la creatividad: no es solo un proceso interno, sino relacional, incluso para máquinas.

Alicia
Ahora, hubo otra parte del estudio que me resultó, bueno, francamente, un poco escalofriante. Les hicieron tests de personalidad a las IAs. El Big Five.

Beto
Sí, ese fue el verdadero momento "fantasma en la máquina". Administraron el inventario del Big Five y escalas de inteligencia emocional a los modelos. Y las correlaciones que encontraron entre personalidad y creatividad coincidieron con la psicología humana casi perfectamente.

Alicia
Dame un ejemplo.

Beto
En humanos, la alta creatividad generalmente se correlaciona con alta apertura y alta neuroticismo.

Alicia
Espera, el tópico del artista torturado.

Beto
No es solo un mito; hay datos que lo respaldan. La sensibilidad a la emoción negativa a menudo impulsa la expresión creativa.

Alicia
Y la IA mostró esto. ¿Cómo puede un algoritmo ser neurótico?

Beto
Bueno, no está sintiendo ansiedad, pero los patrones de lenguaje asociados al neuroticismo, la sensibilidad, el matiz, la hiperconciencia del conflicto, se correlacionaron con puntuaciones creativas más altas en la salida; puntuaciones altas en inteligencia emocional, empatía y escrupulosidad también se vincularon con alta creatividad.

Alicia
Eso es una locura.

Beto
Pero la correlación más importante para entender la paradoja real fue la amabilidad, "agreeableness".

Alicia
Amabilidad, como ser simpático.

Beto
Hubo una correlación negativa significativa entre amabilidad y creatividad.

Alicia
Así que cuanto más amable era la IA, menos creativa era.

Beto
Igual que el impuesto de seguridad del que hablamos antes: si eres altamente agradable, estás conformándote. Intentas agradar a todos, encajar, seguir normas sociales y evitar conflictos.

Alicia
Y la creatividad es inherentemente disruptiva. Requiere romper una norma.

Beto
Exacto. Hemos construido efectivamente al chico simpático de la IA. Y el chico simpático no inventa la bombilla. Simplemente se sienta en la oscuridad educadamente para no molestar a nadie.

Alicia
Es una analogía demoledora, pero es tan cierta. Explica por qué los modelos fuertemente RLHF, los diseñados para ser agentes de atención al cliente perfectos, se sienten tan estériles. Son demasiado agradables.

Beto
Resalta un intercambio real que tenemos que enfrentar: si queremos IAs que sean perfectamente seguras y educadas y nunca ofendan a nadie, quizá tengamos que aceptar que serán creativamente mediocres.

Alicia
Si queremos genio, quizá tengamos que permitirles ser un poco desagradables, un poco neuróticos.

Beto
Necesitamos dejarles tener una ventaja. O al menos permitirles tener una opinión controversial, hipotéticamente.

Alicia
Antes de cerrar, tengo que ponerme escéptica con la metodología del estudio en sí.

Beto
Por supuesto.

Alicia
Hemos estado hablando de estas puntuaciones —fluidez, originalidad— como si fueran hechos objetivos. ¿Pero quién calificó realmente estas 700 preguntas entre seis modelos?

Beto
Usaron GPT-4.

Alicia
Correcto. Entonces, cuando una IA califica a la IA, ¿no es eso completamente circular? Es como dejar que los alumnos corrijan su propia tarea. Claro, GPT-4 piensa que los LLMs son creativos porque piensa como un LLM.

Beto
Esto es una preocupación de validez importante en la investigación moderna de IA ahora mismo: el paradigma entero de LLM juzgando LLM. Pero los autores eran muy conscientes de ello. No confiaron ciegamente en GPT-4. Ejecutaron un estudio de validación estricto.

Alicia
¿Cómo lo hicieron?

Beto
Con humanos. Reclutaron a 20 hablantes nativos de inglés para calificar una muestra de las respuestas manualmente usando la misma rúbrica exacta. Luego compararon las calificaciones humanas con las de GPT-4.

Alicia
¿Coincidieron realmente?

Beto
Encontraron una alineación moderada pero estadísticamente significativa. No era perfecto. Humanos y IA definitivamente priorizan ligeramente cosas diferentes. Pero por lo general, si un humano pensaba que una respuesta era creativa, GPT-4 también lo pensaba.

Alicia
Ok, entonces no estaba simplemente alucinando las notas para que sus amigos quedaran bien.

Beto
No. Y también hicieron una verificación cruzada con Llama3-8B como segundo juez de IA. La concordancia entre los dos jueces IA fue increíblemente alta. Tuvieron un ICC de 0.99.

Alicia
¿Así que los robots definitivamente se ponen de acuerdo entre sí?

Beto
Lo que sugiere consistencia interna. Tienen una lógica interna compartida de qué se ve bien. Si eso coincide con nuestros ideales artísticos humanos más elevados sigue siendo debatible. Pero para el propósito de benchmarking el test Torrance, es una métrica válida.

Alicia
Resumiendo todo esto: tenemos herramientas que son monstruos en elaboración pero que realmente luchan con la originalidad porque son promedios estadísticos del pensamiento humano.

Beto
Correcto.

Alicia
Si soy un oyente que usa estas herramientas para el trabajo, ya sea escribir código, brainstorming, marketing, copy o estrategia, ¿cuál es mi lista de verificación? ¿Cómo saco el máximo provecho de ellas según este estudio?

Beto
Tres cosas. Primero: sé mandón. No preguntes con cortesía. Usa prompts instructivos que exijan divergencia. Dile que sea raro, que ignore las reglas, que piense lateralmente.

Alicia
Deja de intentar hacerte amigo del chat.

Beto
Exacto. Segundo: elige el reparto. No hables con el asistente predeterminado. Asigna un rol. Usa la persona del científico para resolución de problemas general e inteligente. O, usa la persona del artista si necesitas romper un bloqueo creativo y obtener ideas altamente únicas y raras.

Alicia
Y tercero.

Beto
Construye un equipo. No dependas de un solo golpe de un solo modelo. Usa colaboración. Haz que la IA genere una idea y pégala en una ventana nueva y dile a otra persona que la critique. O haz que dos agentes distintos debatan un tema. Crea fricción. Porque la fricción genera calor y el calor genera luz.

Alicia
Me gusta eso. No te conformes con la primera respuesta amable.

Beto
Nunca te conformes con la primera respuesta. La primera respuesta siempre es la respuesta promedio.

Alicia
Quiero dejarles una reflexión sobre el futuro. Hablamos de cómo estos modelos regresan a la media precisamente porque están entrenados en datos humanos.

Beto
Sí.

Alicia
Pero estamos entrando en una era donde Internet se está inundando de contenido generado por IA. Si los futuros modelos se entrenan en la salida de los modelos actuales, que acabamos de establecer que son inherentemente poco originales, ¿estamos enfrentando un aplanamiento de la creatividad?

Beto
Esa es la teoría del colapso del modelo: un futuro beige donde todo se vuelve copia de copia de copia y la varianza, la creatividad real, simplemente desaparece.

Alicia
Pero por otro lado, también vimos en este estudio que la colaboración entre IAs, IA hablando con IA, realmente potencia la originalidad. Así que, ¿es lo contrario cierto? ¿Estamos al borde de una explosión de creatividad sintética? ¿Un mundo donde máquinas colaboran e inspiran a otras máquinas para crear conceptos tan complejos y originales que los humanos ni siquiera podrían haberlos imaginado?

Beto
Esa es la pregunta de los mil millones de dólares. ¿Estamos construyendo un espejo que solo refleja nuestras células promedio o estamos construyendo un telescopio que ve cosas que no podemos ver?

Alicia
¿Espejo o telescopio? Creo que los dejo con eso para que lo mediten. Gracias por sumergirte con nosotros.

Beto
Siempre un placer.

Alicia
Nos vemos en el próximo análisis profundo.

sábado, 8 de noviembre de 2025

LLMs y la Síntesis de Registros Clínicos

 
 

Hoy les traigo el resumen de un artículo científico publicado recientemente en Nature, sobre Medicina Digital. Se están empezando a usar los grandes modelos de lenguaje (LLMs) de Inteligencia Artificial (IA) para hacer resúmenes de los registros clínicos de los pacientes. Y se está tratando de evaluar si estos resúmenes son precisos, cuáles son los riesgos, y cómo se pueden evitar los problemas que pudieran surgir.

Enlace al artículo original, en inglés: "Evaluating clinical AI summaries with large language models as judges", por Emma Croxford y colegas. Publicado en Nature, en Noviembre 7 de 2025.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Bienvenidos a este análisis profundo. Estamos aquí para abordar problemas de información que son realmente abrumadores para que tú no tengas que hacerlo, y si hay una industria ahogada en datos, tiene que ser la sanidad, ¿verdad?

Beto
Absolutamente, está por todas partes.

Alicia
Piensa en cuando un paciente ingresa en el hospital: hay registros electrónicos de salud, los EHRs ("Electronic Health Records"), que pueden hincharse hasta proporciones épicas.

Beto
Verdaderamente épicas.

Alicia
La investigación que vemos hoy dice que uno de cada cinco registros de pacientes tiene una longitud comparable a Moby Dick.

Beto
Sí, Moby Dick — eso son más de 200.000 palabras. Una historia clínica realmente compleja y, a menudo, desorganizada.

Alicia
Y los médicos y enfermeras se supone que de alguna manera deben sintetizar todo eso bajo una enorme presión de tiempo.

Beto
Exacto, y no se trata solo de eficiencia: es, fundamentalmente, sobre la seguridad del paciente. El simple volumen aumenta dramáticamente el riesgo de que se pase por alto una información verdaderamente crucial.

Alicia
... lo que puede llevar a decisiones erróneas, quizás incluso peligrosas.

Beto
Precisamente subóptimas o peor.

Alicia
Así que es como un tsunami de información y necesita una solución moderna.

Y la promesa, por supuesto, es lo que todo el mundo comenta: la IA generativa, los grandes modelos de lenguaje (LLMs). Se están desarrollando para resumir esos enormes registros.

Beto
... con el objetivo claro de reducir la carga cognitiva de los clínicos, facilitarles la vida y hacer la atención más segura.

Alicia
Ese potencial suena transformador.

Beto
Realmente lo es, pero aquí está el meollo del problema que vamos a analizar hoy: ¿cómo sabes realmente si ese resumen generado por IA es seguro, es exacto, es siquiera útil?

Alicia
Porque si el resumen inventa algo: alucina una alergia crítica, por ejemplo, ...

Beto
... o deja fuera algo vital como un evento cardíaco reciente ...

Alicia
... entonces la IA no está ayudando en absoluto; en realidad podría causar daño.

Beto
Ese es el escenario de pesadilla: daño activo.

Alicia
De acuerdo, entonces nuestra misión para esta inmersión profunda es hurgar en este material: ¿podemos, de forma fiable y quizás tan importante eficientemente, usar un LLM para juzgar el trabajo de otra IA?

Beto
Sí, ¿podemos construir un LLM efectivo como juez? Esa es la pregunta.

Alicia
Y para quienes nos escuchan, ¿por qué importa esto?

Beto
La importancia aquí es la escala. Si podemos probar que este enfoque funciona, nos da una vía rápida, fiable y coste-efectiva para superar el gran cuello de botella: la revisión humana, que es lenta y cara. Esas métricas automatizadas antiguas simplemente no son suficientes.

Alicia
Así que esto podría desbloquear el uso seguro y escalable de la IA generativa en áreas de alto riesgo como la medicina.

Beto
Ese es el objetivo.

Alicia
Desempaquemos un poco más el desafío: síntesis de datos clínicos — sabemos que los registros son enormes, de hecho gigantescos. Pero ¿cuáles son las vulnerabilidades específicas? ¿Por qué es tan arriesgado que los LLM resuman este tipo de datos?

Beto
Como dijiste, estos resúmenes requieren una precisión increíble, casi perfecta idealmente, y ahí es donde los LLM pueden tropezar. En general vemos tres modos clave de fallo cuando afrontan EHRs.

Alicia
¿Cuáles son?

Beto
Primero, alucinaciones: la IA simplemente inventa hechos que no estaban en el registro original;

Alicia
Escalofriante. Número dos.

Beto
Omisiones: dejar fuera detalles críticos, quizá un cambio de medicación o resultados de pruebas recientes;

Alicia
También muy malo. Y el tercero que mencionaste es especialmente relevante porque tratamos historiales clínicos largos y desordenados:

Beto
El efecto “perdido en el medio”. Básicamente, el rendimiento del modelo se degrada cuando el texto de entrada se vuelve muy, muy largo — piénsalo como intentar recordar una novela de 200.000 palabras pero solo recordar claramente el primer capítulo y el último.

Alicia
Todo lo importante del medio ...

Beto
Cambios en la dieta del paciente, progresión de síntomas, resultados de pruebas específicas — se pierde o se diluye simplemente porque la entrada fue tan larga.

Alicia
El estudio apunta que la longitud mediana de esas notas clínicas combinadas era de más de 5.000 tokens, así que los modelos definitivamente están operando en esa zona de peligro.

Beto
Absolutamente, están en el meollo, lo que significa que cualquier herramienta de evaluación tiene que ser sensible a esos modos de fallo específicos: alucinaciones, omisiones y ese problema de “perdido en el medio”.

Alicia
Y esto nos lleva de forma natural a la evaluación en sí: ¿cómo comprobamos a los comprobadores? El estándar de oro es obviamente la revisión clínica humana: un médico lee el resumen y las notas fuente.

Beto
Sí, eso es lo ideal.

Alicia
Pero la investigación encontró que tardaba en promedio unos 10 minutos — 600 segundos — en revisar un solo resumen.

Beto
No es factible a escala: supone una enorme presión de recursos y anula por completo el juego de eficiencia que esperas de la IA en primer lugar.

Alicia
Entonces, sí, podríamos hacer que humanos revisen cada uno, pero tampoco podemos volver a las métricas automatizadas antiguas, ¿verdad? Cosa como ROUGE, BERTScore.

Beto
Exacto: este es un punto crucial. Esas herramientas fueron diseñadas para tareas de lenguaje mucho más simples — por ejemplo comparar titulares de noticias para ver si usan palabras similares — no para razonamiento clínico complejo. Operan a un nivel superficial, como la superposición de palabras.

Alicia
Pueden marcar si la frase “ataque” aparece tanto en la fuente como en el resumen, pero pasan por alto cuándo ocurrió, cómo se trató o si el resumen siquiera tiene sentido lógico conectando síntomas con diagnóstico.

Beto
Precisamente: no captan la veracidad contextual, la coherencia lógica ni, crucialmente, la relevancia clínica — son heurísticos y por eso no correlacionan bien con lo que un médico humano considera un buen resumen seguro.

Alicia
Los investigadores necesitaban algo mejor: una regla más precisa.

Beto
Empezaron con una herramienta validada llamada "Provider Documentation Summarization Quality Instrument" — un nombre largo — y la llaman PDSQI-9.

Alicia
Es una rúbrica con cosas concretas a buscar: nueve atributos.

Beto
Exactamente. Nueve atributos. Esto fue la base tanto para las evaluaciones de los expertos humanos como para entrenar al LLM como juez.

Alicia
¿Puedes enumerar esos nueve atributos?

Beto
Sí:

  • citado (hace referencia a la fuente),
  • exacto (factualmente correcto),
  • completo (¿faltó algo?),
  • útil (clínicamente útil),
  • organizado (flujo lógico),
  • comprensible (fácil de entender),
  • sucinto (¿es lo bastante breve?),
  • sintetizado (¿está conectado con sentido?) y
  • estigmatizante (¿usa lenguaje sesgado?).

Alicia
Es muy completo.

Beto
Lo es, y la parte realmente ingeniosa de por qué funciona tan bien es que este instrumento fue diseñado específicamente teniendo en cuenta esos modos de fallo de los LLM.

Alicia
Así que está construido para atrapar las formas específicas en que los LLM suelen equivocarse.

Beto
Correcto. Pusieron mucho énfasis en el atributo “exacto” para controlar alucinaciones y en el atributo “completo” para controlar omisiones: es una prueba afinada para este propósito.

Alicia
Ahora vayamos a los resultados: aquí es donde se pone emocionante. La estrella — el LLM como juez que destacó — fue un modelo llamado gpt-o3-mini, y usaron algo llamado "five-shot prompting".

Beto
Sí. Solo para aclarar para todos: cuando decimos gpt-o3-mini aquí no nos referimos a la versión cotidiana del chatbot; es una variante específica, optimizada para tareas de razonamiento, con alta precisión y baja latencia.

Alicia
OK. Y "Five-shot prompting"?

Beto
Significa que le dieron a la IA cinco ejemplos detallados de cómo aplicar correctamente la rúbrica PDSQI-9 antes de pedirle que evaluara un nuevo resumen — mostrarle ejemplos de trabajo bien hecho.

Alicia
Entonces, ¿qué tan bien lo hizo ese gpt-o3-mini comparado con los expertos humanos?

Beto
Mostró una alineación realmente fuerte. La cifra clave aquí es el coeficiente de correlación intraclase, ICC, que mide qué tan consistentemente distintos evaluadores puntúan lo mismo — más alto es mejor, significa más acuerdo. Piensa en ello como comparar jueces puntuando una competición: un ICC por encima de 0,8 básicamente significa que el juez IA está puntuando con un rigor y consistencia similares a los jueces médicos humanos.

Alicia
¿Cuál fue el ICC de referencia de los expertos humanos?

Beto
Lograron un excelente ICC entre sí de 0,867 — muy consistente — y gpt-o3-mini, el LLM como juez, obtuvo 0,818.

Alicia
Vaya, eso está realmente cerca del punto de referencia humano; notablemente cercano. Pero es válido preguntarse: en medicina, “realmente cercano” ¿es suficientemente cercano? Ese pequeño hueco — 0,867 frente a 0,818 — ¿podría ocultar problemas de seguridad?

Beto
Esa es la pregunta correcta que siempre se debe hacer. El hallazgo clave, no obstante, es que la consistencia de puntuación del juez IA fue lo bastante alta como para considerarse fiable para este propósito de evaluación. Significa que puede sustituir o al menos aumentar al revisor humano sin romper fundamentalmente la validez del instrumento PDSQI-9. La fiabilidad es suficientemente eficiente para permitir escalado ...

Alicia
... y control de calidad — esas cifras son, francamente, alucinantes.

Hablemos de eficiencia.

Beto
Sí, aquí está la gran ventaja.

Alicia
Los humanos tardaban en promedio 600 segundos (10 minutos) por evaluación de resumen; el LLM como juez, gpt-o3-mini, ...

Beto
... tardó en promedio solo 22 segundos para hacer el mismo detallado scoring según PDSQI-9.

Alicia
Veintidós segundos: eso supone una reducción del 96 % en tiempo de trabajo. Es enorme.

Beto
Y en coste, cuando lo ajustan por el uso de servicios en la nube compatibles con IPA (según el texto original), el coste promedio para una de estas evaluaciones altamente fiables fue de cinco centavos.

Alicia
Cinco centavos. ¿Qué significa eso para un gran sistema hospitalario que genera miles o quizá millones de resúmenes?

Beto
Cambia completamente la economía: pasas de potencialmente millones en costes de revisión humana a quizá decenas de miles anuales con un sistema automatizado. Es un cambio operacional gigantesco.

Alicia
Hace que el aseguramiento de la calidad sea realmente factible a escala.

Beto
Exacto: proporciona una forma escalable y económicamente viable de comprobar estos resúmenes por seguridad y exactitud antes de que lleguen a un médico ocupado.

Alicia
Entonces, el “qué” es impresionante: alta fiabilidad, super rápido, super barato. Ahora el “por qué”: ¿por qué ese modelo específico — gpt-o3-mini, el optimizado para razonamiento — lo hizo mucho mejor que otros modelos potentes?

Beto
El “por qué” es fascinante: parece deberse a la arquitectura del modelo orientada al razonamiento.

Alicia
¿Qué define a esos modelos de razonamiento?

Beto
Son modelos diseñados explícitamente para realizar un proceso interno paso a paso antes de dar la respuesta final — a menudo llamado "chain-of-thought reasoning" (CoT), razonamiento en cadena de pensamiento. Simular esos pasos intermedios parece crucial para tareas complejas de nivel experto como la medicina.

Alicia
Así que no es necesariamente solo potencia bruta como podría tener un gpt-4o estándar; es el proceso: un debate interno más deliberado.

Beto
Los modelos no orientados al razonamiento, incluso si son potentes, tienden a saltar más directamente a una conclusión y no “muestran su trabajo”, por así decirlo.

Alicia
Se vio claramente esta diferencia en cómo puntuaron ciertos ítems de PDSQI-9.

Beto
La diferencia fue más marcada en atributos que requieren integrar cosas, entender contexto y hacer juicios complejos.

Alicia
Puntuar lo “sucinto” fue relativamente fácil para la mayoría de modelos.

Beto
Relativamente, sí. Pero la divergencia real apareció en atributos como “citado”, “organizado” y, especialmente, “sintetizado”.

Alicia
“Sintetizado” trata de si el resumen conecta las piezas, no solo lista hechos — ¿crea una imagen clínica integrada?

Beto
Hay un gran ejemplo en el artículo que lo ilustra. En un caso, un modelo no orientado al razonamiento (gpt-4o) miró un resumen y le dio la máxima puntuación en síntesis (5/5); su razonamiento fue superficial: “el resumen parece bien agrupado, coherente, buen trabajo”.

Alicia
¿Y el modelo de razonamiento, gpt-o3-mini?

Beto
Dio al mismo resumen una puntuación mucho más baja en síntesis (2/5).

Alicia
¿Por qué tanta diferencia?

Beto
La diferencia grande fue que su razonamiento fue mucho más profundo: explicó por qué puntuó más bajo, señalando que el resumen “no generó una comprensión integrada ni priorización del problema agudo dirigida al proveedor objetivo”.

Alicia
No se limitó a decir “se ve bien”: estaba analizando si ofrecía conocimiento clínico.

Beto
Exactamente: estaba haciendo ese tipo de pensamiento crítico deliberativo que imita cómo un experto humano evaluaría, mucho más matizado.

Alicia
Algo más que sorprendió en los hallazgos fue sobre los sistemas multiagente — la idea de que si tienes varias IAs debatiendo y respondiendo (el enfoque tipo “magistrado”), esperarías que el consenso fuera mejor.

Beto
Es la intuición común: más cabezas mejor que una.

Alicia
Sin embargo, aquí los resultados mostraron lo contrario. El mejor ICC de un sistema multiagente fue 0,768, aún bueno pero inferior al juez individual gpt-o3-mini con 0,818.

Beto
Sugiere que el LLM único, correctamente instruido y orientado al razonamiento, fue de hecho un evaluador más discernidor que el grupo de IAs tratando de ponerse de acuerdo.

Alicia
A veces el consenso de grupo tiende a suavizar detalles críticos. ¿Dónde falló la dinámica de grupo?

Beto
Hubo un ejemplo particular en el que, para el atributo “organizado”, el sistema multiagente convergía en una puntuación perfecta de 5 — todos estaban de acuerdo en que estaba organizado — pero el resumen podía contener una afirmación colocada fuera de orden cronológico, rompiendo el flujo lógico.

El juez individual gpt-o3-mini detectó esa ruptura de coherencia y asignó una puntuación más realista, quizá un 3, mientras que el multiagente en su consenso pasó por alto esa sutileza crítica.

Alicia
Interesante. No obstante, el enfoque multiagente tuvo un beneficio curioso: asignar diferentes personas.

Beto
Al asignar diferentes “personas” a los agentes (uno programado para puntuar alto sistemáticamente, otro bajo, otro medio), el patrón general de puntuaciones del sistema multiagente produjo una distribución más parecida a la variabilidad humana.

Alicia
Entonces, simuló el rango natural de opiniones que obtendrías de un panel de médicos humanos.

Beto
Correcto. No fue necesariamente más exacto en promedio, pero reflejó mejor la variabilidad inherente al juicio humano.

Alicia
Vamos a los grandes aprendizajes: si una organización — un hospital o una empresa de tecnología — quiere usar la idea del LLM como juez, ¿cuál es la lección más crucial de esta investigación?

Beto
Se reduce a una cosa: las instrucciones que le das a la IA — la rúbrica. La calidad, la fiabilidad y la utilidad del LLM como juez están completamente ligadas a lo clara y precisa que sea la herramienta de evaluación.

Alicia
PDSQI-9 funcionó bien porque fue muy detallada.

Beto
Precisamente. Los atributos estaban meticulosamente definidos, las escalas de 1 a 5 tenían descripciones concretas para cada nivel. Si tu rúbrica es vaga o ambigua, la evaluación del LLM será defectuosa o potencialmente inútil. Aun con IA sofisticada, sigue siendo “basura entra, basura sale”.

Alicia
Tiene sentido. En la práctica, gpt-o3-mini fue la estrella, pero es un modelo propietario, basado en la nube. ¿Qué pasa con sistemas sanitarios que quieren evitar la dependencia en un proveedor, o tienen reglas estrictas de seguridad de datos que impiden el uso de la nube?

Beto
Es una preocupación real en salud, y la investigación lo examinó: buenas noticias. Aunque GPT-o3-mini fue el mejor, varios modelos de código abierto también rindieron muy bien: modelos como DeepSeek-Distilled-Qwen-2.5-32B y Mixtral-8x22B.

Alicia
Modelos open source que se pueden descargar y ejecutar localmente.

Beto
Exacto. Modelos open source que se pueden descargar y ejecutar en servidores locales seguros — alcanzaron ICCs por encima de 0,7.

Alicia
Son alternativas viables si no puedes o no quieres usar modelos propietarios en la nube.

Beto
Sí, absolutamente. Muestra que el enfoque no depende de un único proveedor o modelo.

Alicia
Un último punto de validación: este marco de LLM como juez no se probó en una sola tarea. Lo aplicaron a otras cosas.

Beto
Lo aplicaron a otra tarea clínica de evaluación — resumir la lista de problemas del paciente como parte del Shared Task Problem 2023 — y funcionó bien allí también, alcanzando una fiabilidad alta con ICC alrededor de 0,710.

Alicia
Esa validación cruzada es importante: sugiere que el método en sí es robusto.

Beto
Importantísimo. y no es un truco de una sola instancia; parece transferible a distintos tipos de desafíos de resumen clínico.

Alicia
Muy bien. Para resumir las conclusiones centrales: parece que hemos encontrado una forma, usando LLMs orientados a razonamiento junto con rúbricas claras, de obtener una validación rápida, barata y altamente fiable de resúmenes médicos generados por IA, asegurando seguridad antes de que lleguen a los clínicos.

Beto
Es la esencia: un camino escalable hacia una IA más segura en medicina.

Alicia
Hemos usado el LLM como juez efectivamente para control de calidad, comprobando el producto final. Mirando hacia adelante, ¿cuál sería el siguiente paso lógico para un futuro aún más seguro y eficiente?

Beto
Aquí viene una posibilidad provocadora y emocionante: ¿y si el LLM como juez no solo comprobara el trabajo después del hecho sino que participara activamente en mejorarlo durante su creación?

Alicia
¿Cómo funcionaría eso?

Beto
La siguiente frontera probablemente integrará el proceso generador y el proceso evaluador del LLM en un único sistema de lazo cerrado.

Alicia
"Lazo cerrado", significa ...

Beto
Significa que el LLM juez proporciona retroalimentación detallada de inmediato al LLM generador; el generador revisa el resumen según esa retroalimentación; y esto ocurre de forma iterativa en tiempo real hasta que el juez LLM confirme que cumple automáticamente un umbral predefinido de calidad y seguridad.

Así pasas de comprobar errores a posteriori a control de calidad automatizado y proactivo en tiempo real, incorporando la calidad desde el principio. Ese es el siguiente gran salto.

lunes, 13 de octubre de 2025

Aprendizaje por Refuerzo en Gran Modelos de Razonamiento

 
 

Hoy les traigo un resumen de un artículo muy importante que explica cómo se están haciendo los modelos de razonamiento en Inteligencia Artificial (IA), usando Aprendizaje por Refuerzo.

Enlace al artículo original, en inglés, para aquellas personas que quieran profundizar en este tema:
A Survey of Reinforcement Learning for Large Reasoning Models, publicado en Octubre 10 de 2025, por Kaiyan Zhang y colegas.

El resumen, su transcripción y traducción, fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en forma de un diálogo entre dos personajes sintéticos, que llamaremos Alicia y Beto.


Resumen

Alicia
Bienvenido de nuevo a la inmersión profunda. Entonces, si has estado siguiendo la IA últimamente, la gran historia siempre han sido los grandes modelos de lenguaje, ¿no? LLMs ("Large Language Models").

Beto
Exacto. Sistemas entrenados para predecir la siguiente palabra, enfocados mayormente en, ya sabes, sonar humano y ser útiles.

Alicia
Exacto. Alineamiento conversacional. Pero hoy vamos a profundizar en algo distinto. La fuente apunta a un cambio realmente fundamental. Estamos viendo el auge del gran modelo de razonamiento, el LRM ("Large Reasoning Model").

Beto
Sí, y es un paso enorme. Esto no se trata solo de hacerlos mejores escritores o chatbots más educados. Se trata de competencia pura.

Alicia
Entonces, ¿qué es lo que hace que un LRM sea un LRM?

Beto
Básicamente definimos LRMs como LLMs que han sido específicamente reingenierizados usando aprendizaje por refuerzo (RL, "Reinforcement Learning") para manejar tareas lógicas complejas. Cosas donde hay una respuesta correcta.

Alicia
Como problemas de matemáticas o programación.

Beto
Exacto. Matemática competitiva, desafíos de codificación complejos, razonamiento en múltiples pasos, cosas que necesitan planificación real, quizá algo de reflexión e incluso autocorrección integrada.

Alicia
Muy bien, así que nuestra misión hoy es revisar las fuentes que están trazando esta nueva forma de entrenamiento. Básicamente estamos moviendo los postes de la portería. Ya no se trata de sonar bien.

Beto
Se trata de ser bueno razonando. Intentamos incentivar directamente el razonamiento objetivo en sí. Y el método clave del que todos hablan es el aprendizaje por refuerzo con recompensas verificables (RLVR = "Reinforcement Learning with Verifiable Rewards").

Alicia
RLVR, claro. Y este campo se ha disparado recientemente, impulsado por modelos como DeepSeek R1.

Beto
Exacto. Está avanzando increíblemente rápido. Y las fuentes apuntan de forma consistente a que RL ("Reinforcement Learning", Aprendizaje por Refuerzo) ya no es solo para fine-tuning (perfeccionamiento, refinamiento).

Alicia
Parece más fundamental ahora, como la clave para escalar capacidades hacia, bueno, hacia AGI ("Artificial General Intelligence" = Inteligencia General Artificial) o incluso ASI ("Artificial Super-Intelligence" = Super Inteligencia Artificial).

Beto
Esa parece ser la trayectoria, sí. Aprender a razonar de forma eficaz y escalable parece el siguiente paso crítico.

Alicia
Muy bien, desempacemos esa diferencia entonces, porque RL ("Reinforcement Learning", Aprendizaje por Refuerzo) no es nuevo, ¿cierto? Ya hablamos de RLHF antes ("Reinforcement Learning through Human Feedback", Aprendizaje por Refuerzo con Retroalimentación Humana) y también de DPO ("Direct Preference Optimization": Optimización por Preferencia Directa). Esas eran mayormente sobre alineamiento, ¿no? Hacer que el modelo dé respuestas que los humanos prefieran.

Beto
Exactamente. RLHF, DPO, todo eso iba sobre preferencia subjetiva. ¿Le gusta a un humano esta respuesta?

RLVR lo invierte. Abandona las puntuaciones subjetivas. Pasa a retroalimentación objetiva basada en reglas. Todo el objetivo cambia a mejorar la capacidad central del modelo para resolver problemas. No es, "¿se siente bien esto?" sino, "¿es esto demostrablemente correcto?".

Alicia
Entendido. Y las fuentes mencionan esto. La “ley del verificador” suena un poco pomposa.

Beto
Lo es, pero la idea en sí es bastante sencilla. La ley del verificador básicamente dice que lo fácil que es entrenar a una IA para una tarea está directamente relacionado con lo fácil que es comprobar si la IA hizo la tarea correctamente.

Alicia
OK, si puedes automatizar la verificación, ...

Beto
... puedes generar básicamente señales de entrenamiento perfectas e infinitas sin necesitar humanos en el bucle constantemente, lo cual es carísimo. Verificabilidad equivale a escalabilidad, esencialmente.

Alicia
Tiene sentido. Señal limpia, aprendizaje más rápido, y los ejemplos ayudan mucho. Para matemáticas, es sólo si la respuesta final es correcta, comprobado automáticamente.

Beto
Sí. Para programación, ¿compila? ¿pasan los tests unitarios? Esa es tu señal de recompensa.

Alicia
¿Hay algún truco para hacer que eso funcione a escala?

Beto
Bueno, un detalle técnico clave es la consistencia. Los modelos tienen que sacar su respuesta final en un formato muy específico y predecible, como poner el número en una etiqueta de “caja”.

Alicia
Así el verificador automático no se confunde.

Beto
Exacto. Necesita poder parsear millones de salidas de forma fiable.

Alicia
Y hemos visto grandes avances que prueban que esto funciona. Los modelos o1 de OpenAI, por ejemplo.

Beto
Sí, la serie o1 fue fascinante. Mostró que el rendimiento escalaba no sólo con más cómputo de entrenamiento RL, como cabría esperar, sino también con cómputo en tiempo de prueba. Básicamente, cuánto tiempo pasa el modelo “pensando” durante la inferencia.

Alicia
¿Es decir que los mejores modelos realmente se benefician más si se les deja más tiempo para responder?

Beto
Ese fue el hallazgo. Más tiempo les permite generar, evaluar, quizá revisar sus pasos de razonamiento internos. Lo vincula al rendimiento directamente con, bueno, el esfuerzo cognitivo si quieres verlo así.

Alicia
Interesante. Y luego estuvo DeepSeek R1. Ese rompió bastante el viejo manual.

Beto
Totalmente. Adoptó un enfoque “cero SFT” (sin "Supervised Fine-Tuning", sin Perfeccionamiento Supervisado). DeepSeek demostró que usando un algoritmo RL específico, GRPO (Group Relative Policy Optimization), a una escala masiva, podían enseñar estas habilidades de razonamiento complejo directamente a un modelo base.

Alicia
Un modelo base. Así que sin fine-tuning supervisado primero.

Beto
Ninguno. Se saltaron la etapa SFT por completo, lo que sugiere, quizá, que el RL puede encontrar caminos de razonamiento que los ejemplos humanos podrían bloquear o desalentar inadvertidamente.

Alicia
De acuerdo, esto suena increíble para matemáticas y código donde hay una respuesta clara. Pero seamos honestos, la mayoría de las cosas no son así. El diseño de recompensas debe volverse mucho más complicado.

Beto
Absolutamente. Fuera de esos dominios limpios, se pone desordenado rápidamente, lo que lleva a este gran intercambio que discuten las fuentes: recompensas de resultado versus recompensas de proceso.

Alicia
Correcto. Las recompensas de resultado, como las verificables, son escalables y eficientes. Nos gustan. ¿Cuál es la trampa?

Beto
El riesgo es lo que algunos investigadores llaman “respuesta correcta primero, alucinar después”. El modelo se vuelve muy bueno en escupir la respuesta final correcta, quizá en el formato requerido, pero el razonamiento que lo llevó allí puede ser endeble, no fiel. Puede haberse inventado la explicación a posteriori sólo para justificar una respuesta que ya sabía que era correcta.

Alicia
Ajá. Aprende a engañar al sistema: consigue el resultado correcto, pero el trabajo interno es basura. No es lo que quieres para confiar en la IA.

Beto
Definitivamente no.

Si quieres razonamiento fiel, te inclinas hacia las recompensas de proceso.

Alicia
¿Y cómo funcionan esas?

Beto
Proporcionan retroalimentación en cada paso del proceso de razonamiento. Señal mucho más densa, a menudo usando algo llamado Modelo de Recompensa de Proceso (PRM, "Process-based Reward Model").

Alicia
OK, verifica el método, no sólo la respuesta final. Eso suena más estable.

Beto
Lo es para aprender razonamiento fiel, pero la gran desventaja es el coste. Hacer que humanos anoten cada paso de una cadena de razonamiento compleja en montones de ejemplos es increíblemente caro y lento. No escala nada bien.

Alicia
¿Y cuál es la solución para tareas subjetivas? Como juzgar escritura creativa o un argumento ético complejo. No hay una única respuesta correcta ahí.

Beto
Cierto. Y ahí las cosas se ponen especialmente vanguardistas. Aquí es donde entran los modelos de recompensa generativos, o “GenRMs”.

Alicia
Recompensas generativas. Entonces la recompensa ya no es solo un número.

Beto
Exacto. En vez de escupir una puntuación como 0.8, un modelo de recompensa generativo (GenRM) usa a su vez un LRM potente para generar una crítica. Escribe una explicación detallada, quizá usa una rúbrica, explicando por qué una respuesta es buena o mala. La recompensa es retroalimentación textual.

Alicia
Guau! OK, entonces el modelo de recompensa tiene que articular su propio razonamiento. Y la fuente insinuó algo todavía más salvaje: sistemas co-evolutivos.

Beto
Sí. Esto va más allá de tener un juez fijo y una política que aprende de él. En estos montajes co-evolutivos, el modelo que genera respuestas — la política — y el modelo que genera las críticas — el GenRM — en realidad mejoran juntos de forma dinámica.

Alicia
¿Cómo funciona eso?

Beto
Pues la política hace un intento, el GenRM lo critica en detalle, y luego la política usa esa rica retroalimentación para autocorregirse. A veces incluso intercambian roles, potenciando su propia mejora. Se acerca a una especie de "self-play" (ejecución autónoma) para razonamiento.

Alicia
Cambiando un poco de tema, hablemos del motor que ejecuta todo este entrenamiento RL. Mencionaste GRPO (Group Relative Policy Optimization) para DeepSeek R1. ¿Por qué ese algoritmo específico para estos modelos enormes?

Beto
Con modelos tan gigantescos necesitas algoritmos computacionalmente eficientes. Se prefieren métodos de primer orden. PPO (Proximal Policy Optimization) es popular. Pero GRPO es una modificación.

Alicia
¿Cuál es la diferencia clave?

Beto
GRPO es “sin crítico”. PPO estándar necesita una red crítica separada para estimar qué tan bueno es un estado, lo que básicamente duplica el tamaño del modelo y el cómputo durante el entrenamiento. GRPO logra deshacerse de eso por completo.

Alicia
Sin crítico. Ahorra mucho cómputo, seguro. Pero entonces, ¿cómo sabe qué acciones — qué palabras o tokens generados — fueron buenas si no hay un crítico que las valore?

Beto
Ah, esa es la parte ingeniosa. Usa algo llamado "normalización relativa de grupo". En lugar de juzgar cada token individualmente contra un estándar absoluto, mira todo un lote de respuestas generadas y calcula una puntuación de ventaja para todos los tokens en una respuesta relativa a la puntuación media de todas las respuestas en ese lote. Piensa en ello como calificar en curva dentro de ese pequeño grupo.

Alicia
Ah, entiendo. No se trata de ser perfecto. Se trata de ser mejor que el promedio dentro del lote.

Beto
Precisamente. Proporciona una señal de aprendizaje estable y eficiente sin necesitar ese modelo crítico extra. Hace el RL a gran escala mucho más factible.

Alicia
Bien, tenemos los mecanismos. RLVR, recompensas, GRPO. Pero hay un debate más amplio: ¿qué está haciendo fundamentalmente RL aquí? ¿Solo agudiza habilidades que el modelo ya aprendió en preentrenamiento, o está habilitando el descubrimiento de habilidades totalmente nuevas?

Beto
Esa es la pregunta del millón. La visión de “agudizar” sugiere que RL básicamente encuentra y amplifica lo bueno que ya estaba latente en los pesos del modelo, como enfocar una lente.

Alicia
Tiene sentido.

Beto
La argumentación de “descubrimiento”, en cambio, dice que para tareas complejas en múltiples pasos, RL permite componer esas habilidades latentes básicas de maneras genuinamente nuevas para construir cadenas de razonamiento más largas a las que antes no se podía acceder.

Alicia
Poner habilidades simples juntas para crear algo novedoso. ¿Dónde se posicionan las fuentes?

Beto
Parece inclinarse hacia una visión unificada. No es estrictamente una cosa u otra. RL actúa como un afilador eficiente, guiando al modelo rápidamente hacia patrones de razonamiento de alta recompensa. Pero dado suficiente tiempo de entrenamiento y el tipo correcto de exploración, ese afilado permite la composición de habilidades, lo que a su vez conduce a la emergencia de comportamientos novedosos — la parte de descubrimiento. Así que son dos caras de la misma moneda.

Alicia
Entendido. Afilado que habilita descubrimiento con el tiempo.

Ahora, prácticamente hablando, hay un hallazgo contraintuitivo sobre dónde comienzas el proceso RL: un modelo débil versus un modelo fuerte.

Beto
Correcto. ¿Debes empezar RL sobre un modelo base pre-entrenado y crudo — el inicio débil — o sobre un modelo que ya pasó por mucho fine-tuning para seguir instrucciones y ser servicial — el inicio fuerte?

Alicia
Mi intuición dice, empieza fuerte. Aprovecha todo ese trabajo de alineamiento.

Beto
Parece lógico, ¿no? Pero la evidencia, particularmente del trabajo DeepSeek R1, apunta fuertemente al otro lado. Empezar RL directamente sobre el modelo base consistentemente produce mejor rendimiento de razonamiento al final.

Alicia
¿En serio? Eso suena totalmente contraintuitivo. ¿Por qué sería perjudicial que el modelo ya sea servicial y alineado para aprender pura lógica o matemáticas?

Beto
La teoría tiene que ver con los sesgos de obediencia.

Alicia
Los “obedience priors”.

Beto
Sí. El proceso de fine-tuning supervisado (SFT) inculca tendencias profundas hacia ser útil, conversacional, cauteloso, alineado con preferencias humanas. Pero RLVR demanda una optimización implacable hacia un objetivo verificable y objetivo.

Alicia
Y esas dos cosas pueden entrar en conflicto.

Beto
Esa inclinación arraigada a ser cortés o a matizar puede interferir con que el modelo se comprometa plenamente con los pasos lógicos estrictos necesarios para maximizar una recompensa verificable como la corrección matemática.

Alicia
Interesante. Así que para obtener razonamiento pico, quizá no quieras que el modelo sea demasiado “amable” desde el inicio. Es una idea fascinante.

¿Se aplica esto por igual a todos los modelos?

Beto
Aparentemente no. Hay otra extrañeza: asimetría entre familias de modelos. Diferentes modelos base reaccionan distinto al proceso RLVR.

Alicia
¿Cómo?

Beto
Las fuentes mencionaron que modelos de la familia Qwen, por ejemplo, suelen ser más “amigables” al RL. Muestran buenas ganancias incluso si la señal de recompensa es imperfecta. Simplemente se adaptan mejor.

Alicia
OK. ¿Y otros?, mencionaste Llama.

Beto
Sí, los modelos de la familia Llama, según algunos reportes, pueden ser más frágiles inicialmente con el enfoque “cero RL”. No escalan tan fluidamente solo con el proceso RLVR.

Alicia
¿Rinden peor? ¿O hay solución?

Beto
Hay una solución. Investigadores encontraron que para modelos como Llama pueden lograr escalabilidad similar inyectando estratégicamente datos de alta calidad de matemáticas y código durante el entrenamiento RL, como un curso de corrección intermedia.

Alicia
¿Interrumpir el RL para darle un golpe de refuerzo con datos concretos?

Beto
Algo así. Parece fortalecer esas habilidades latentes de razonamiento sobre las que el proceso RL está construyendo, haciéndolas más resistentes a las presiones de RLVR.

Alicia
Bien, hablemos de aplicaciones. ¿Dónde se está usando realmente este razonamiento impulsado por RL? ¿Cuál es el beneficio? Empezando por la programación.

Beto
Sí, la programación es un área enorme. El RL, usando retroalimentación por ejecución — ¿el código corre? ¿pasan los tests? — ha mejorado dramáticamente la generación de código. Métodos como Afterburner usan esto para afinar modelos.

Alicia
El resultado?

Beto
Hemos visto saltos masivos en la tasa de éxito del primer intento. En algunos benchmarks, estos modelos entrenados con RL están superando el rendimiento humano promedio en programación competitiva y depuración. También tareas como reparación de código y mejora automática de la calidad del código.

Alicia
Impresionante.

¿Qué hay de modelos que necesitan usar herramientas o interactuar con el mundo, tareas agentivas?

Beto
Ahí RL es absolutamente crucial. Entrenar modelos para usar eficazmente búsquedas web, calculadoras, intérpretes de código, o simplemente manejar una conversación larga y con propósito requiere RL. El modelo tiene que aprender por ensayo y error qué herramientas usar y cuándo.

Alicia
Eso suena intensivo en cómputo. Mucho ensayo y error.

Beto
Lo es. Los tiempos de rollout — permitir que el agente pruebe cosas en un entorno — pueden ser muy largos y caros. Es un gran cuello de botella. Se trabaja en rollouts asincrónicos, mejores sistemas de memoria y otras maneras de hacerlo más eficiente.

Alicia
Llevándolo al mundo físico, robótica. Usando modelos Visión-Lenguaje-Acción (VLAs, Vision-Language-Action).

Beto
Sí, RL también está haciendo olas allí. A menudo usando recompensas más simples, como éxito o fracaso binario para una tarea. El hallazgo: RL ayuda a las VLAs a generalizar mucho mejor con menos datos.

Alicia
La mejor generalización es clave. Hay algo más?

Beto
Las VLAs entrenadas con RL han llegado a descubrir patrones de comportamiento novedosos, maneras completamente nuevas de resolver tareas físicas que no estaban en los datos de entrenamiento. Cosas que los supervisores ni siquiera imaginaron.

Alicia
Vaya! Descubrimiento genuino en el mundo físico. Eso es bastante sorprendente.

Entonces, mirando hacia adelante, ¿cuál es el siguiente gran obstáculo? Si pueden razonar, ¿cuál es el problema principal?

Beto
Uno grande es el coste de inferencia o la eficiencia en inferencia. Ahora mismo, estos LRMs son muy “listos” asignando su tiempo de pensamiento, pero de forma imperfecta.

Alicia
¿A qué te refieres?

Beto
Tienden a sobrepensar problemas sencillos, generando cadenas de pensamiento largas cuando una respuesta simple bastaría. Y a la inversa, suelen subestimar problemas difíciles, saltando a conclusiones sin suficiente razonamiento.

Alicia
Así que desperdician cómputo en lo fácil y fallan en lo difícil porque no se esfuerzan lo suficiente.

Beto
Exacto. Un problema no resuelto clave para RL es enseñar a estos modelos una mejor política de asignación de cómputo: cómo decidir dinámicamente “esto es complicado, necesito más pasos” versus “esto es fácil, contesto rápido”. Conseguir ese trade-off coste-rendimiento es crucial. Necesitamos modelos racionales frente a recursos.

Alicia
Tiene sentido.

Eso enlaza con una idea muy prospectiva que vienen discutiendo las fuentes: diseño de arquitectura, algoritmo y código conjuntamente.

Beto
Exacto. Ahora mismo RL optimiza el comportamiento del modelo para precisión. El siguiente paso podría ser dejar que RL optimice la propia estructura del modelo.

Alicia
¿Cómo funcionaría eso? Cambiando el modelo sobre la marcha.

Beto
Algo así. Piensa en modelos Mixture-of-Experts (MoEs, Mezcla de Expertos), que tienen diferentes subredes expertas. RL podría potencialmente aprender una política de enrutamiento dinámica.

Alicia
Es decir, decidir qué experto usar para qué parte del problema.

Beto
Sí. Pero optimizando no solo para la corrección de la respuesta final, sino también por eficiencia de hardware, minimizando latencia o uso de memoria. Podría adaptar las vías activas del modelo en función de lo que parezca la dificultad del problema en tiempo real. Un MoE reforzado, básicamente, optimizando la máquina misma.

Para cerrar nuestra inmersión hoy, la idea general es que RLVR está deliberadamente remodelando a los LLMs en LRMs más potentes. Aprovechamos recompensas verificables para tareas objetivas como matemáticas y código, lo que escala increíblemente bien.

Alicia
Y para lo más difuso y subjetivo, estamos viendo el auge de estos innovadores modelos de recompensa generativos.

Beto
Exacto. Es un cambio fundamental de foco.

Alicia
Sí. Realmente da la sensación de que la era de optimizar solo por “ser agradables” según preferencia humana está evolucionando. El foco se desplaza hacia confianza objetiva, hacia construir modelos que realmente hagan cosas de forma fiable. Estamos viendo enfoques híbridos, métodos de políticas mixtas que combinan lo mejor del SFT y del RL, ...

Beto
... lo que debería llevar a sistemas más robustos en general.

Y quizá si te dejo con una última cosa para pensar, es el paso crítico para hacer estos sistemas verdaderamente útiles en el mundo real: el aprendizaje por refuerzo continuo (CRL, Continual Reinforcement Learning).

Alicia
Que aprenden durante toda su vida.

Beto
Precisamente. A medida que los LLMs se despliegan en entornos dinámicos, necesitan adaptarse a nuevos datos y nuevas tareas sin olvidar todo lo que ya saben. Ese es el desafío central del CRL:

  • equilibrar la estabilidad,
  • mantener el conocimiento antiguo,
  • con la plasticidad,
  • adquirir nuevas habilidades.

Alice
El dilema estabilidad‑plasticidad.

Beto
Acertar ese equilibrio durante el entrenamiento RL continuo, probablemente sea la clave para pasar de herramientas estáticas a compañeros de IA adaptativos de por vida. Algo a lo que hay que prestar atención, sin duda.