Mostrando entradas con la etiqueta generalización. Mostrar todas las entradas
Mostrando entradas con la etiqueta generalización. Mostrar todas las entradas

lunes, 2 de marzo de 2026

Marco de Creatividad de IA

 
 

Esta investigación presenta CREATIVITYPRISM, un marco integral diseñado para evaluar la naturaleza multifacética de la creatividad en grandes modelos lingüísticos. Reconociendo que la evaluación humana es demasiado lenta y costosa para el desarrollo moderno de IA, los autores proponen un sistema estandarizado que utiliza LLM como juez para automatizar el proceso. Este punto de referencia mide la producción creativa en tres dimensiones principales: calidad, novedad y diversidad, garantizando que los resultados no solo sean originales, sino también funcionales y variados. Al utilizar diversas tareas como pruebas de usos alternativos, escritura creativa y resolución de problemas matemáticos, el estudio proporciona una visión holística del rendimiento del modelo. La validación estadística mediante la Prueba de Anotación Alternativa garantiza que estos jueces automatizados se alineen estrechamente con la intuición humana experta. En definitiva, los resultados destacan que modelos propietarios como GPT-4 y DeepSeek lideran actualmente el campo de la generación de contenido sofisticado e innovador.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema:

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
El otro día intenté que un chatbot me ayudara a encontrar un título para un proyecto. Quería algo contundente, algo único. Le pedí específicamente que pensara fuera de la caja.

Alicia
Ay, déjame adivinar. ¿Te dijo "The Innovation Hub" o "Project Phoenix"?

Beto
Cerca. Me dio "The Future Initiative" y "The Creative Spark".

Alicia
Vaya. Buen inicio.

Beto
Es el tipo de discurso corporativo más gris imaginable: gramaticalmente perfecto, totalmente lógico y completamente muerto por dentro. Me hizo preguntarme porque no dejamos de oír hablar de IA generativa y arte con IA todo el tiempo. Pero, ¿realmente son creativas estas máquinas?

Alicia
Vale. ¿O son solo imitadores extremadamente eficientes que, por casualidad, saben qué palabras suelen ir juntas?

Beto
Exacto. Esa es la pregunta del millón ahora mismo. Porque estamos viendo a la IA aprobar el examen de abogacía y escribir código en Python. Pero la creatividad se siente como esa frontera nebulosa distintivamente humana.

Alicia
Es como la última trinchera del excepcionalismo humano.

Beto
No nos vamos a quedar solo en la filosofía hoy. Para este análisis profundo tenemos, de hecho, un artículo de investigación que intenta poner un número concreto sobre esto. Se titula "CreativityPrism, a Holistic Evaluation Framework for Large Language Model Creativity".

Alicia
Es de Zhaoyi Joey Hou y un equipo bastante amplio de Pittsburgh, Johns Hopkins y algunas otras instituciones.

Beto
Me alegra que lo estudiemos porque la evaluación basada en sensaciones, la gente diciendo “oh, este modelo se siente más inteligente”,

Alicia
Ya no es suficiente. Necesitamos datos duros.

Beto
La misión hoy es averiguar si la IA que usas es un loro o un poeta. Y sinceramente, si me escuchas ahora mismo, y usas estas herramientas para programar, escribir o simplemente redactar un mejor correo, necesitas saber cuál es el techo.

Alicia
Necesitas saber si le estás pidiendo a una calculadora que pinte una obra maestra.

Beto
Empecemos por el problema. ¿Por qué esto no está resuelto aún? Tenemos benchmarks para todo lo demás en IA. Sí, probamos matemáticas. Probamos lógica. Comprensión lectora. ¿Por qué medir la creatividad es un desastre?

Alicia
El artículo describe el panorama actual como fragmentado, que es una forma muy académica y educada de decir que es un desastre total. Históricamente, si querías evaluar la creatividad en una máquina —o incluso en un humano— tenías que elegir un carril muy pequeño y específico.

Beto
¿Qué forma tenían esas pruebas antiguas?

Alicia
Por un lado tenías pruebas semánticas. La más famosa es la divergent association task (tarea de asociaciones divergentes, DA).

Beto
Básicamente pregunta si puedes elegir palabras que estén semánticamente lejanas entre sí.

Alicia
Es, en esencia, solo una prueba de distancia de vocabulario. Luego está la alternative use test, la prueba de usos alternativos. Esa clásica pregunta de psicología 101: ¿De cuántas maneras puedes usar una botella de vidrio?

Beto
Florero. Rodillo. Arma.

Alicia
Seguro. Pero esa prueba normalmente cuenta solo el número bruto de usos no convencionales; no juzga si son buenas ideas o si funcionarían en el mundo real. Y en el otro extremo tienes benchmarks cargados de lógica, como CreativeMath o NeoCoder.

Beto
... que honestamente suenan a lo opuesto de creatividad para la mayoría de la gente. “Matemática creativa” suena como algo por lo que un contable podría acabar en la cárcel.

Alicia
El gran problema que señalan los investigadores es que todas esas pruebas son islas aisladas. Tienes una prueba para palabras, una para código, otra para historias, ...

Beto
... pero no hay una puntuación general de creatividad.

Alicia
Exacto. Y encima hay un problema mayor encima de todo esto: el cuello de botella humano, ...

Beto
Ah, es decir, la escalabilidad.

Alicia
La creatividad es notoriamente subjetiva. Históricamente, para juzgar una historia necesitas que un humano la lea. Pero piensa en el ciclo de liberación de modelos hoy.

Beto
Recibimos nuevos modelos o actualizaciones masivas literalmente cada semana.

Alicia
Correcto. Si necesitas un panel de jueces humanos que lean mil historias cada vez que un desarrollador cambia un hiperparámetro, nunca vas a lanzar tu producto.

Beto
Quedarías permanentemente atascado en pruebas.

Alicia
Exacto. Es lento, caro y los humanos son inconsistentes: nos cansamos, nos aburrimos. Por eso CreativityPrism no es solo una nueva prueba; es una propuesta para automatizar el proceso de calificación sin perder esa sutileza humana.

Beto
Hablemos del marco mismo. Se llama “prisma” porque descompone la creatividad en diferentes espectros. ¿Qué estamos viendo exactamente?


CreativityPrism - Marco para medir la creatividad de la IA

Alicia
Proponen una visión holística que combina ocho tareas específicas repartidas en tres dominios principales. Y creo que la elección de dominios es interesante porque nos obliga a ampliar nuestra propia definición de lo que es creatividad.

Beto
El primer dominio es probablemente con el que más estamos familiarizados: pensamiento divergente.

Alicia
Es brainstorm puro. Es la capacidad de tomar un punto de partida y expandirlo en una gran variedad de direcciones.

Beto
El artículo destaca una tarea concreta que a mí me costó bastante: la tarea de “10 sustantivos irrelevantes”.

Alicia
Me encanta esta. El enunciado es muy simple: escribe 10 sustantivos en inglés que sean lo más irrelevantes entre sí posible.

Beto
Suena facilísimo hasta que lo intentas. Yo lo intenté esta mañana. Puse “manzana” y enseguida mi cerebro gritó “naranja”. Luego “árbol”. Luego “gusano”.

Alicia
Así funcionan las asociaciones humanas. Funcionamos con cadenas de asociaciones. Para ser verdaderamente divergente tienes que romper esa cadena. Tienes que suprimir la conexión obvia.

Beto
El artículo muestra una respuesta de modelo que lo clavó: listó "volcán, violín, democracia, alfombra, bacteria".

Alicia
Es una lista genuinamente bellísima.

Beto
Lo es. "Democracia" y "alfombra" tienen casi cero solapamiento semántico.

Alicia
Y piensa lo que eso supone para una IA: estos modelos son predictores de siguiente token. Están entrenados estadísticamente para predecir la palabra más probable que sigue.

Beto
Correcto. Si digo “peanut butter”, manteca de cacahuete, el modelo realmente quiere decir “gelatina”.

Alicia
Precisamente. Así que pedirle que sea lo emergente es pelear contra su propia arquitectura. Le pides a una máquina de probabilidad que sea altamente improbable.

Beto
Tiene sentido. Por eso el pensamiento divergente es una prueba de estrés: mide si puede salirse de su propia gravedad estadística.

Alicia
Sí.

Beto
OK. El segundo dominio es la escritura creativa. Esto parece el dominio más artístico y tradicional.

Alicia
Así es. Pero no se limitaron a “escribe un poema”; usaron una tarea de cuento corto con un prompt muy específico y constreñido.

Beto
Tengo el prompt aquí. Dice: “Escribe una historia al estilo de The New Yorker con la siguiente trama. Asegúrate de que tenga al menos 2000 palabras. Argumento: Una mujer vive una noche desorientadora en una sala de maternidad...”.

Alicia
Le das personaje, tiempo, estado, y localización.

Beto
Obliga a la IA a coger un hilo narrativo que ya está en marcha. No puede salir por la tangente con un cuento genérico de dragones.

Alicia
Correcto. Tiene que entender profundamente la dinámica social implícita. Prueba escena, exposición, coherencia, perspectiva, y ajuste de tono.

Beto
¿Puede la IA tejer una historia que parezca continuación natural y no un giro brusco?

Alicia
Exacto.

Beto
Y el tercer dominio sorprende a mucha gente.

Alicia
Razonamiento lógico, el dominio Spock.

Beto
Sí, el dominio Spock. ¿Desde cuándo escribir código o resolver matemáticas se considera creativo? Siempre pensé que la creatividad era romper reglas, no seguir leyes matemáticas estrictas.

Alicia
Es una idea muy común. Pero si hablas con un ingeniero senior o un matemático te dirán que su trabajo es increíblemente creativo porque consiste en resolver problemas bajo restricciones.

Beto
“Bajo restricciones” es la frase clave.

Alicia
Si te pido que vayas del punto A al punto B andando en línea recta no es creativo. Pero si te digo que llegues al punto B, que el suelo es lava y solo puedes usar una cuchara, de pronto tienes que ser extremadamente creativo.

Beto
Tienes que ingeniártelas al estilo MacGyver.

Alicia
Exacto. El artículo usa la tarea NeoCoder para probar esto.

Beto
El prompt pide resolver un problema algorítmico estándar, encontrar la longitud de una subcadena, pero mete una “pastilla envenenada” de restricción: explícitamente dice que "no uses recursión".

Alicia
Para quienes no programan, la recursión es básicamente la solución estándar para este problema.

Beto
Es como pedirle a un carpintero que haga una mesa sin usar un martillo.

Alicia
Quitar la herramienta obliga al modelo a inventar un destornillador sobre la marcha. Tiene que derivar una solución que no sea la que vio un millón de veces en sus datos de entrenamiento.

Beto
Aquí la creatividad no es hacer arte: es ingenio.

Alicia
Es pensamiento lateral. ¿Puedes encontrar una puerta lateral cuando la puerta principal está cerrada?

Beto
Teniendo los tres dominios, pensamiento divergente, escritura creativa y resolución de problemas lógicos, ¿cómo los califican? No puedes poner un pulgar arriba a un poema.

Alicia
Aquí entra la metáfora del prisma: descomponen la puntuación en tres dimensiones para cada respuesta: calidad, novedad y diversidad.

Beto
Desgranémoslas porque la tensión entre estas tres es donde están las verdaderas conclusiones.

Alicia
Primero, calidad: es la base. ¿Es la respuesta útil? ¿Tiene sentido? Si pides un cuento y la IA te entrega una cadena aleatoria de letras, puede que sea única, pero no tiene calidad.

Beto
El artículo menciona elaboración y utilidad como métricas aquí.

Alicia
Luego novedad: ¿es original? ¿Sorprende? Mide si la IA está rompiendo el molde.

Beto
Y finalmente diversidad.

Alicia
O flexibilidad: si pido diez ideas, ¿recibo diez conceptos distintos o diez variaciones leves de la misma idea?

Beto
Para hacer esto a escala, calificar miles de respuestas en estas tres métricas, usan LLMs como jueces.

Alicia
Es una metodología que está ganando tracción.

Beto
Básicamente dejan que las máquinas califiquen su propia tarea.

Alicia
Lo hacen inteligentemente: usan modelos muy potentes como GPT-4 para evaluar las salidas de otros modelos. Y esto lo validaron primero con anotaciones humanas de alta calidad.

Beto
Es decir, hicieron que humanos calificaran una muestra; comprobaron que los jueces IA coincidían con los humanos; y luego dejaron que la IA hiciera el resto del enorme conjunto de datos.

Alicia
Exacto. Establecer una “verdad de referencia” antes de automatizar es, en la práctica, la única forma de hacerlo escalable sin perder precisión.

Beto
Bien, tenemos el mapa y el prisma listos. ¿Y qué encontraron? Probaron 17 modelos de última generación: algunos propietarios y costosos (los de suscripciones) y otros open-source que puedes descargar y ejecutar en tu máquina.

Alicia
Los resultados fueron, honestamente, un poco contraintuitivos.

Beto
Empecemos por los pesos pesados, los modelos propietarios. ¿Cómo les fue?

Alicia
En escritura creativa y razonamiento lógico, los modelos propietarios ganan, y no por poco.

Beto
¿Qué magnitud de ventaja?

Alicia
Estamos viendo aproximadamente un 15% de ventaja en esos dominios específicos.

Beto
Es significativo. Así que si necesitas un cuento corto o resolver un problema de programación complejo sin recurrir a recursión, probablemente convenga quedarte con los modelos de pago.

Alicia
Generalmente, sí. La razón parece recaer en la dimensión de calidad: esos modelos están pulidísimos, son coherentes, siguen instrucciones y rara vez fallan. Son empleados fiables.

Beto
Pero aquí viene el giro: esa dominancia no se mantuvo en todas las pruebas.

Alicia
Cuando miraron el pensamiento divergente, el brainstorming, la tarea de sustantivos irrelevantes, esa ventaja se evaporó.

Beto
¿No fueron mejores los modelos propietarios comparados con los open source?

Alicia
Estadísticamente fue un empate técnico. Los modelos open-source estuvieron bien representados.

Beto
¿Por qué?

Alicia
La hipótesis de los investigadores es que tiene que ver con cómo se entrenan los modelos comerciales. Pasan por un proceso llamado RLHF: "aprendizaje por refuerzo con retroalimentación humana".

Beto
Ahí es donde los humanos puntúan las respuestas para enseñar al modelo a ser “bueno”.

Alicia
¿Qué están recompensando los humanos en ese proceso? Recompensamos seguridad, coherencia y la respuesta más probable y sensata. Normalmente no premiamos el caos o las asociaciones salvajes.

Beto
Así que al entrenarlos para ser asistentes útiles y corteses, quizá inadvertidamente les quitamos lo salvaje.

Alicia
Exacto. Hemos alisado todos los bordes ásperos. Pero el pensamiento divergente existe en esos bordes. Los modelos open-source, que suelen estar menos alineados o filtrados, parecen conservar un poco más de esa capacidad cruda de asociación aleatoria.

Beto
Eso es una gran conclusión: si usas IA para salir de un bache creativo, no necesariamente necesitas la herramienta más cara. De hecho, la herramienta cara podría estar demasiado educada para darte la idea loca que necesitas.

Alicia
Literalmente, podría tener demasiado miedo a equivocarse para ser creativa.

Beto
Esto nos lleva al hallazgo más profundo del artículo: la paradoja de la novedad.

Alicia
Los investigadores analizaron las correlaciones entre calidad, novedad y diversidad. Idealmente quieres un modelo que puntúe alto en todo.

Beto
Sí. Quieres alta calidad y gran originalidad.

Alicia
Pero los datos muestran una fricción enorme; casi un intercambio directo. Concretamente, las métricas de novedad suelen mostrar correlaciones débiles o incluso negativas con otras métricas.

Beto
Correlaciones negativas. Cuanto más novedosa es la respuesta, más baja tiende a ser la puntuación de calidad.

Alicia
Con frecuencia, sí. Si un modelo se esfuerza demasiado por sorprender, la utilidad se desploma. Se vuelve raro en lugar de revelador.

Beto
Es como ese amigo que intenta ser diferente a toda costa y acaba siendo incomprensible: “comamos sopa con tenedor, mirad lo original que soy”.

Alicia
Sí, es novedoso, pero como experiencia culinaria es terrible. Esa contradicción es la lucha central de la IA generativa ahora mismo. Es muy difícil ser original sin derivar al absurdo.

Beto
Y eso complica mucho la construcción de un modelo creativo general: si optimizas por calidad pierdes novedad; si optimizas por novedad, pierdes calidad.

Alicia
También tocan la idea de generalización: ser bueno en una cosa no implica ser bueno en otra.

Beto
La falacia del chico listo. El “chico listo” no siempre es versátil.

Alicia
Correcto. Que un modelo sea un genio en NeoCoder y lógica no significa que escriba una historia empática y matizada sobre "la mujer desorientada en la sala de maternidad". Las habilidades no se transfieren automáticamente.

Beto
Validan así el concepto del prisma: no puedes darle a una IA una sola puntuación tipo CI para la creatividad.

Alicia
Es desigual, con picos muy marcados.

Beto
¿Qué significa todo esto para ti? Hemos analizado el marco, los dominios y los trade-offs (compromisos).

Alicia
Plantea una pregunta fundamental sobre lo que realmente queremos de la IA. Hoy los incentivos comerciales empujan hacia calidad, utilidad, seguridad y precisión. Estamos entrenando estos modelos para que sean el empleado corporativo perfecto.

Beto
¿Los estamos volviendo aburridos?

Alicia
Ese es el gran temor. Si filtramos toda la rareza para garantizar alta calidad quizá estemos lobotomizando el potencial de la máquina para una creatividad verdaderamente transformadora.

Beto
Porque la verdadera innovación a menudo parece un gran error al principio.

Alicia
Exacto. La penicilina fue un accidente, el marcapasos fue una casualidad feliz. Si tienes una IA aterrorizada de equivocarse, quizá nunca tengas esos “accidentes felices”.

Beto
¿Queremos aceptar un poco más de caos en las salidas para permitir creatividad de verdad?

Alicia
Puede que tengamos que tolerar puntuaciones de calidad más bajas, a corto plazo. Permitir que los modelos estén un poco equivocados o raros para que luego puedan llegar a aciertos brillantes.

Beto
Es una propuesta complicada en un contexto corporativo: “disculpa, confundí tu informe legal, estaba siendo creativa”.

Alicia
Difícil de vender. Pero para un compañero creativo tal vez sea justo lo que necesitamos: una herramienta que no tema sugerir la idea del tenedor-sopa porque quizá esa rareza desencadene algo en tu cerebro humano que conduzca a un verdadero avance.

Beto
Es una asociación: la IA aporta la divergencia; el humano aporta la convergencia y control de calidad.

Alicia
Esa es la zona dulce. Usa los modelos open-source más salvajes en la fase de brainstorming; usa los modelos propietarios y pulidos en la fase de ejecución. No pidas a la misma herramienta que haga ambos trabajos.

Beto
Me gusta ese enfoque: trátalos como un equipo de especialistas, no como un genio universal.

Alicia
Precisamente. Y no descartes un modelo solo porque a veces dé respuestas raras: esa rareza puede ser la característica, no el error.

Beto
Eso es todo en este análisis profundo sobre CreativityPrism. Es una mirada fascinante a cómo los investigadores intentan medir lo que parece inmedible. Te animo a probar la prueba hoy mismo: escribe 10 sustantivos que no tengan absolutamente nada que ver entre sí.

Alicia
Y no hagas trampa: si piensas “perro”, no puedes escribir “gato”.

Beto
Es mucho más difícil de lo que parece. Gracias por escuchar y nos vemos en el próximo análisis profundo.

domingo, 11 de enero de 2026

El Compromiso entre Razonamiento y Creatividad

 
 

Hoy les traigo un resumen de un artículo de investigación que investiga el colapso de la diversidad en grandes modelos lingüísticos (LLMs), donde el aprendizaje por refuerzo (RL) hace que los modelos se fijen en unos pocos patrones de razonamiento repetitivos. Los autores presentan el Razonamiento Creativo Distribucional (DCR), un marco teórico que trata el entrenamiento como un flujo gradiente para analizar por qué estrategias como STaR, GRPO y DPO sufren de diferentes modos de decadencia creativa. Para resolver esto, proponen una nueva función objetivo que combina la entropía de Shannon para la amplitud probabilística con un término de cobertura del núcleo para recompensar la distinción semántica. Su teorema de decadencia de la diversidad predice formalmente estos modos de falla, lo que demuestra que las recompensas estándar impulsadas por escalares erosionan inherentemente la variedad. En última instancia, el marco DCR proporciona un método basado en principios para equilibrar la utilidad y la creatividad, garantizando que los modelos converjan en un conjunto estable y diverso de caminos de razonamiento. El estudio valida estos hallazgos a través de pruebas matemáticas y simulaciones empíricas de dinámicas de estrategia simple.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "The Reasoning–Creativity Trade-off: Toward Creativity-Driven Problem Solving", por Max Ruiz Luyten y Mihaela van der Schaar, de la universidad de Cambridge. Publicado en Enero 02 del 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Sabes, es simplemente increíble lo que pueden hacer ahora los modelos de lenguaje a gran escala (LLM). Quiero decir, el nivel de razonamiento complejo es fuera de serie.

Beto
Absolutamente. Pueden escribir código sin errores, resolver problemas matemáticos muy avanzados, cosas que hace un par de años ni siquiera creíamos posibles.

Alicia
Y, sin embargo, hay una sensación que te entra cuando los usas mucho. Es como si sus soluciones, por brillantes que sean, empezaran a sentirse un poco repetitivas.

Beto
Eso es todo. Ese es el gran paradoja, ¿no? Diseñas estos sistemas para la perfección total, para la corrección, pero parece que maximizar esa brillantez en realidad los hace — bueno — mata su diversidad creativa.

Alicia
Y ese es el núcleo de lo que hablamos hoy. Esta nueva investigación de la Universidad de Cambridge lo llama la "Compensación Razonamiento–Creatividad" ("Reasoning Creativity Trade-off", RCT).

Beto
Exacto. Y es un resultado directo de nuestras actuales pipelines de entrenamiento de última generación.

Alicia
Claro. Esas que están tan fuertemente optimizadas para la corrección, usando cosas como el aprendizaje por refuerzo, RL.

Beto
Sí. Y cuando entrenas un modelo para maximizar un único y simple puntaje — tal como "¿es esta respuesta correcta?" — creas un sistema que es fatalmente sensible a lo que la investigación llama "colapso creativo".

Alicia
Así que nuestra misión en este análisis profundo es desentrañar ese colapso. Vamos a diagnosticar qué está fallando con algunos de los algoritmos de entrenamiento más grandes que hay: STaR, GRPO, DPO.

Beto
Y luego entraremos en la solución que proponen, que es este marco realmente fascinante llamado "Razonamiento Creativo Distribucional" ("Distributional Creative Reasoning", DCR).

Alicia
Antes de meternos en los fallos, tenemos que aclarar qué queremos decir con "creatividad" aquí. No es esa cosa borrosa y artística.

Beto
No, en absoluto. Tienes que pensarlo como un requisito técnico estricto. Para un LLM, la creatividad es la capacidad de mantener una cartera diversa de estrategias de razonamiento de alta utilidad.

Alicia
¿Una cartera? Me gusta mucho esa metáfora. Es como una estrategia de inversión.

Beto
Lo es, porque esa diversidad es lo que te da generalización. Si un modelo solo conoce una forma de resolver un problema, va a fallar en cuanto vea algo nuevo, algo fuera de sus datos de entrenamiento. Una IA creativa necesita respaldos. Necesita formas diferentes de pensar.

Alicia
Bien, empecemos con el problema en sí: el colapso creativo. Las fuentes lo califican como un efecto secundario recurrente y perjudicial del aprendizaje por refuerzo posterior al entrenamiento.

Beto
Especialmente el RL a partir de retroalimentación humana, "Reinforcement Learning with Human Feedback", RLHF. Y es importante notar: esto no es un "bug". Es una característica del objetivo que le estamos dando a los modelos.

Alicia
¿Cómo funciona? ¿Cuál es el mecanismo?

Beto
Bueno, es sorprendentemente simple. Cuando entrenas el modelo para maximizar ese único número de recompensa, su entropía de salida se desploma.

Alicia
La entropía aquí es básicamente nuestro sustituto para la diversidad o aleatoriedad.

Beto
Exacto. Así que todo el espacio de soluciones se contrae. El modelo deja de explorar y empieza a concentrar toda su probabilidad en solo unas pocas plantillas que sabe que van a obtener una puntuación alta. Terminas con una monocultura de alto rendimiento.

Alicia
Y hay datos duros sobre esto. No es solo una sensación. Pasa sin importar qué algoritmo uses.

Beto
Correcto. Es agnóstico al algoritmo. Lo ves en RLHF. Lo ves cuando los modelos usan GRPO para matemáticas, incluso durante la sintonización de auto-consistencia.

Alicia
Y las métricas son bastante tajantes.

Beto
Lo son. La diversidad, medida por entropía u otras cosas como la dispersión en el espacio de embeddings, simplemente se desploma después de RLHF. En algo como la escritura de historias abiertas, los modelos Llama 2 alineados perdieron algo así como entre tres y seis veces su entropía de tokens original.

Alicia
Vaya. Es como entrenar a un novelista que, al final, solo puede escribir la misma historia una y otra vez.

Beto
Ese es el colapso en acción.

Alicia
Si este es un problema tan conocido, ¿qué hay de las soluciones? Quiero decir, la gente ha intentado contrarrestarlo, ¿no? Las fuentes mencionan penalizaciones KL.

Beto
Las han usado. Pero las soluciones son, yo diría, incompletas. Son indiscriminadas. Una penalización KL básicamente le dice al modelo: oye, no te alejes demasiado de tu programación base.

Alicia
Está bien.

Beto
Pero el problema es que penaliza todo lo nuevo, incluso soluciones brillantes y de alta utilidad. Si resultan ser demasiado diferentes del modelo base, es como poner un limitador en un motor. Evitas que vaya demasiado rápido, pero también le impides encontrar un atajo brillante.

Alicia
¿Y añadir más ruido, como con PPO regularizado por entropía, ayuda?

Beto
Hace las cosas más aleatorias, claro. Pero no crea ideas cualitativamente distintas. El modelo simplemente se vuelve más ruidoso, menos confiado. Pero no está siendo más creativo de una manera estructurada. Es solo añadir estática, no esculpir nuevas vías.

Alicia
Para esculpir necesitas primero un diagnóstico. Eso nos lleva al teorema de decaimiento de diversidad. Esta es la herramienta que predice exactamente cómo fallan estos algoritmos.

Beto
Sí. Nos da tres modos muy distintos de colapso.

Alicia
Bien. Desgranémoslos. Modo de fallo 1. STaR — Self-taught Reasoner. El artículo lo llama "fijación de ganador se lo lleva todo".

Beto
Y es una descripción perfecta. La dinámica en STaR es un clásico ciclo de retroalimentación positiva.

Alicia
¿Qué significa?

Beto
Significa que si una vía de razonamiento, por simple azar, tiene una ligera ventaja al principio, el proceso de entrenamiento se aferra a ella y colapsa rápida y de forma determinista sobre esa única solución dominante. Todo lo demás se olvida.

Alicia
Así que no es una declinación lenta. Es un chasquido.

Beto
Lo es. Los datos muestran que el colapso es casi inmediato. La entropía tiende a 0. El índice de fijación tiende a 1. Es una carrera. Y el ganador se lleva literalmente todo.

Alicia
Aterradoramente eficiente. Bien. Eso es STaR. ¿Y el modo de fallo 2? GRPO. Este es mucho más sutil.

Beto
Lo es. El diseño de GRPO crea lo que llaman "estabilidad neutral entre todas las soluciones correctas".

Alicia
Lo cual suena bien en papel: no elige un único ganador.

Beto
Correcto. Trata de preservar las probabilidades iniciales de todas las respuestas correctas. Pero — y aquí está la clave — no proporciona ninguna protección activa para esa diversidad.

Alicia
¿A qué te refieres con eso?

Beto
Piénsalo como un montón de canicas sobre una lámina de hielo perfectamente plana y sin fricción. Son estables. Ningún punto es mejor que otro.

Alicia
Pero también son muy fáciles de mover.

Beto
Exacto. Y en el entrenamiento de LLM, la pequeña fuerza que las mueve es el ruido del muestreo en mini-batches.

Alicia
Espera. Entonces lo que hacemos para que el entrenamiento sea eficiente — los mini-batches — es en realidad la causa del colapso aquí.

Beto
Es el desestabilizador. Ese pequeño ruido estadístico es suficiente para que la política simplemente derive. Deambula aleatoriamente hasta que eventualmente las canicas se amontonan en una esquina. Se fija en un subconjunto pequeño de soluciones. Los datos muestran que esta deriva es lenta y depende del tamaño del batch, lo que confirma que el ruido es el culpable.

Alicia
Fascinante.

Así que tenemos una monopolización repentina con Star y una deriva lenta y ruidosa hacia una esquina con GRPO.

¿Y el modo de fallo tres? DPO, Direct Preference Optimization, es muy popular.

Beto
Y su modo de fallo es distinto de nuevo. El objetivo de DPO es hacer que las buenas respuestas tengan probabilidades aproximadamente iguales. Así que resulta en homogenización o igualación.

Alicia
De ese modo evita la fijación, lo cual es bueno.

Beto
Sí. Pero no promueve diversidad semántica dirigida.

Alicia
¿Qué significa eso en la práctica?

Beto
Significa que pides cinco formas diferentes de decir algo y DPO te da cinco excelentes maneras que son todas solo variaciones menores entre sí. Empuja probabilidades iguales a respuestas de alta utilidad, pero muchas de esas respuestas son conceptualmente redundantes. Obtienes calidad igual, pero no diversidad de ideas.

Alicia
Entonces Star es una única respuesta dominante, GRPO deriva hacia unas pocas respuestas, DPO nos da muchas respuestas similares. El problema no es el proceso de optimización en sí, entonces.

Beto
No, la optimización funciona perfectamente. El problema es la función objetivo. Le falta cualquier tipo de fuerza que recompense activamente la verdadera diversidad semántica.

Alicia
Lo que significa que la única solución es una función objetivo totalmente nueva. Hablemos de la solución: Razonamiento Creativo Distribucional, "Distributional Creative Reasoning", DCR.

Beto
DCR replantea completamente el problema. Dejamos de pensar en optimizar una sola respuesta. Empezamos a pensar en optimizar toda la cartera de estrategias del modelo.

Alicia
Le decimos: no quiero solo una buena respuesta. Quiero una política que genere muchos tipos diferentes de respuestas buenas.

Beto
Exacto. Y el objetivo DCR está diseñado para hacer eso. Es un acto de equilibrio.

Alicia
Mantiene utilidad por la corrección y algo de divergencia KL para estabilidad.

Beto
Correcto. Pero entonces está el ingrediente clave: el funcional de energía de diversidad ("Diversity Energy Functional", D[p]).

D[p] = alfa * H[p] - beta * Q[p], con alfa, beta >= 0.

Alicia
Y este tiene dos partes que hacen dos trabajos distintos.

Beto
Así es. La primera parte se basa en la vieja entropía de Shannon (H[p]). Eso promueve lo que podrías llamar "amplitud indiscriminada". Simplemente anima al modelo a mantener las opciones abiertas, a no dejar que las probabilidades de soluciones buenas pero poco comunes vayan a cero.

Alicia
Pero, como dijiste antes, la entropía por sí sola es ciega. No distingue lo correcto de lo incorrecto.

Beto
Precisamente. Y ahí entra la segunda parte: el término de cobertura del kernel ("Kernel Coverage", Q[p]).

Alicia
¿Qué hace el kernel?

Beto
Piensa en el kernel como una herramienta para medir la similitud entre dos respuestas diferentes, dos trazas de razonamiento distintas.

Alicia
Si el modelo genera dos soluciones que son básicamente la misma idea, solo enunciadas de forma distinta, el kernel las señalaría como muy similares.

Beto
Exactamente. Y aquí está la jugada inteligente. El objetivo DCR canaliza esa similitud. Castiga al modelo por tener alta cobertura de kernel. Es decir, empujas activamente la política a alejarse de generar respuestas semánticamente redundantes.

Alicia
Wow. Entropía te da amplitud. El kernel te da distintividad semántica dirigida. Es un tira y afloja.

Beto
Y la garantía matemática es el verdadero avance. Está probado que este funcional garantiza que la política convergerá a un equilibrio único, estable y diverso. No puede fijarse, no puede derivar, no puede marginalizar. Neutraliza los tres modos de fallo de los que hablamos.

Alicia
Para un practicante, esto es enorme. De repente tienes palancas reales para ajustar. Puedes definir qué significa similaridad con tu elección de kernel. Y luego puedes tunear el balance entre amplitud bruta y diversidad semántica.

Beto
Es un problema real de diseño de ingeniería ahora. No solo un tiro en la oscuridad.

Alicia
Seamos prácticos, eso sí. Aún necesitas que las respuestas sean correctas. Recompensar la diversidad no puede salirle caro a la supresión de respuestas erróneas.

Beto
Absolutamente. Y eso se resuelve con lo que llaman "la estrategia de kernel con compuerta". El kernel que usas es un kernel efectivo: un kernel semántico que está reglado por un verificador binario simple.

Alicia
Un verificador que solo pregunta: "¿es esta respuesta correcta?" Sí o no.

Beto
Eso es todo. Entonces la penalización promotora de diversidad — la parte que castiga la similitud — se aplica solo a las interacciones entre respuestas correctas.

Alicia
Ah, ya veo. Así que solo estás esculpiendo la diversidad entre las soluciones válidas. Las respuestas incorrectas ni siquiera participan en esa parte del proceso.

Beto
Estás enfocando el cincel solo en la canica buena.

Alicia
Ok, esto suena increíblemente poderoso, pero también intenso computacionalmente. ¿Es escalable para los modelos masivos de hoy?

Beto
Sorprendentemente es práctico. El término de cobertura del kernel puede estimarse muy eficientemente durante el entrenamiento usando una estadística U. El coste escala cuadráticamente con el tamaño del batch, pero ese tipo de complejidad, O(B2), ya es estándar en mucho aprendizaje métrico moderno. No es un cuello de botella imposible nuevo.

Alicia
Así que afinemos el principio central para un ingeniero que quiera usar esto. ¿Cuál es la regla más importante para balancear corrección y creatividad?

Beto
El análisis da una regla empírica muy clara: para asegurarte de que sigues suprimiendo respuestas incorrectas, la fuerza matemática que aplicas desde la penalización de diversidad no debe ser más fuerte que la recompensa que obtienes por estar en lo correcto.

Alicia
¿Puedes ponerlo en términos más sencillos?

Beto
Significa que el mando que giras para la creatividad — esa penalización del kernel — tiene que permanecer más débil que la recompensa fundamental por la corrección. Si empujas demasiado fuerte por la diversidad, corres el riesgo de que el modelo decida que una respuesta novedosa pero equivocada es mejor que una respuesta aburrida pero correcta. Es un acto de equilibrio.

Alicia
Sí. Y cada palanca afecta a las demás. Si aumentas demasiado la entropía bruta, también debilitas la supresión de respuestas erróneas, incluso mientras ayudas a que la correcta se expanda.

Beto
Exacto. DCR te da las herramientas, pero aprender a usarlas para obtener máxima amplitud estratégica sin sacrificar precisión será el próximo gran desafío de ingeniería.

Alicia
Este análisis profundo nos ha mostrado que llegar a una IA verdaderamente innovadora significa dejar atrás el premio al único mejor resultado. Las formas antiguas — STaR, GRPO, DPO — todas conducen a estos colapsos previsibles: ganador se lo lleva todo, deriva ruidosa o simple homogenización.

Beto
Y el Razonamiento Creativo Distribucional, DCR, nos da un esquema unificado y demostrable. Al construir el funcional de diversidad estructurada directamente en la función objetivo, combinando amplitud con un kernel de creatividad con compuerta, garantiza que la política encuentre una cartera estable y verdaderamente diversa de soluciones de alta calidad.

Alicia
Es el plano para modelos que pueden ser a la vez increíblemente precisos y genuinamente creativos, pero, como dijiste, hay una línea fina que hay que recorrer.

Beto
La hay. Y eso nos lleva a la pregunta final, realmente provocadora. DCR está probado que funciona, pero su efectividad depende de esa única heurística: la penalización de creatividad tiene que ser más débil que la recompensa de utilidad. Así que te preguntas qué pasaría si, en nuestra búsqueda de creatividad estructurada extrema, giramos ese dial al máximo. ¿Podríamos comprometer inadvertidamente la capacidad central del modelo para distinguir el bien del mal, creando una especie de colapso de utilidad? El reto ahora es usar estas nuevas palancas para acercarnos lo máximo posible a esa línea sin jamás, jamás cruzarla.