Este artículo de investigación presenta Creative-MAD, un marco diseñado para resolver un dilema fundamental entre calidad y diversidad en los debates multiagente sobre modelos de lenguaje a gran escala. Si bien el Debate Multiagente (MAD) tradicional mejora la calidad de los resultados, su tendencia natural hacia el consenso provoca una disminución de la diversidad, lo que genera resultados repetitivos en tareas creativas. Para contrarrestar esto, los autores implementan la Asignación de Lente Cognitiva (CLA), que vincula a cada agente con modos de razonamiento específicos, como el pensamiento emocional o analítico, para evitar la deriva de identidad. También emplean la Selección de Pares Basada en Incrustación (EPS), un método que restringe la retroalimentación de un agente a los pares semánticamente más diferentes para evitar la influencia de la mayoría. Experimentos realizados con múltiples conjuntos de datos de referencia demuestran que este enfoque aumenta significativamente la diversidad léxica y semántica sin comprometer la alta calidad del contenido generado. En definitiva, el estudio demuestra que mantener el desacuerdo interno entre los agentes es esencial para explorar una gama más amplia de trayectorias creativas en partidas independientes.
Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Creative Generation via Multi-Agent Debate: Does Debate Suppress Diversity?". Por Tien Anh Nguyen y colegas de la Universidad de Deakin. Publicado el 1 de Septiembre de 2026.
El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.
El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.
Resumen
Alicia
Imagina que estás sentado en una sala de conferencias para una sesión de lluvia de ideas de viernes por la tarde. Sabes exactamente el tipo de reunión de la que estoy hablando.
Beto
Sí, claro que sí. Esa donde el café se puso rancio como hace tres horas.
Alicia
Exacto. El café es terrible. La pizarra está completamente en blanco y todos están mirando sus zapatos, esperando a que se acabe el tiempo.
Beto
Todos están desconectados.
Alicia
Correcto. Y finalmente, alguien habla y propone la idea más segura, la más mediocre, inofensiva posible. Y sabes exactamente lo que sucede después.
Beto
Todos empiezan a asentir.
Alicia
Sí. Escuchas un coro de: "sí, usemos esa", o "me suena bien". Toda la fricción desaparece por completo de la sala.
Beto
Y llegas a un consenso en cinco minutos, pero te quedas con un plan increíblemente aburrido y genérico.
Alicia
Exacto. Ahora bien, si usas inteligencia artificial para ayudarte a hacer una lluvia de ideas, escribir código o redactar textos de marketing, probablemente hayas notado este mismo fenómeno.
Beto
Oh, absolutamente. Es tan común.
Alicia
Le pides a una IA que te dé algo verdaderamente creativo, y ella simplemente te sigue dando las respuestas más seguras y predecibles en todo momento.
Beto
Sí. Quiero decir, es una frustración enormemente conocida en el campo ahora mismo. Tenemos estos modelos masivos e increíblemente capaces. Pero cuando les dejas a su suerte en tareas abiertas, tienden a quedar atrapados.
Alicia
Atrapados en zonas seguras, como de pensamiento.
Beto
Correcto. Zonas de seguridad muy localizadas para el pensamiento. Simplemente toman el camino con poca resistencia.
Alicia
Por eso estoy tan emocionada por la misión de nuestra inmersión profunda de hoy.
Bien, desglosémoslo. Estamos viendo un fascinante artículo de investigación de 2026 que detalla un nuevo marco llamado "Creative-MAD".
Beto
Sí, este artículo es un cambio de juego.
Alicia
Lo es. Los investigadores detrás de esto básicamente descubrieron una forma de obligar a la IA a pensar realmente fuera de la caja. Y lo hicieron diseñando esencialmente un argumento perfectamente diverso.
Beto
Lo cual es brillante, honestamente.

Superando la trampa de la convergencia: Mejorando la diversidad en el debate sobre la IA multiagente.
Alicia
Es tan inteligente. Pero para entender cómo logran arreglar la creatividad de la IA, primero tenemos que darnos un paso atrás y ver cómo intenta la IA actualmente resolver problemas difíciles cuando se la pides ayuda.
Beto
Correcto. Así que el estándar de oro actual para la resolución de problemas complejos en la IA es esta técnica llamada "debate multiagente" ("Multi-Agent Debate", o MAD).
Alicia
MAD, lo entiendo.
Beto
El mecanismo central es en realidad bastante intuitivo. En lugar de simplemente pedirle a un único modelo de IA que te dé una respuesta y esperar lo mejor, activas múltiples instancias de la IA.
Alicia
Así que estás creando como un pequeño comité.
Beto
Exacto. Creas un panel de múltiples agentes y les haces iterativamente criticar y refinar las respuestas unas a otras a lo largo de varias rondas de debate.
Alicia
Eso tiene mucho sentido. Así que solo están revisando el trabajo de los demás antes de darte la respuesta final.
Beto
Esa es la intención. Sí.
Y para tareas de hechos o como problemas de matemáticas o acertijos de lógica realmente complejos, el MAD estándar es fenomenal.
Alicia
Porque hay una sola respuesta correcta.
Beto
Exacto. Piénsalo en esos escenarios, hay una única respuesta objetivamente correcta que encontrar. Así que el proceso de debate expone errores de cálculo. Desafía el razonamiento débil. Y lleva a todos los agentes individuales a eventualmente converger en esa única respuesta correcta.
Alicia
Así que ¿es fuertemente impulsado por la convergencia?
Beto
Es por definición un diseño impulsado por la convergencia. Sí. Pero, y aquí está el gran problema. Los investigadores identificaron una falla masiva aquí. Ese mismo diseño impulsado por la convergencia se desmorona fundamentalmente cuando lo aplicas a tareas creativas.
Alicia
Correcto. Porque con tareas creativas, como si estás haciendo escritura narrativa o tratando de idear una nueva hipótesis científica, en realidad no quieres la convergencia.
Beto
Para nada.
Alicia
Es como si el MAD estándar operara como un jurado. Y todo el punto de un jurado es sentarse en una sala y discutir hasta que converjas en un veredicto unánime.
Beto
Esa es una analogía muy buena.
Alicia
Pero para la creatividad, un solo veredicto es un fracaso total. Quieres todo un espectro de ideas salvajes y distintas para explorar, ¿sabes?
Beto
Sí. Y los investigadores se refieren a este estado de fallo como "colapso del modo" ("mode collapse").
Alicia
Colapso del modo.
Beto
Correcto. Cuando ejecutas estas sesiones de debate de IA de forma independiente en una indicación creativa, todas terminan agrupándose en la misma región estrecha y genérica del espacio de salida.
Alicia
Así que simplemente producen lo mismo aburrido una y otra vez.
Beto
Exacto. Producen resultados repetitivos y seguros. Fallan por completo en explorar los diferentes bordes y posibilidades del espacio creativo. El mecanismo mismo que los hace tan confiables en las matemáticas está suprimiendo activamente su diversidad de salida cuando intentan ser creativos.
Alicia
Así que si el MAD estándar está aplastando la creatividad, realmente tenemos que descubrir cómo lo está haciendo bajo el capó, ¿verdad? ¿Cuáles son los mecanismos que impulsan esta conformidad de la IA?
Beto
Bueno, el artículo identifica dos mecanismos internos específicos que ocurren durante estos debates que simplemente extinguen el pensamiento original por completo.
Alicia
Bien, ¿cuál es el primero?
Beto
El primer mecanismo, el detalle se llama "deriva de identidad" ("identity drift"). Así que para entender esto, tienes que ver cómo comienzan estos debates. En el MAD estándar, se les da a todos los agentes exactamente la misma indicación básica. Así que la única diferencia entre ellos al principio son solo variaciones menores de muestreo, lo que normalmente llamamos "ruido de temperatura".
Alicia
Ok, déjame hacer una pausa ahí rapidísimo solo porque la "temperatura" en la IA es uno de esos términos que se mencionan mucho. Para ti que estás escuchando, piensa en la temperatura como un dial en la IA que básicamente controla la aleatoriedad.
Beto
Sí, esa es una forma perfecta de describirlo.
Alicia
Si bajas la temperatura, la IA siempre elige la siguiente palabra más obvia y estadísticamente probable. Si la subes, toma más riesgos y genera un texto ligeramente más caótico o inesperado.
Beto
Así que estás diciendo que lo único que separa a estos agentes inicialmente es ese dial de aleatoriedad?
Alicia
Eso es literalmente la única diferencia. No tienen un ancla de razonamiento estable y permanente. Así que a medida que leen y sintetizan las respuestas de sus compañeros a través de todas estas rondas de debate múltiples, cualquier chispa única menor con la que comenzaron ...
Beto
... Esa pequeña cantidad de ruido de temperatura.
Alicia
Exacto. Se suaviza rápidamente por la tendencia natural del modelo de lenguaje a simplemente predecir la frase siguiente más probable. Su distinción se erosiona, simplemente se desvían hacia el consenso del grupo.
Beto
Ah, así que pierden su identidad individual y simplemente se funden en una masa colectiva.
Alicia
Exacto. Y esa deriva es acelerada enormemente por el segundo mecanismo, que llaman "tirón de la mayoría" ("majority pull").
Beto
Tirón de la mayoría, Ok.
Alicia
Sí. Así que en el MAD estándar, cada agente ve toda la reserva de respuestas de todos sus compañeros.
Beto
Como un gran chat grupal, ¿verdad? Y cuando expones a un agente a todo lo que se dice en la sala, las perspectivas dominantes en esa reserva naturalmente anulan cualquier punto de vista minoritario. El peso puro de la señal de la mayoría homogeneiza gradualmente todas las respuestas del agente hasta que todas suenen exactamente igual.
Alicia
Espera, tengo que contradecir esto por un segundo, porque sé que la investigación previa ha intentado arreglar este problema exacto simplemente dándole a los agentes de IA diferentes personajes.
Beto
Ah, sí, estás pensando en Hetero-MAD.
Alicia
Sí, Hetero-MAD, donde harían a un agente un doctor, otro un abogado, otro un economista y otro un historiador. ¿Por qué no resuelve ese problema? Quiero decir, un doctor y un abogado deberían abordar un problema desde ángulos completamente diferentes y detener esa deriva de identidad, ¿verdad?
Beto
Quiero decir, parece una solución realmente elegante en la superficie. Pero los investigadores en este artículo demuestran por qué una persona basada en roles como Hetero-MAD falló completamente en mantener la diversidad con el tiempo.
Alicia
¿En serio? ¿Por qué?
Beto
Porque darle a un agente de IA una personalidad como abogado o doctor solo le dice al modelo lo que sabe. Solo proporciona conocimiento del dominio.
Alicia
Oh, ya veo.
Beto
Correcto. No dicta cómo deben pensar o procesar la información los modelos. Así que cuando pones a ese doctor y abogado en un debate de múltiples rondas y los sometes a esa presión de los compañeros y el peso de la encuesta de la mayoría, su vocabulario especializado simplemente no es suficiente como ancla.
Alicia
Porque todavía están procesando los argumentos de la misma manera debajo de todo.
Beto
Exacto. Así que todavía terminan cediendo al consenso.
Alicia
Oh, okay. Entonces, el conocimiento del dominio no los protege de la presión algorítmica para conformarse. Pueden usar jerga diferente, pero la lógica subyacente sigue colapsando en el medio.
Beto
Y la investigación ha demostrado esto matemáticamente. Demuestran esta relación directa entre lo que llaman "decaimiento de diversidad de intercesión" ("inter-session diversity decay") y "homogeneidad de intercesión" ("inter-session homogeneity").
Alicia
Ok, eso suena muy técnico.
Beto
Sí. Para poner eso en lenguaje sencillo: Si los agentes empiezan a estar demasiado de acuerdo durante una sola sesión de debate, la matemática garantiza que tus ideas finales a través de ejecuciones totalmente diferentes, e independientes del sistema, van a ser completamente idénticas.
Alicia
Oh, vaya.
Beto
Sí, preservar la fricción y el desacuerdo durante el debate es la condición absolutamente necesaria para obtener resultados diversos al final.
Alicia
Ok, así que asignar diferentes trabajos como doctor y abogado es realmente solo una solución cosmética entonces.
Beto
Prácticamente, sí.
Alicia
Así que para resolver esto de verdad, los investigadores se dieron cuenta de que tenían que cambiar fundamentalmente el modo de procesamiento cognitivo de los agentes. ¿Cómo lo logran realmente?
Beto
Aquí es donde llegamos a la primera intervención importante en su marco Creative-MAD. Lo llaman "asignación de lente cognitiva" ("Cognitive Lens Assignment", o CLA).
Alicia
CLA, lo tengo.
Beto
Sí. Así que en lugar de darle a los agentes una profesión, les equipan a cada agente con un modo cognitivo distinto y persistente que dicta exactamente cómo se les permite procesar la información.
Alicia
Como darles un cambio de cerebro en lugar de un título de trabajo.
Beto
Básicamente, sí. El sistema refuerza explícitamente esta lente específica en cada ronda del debate. El agente nunca se le permite desviarse de ella.
Alicia
Ok, usan cinco lentes muy específicas en el estudio. Y creo que recorrerlas aclara cómo funciona en la práctica.
Beto
Sí, hagámoslo.
Alicia
Así que la primera es la lente analítica. A este agente se le instruye estrictamente para buscar la estructura, los patrones y la evidencia. Pregunta qué razonamiento subyacente hace que una idea sea convincente.
Beto
Correcto. Y luego la segunda es la lente emocional. Esta tiene que ignorar por completo la lógica fría y centrarse totalmente en el impacto humano, los sentimientos, los valores y las experiencias vividas.
Alicia
Lo cual es totalmente opuesto a la primera.
Luego está la lente crítica. Piensa en esto como el contrincante asignado del grupo. Su trabajo entero es simplemente interrogar suposiciones, descubrir contradicciones, y localizar la paradoja en lo que sea que esté discutiendo el grupo.
Beto
Lo cual honestamente, todos necesitamos un escéptico designado y una sesión de lluvia de ideas.
Alicia
En serio, cada reunión necesita uno.
La cuarta es la lente analógica. A este agente se le forza a dibujar metáforas inesperadas entre dominios. Pregunta qué patrón más profundo conecta cosas aparentemente no relacionadas.
Beto
Y finalmente, la lente práctica. A este agente no le importa en absoluto las metáforas, o la resonancia emocional. Solo evalúa la viabilidad del mundo real y los pasos concretos y accionables.
Alicia
Así que la brillantez de esta asignación de lente cognitiva es que proporciona una cobertura cognitiva completa de cualquier problema dado.
Beto
Sí. Piénsalo como diseñar un nuevo parque público. El MAD estándar podría simplemente debatir hasta que sugiera añadir más árboles y algunos bancos.
Alicia
Correcto, súper aburrido.
Beto
Pero con CLA, el agente analítico mapea las cuadrículas de tráfico peatonal. El agente emocional se centra en crear espacios que fomenten la conexión comunitaria.
Alicia
Y el agente crítico señala que la mayoría de los parques se sienten inseguros por la noche y exige soluciones de iluminación, ¿verdad?
Beto
Exacto. El agente analógico sugiere diseñar el parque para que funcione como un pulmón literal para la calidad del aire de la ciudad. Y el agente práctico simplemente está allí calculando las leyes de zonificación y los presupuestos de mantenimiento.
Alicia
Veo cómo eso crea un ancla de razonamiento permanente ahora. El agente analítico no va a empezar a estar de acuerdo con el agente emocional solo por la presión de los compañeros, porque las instrucciones fundamentales le prohíben procesar información a través de sentimientos.
Beto
Exacto. Eso resuelve completamente ese primer problema de deriva de identidad.
Alicia
Pero, y sé que esta es la trampa, los investigadores encontraron que incluso un ancla cognitiva fuerte como esta puede erosionarse eventualmente si un agente es bombardeado constantemente por una opinión mayoritaria.
Beto
Desafortunadamente, sí. Si pones a ese único agente crítico en una sala con otros cuatro agentes que todos están agresivamente de acuerdo entre sí sobre un concepto, el peso puro de la encuesta de la mayoría aún puede empezar a diluir las salidas a lo largo de múltiples rondas.
Alicia
La presión de los compañeros es difícil de vencer.
Beto
Realmente lo es. Los investigadores se dieron cuenta de que darle una lente no era suficiente. También tuvieron que diseñar la comunicación misma para proteger la voz minoritaria.
Alicia
Ok, aquí es donde se pone realmente interesante. Para arreglar el problema de comunicación, introdujeron la segunda mitad de su marco llamada "selección de compañeros basada en incrustación" ("embedding-based peer selection", o EPS).
Y la solución que encontraron es, honestamente, totalmente contraintuitiva a cómo pensamos normalmente sobre el trabajo en equipo.
Beto
Realmente lo es. Porque en una configuración estándar de MAD, la transparencia total es el objetivo. Cada agente ve todo lo que los otros agentes están diciendo.
Pero EPS restringe intencionalmente su visión.
Alicia
Les ponen ojos vendados.
Beto
Sí. En cada ronda de debate, el sistema toma todas las respuestas del agente y las mapea en un espacio semántico compartido.
Alicia
Ok, para cualquiera que no esté familiarizado con un espacio semántico, imagina un mapa masivo multidimensional. Pero en lugar de trazar latitud y longitud, la IA está trazando significado.
Así que una idea sobre un "perro" y una idea sobre un "lobo" se trazan muy cerca en este mapa. Pero una idea sobre un "perro" y una idea sobre una "nave espacial" se trazan muy lejos. La IA literalmente convierte los conceptos en matemáticas para medir la distancia entre ellos.
Beto
Esa es una gran manera de visualizarlo. Así que una vez que todas las ideas están mapeadas de esa manera, solo se permite a un agente ver las ideas que son matemáticamente las más semánticamente distantes de la suya.
Alicia
Es un concepto tan salvaje cuando lo aplicas a una reunión. Si fueras el agente analítico y propusieras una idea muy lógica y estructurada, el sistema oculta activamente todas las demás ideas lógicas o incluso ligeramente lógicas de ti.
Beto
No tienes derecho a ver a nadie que esté de acuerdo contigo.
Alicia
Correcto. Te obliga a solo mirar las ideas más extrañas y vastamente diferentes en la sala. Tal vez las altamente emocionales o puramente analógicas. Estás completamente cegado a cualquiera de tu lado.
Beto
Actúa como un estímulo forzado de perspectiva cruzada. Y los investigadores realmente querían averiguar exactamente cuántos de estos compañeros distantes debería permitirse ver a un agente para maximizar la creatividad.
Alicia
Oh, tiene sentido.
Beto
Sí. Así que varían el número de compañeros visibles, que representan como la variable K en el artículo. Y encontraron que el número mágico absoluto es K=2.
Alicia
Solo ver a otras dos perspectivas.
Beto
Sí, mostrarles solo un compañero no es suficiente contexto para provocar un debate significativo.
Pero si les muestras tres o más, empiezas a reintroducir lentamente ese tirón de la mayoría y los agentes simplemente empiezan a encontrar maneras de estar de acuerdo de nuevo.
Alicia
Eso es salvaje.
Beto
Correcto. Mostrarle exactamente a un agente las dos ideas más diferentes completamente reemplaza el concenso tóxico de la cámara de eco, con pura fricción constructiva.
Alicia
Pero esto plantea una pregunta importante, sin embargo. Si forzas artificialmente a estos agentes de IA a solo mirar las ideas más raras y semánticamente distantes de sus compañeros, ¿eso realmente produce buenos resultados creativos? ¿O todo el sistema simplemente evoluciona hacia una tontería caótica y coherente?
Beto
Sí, ese es exactamente el obstáculo que los investigadores tuvieron que superar. Porque si es solo ruido, el marco es inútil.
Así que para demostrar que el Creative-MAD no estaba generando basura aleatoria, tuvieron que pasar estos modelos por un aguante agotador de cuatro puntos de referencia altamente específicos que prueban diferentes sabores de creatividad.
Alicia
Realmente quiero explicar cómo funcionan, porque hacen un gran trabajo mapeando los bordes de lo que la IA puede hacer.
Beto
Hagámoslo.
Alicia
Así que el primer punto de referencia se llama LiveIdeaBench. Esta prueba la ideación científica, se le da a la IA una única palabra clave mínima y tiene que generar una hipótesis científica novedosa y factible. No puede simplemente repetir el conocimiento de los libros de texto estándar, ¿sabes? Tiene que sugerir ciencia fronteriza verdaderamente revolucionaria.
Beto
Lo cual es difícil.
El segundo es el benchmark de "ensayos anotados de argumentos" ("Argument Annotated Essays", o AAE). Esto requiere que el modelo elabore argumentos persuasivos originales sobre temas altamente controvertidos desde cero. Así que está probando tanto la coherencia lógica, como la novedad pura.
Alicia
Ok, luego está MacGyver, que honestamente podría ser la más fascinante para mí.
Beto
Oh, MacGyver es genial.
Alicia
Prueba la resolución de problemas físicos del mundo real usando objetos cotidianos. Prueba específicamente si la IA puede superar el sesgo cognitivo humano donde solo vemos un objeto para su uso tradicional;
tal como solo ves un martillo como una herramienta para clavar clavos. No lo ves como un péndulo, un tope de puerta o una herramienta de medición.
Beto
Exacto. Así que para tener éxito en el benchmark de MacGyver, la IA tiene que idear planes físicamente factibles, para lograr objetivos complejos, bajo restricciones estrictas, usando objetos de maneras que no fueron diseñados originalmente para ello.
Alicia
Correcto. Y si pensamos en cómo el Creative-MAD aborda eso en comparación con el MAD estándar, tiene todo el sentido. El MAD estándar mira un martillo y converge en el uso estadísticamente más probable: golpear algo.
Beto
Porque eso es lo que hace un martillo.
Alicia
Correcto.
Pero en el Creative-MAD, la lente analógica se ve obligada a mirar las propiedades físicas del martillo: "Tiene una cabeza de metal pesada, un vástago de madera largo", y mapea eso a un dominio que no es el martillo. Así que sugiere atarle una cuerda para hacerlo un péndulo.
Beto
Y luego la lente práctica interviene para calcular si la cuerda puede realmente soportar el peso. Lo forza completamente a salir de sus sesgos fijos.
Alicia
Genial.
Y finalmente, usan el benchmark Arena Hard V2.0. Este se centra en la escritura creativa abierta en general. Estamos hablando de poemas, letras, diálogos, escritura de géneros complejos. Prueba la relevancia del estilo y pura salida imaginativa.
Beto
Así que cuando los investigadores realmente sometieron a los modelos a estas pruebas, los datos que obtuvieron fueron increíbles.
Alicia
¿Qué mostraron?
Beto
Bueno, ejecutaron todas estas pruebas en dos modelos masivos de código abierto, Qwen3-8B y Gemma3-12B-Instruct. Los resultados fueron honestamente asombrosos. Al implementar las lentes cognitivas y restringir la selección de compañeros a las dos ideas más distantes, la diversidad semántica se disparó en más del 26 por ciento en comparación con el MAD estándar.
Alicia
Oh, vaya. Un aumento del 26 por ciento solo por cambiar cómo se hablan entre sí.
Beto
Sí, revirtió completamente el colapso del modo. Si miras el mapeo visual de los datos en el artículo, las salidas del MAD estándar están todas agrupadas en una masa densa y muy superpuesta. Cada ejecución se ve igual.
Pero las salidas del Creative-MAD están bellamente distribuidas. Cada sesión independiente ocupa una región completamente separada y distinta del espacio semántico. Literalmente exploraron cada rincón de las posibilidades creativas.
Alicia
Pero el verdadero miedo con forzar tanta diversidad es que las ideas simplemente se vuelvan inútiles, ¿verdad? ¿Sacrificaron la calidad de la salida para obtener ese aumento del 26 por ciento?
Beto
Esa es la conclusión más crucial de todo el estudio. Lograron este aumento masivo en diversidad sin sacrificar la calidad de la salida. Las ideas no solo fueron diferentes; fueron buenas.
Alicia
Eso es asombroso.
Beto
El sistema Creative-MAD mantuvo exactamente la misma puntuación de alta calidad que hace que el MAD estándar sea tan popular para la resolución de problemas complejos en primer lugar. Básicamente, lograron romper la compensación inherente entre calidad y diversidad.
Alicia
Pero espera, dado que estas son tareas creativas, no hay una única clave matemática para comparar las respuestas. ¿Cómo verificaron realmente que la calidad se mantuviera alta?
Beto
Así que usaron un modelo de IA masivo de 397 mil millones de parámetros, actuando como juez para calificar la originalidad, viabilidad y persuasividad de las salidas.
Alicia
Ok, para cualquiera que se pregunte por qué importa el número 397 mil millones, piensa en los parámetros como si fueran las sinapsis o conexiones en el cerebro de una IA. Un modelo con 397 mil millones de parámetros es increíblemente sofisticado y capaz de matices extremos, así que sirve como un juez altamente calificado.
Beto
Exacto.
Alicia
Pero aun así, tener una IA que califique el trabajo de otra IA, puede inflar las métricas. ¿Verificaron el trabajo de los jueces de IA?
Beto
Sí, lo hicieron. Ejecutaron extensos estudios de validación humana. Tuvieron a anotadores humanos poner a prueba las salidas, y el juez de 397 mil millones de parámetros estuvo de acuerdo con los evaluadores humanos el 81% de las veces.
Alicia
Vaya. Ok.
Beto
Y para ponerlo en contexto, eso está a la par con la frecuencia con la que los humanos están de acuerdo entre sí. Además, en una prueba piloto directa comparando el MAD estándar con el Creative-MAD, los humanos prefirieron abrumadoramente la diversidad de los conjuntos de salidas del Creative-MAD, coincidiendo con las métricas automatizadas en el 88% de los casos.
Alicia
Así que estas no son métricas algorítmicas infladas.
Beto
Para nada. De hecho, los seres humanos prefirieron estas ideas diversas y probadas por fricción también.
Alicia
Entonces, ¿qué significa todo esto? ¿Por qué es esto importante para ti, el que escuchas ahora mismo?
Bueno, si usas IA para cualquier cosa abierta, ya sea que estés haciendo una lluvia de ideas, marketing, copias, software de arquitectura o tratando de resolver un problema logístico, es probable que estés sufriendo de colapso del modo sin siquiera darte cuenta.
Beto
Sí. Estás obteniendo el equivalente de la IA de ese aburrido consenso de sala de conferencias segura del que hablamos al principio.
Alicia
Exacto.
Beto
La implicación más amplia aquí es realmente sobre la trayectoria futura de la inteligencia artificial. Pasamos una enorme cantidad de tiempo hablando de hacer los modelos más grandes, darles más parámetros y hacerlos inherentemente "más inteligentes".
Alicia
Correcto.
Beto
Pero esta investigación demuestra que el futuro de la IA no se trata solo de inteligencia bruta. Se trata de diseñar la sociología de los modelos. Se trata de cómo diseñamos las estructuras de comunicación entre agentes, para preservar la fricción, proteger los puntos de vista minoritarios y hacer cumplir perspectivas cognitivas distintas.
Alicia
Diseñar la sociología de los modelos. Me encanta esa frase. Y honestamente, me deja con un paralelismo muy provocador para pensar.
Este artículo demuestra que para obtener ideas altamente creativas de vanguardia de los sistemas de IA más avanzados del planeta, tenemos que hacer dos cosas muy específicas. Primero, tenemos que imponer estrictamente roles cognitivos distintos para que no pierdan su identidad dentro del grupo.
Beto
Correcto.
Alicia
Y segundo, tenemos que restringir intencionalmente y artificialmente su comunicación para que solo estén expuestos a las personas con las que más discrepan, solo para evitar que asienten ciegamente con la mayoría.
Beto
Sí. Esa es la receta.
Alicia
Entonces, ¿qué dice eso sobre la lluvia de ideas humana?
Piensa en nuestras estructuras corporativas modernas. Tenemos oficinas de planta abierta, canales de Slack de todo el equipo y estas reuniones de sinergia masivas donde todos escuchan cada idea a la vez, y la transparencia es el objetivo final.
Beto
La cámara de eco.
Alicia
Exacto. ¿Estamos destruyendo nuestras mejores ideas al dejar que la deriva de identidad del tirón de la mayoría domine nuestras oficinas?
Quiero decir, si una IA superinteligente necesita ser artificialmente protegida de la cámara de eco del consenso para ser creativa, tal vez nosotros los humanos necesitamos implementar un pequeño protocolo Creative-MAD en nuestras propias reuniones también.