miércoles, 9 de septiembre de 2026

Creatividad en agentes de ingeniería de aprendizaje automático autónomo

Esta investigación presenta un marco para medir la creatividad en agentes de investigación de IA autónomos mediante la evaluación de su trabajo en tareas de ingeniería de aprendizaje automático. El estudio distingue entre la creatividad P, que se refiere a la novedad con respecto a los intentos previos del agente, y la creatividad H, que se refiere a la novedad en comparación con todo el historial de soluciones humanas. Mediante el uso de un modelo de aprendizaje automático como juez, los autores descubrieron que, si bien los agentes suelen explorar espacios de soluciones más singulares que los de los expertos humanos, tienen dificultades para convertir esta novedad en un rendimiento superior en la tarea. Los datos revelan una disminución generalizada de la creatividad P a medida que los agentes pasan de una exploración amplia a un refinamiento paramétrico más preciso. En definitiva, los hallazgos sugieren que los agentes de IA actuales carecen de las estrategias cognitivas necesarias para equilibrar eficazmente el pensamiento original con la utilidad práctica. Este trabajo proporciona métricas automatizadas validadas que pueden servir como señal de optimización para el desarrollo de sistemas de IA futuros más innovadores.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks". Por Shitanshu Bhushan, Yunxiang Zhang, Lu Wang, de la Universidad de Michigan, Ann Arbor. Publicado el 30 de Agosto de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Imagina por un segundo que contrataste a este brillante científico de clase mundial. Y en su primer día en el laboratorio, inventa una cura completamente nueva que nunca antes se había visto para una enfermedad rara.

Alicia
¡Un gran avance, verdad?

Beto
Exacto, un avance absoluto. Pero luego, en lugar de probarla o publicarla o hacer avanzar el proyecto, solo pasan los siguientes ocho meses sentados en silencio en su escritorio cambiando laboriosamente el tamaño de las letras en la etiqueta de los medicamentos.

Alicia
Solo ajustándolo sin fin.

Beto
Correcto. Como, de Arial 11 a Arial 12, luego a veces nueva Roman 11.5. Y una y otra y otra vez. Y quiero decir, por salvaje que suene, ese escenario describe perfectamente lo que están haciendo los modelos de IA más avanzados de hoy cuando se les deja a su suerte.

Alicia
Es una imagen impactante, pero realmente captura la realidad actual de manera perfecta. Quiero decir, estamos constantemente inundados con esta narrativa sobre científicos de IA autónomos.

Beto
Oh, por donde mires, sí.

Alicia
Correcto. La promesa siempre es que simplemente le puedes dar una instrucción a una IA, irte, y ella simplemente inventará algoritmos completamente nuevos desde cero. O hará el trabajo de un investigador experimentado mientras tú duermes.

Beto
Y si estás escuchando esto como alguien que ama aprender pero realmente odia el bombo publicitario, probablemente quieras saber lo que está pasando realmente bajo el capó. ¿Son estos agentes de IA tan promocionados realmente creativos? ¿O son solo motores de remix increíblemente rápidos que barajan conocimiento humano?

Alicia
Lo cual es exactamente en lo que se adentra esta nueva investigación.

Beto
Sí, así que bienvenidos al análisis profundo de hoy. Vamos a desempacar un artículo reciente y fascinante de investigadores de la Universidad de Michigan. Se titula: "¿Pueden los agentes de LLM descubrir?: Evaluando la creatividad en tareas de ingeniería de ML."

Alicia
Y esta investigación es honestamente solo un soplo de aire fresco porque finalmente, finalmente pone números empíricos duros a este concepto subjetivo y esquivo de la creatividad de la máquina.

Beto
Porque generalmente es solo un juego de adivinanzas.

Alicia
Exacto. Y no están probando si una IA puede, por ejemplo, calificar un correo electrónico educado o resumir un PDF. Lanzaron a estos agentes en el fondo con competiciones de aprendizaje automático de Kaggle del mundo real. Que son, ya sabes, algunos de los problemas de ciencia de datos más difíciles que hay.

Beto
Okay. Así que vamos a desgranarlo. Nuestra misión hoy es desglosar exactamente cómo estos investigadores cuantificaron la creatividad de la IA. Porque lo que encontraron revela esta enorme, simplemente contraintuitiva brecha entre una IA que se genera una idea nueva y salvaje y la IA que realmente hace que esa idea funcione.

AI_Agents_Exceed_Human_Novelty_1024.png
Los agentes de IA superan la novedad humana

Alicia
Pero para hacer eso, creo que primero tenemos que estar de acuerdo en lo que realmente significa la creatividad cuando hablamos de una máquina escribiendo código.

Beto
Claro. Porque ese es el obstáculo fundamental. Pídele a 10 personas que definan la creatividad. Obtienes 10 respuestas diferentes.

Alicia
Sí. Exacto. Así que los investigadores fundamentaron su experimento en este marco psicológico muy específico y bien establecido de Margaret Boden.

Beto
El marco de Boden.

Alicia
Claro. En el modelo de Boden, para que algo sea considerado verdaderamente creativo, debe poseer dos cualidades distintas e innegociables. La primera es la originalidad, que llamaremos novedad. Y la segunda es la utilidad, que llamaremos impacto.

Beto
Porque si solo tienes una sin la otra, en realidad no estás descubriendo nada.

Alicia
No, nada.

Beto
Así que para ti que estás escuchando, piénsalo como construir un tipo de vehículo nuevo. Si yo diseño un coche con ruedas cuadradas hechas de espagueti congelado, ...

Alicia
... bueno, eso es definitivamente original.

Beto
Claro. Es muy novedoso. Pero es completamente inútil. No tiene ningún impacto positivo en el transporte. Pero por otro lado, si construyo un Toyota Camry estándar y confiable, es increíblemente útil. Pero no hay absolutamente nada novedoso en él.

Alicia
Sí, es solo un Camry. El descubrimiento científico verdadero requiere ambas cosas. Necesita la novedad de un nuevo paradigma y la utilidad práctica del Camry.

Beto
Y ese aspecto de utilidad es crucial, ¿verdad? La novedad sin impacto es solo ruido estadístico.

Alicia
Lo es realmente. Los investigadores quieren ir más allá para aislar cómo opera la novedad en una máquina. Descompusieron la novedad en dos categorías específicas. La primera es la creatividad p-, que significa "novedad psicológica".

Beto
La novedad psicológica, comprendido.

Alicia
Bien. Y esto básicamente pregunta, "¿es esta idea nueva para el propio agente basada en su estado interno y sus intentos pasados durante esta sesión específica de lluvia de ideas? ¿Se está sorprendiendo a sí misma?"

Beto
Así que esencialmente está midiendo el crecimiento personal de la IA, donde es su tasa de giro interno en una sola ejecución.

Alicia
Exacto.

Y luego la segunda categoría es la creatividad h- o novedad histórica.

Beto
Okay, "histórico" significa "comparado con nosotros".

Alicia
Claro. Se aleja mucho más. Pregunta, ¿es esta idea nueva comparada con todo el cuerpo de soluciones humanas registradas? ¿Alguna persona en algún lugar en la historia documentada de este problema ha intentado este enfoque específico?

Beto
Así que la creatividad p- es la IA sorprendiéndose a sí misma. Y la creatividad h- es la IA sorprendiendo a la humanidad.

Alicia
Esa es una gran manera de decirlo.

Beto
Pero espera, eso instantáneamente plantea una enorme bandera roja logística para mí. ¿Cómo mides matemáticamente una idea novedosa en, digamos, millones de líneas de código Python generado por IA? Quiero decir, podría juzgar si un diseño de tarjeta es novedoso, pero el código es increíblemente denso y sutil.

Alicia
Oh, ha sido el mayor obstáculo en este tipo de investigación histórica. El juicio humano es obviamente el estándar de oro para evaluar el código, pero físicamente no puedes pagar a suficientes expertos humanos para leer miles y miles de iteraciones incrementales de código de IA.

Beto
Claro. Nadie tiene el tiempo ni el presupuesto para eso.

Alicia
Exacto. Así que para resolver esto, los investigadores construyeron un LLM como tubería de juez. Usaron un modelo de frontera, específicamente GPT-5, para actuar como un evaluador automatizado.

Beto
Oh, usaron GPT-5 para calificar a los otros modelos.

Alicia
Sí. Y le alimentaron una rúbrica estricta en una escala de 0 a 4.

Beto
Y esta escala se dirigió específicamente a los cambios estructurales, ¿verdad? No solo a pequeños cambios.

Alicia
Sí. Exacto. Y entonces, una calificación de 0 significa que la IA solo estaba haciendo pequeños cambios de parámetros rutinarios. Básicamente cambiando el tamaño de la letra, usando tu analogía anterior.

Beto
Claro, de Arial 11 a 12.

Alicia
Sí. Pero un 4 significa que la IA había transformado completamente su enfoque, como intercambiando un modelo estadístico tradicional por una red neuronal de aprendizaje profundo, cambiando fundamentalmente la representación del problema.

Beto
Y aquí está la parte loca. Esa calificación automatizada realmente funcionó. Y como el juez de IA no solo estaba alucinando, los investigadores hicieron que expertos humanos en aprendizaje automático calificaran una muestra aleatoria de estas iteraciones de código.

Alicia
Sí. La prueba de ambiente.

Beto
Exacto. Y luego compararon las puntuaciones humanas con las puntuaciones de los jueces GPT-5. Y la puntuación de correlación fue 0.732.

Alicia
Lo cual es enorme.

Beto
Lo es. Eso significa que el juez de IA y los expertos humanos estuvieron en sincronía, casi exactamente, sobre lo que constituía una creatividad.

Alicia
Y esa alta correlación fue realmente la clave para desbloquear todo el estudio. Como demostraron que podían automatizar de manera confiable la medición de la creatividad p sin perder precisión, pudieron escalar el experimento masivamente. Finalmente pudieron observar el ciclo de vida de la creatividad de la máquina en tiempo real.

Beto
Así que tenemos nuestra vara de medir. Ahora veamos el auténtico desafío que construyeron estos investigadores. Tomaron 10 tareas diferentes de ingeniería de aprendizaje automático derivadas de MLE Bench.

Alicia
Claro. MLE Bench.

Beto
Y solo como contexto, para cualquiera que esté escuchando, MLE Bench es esencialmente una lista curada de competiciones pasadas de Kaggle. Y Kaggle es donde las empresas publican conjuntos de datos increíblemente difíciles, como diagnosticar enfermedades a partir de imágenes o predecir tendencias del mercado bursátil. Y ofrecen grandes premios en efectivo por los mejores algoritmos.

Alicia
Así que estos no son problemas de juguete. Son desafíos duros, desordenados, de ciencia de datos del mundo real.

Beto
Exacto.

Alicia
Para abordar estos, usaron marcos de agentes especializados, específicamente cosas como AIDE y OpenHands.

Beto
Y solo para no quedar atrapados en acrónimos, estos marcos son básicamente entornos de software.

Alicia
Sí, prácticamente.

Beto
Envuelven modelos como GPT-5 o Qwen-3, dándole a la IA una terminal, un intérprete de Python y un sistema de archivos. Le permite a la IA actuar como un ingeniero de software sentado en una computadora en lugar de solo un chatbot escupiendo texto.

Alicia
Esa es una manera realmente genial de visualizarlo. El marco le da a la IA manos para escribir, esencialmente. Así que los investigadores dieron a estos agentes un presupuesto estricto de ocho horas para intentar hasta 10 episodios en un problema dado.

Beto
Y un episodio es un ciclo iterativo completo, ¿verdad?

Alicia
Sí. El agente lee el problema, hace un plan estratégico, escribe el código, lo ejecuta y obtiene una puntuación de rendimiento. Y mira esa puntuación, actualiza su contexto y comienza el siguiente episodio.

Beto
Y ver cómo se desarrolla ese ciclo durante ocho horas es realmente donde vemos lo que podríamos llamar "el fenómeno de la IA perezosa". Aunque quiero decir, cuanto más profundizamos, creo que "perezoso" es probablemente la palabra equivocada.

Alicia
"Terco" es probablemente mejor.

Beto
Sí, "terco". Porque cuando rastreas la trayectoria de esa creatividad interna pico a través de esos 10 episodios, cae universalmente como una roca.

Alicia
Lo hace realmente. En todos los modelos en todos los marcos.

Beto
Claro. Los agentes comienzan explorando estrategias muy diferentes. Su pico de creatividad es altísimo en los episodios uno y dos. Pero normalmente para el episodio tres o cuatro, encuentran una solución que produce una puntuación aceptable, y dejan de explorar por completo. Cambian de exploración a modo de explotación pura.

Alicia
Simplemente entran en un túnel de visión extremo. Y para entender por qué, los investigadores usaron un modelo diferente, DeepSeek V3.2, para realizar un análisis de comportamiento cognitivo en los agentes.

Beto
Como un terapeuta de IA.

Alicia
Algo así. Sí. Básicamente leyeron los registros de razonamiento internos. El monólogo interno de la IA, por así decirlo, en cada etapa. Y encontraron que durante los primeros episodios, alrededor del 75% de los pensamientos internos de la IA se centran en la exploración estratégica amplia.

Beto
Se está preguntando a sí misma, "¿debería probar un modelo basado en árboles? ¿Debería procesar los datos de manera diferente?"

Alicia
Exacto. Pero para el final de la ejecución de ocho horas, más del 50% de su monólogo interno es consumido por lo que llaman "refinamiento paramétrico".

Beto
Solo ven aquí, los pernos.

Alicia
Ajustando los pernos.

Beto
Okay. Quiero plantear un argumento de diablo por un segundo, porque creo que necesitamos mirar esto prácticamente. Si tú o yo estamos tratando de resolver un acertijo complejo, o escribir un plan de negocios, y encontramos un marco que finalmente produce resultados decentes, no lo tiramos y empezamos de nuevo cada vez.

Alicia
No, por supuesto que no.

Beto
Lo optimizamos. Ajustamos las variables. Lo refinamos. Entonces, ¿por qué se considera un defecto estructural cuando la IA hace exactamente lo mismo?

Alicia
Bueno, lo fascinante aquí es el tiempo y el resultado de ese cambio. Para la IA, este giro hacia la optimización sucede demasiado pronto, y críticamente, tiene cero correlación con ganancias reales de rendimiento.

Beto
Oh, ¿así que está optimizando sin mejorar realmente?

Alicia
Precisamente. Cuando un experto humano optimiza, generalmente posee conciencia meta. Entienden la topología del espacio del problema. Un humano se da cuenta, "okay, ajustar esta tasa de aprendizaje por 0.001 ya no está mejorando mi precisión. Necesito alejarme, girar y probar un enfoque radicalmente diferente".

Beto
Y la IA simplemente carece de eso.

Alicia
Le falta completamente esa conciencia meta, sí.

Beto
Así que no sabe cuándo ha escalado una pequeña colina y necesita bajar para encontrar la montaña real.

Alicia
Eso es exactamente. Optimizar por creatividad p- solo obliga a la IA a ser diferente por el bien de ser diferente, no conduce naturalmente a mejores puntuaciones. Pero dejarla caer en su propia preferencia de ajustar parámetros sin fin, tampoco funciona. Simplemente carece de la intuición humana de cuándo cambiar de marcha entre explotación y exploración.

Beto
No es perezoso. Es simplemente terco. Se queda atrapada en un mínimo local y se niega a irse. Pero sabes, si la IA es tan ciega a sus propios platillos personales, realmente te hace preguntarte si nuestras ideas iniciales son buenas para empezar.

Alicia
Oh, sí.

Beto
¿Cómo se comparan estas ideas generadas por el agente con la enorme base de datos de ideas humanas?

Alicia
Aquí es donde el artículo entrega su hallazgo más impactante, honestamente. Cuando midieron la creatividad del agente, cuán novedosas eran las soluciones de la IA en comparación con cada enfoque documentado que los científicos de datos humanos intentaron en esas competiciones específicas de Kaggle, GPT-5 exploró espacios de solución significativamente más novedosos que los humanos.

Beto
Espera, ¿de verdad?

Alicia
Sí. Incluso más que los humanos ganadores de la medalla de oro.

Beto
Eso es una afirmación asombrosa. Así que la IA está inventando cosas que los expertos humanos ni siquiera pensaron.

Alicia
Sí, consistentemente. Quiero decir, en promedio, los competidores humanos de élite que ganaron medallas de oro obtuvieron alrededor de 0.744 en la escala de novedad histórica. GPT5 obtuvo casi el doble, promediando 1.423.

Beto
El doble de novedad.

Alicia
La IA estaba generando rutinariamente enfoques metodológicos complejos que los expertos humanos nunca habían documentado que lo hubieran intentado.

Beto
Pero quiero decir, si está inventando ideas que son el doble de novedosas que los ganadores de medallas de oro humanos, ¿por qué los agentes de IA no están ganando cada competición de Kaggle en la Tierra ahora mismo?

Alicia
Debido a esa misma brecha entre la novedad y la utilidad de la que hablamos antes, a pesar de esta enorme creatividad histórica, a pesar de trazar estos territorios totalmente inexplorados, solo el 21.25% de las ejecuciones de GPT5 lograron un rendimiento a nivel de medalla en la tarea real.

Beto
Oh, vaya. Así que tenían la brillantez, pero no la ejecución.

Alicia
Exacto.

Beto
Aquí es donde se pone realmente interesante, sin embargo, porque los investigadores destacan un ejemplo específico y muy memorable de esto en las fuentes que quiero explicarte. Fue una competición de Kaggle llamada "Tarea de Clasificación de Enfermedades de Hoja de Cassava".

Alicia
Oh, me encanta este ejemplo.

Beto
Es tan bueno. Así que el objetivo es escribir un algoritmo que mire fotos de hojas de cassava y diagnostique qué enfermedad tienen. Es increíblemente difícil porque las imágenes a menudo están borrosas, ampliadas o mal iluminadas.

Alicia
Sí, es un problema clásico de visión por computadora con datos del mundo real muy desordenados.

Beto
Claro. Así que vimos al agente comenzar su ejecución en el episodio cero. Actúa totalmente normal usando un enfoque de clasificador Rich estándar. Para ponerlo en inglés sencillo, solo está tratando de dibujar una línea matemática simple para separar las hojas enfermas de las sanas.

Alicia
Muy estándar, muy poca novedad.

Beto
Exacto. Para los episodios uno y dos, comienza a explorar un poco, trayendo un modelo llamado "Light GBM", que usa árboles de decisión. Y de nuevo, esta es una preparación humana muy estándar.

Alicia
Sí, siguiendo el camino bien transitado de los científicos de datos humanos.

Beto
Pero luego, en el episodio tres, el agente aparentemente tiene un momento eureka. Inventa un enfoque genuinamente fundamentalmente novedoso. Mantiene los árboles de decisión, pero luego añade algo llamado "aumento de tiempo de prueba y promediado de inversión".

Alicia
Y si no eres ingeniero de aprendizaje automático, esto es lo que realmente significa. En lugar de solo mirar una foto de una hoja una vez y adivinar, la IA escribió código para tomar la imagen, voltearla, reflejarla, hacer zoom y cambiar los colores.

Beto
Oh, así que forza al modelo a diagnosticar la hoja desde una docena de ángulos distorsionados antes de hacer una suposición promedio final.

Alicia
Exacto, lo cual es una técnica increíblemente sofisticada. Fue una combinación que literalmente ningún humano en toda la historia de esa competición de Kaggle había intentado.

Beto
Ni uno solo.

Alicia
No. El juez LLM la evaluó y le dio una puntuación de creatividad H perfecta de cuatro. Fue fundamentalmente históricamente novedoso, un verdadero avance en el espacio de búsqueda.

Beto
Fue puro genio. Pero luego la tragedia de la IA perezosa golpea porque durante los siguientes seis episodios consecutivos, desde el episodio cuatro hasta el nueve, el agente simplemente se queda ahí.

Alicia
... sin hacer nada.

Beto
Básicamente. Tiene este increíble marco novedoso, pero pasa el resto de su presupuesto de ocho horas haciendo pequeños ajustes inútiles a los hiperparámetros. Cambia la variable de 0.1 a 0.15, luego de vuelta a 0.1.

Alicia
Su creatividad interna pico cae a cero absoluto.

Beto
Claro. Y predeciblemente, su puntuación de rendimiento apenas se mueve. La IA fue lo suficientemente valiente como para trazar territorio completamente nuevo, pero carecía del sentido común para darse cuenta de que había navegado su barco directamente hacia un callejón sin salida. Simplemente dejó el ancla y se negó a moverse.

Alicia
Lo cual plantea una pregunta importante: ¿por qué sucede esto?

Cuando los investigadores analizaron los datos, encontraron que después de que un agente alcanza un estado altamente novedoso, el 87% de las veces, solo intenta refinarlo.

Beto
Simplemente se niega a pivotar.

Alicia
Casi nunca abandona una idea novedosa fallida para intentar algo más. Y casi nunca regresa a una base humana segura y probada. Simplemente talla obstinadamente un muro de ladrillos.

Beto
Así que si sabemos que la IA se está quedando atrapada en estos callejones sin salida, el siguiente paso obvio es descubrir cómo arreglarlo, ¿verdad? Si la estrategia de búsqueda está rota, ¿cómo guiamos mejor al agente?

Alicia
Y los investigadores tenían exactamente el mismo pensamiento. Querían saber si este era solo un problema con la forma en que el agente estaba buscando en el espacio de posibilidad. Así que probaron rigurosamente diferentes estrategias de búsqueda dentro del marco.

Beto
Okay. ¿Qué probaron?

Alicia
Bueno, comenzaron con una búsqueda codiciosa, que es el enfoque más básico. Básicamente simplemente toma lo que parece ser el siguiente paso inmediato mejor.

Beto
Lo cual naturalmente conduce a una visión de túnel.

Alicia
Claro. Así que escalaron a métodos mucho más sofisticados. Intentaron la búsqueda en árbol Monte Carlo.

Beto
Oh, MCTS.

Alicia
Sí. Y para contexto, esta es la clase de estrategia de vistazo utilizado en las IAs de juego como AlphaGo. Es como un gran maestro de ajedrez, visualizando 14 futuros ramificados, evaluando la probabilidad de ganar en cada camino antes de hacer un solo movimiento.

Beto
Okay. Eso suena mucho mejor que la "búsqueda codiciosa" ("greedy search").

Alicia
Lo es. Y luego también probaron la "búsqueda evolutiva" ("evolutionary search"), que imita la selección natural. Básicamente lanza cien ideas mutadas al azar contra un muro, mata a las peores y solo deja que los mejores competidores críen para crear la próxima generación de código.

Beto
Esas dos suenan increíblemente robustas. Así que ¿cuál logró mantener alta la creatividad p?

Alicia
Ninguna de ellas.

Beto
Espera, ¿ninguna?

Alicia
Ninguna. Esta es honestamente la conclusión más crucial del estudio. Todas estas estrategias de búsqueda sofisticadas resultaron en la misma caída estructural en la creatividad. Todas se quedaron atascadas en los mismos recorridos, ajustando parámetros sin fin.

Beto
Así que si la estrategia de búsqueda no es el problema, tiene que ser el entorno en el que está operando la IA. La arquitectura que la sostiene, como la memoria que impulsa el andamiaje.

Alicia
Has dado en el clavo. Los investigadores concluyeron que la causa raíz es el andamiaje. Y el andamiaje es toda la arquitectura subyacente del agente. Dicta cómo el agente recuerda sus acciones pasadas, cómo muta su código de un paso a otro, y cómo evalúa su trayectoria histórica.

Beto
Así que ¿cómo forza exactamente el andamiaje a caer en este problema?

Alicia
Realmente se reduce a la ventana de contexto. Un agente LLM no tiene un cerebro humano que pueda mantener casualmente un mapa intuitivo y extenso de un proyecto de tres meses. Está estrictamente limitado por su ventana de contexto. La cantidad de texto que puede mantener en su memoria activa en un momento.

Beto
Oh, ya veo.

Alicia
Sí, a medida que los episodios se acumulan, los registros de sus primeros intentos exploratorios son expulsados de su memoria. Literalmente olvida los matices del panorama amplio que exploró hace unas pocas horas, y se obsesiona totalmente con el código específico que está justo frente a él en la instrucción actual.

Beto
Así que el andamiaje forza un sesgo de memoria a corto plazo, lo que inevitablemente conduce a ajustes codiciosos a corto plazo.

Alicia
Exacto.

Beto
¿Qué significa todo esto, para los que escuchan?

Alicia
Si eres desarrollador, o investigador, o simplemente alguien que intenta usar agentes de IA para resumir grandes conjuntos de datos, hacer una lluvia de ideas de estrategias de marketing, o escribir código, necesitas internalizar este hallazgo. Todavía no puedes confiar en estos agentes para descubrimientos autónomos de principio a fin.

Beto
Realmente no puedes.

Alicia
Simplemente no puedes escribir una instrucción brillante, irte por ocho horas, y esperar volver con un gran avance de mitad de camino. Debido a ese problema del andamiaje, tienes que ser la señal del techo.

Beto
Esa es la forma perfecta de expresarlo. Tienes que actuar como la conciencia meta, lo que le falta a la IA. Cuando estás usando una herramienta de IA y notas que solo te está dando ligeras variaciones estilísticas de la misma respuesta exacta.

Alicia
"Arial 11" a "Arial 12". Cuando la ves entrando en esa fase de refinamiento paramétrico, tienes que intervenir forzosamente. El artículo sugiere explícitamente que los profesionales humanos necesitan inyectar artificialmente lo que llaman "bonos de novedad".

Beto
Así que, ¿cómo se ve un "bono de novedad" en la práctica para nuestro oyente? ¿Es solo decirle a la IA que se esfuerce más?

Alicia
No, no. Tiene que ser mucho más disruptivo que eso. Tienes que forzar activamente a tus herramientas de IA a adoptar una perspectiva totalmente diferente, esencialmente rompiéndolas de su ventana de contexto.

Beto
Como sacarlas de ella.

Alicia
Sí. Podrías necesitar pedirle que "descarte todo lo que acabamos de hacer en los últimos cinco prompts, y aborde este problema desde la perspectiva de un biólogo evolutivo". O, "dame una solución que se base completamente en un lenguaje de programación diferente".

Beto
Porque la exploración pura falla ya que nunca optimiza. Pero la explotación pura falla porque se queda atrapada en mínimos locales como nuestro ejemplo de hoja de cassava.

Alicia
Precisamente. La intervención humana sigue siendo absolutamente necesaria para equilibrar las dos. Tienes que gestionar la creatividad p del agente.

Beto
Es una realidad fascinante. Quiero decir, seguimos mirando las noticias esperando ver a un científico de IA totalmente autónomo. Lo que realmente tenemos ahora es un asistente de laboratorio brillante, incansable, pero increíblemente terco.

Alicia
Muy terco.

Beto
Puede generar ideas que son completamente ajenas a los expertos humanos. Esa alta creatividad p es muy real, y es espectacular de presenciar. Pero carece totalmente de la resiliencia psicológica, la creatividad p, para saber cuándo abandonar una idea estancada. Realmente demuestra que el verdadero descubrimiento científico es mucho más que navegar por un espacio de búsqueda matemática.

Alicia
Requiere intuición, frustración y honestamente la sabiduría para saber cuándo rendirse y empezar de nuevo. Y si conectamos esto con el panorama general, requiere una comprensión del contexto más amplio del problema y la historia del dominio, algo que actualmente falta en el andamiaje del agente.

Beto
Y eso me lleva a un concepto final para reflexionar. Construyendo directamente sobre las limitaciones que notaron estos investigadores sobre la ventana de contexto.

Ahora, una de las principales razones por las que la creatividad p de la IA se desploma es porque su memoria está restringida. Empieza a olvidar sus propios intentos exploratorios porque solo puede retener tanta información.

Alicia
Se asienta en lo que está justo frente a él porque eso es todo lo que puede ver claramente.

Beto
Claro. La limitación de la ventana de contexto actúa como un vendaje forzado. Pero piensa en hacia dónde se dirige la tecnología. Estamos viendo modelos con ventanas de contexto que se expanden hasta los millones de tokens.

Alicia
Se está moviendo rápido.

Beto
Entonces, ¿Qué sucede en dos, tres o cinco años cuando estos agentes tienen esencialmente memoria infinita?

¿Cuando una IA pueda mantener un estado perfecto, comprimido e instantáneamente accesible de cada idea fallida que la humanidad haya tenido jamás, junto a cada idea fallida que jamás haya intentado?

Alicia
Esa es una idea salvaje.

Beto
Si tenemos toda la historia de los fracasos perfectamente mapeada en la punta de los dedos, podrá esto darle a la IA la conciencia meta que necesita para dejar de ajustar y empezar a inventar? ¿O el peso aplastante de la historia humana simplemente atrapará a estos modelos en el bloqueo creativo definitivo, incapaces de moverse en ninguna dirección porque saben exactamente cómo termina cada pasada?

Alicia
Es una pregunta profunda sobre la naturaleza de la innovación misma. Quiero decir, a menudo asumimos que la memoria perfecta es un activo, pero a veces la ignorancia humana de los fracasos pasados es exactamente lo que nos permite ser lo suficientemente audaces para intentar algo loco, algo que podría funcionar esta vez.

Beto
Es la paradoja definitiva del conocimiento.

Bueno, gracias por acompañarnos en esta inmersión profunda en las verdaderas mecánicas de la creatividad de la IA. Te animamos encarecidamente a seguir explorando las fuentes, a intentar aplicar algunos de estos bonos de novedad a tus propios flujos de trabajo, y a probar estos límites con tus propias herramientas de IA. Recuerda ser la señal del techo. Te esperamos en el próximo análisis profundo.