Mostrando entradas con la etiqueta código. Mostrar todas las entradas
Mostrando entradas con la etiqueta código. Mostrar todas las entradas

viernes, 19 de junio de 2026

Inteligencia de código multimodal

 
 

Esta encuesta explora el floreciente campo de la inteligencia de código multimodal, donde los modelos traducen entradas visuales como capturas de pantalla, gráficos y diagramas en código ejecutable. Mientras que los sistemas tradicionales se basan en texto, estos marcos avanzados utilizan la percepción visual como requisito central para automatizar tareas en el desarrollo frontend, la visualización de datos y el diseño asistido por computadora. La investigación clasifica el panorama en cuatro dominios clave: interfaces gráficas de usuario, visualización científica, gráficos estructurados y tareas fronterizas como la robótica y la generación de videos. Al establecer una taxonomía formal, los autores distinguen entre las diversas funciones del código como artefacto renderizado, estructura editable o política ejecutable. Un hallazgo principal es que, si bien la similitud visual es una métrica común, el verdadero progreso requiere métodos centrados en la verificación que prueben la interacción funcional y la corrección semántica. En última instancia, las fuentes abogan por un cambio hacia sistemas basados en evidencia que puedan validar el código de manera confiable a través de la ejecución de múltiples señales y múltiples estados.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence", por Xuanle Zhao y colegas. Publicado el 16 de Junio de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Imaginen tomar una foto de una encimera desordenada, y entregar esa foto a una IA, para que instantáneamente escriba el código, para operar un brazo robótico, que simplemente limpie la superficie.

Alicia
Correcto, sin ningún tipo de entrada de texto.

Beto
Exacto. Sin manuales, sin teclear, solo ver un espacio físico y hacer algo al respecto. Eso no es ciencia ficción, por cierto. Es la vanguardia de la programación en este momento.

Alicia
De verdad lo es.

Beto
Porque probablemente estén acostumbrados a tener una ventana abierta, hablar con un chatbot de IA y escribir una rápida indicación de texto para arreglar un error, o escribir un simple script de Python.

Alicia
Y eso ya se siente como magia para mucha gente.

Beto
Lo hace totalmente. Pero intenten pedirle a ese mismo modelo de texto espacial que construya un panel de control complejo de múltiples capas, o que intente recrear perfectamente un gráfico científico denso y fuertemente anotado, solo describiéndolo con palabras.

Alicia
Oh, se desmorona casi de inmediato.

Beto
Correcto. Escribir todos los requisitos espaciales, todas las reglas de diseño, las sombras. Es como intentar pintar una obra maestra usando solo una máquina de escribir.

Alicia
Sí, hemos pasado la última década tratando el texto como la interfaz definitiva para la IA. Pero el texto, si bien es fantástico para la lógica abstracta, es una banda de baja capacidad, dolorosamente baja para describir la realidad espacial visual.

Beto
Lo que nos lleva a nuestra pila de fuentes para esta inmersión profunda de hoy. Estamos viendo una masiva encuesta de investigación de 2026 titulada "Más allá del NL2Code, una encuesta estructurada sobre la inteligencia de código multimodal".

Alicia
Y la autoría de esto es increíble. Es una coalición global de investigadores de potentes instituciones, lugares como la Universidad de Tsinghua, Stanford, Apple y la Universidad de Hong Kong.

Beto
Un grupo realmente contundente. Y nuestra misión hoy es explorar cómo la IA está cerrando lo que llaman "una brecha de modalidad". Es decir, pasar de solo leer indicaciones de texto a modelos que pueden ver imágenes, gráficos, entornos.

Alicia
Y luego traducir esas entradas visuales directamente a código ejecutable.

Beto
Sí.

Multimodal_Code_Intelligence_Landscape_1024.png
El Panorama de Inteligencia de Código Multimodal

Beto
Bien, desglosemos esto.

¿Por qué está el lenguaje tradicional a código, golpeando un muro en el mundo real?

Alicia
Bueno, para entender el muro, tenemos que mirar la arquitectura de cómo estos modelos más antiguos procesan la información. Durante años, el enfoque ha estado estrictamente en alinear la intención lingüística con la sintaxis formal.

Beto
Así que escribes algo como, "escriba una función para calcular la secuencia de Fibonacci".

Alicia
Exacto. Y el modelo mapea la secuencia de tus palabras, tus tokens de texto, a la lógica de un lenguaje de programación. Y eso funciona maravillosamente para el procesamiento de datos de "backend".

Beto
Correcto.

Alicia
Pero la programación moderna no se trata solo de lógica abstracta. Requiere jerarquías espaciales, reglas de diseño estrictas, geometría compleja, ...

Beto
... lo que tiene mucho sentido. Confiar únicamente en el texto para describir la disposición precisa de una aplicación móvil moderna, es como intentar explicar cómo construir una escalera de caracol por teléfono.

Alicia
Sí, por teléfono sin dejar que los carpinteros vean un plano.

Beto
Exacto. Puedes decir que "el peldaño sube y se curva a la derecha con una inclinación de 30 grados", pero sin ver la geometría, van a construir algo completamente deformado.

Alicia
La relación estructural inherente se pierde en la traducción. Y ese es el concepto formal que los investigadores definen como "la brecha de modalidad".

Beto
La brecha de modalidad.

Alicia
Correcto. El texto es fundamentalmente secuencial y lineal. Lo lees palabra por palabra.

Las señales visuales, por otro lado, son de alta capacidad y paralelas. Una sola imagen codifica información estructural densa, relaciones espaciales, restricciones estéticas, todo a la vez.

Beto
¿Así que obtienes toda la información en una sola mirada?

Alicia
Exacto. La brecha existe porque estás tratando de forzar una realidad 2D o 3D de alta capacidad a través de un cuello de botella textual unidimensional.

Beto
Vaya.

Alicia
Así que el cambio hacia los modelos de lenguaje grandes multimodales, o MLLMs, se trata de eliminar ese cuello de botella por completo. Tratan la percepción visual no como una característica adicional divertida, sino como un requisito previo central para sintetizar código.

Beto
Así que pónganse en el lugar de un desarrollador o diseñador, piensen en cómo cambia su flujo de trabajo. Imaginen estar en una cafetería con un boceto de una interfaz de aplicación en una servilleta.

Alicia
Justo como cajas y flechas dibujadas a mano.

Beto
Sí, solo un diseño de distribución de una barra de navegación. En lugar de escribir un documento de especificación de 10 páginas detallando cada margen, relleno y código hexadecimal a una IA, ¿qué pasaría si simplemente le mostraran la servilleta?

Alicia
Y el modelo realmente entendiera las relaciones espaciales lo suficiente como para generar toda la parte frontal y la estructura.

Beto
Es salvaje de pensar. Pero lograr que un modelo mire una servilleta y escriba código funcional que deba requerir metodologías de entrenamiento específicas, ¿cierto?

Alicia
Oh, absolutamente. No se trata solo de alimentar una imagen en una red neuronal y esperar lo mejor. Los investigadores mapean cómo los modelos están sintetizando este código multimodal en tres tareas distintas.

Beto
Bien, vamos a desglosarlas.

Alicia
La primera es lo que llaman "generación directa multimodal". Esta es la base. El modelo reconstruye un artefacto visual, esencialmente desde cero.

Beto
Así que le proporcionas un contexto visual como una captura de pantalla de una interfaz de usuario, junto con una indicación de texto.

Alicia
Correcto. Y el objetivo es que la IA sintetice toda la base de código que, cuando se ejecuta, produce exactamente ese artefacto visual.

Beto
Quiero hacer una pausa en el mecanismo allí porque suena simple. Pero por dentro, ¿cómo mira realmente una IA una cuadrícula plana de píxeles y la traduce en líneas anidadas de HTML y CSS?

Alicia
Implica tokenización visual. El modelo utiliza un codificador de visión para rebanar la imagen en una cuadrícula de pequeños parches.

Beto
Como si la estuviera cortando en un mosaico.

Alicia
Exacto. Analiza los patrones de píxeles en cada parche, los bordes, los colores, el texto, y mapea esas características visuales a un espacio matemático que el modelo de lenguaje pueda comprender. Luego el modelo hace referencia cruzada de esos tokens visuales con su vocabulario de lenguajes de programación. Así que ve un parche con un rectángulo azul que contiene texto blanco, reconoce la posición espacial, y traduce ese token visual en la sintaxis para un elemento de contenedor CSS.

Beto
Eso tiene perfecto sentido. Pero en el mundo real, nadie genera una aplicación perfecta a la primera.

Alicia
Muy cierto.

Beto
Normalmente, tienes una base, tienes una página web funcional, y solo necesitas ajustarla. Lo que nos lleva a la segunda tarea que los investigadores identifican, que es "la edición de código guiada por instrucciones".

Alicia
Sí. Y aquí es donde aprovechamos las capacidades de seguimiento de instrucciones de estos modelos. En lugar de empezar desde una pizarra en blanco, tienes un estado visual existente en su código subyacente, y quieres modificarlo.

Beto
Así que proporcionas al modelo una instrucción textual combinada con una indicación visual dirigida.

Alicia
Correcto. En este caso, podrías subir una imagen de tu aplicación actual, dibujar un cuadro delimitador rojo alrededor de un menú de navegación específico, y decir: "cambia el color de fondo del elemento en esta caja a gris pizarra e incrementa el relleno".

Beto
Y luego el modelo tiene que generar el código editado que renderice ese nuevo estado específico.

Alicia
Exacto.

Beto
Eso se siente increíblemente intuitivo. Es el equivalente digital de señalar una pantalla mientras estás sentado junto a un colega. No dices: "ve a la línea 452 del CSS y ajusta el contenedor flex". Simplemente señalas y dices: "haz que esa parte sea más ancha".

Alicia
Correcto. Pero la IA tiene que conectar esa caja roja con el código real.

Beto
Sí. ¿Cómo lo hace?

Alicia
Lo fascinante aquí es la pura complejidad de esa conexión. El modelo no solo está haciendo un simple reemplazo de texto. Está realizando lo que los investigadores llaman "anclaje espacial".

Beto
Anclaje espacial. OK.

Alicia
Tiene que mirar las coordenadas de tu cuadro delimitador, mapear esas coordenadas al elemento de interfaz de usuario específico renderizado en la pantalla, y luego encontrar las líneas exactas y el modelo de objeto de documento subyacente, el árbol DOM que dicta ese elemento.

Beto
Vaya.

Alicia
Y una vez que encuentra el código correcto, realiza síntesis de código contrafactual.

Beto
Espera. La "síntesis de código contrafactual" es un gran jerga. ¿Significa básicamente que la IA está imaginando un escenario de "qué pasaría si ..." para averiguar qué líneas de código deben cambiar?

Alicia
Esa es una gran manera de decirlo. El modelo tiene que proyectar un estado futuro hipotético. Algo así como, "si cambio esta variable de relleno de 10 píxeles a 20 píxeles, ¿qué pasará con el resto de la página?"

Beto
Correcto. Porque cambiar una cosa generalmente rompe otra.

Alicia
Exacto. Tiene que sintetizar la diferencia de código que muestre tu objetivo visual sin empujar accidentalmente un bloque de texto vecino fuera de la pantalla. Es una edición contextual quirúrgica.

Beto
Lo que cualquiera que haya intentado centrar un `div` en CSS, sabe que es una pesadilla total. Cambias un margen y de repente tus pies se superponen con tu encabezado.

Alicia
Muy cierto.

Beto
Así que tenemos generación directa desde cero, y edición guiada por instrucciones para ajustes. ¿Cuál es la tercera tarea?

Alicia
La tercera es "el refinamiento de código basado en referencias", que se centra mucho en la depuración automatizada.

Beto
Depuración basada en imágenes.

Alicia
Sí. En este escenario, le alimentas al modelo un código defectuoso, un borrador de código que compila pero produce el diseño visual incorrecto, junto con una imagen de cómo debería verse la salida final. Se forza a la IA a depurar su propia lógica comparando la salida rota de su código actual con la referencia visual perfecta. Utiliza la discrepancia visual como señal para arreglar el código estructural.

Beto
Así que esencialmente está jugando un juego de alto riesgo de encontrar la diferencia. Mira el código renderizado, mira la imagen objetivo, notas que una barra lateral está a la izquierda en lugar de a la derecha y luego vuelve al código para invertir la dirección flex.

Alicia
Precisamente. Y demuestra que la retroalimentación visual es una herramienta de depuración crítica, no solo para los humanos, sino para los modelos de IA que aprenden a codificar.

Beto
Ok, así que tenemos cómo generar, editar y depurar basado en entradas visuales. Pero ¿dónde se está implementando esto realmente en el mundo? Porque los investigadores no solo hablan de esto en teoría, ¿cierto?

Alicia
No, para nada. Mapean cuatro dominios distintos donde la codificación multimodal está acelerando actualmente.

Beto
Y el panorama se está expandiendo rápidamente. El primer dominio, y probablemente el que tiene más tracción, es la interfaz gráfica de usuario o GUI.

Alicia
Correcto, esto implica traducir diseños visuales estáticos como capturas de pantalla, maquetas o archivos de diseño a código funcional de front-end, principalmente para web y móvil.

Beto
Y para entrenar estos modelos, los investigadores han construido conjuntos de datos de referencia masivos. El artículo destaca proyectos como WebSight, Web2Code y Design2Code.

Alicia
WebSight es un conjunto de datos particularmente fascinante. Está diseñado para entrenar modelos en cómo traducir perfectamente una imagen a código funcional de React o HTML.

Beto
Pero espera, para entrenar a una IA para construir un sitio web, no puedes simplemente mostrarle fotos de internet. Tienes que mostrarle la imagen y el plano simultáneamente, ¿cierto?

Alicia
Sí. Conjuntos de datos como WebSight contienen millones de páginas web generadas sintéticamente. Por cada página, el conjunto de datos proporciona una captura de pantalla de cómo se ve en un navegador, emparejada directamente con el árbol DOM completo y el código fuente.

Beto
Así que al entrenar con estos millones de ejemplos uno al lado del otro, el modelo aprende el mapeo subyacente.

Alicia
Exacto. Aprende que una disposición específica de píxeles generalmente se correlaciona con una anidación específica de etiquetas `div` de HTML y cajas `flex` de CSS.

Beto
Eso maneja los diseños web estándar. Pero una interfaz de usuario es en su mayoría solo cajas dentro de otras cajas. ¿Qué pasa cuando los datos visuales no son solo estéticos, sino matemáticamente precisos?

Alicia
Eso nos lleva al segundo dominio, que es la visualización científica. Este es un desafío fundamentalmente diferente de una GUI.

Beto
¿Cómo así?

Alicia
Aquí, el objetivo es convertir gráficos estadísticos, gráficos de datos complejos y documentos científicos estructurados en scripts de trazado, como los que escribirías usando la biblioteca Matplotlib de Python.

Beto
Así que la IA tiene que mirar un gráfico, inferir las tendencias de los datos, leer los ejes y leyendas, y escribir el script que genere esa visualización precisa.

Alicia
Sí. Y hay puntos de referencia específicos para esto ahora, como MatplotBench y ChartMimic, que prueban exactamente esta capacidad.

Beto
Lo que significa que tiene que hacer ingeniería inversa de las matemáticas a partir de una imagen plana.

Por ejemplo, si subiera un diagrama de dispersión de un PDF de los 90, la IA no solo está dibujando puntos. Tiene que descubrir la escala X e Y. Mapear la ubicación de píxeles de cada punto a una coordenada y esencialmente reconstruir el arreglo de datos crudos que se utilizó para hacer el gráfico hace 30 años.

Alicia
Requiere un nivel profundo de razonamiento matemático y espacial. El modelo no solo está recreando una textura visual, está reconstruyendo la realidad estadística subyacente.

Beto
Es simplemente salvaje.

Alicia
Y esta dificultad se escala aún más en el tercer dominio, que es la gráfica estructurada. Aquí es donde entramos completamente en el reino de la geometría.

Beto
Correcto. Generar gráficos vectoriales escalables, o SVG, así como diagramas complejos y diseño CAD o de computadora.

Alicia
Sí. Los investigadores mencionaron herramientas como DeepCAD y Text2CAD que están empujando los límites aquí.

Beto
¿Por qué un SVG es más difícil de generar para una IA que una página web HTML estándar?

Alicia
Porque un SVG es esencialmente pura matemática, disfrazada de imagen. Cuando una IA genera una página web, puede confiar en contenedores de diseño relativos. Pero un SVG requiere definir vectores absolutos, curvas Bézier, coordenadas y relaciones geométricas continuas.

Beto
Así que una curva no es solo una colección de píxeles para la IA.

Alicia
No, tiene que ser definida por una ecuación polinómica en el código. El modelo no está organizando bloques visuales. Está definiendo marcos estructurales que literalmente pueden ser alimentados a una cortadora láser o a una tubería de fabricación 3D.

Beto
Eso es un salto increíble. Hemos pasado de generar maquetas de interfaz de usuario, a hacer ingeniería inversa de conjuntos de datos a partir de gráficos, a escribir los planos matemáticos para la fabricación física. ¿Qué podría quedar para el cuarto dominio?

Alicia
Bueno, los investigadores clasifican el cuarto dominio simplemente como "tareas fronterizas". Esta es la vanguardia absoluta.

Beto
¿Qué incluye?

Alicia
Cubre áreas tales como la programación visual, donde el código manipula elementos visuales dinámicamente en un lienzo, y la generación de video, donde la IA sintetiza código que dicta cambios temporales a través de fotogramas.

Beto
Es decir, codificar efectivamente un motor de física o un video para que exista con el tiempo.

Alicia
Exacto.

Beto
Ok, espera, tengo que intervenir aquí con un poco de objeción. Estamos hablando de todos estos puntos de referencia y dominios, especialmente volviendo a la primera, las cosas de la GUI. Si la IA puede mirar una captura de pantalla, escribir el HTML y el CSS, y renderizar una página web que se vea pixel perfecta a mi imagen de referencia original, el trabajo no está terminado.

Alicia
¿Qué quieres decir?

Beto
Quiero decir, si la salida se ve completamente idéntica al objetivo, ¿no hemos resuelto el problema de la codificación multimodal?

Alicia
Esa es la trampa exacta a la que los investigadores en esta encuesta están expuestos. La identifican como un gran obstáculo, llamándolo "el cuello de botella del espejismo" ("Mirage").

Beto
Un espejismo. ¿Cómo es eso? Si se ve como una página web funcional, ¿qué falta?

Alicia
Porque parecer una página web funcional no significa que opere como una. Alinearse puramente con el renderizado del navegador, juzgar la calidad del código generado solo por lo visualmente similar que sea la salida, a la imagen de referencia, es muy engañoso.

Beto
Ya veo.

Alicia
Un fragmento de código generado podría renderizar una interfaz que se ve absolutamente idéntica a tu maqueta. Visualmente puntúa 100% en una prueba de coincidencia de píxeles. Pero por dentro, puede ser una cáscara completamente hueca.

Beto
Así que la estructura DOM puede ser caótica.

Alicia
Exacto. Los botones visuales pueden estar allí, pero carecen completamente de manejadores de eventos ("event handlers"). Si un usuario intenta interactuar con el menú desplegable, no sucede nada porque las transiciones de estado faltan. El enrutamiento interno podría estar completamente roto.

Beto
Es como un set de película de Hollywood. La parte del salón se ve perfectamente real. La pintura es correcta. Las puertas que se abren están allí. Pero si abres las puertas y pasas, no hay ningún edificio real, solo un montón de vigas de madera sosteniendo la fachada. No hay plomería, ni cableado, ni interior.

Alicia
Esa es una analogía perfecta. La similitud visual es una línea base útil. Pero está profundamente incompleta si el código subyacente no funciona realmente en un entorno interactivo funcional.

Beto
Correcto.

Alicia
Una interfaz de usuario solo es correcta a lo largo de una secuencia de estados interactivos, no solo dentro de una instantánea de visualización estática.

Beto
Aquí es donde se pone realmente interesante, porque los investigadores no solo señalan el problema del set de película de Hollywood. Exploran lo que sucede cuando exigimos que el código haga algo de verdad. Y se enfocan ahora en este concepto increíble llamado "razonamiento y actuación centrados en el código".

Alicia
Sí. Y esto representa quizás el cambio de paradigma más profundo discutido en toda la encuesta. Los modelos más avanzados están trascendiendo la idea del código como meramente un producto final visual, ya sabes, un artefacto estático sentado en una pantalla. En cambio, están usando el código como un sustrato robusto para razonamiento avanzado y control ambiental. Están utilizando el código como una política ejecutable.

Beto
Una política ejecutable. Hagámoslo concreto. Porque suena un poco abstracto. ¿Cómo se ve una política ejecutable en la práctica?

Alicia
Veamos de nuevo las tareas fronterizas, específicamente el subdominio del "control incorporado" ("embodied control"). Imagina un brazo robótico autónomo estacionado en una cocina. Las cámaras del robot proporcionan una observación visual continua de su entorno. Ve una mesa desordenada con una tela apoyada en el borde.

Beto
Ok. Y se lo das con una instrucción simple de alto nivel como "limpia la mesa".

Alicia
Correcto. Un desafío clásico de robótica.

Beto
En sistemas más antiguos, imagino que la IA solo intentaría mapear el texto a controles de motor discretos.

Alicia
Exacto. Los paradigmas más antiguos podrían intentar producir comandos de motor crudos y aislados como "mover la articulación A, 15 grados, mover la articulación B, 10 grados". Pero en este nuevo paradigma multimodal, utilizando marcos como Open VLA, que la encuesta destaca específicamente, la IA hace algo completamente diferente. Sintetiza un guión de acción.

Beto
Espera. La IA está escribiendo dinámicamente un guión para sí misma en tiempo real, basado en lo que ve en la habitación.

Alicia
Sí. Toma la observación visual, procesa tu instrucción y escribe instantáneamente un script de Python que conducirá a sus propias acciones. El código que genera es el mecanismo para calcular movimientos espaciales.

Beto
Eso es increíble.

Alicia
El script contiene la lógica que dice: "identifica el cuadro delimitador de la tela en el campo visual; calcula las coordenadas 3D del mundo real; mueve el efector final a las coordenadas x, y, z; cierra la pinza".

Beto
Vaya.

Alicia
Identifica los límites de la superficie de la mesa. Ejecuta una trayectoria barrida a través de estos parámetros espaciales específicos. El código generado actúa como el cerebro de alto nivel, procesando la entrada visual y produciendo interacciones estructuradas con el entorno físico.

Beto
Eso cambia toda la perspectiva sobre lo que es realmente el código. El código no está construyendo un sitio web. El código es la cuerda de marioneta para el mundo físico, generado sobre la marcha basándose puramente en evidencia visual.

Alicia
Y nota cómo esto resuelve el cuello de botella del espejismo por completo dentro de este contexto. En el control incorporado, la fidelidad visual del código en sí no importa. No estás juzgando si el código se ve bien.

Beto
Correcto. Porque lo que importa es el logro de objetivos y la corrección funcional.

Alicia
Exacto. ¿Compiló el script? ¿Ejecutó el bucle? ¿Logró el robot limpiar la mesa sin tirar un vaso? El código empodera al agente con un espacio de acción estructurado y generalizable.

Beto
Fundamentalmente, cierra la brecha entre ver y hacer.

Lo que nos lleva a las conclusiones finales de esta masiva encuesta. Hemos viajado desde luchar por describir una interfaz de usuario y texto hasta modelos que hacen ingeniería inversa de matemáticas a partir de un gráfico, a robots que escriben sus propios scripts de Python para interactuar con el mundo real.

Alicia
Ha sido una evolución masiva.

Beto
Entonces, ¿a dónde dicen esta coalición global de investigadores que debemos ir desde aquí? ¿Cómo superamos los cuellos de botella restantes?

Alicia
Los investigadores proponen una agenda fuertemente centrada en la verificación para el futuro. Se dan cuenta de que ya no podemos simplemente generar código multimodal y confiar en la salida visual. Destacan tres evoluciones necesarias.

Beto
Ok, ¿cuál es la primera?

Alicia
La primera es la validación multi-señal. Acabamos de establecer que no podemos juzgar el código solo por el renderizado del navegador. Tenemos que combinar evidencia complementaria de corrección.

Beto
Así que necesitamos validar el renderizado visual, sí. Pero también necesitamos herramientas automatizadas para analizar la estructura DOM subyacente, verificar la integridad de los manejadores de eventos y verificar la precisión semántica de los datos.

Alicia
Exacto. Básicamente, traer a un inspector de edificios para que revise la plomería y la integridad estructural de la casa, no solo admirar el trabajo de pintura en el porche delantero.

Beto
La segunda dirección es la verificación multi-estado, ¿cierto? Porque el programa no es estático.

Alicia
Correcto. Necesitamos probar rigurosamente cómo se comporta el código generado a través de diferentes interacciones y trayectorias de ejecución a lo largo del tiempo. Si un usuario hace clic en un botón, ¿se actualiza el estado interno correctamente?

Beto
O si redimensionas la ventana a una vista móvil, ¿responde el diseño dinámicamente?

Alicia
Exacto. Debemos verificar el comportamiento de manera interactiva, no solo en una sola pantalla estática.

Beto
Tiene sentido. No puedes probar un coche sin girar el volante.

¿Y la tercera evolución?

Alicia
La tercera es lo que llaman trazas de agentes verificables. A medida que estos modelos evolucionan hacia agentes autónomos como nuestro robot limpiando la mesa, tenemos que garantizar que cuando la IA toma una acción, esta esté anclada en evidencia visual real.

Beto
Así que necesitamos asegurarnos de que no solo esté alucinando una secuencia de pasos, porque leyó sobre pasos similares en sus datos de entrenamiento.

Alicia
Exacto. Necesitamos poder mirar la traza de razonamiento intermedia, los comentarios o registros de código reales que generó, y verificar exactamente por qué tomó su decisión.

Beto
Eso me recuerda a un profesor de matemáticas calificando un examen. El profesor no solo quiere la respuesta final al final de la página. Forza al estudiante a mostrar su trabajo paso a paso.

Alicia
Esa es una gran manera de pensarlo.

Beto
Si la IA deja un rastro de registros de código, dice: "identifico la tela que recogerá será 400 por 500, por lo tanto, establezco la variable objetivo en 400", podemos verificar su lógica.

Alicia
Correcto. Pero si simplemente establece el objetivo de la variable objetivo en 400 sin razón, sabemos que está alucinando.

Si conectamos esto con la imagen más grande, esa verificación es lo que permite que esta tecnología escale de forma segura.

Lo que revela esta encuesta es un cambio monumental en el desarrollo de software. Estamos pasando de la imitación de una sola salida, tratando de copiar ciegamente una imagen de una interfaz de usuario, y pasando hacia sistemas ejecutables y del mundo real, basados en evidencia.

Beto
Está quitando las ruedas de entrenamiento a la IA.

Alicia
De verdad lo está haciendo. Requiere un nivel fundamentalmente más profundo de inteligencia multimodal para pedirle a una IA que no solo dibuje una herramienta, sino que construya una herramienta, verifique su estructura y luego la use.

Beto
Lo que nos deja con un pensamiento final verdaderamente salvaje para reflexionar mientras escuchan en casa. Pasamos décadas pensando en la codificación como un acto de traducción. Tenemos una idea, y escribimos un lenguaje altamente estructurado en un teclado para explicar esa idea a una máquina.

Alicia
Correcto.

Beto
Pero si la IA puede eventualmente mirar un problema complejo del mundo real, digamos un atasco de tráfico capturado en una cámara de ciudad en vivo, o un piso de fábrica público, e instantáneamente generar el código ejecutable para reorganizar los sistemas de física a su alrededor, ¿en qué punto deja de ser la codificación un lenguaje que escribimos en un teclado, y comienza a ser la forma en que simplemente conversamos con el mundo físico?

Alicia
Nos obliga a replantear nuestra interacción completa con la tecnología. En un futuro cercano, puede que dejemos de pensar en términos de sintaxis, variables y funciones por completo, y empecemos a pensar puramente en términos de intención visual y resultados físicos.

Beto
El código simplemente se convierte en el tejido conectivo invisible.

Alicia
Exacto.

Beto
Es un paradigma completamente nuevo. Ya no estarás charlando con un bot en una pantalla, sino que estarás presentando un plano visual a un arquitecto que construye la realidad a tu alrededor.

Gracias por acompañarnos en esta inmersión profunda en la brecha de modalidad. Nos vemos la próxima vez.

lunes, 8 de junio de 2026

Cuando la IA se construye a sí misma

 
 

Anthropic describe una transición hacia la auto-mejora recursiva, donde la inteligencia artificial gestiona cada vez más su propio ciclo de desarrollo. Los datos indican que la automatización impulsada por la IA ya ha acelerado drásticamente la productividad de la programación y la ejecución de la investigación, igualando o superando con frecuencia las capacidades humanas en tareas especializadas. Si bien esta aceleración tecnológica ofrece enormes beneficios potenciales para la ciencia y la salud, también introduce riesgos significativos en cuanto a la supervisión y el control humanos. La empresa identifica una brecha cada vez menor donde los humanos proporcionan principalmente juicios de alto nivel, aunque incluso esta función podría automatizarse en el futuro. En consecuencia, el texto enfatiza la necesidad urgente de marcos de coordinación y seguridad globales para gestionar un futuro en el que los sistemas de IA podrían diseñar de forma autónoma a sus propios sucesores.

Enlace al artículo, para aquellos que quieran profundizar en el tema: "When AI Builds Itself", por Marina Favaro, Jack Clark y colegas de Anthropic. Publicado en Junio de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Sabes, es salvaje lo rápido que cambia nuestra línea base de lo que se considera normal.

Beto
Oh, absolutamente. Sucede en un abrir y cerrar de ojos.

Alicia
Correcto. Y quiero que imagines, por un segundo, que eres un ingeniero de software, en una empresa tecnológica de primer nivel. Es a mediados de 2026. Te sientas en tu escritorio. Revisas tu código fusionado del trimestre, y te das cuenta de que acabas de enviar ocho veces más código de lo que hiciste solo hace dos años, en 2024. Ocho veces.

Beto
Es un salto masivo.

Alicia
Correcto. Y aquí está el punto clave. A partir de mayo de 2026, más del 80% del código que se está fusionando en la base de código central de tu empresa, ni siquiera fue escrito por ti. No fue escrito por ningún humano. Fue desarrollado enteramente por una IA.

Beto
Y esa clase de métrica, reencuadra por completo nuestra comprensión de la producción humana.

Alicia
Sí, lo hace.

Beto
Estamos viendo un informe exhaustivo, a mediados de 2026, de Anthropic, y está titulado "Cuando la IA se construye a sí misma". Y estos son datos internos, directamente de la frontera absoluta del desarrollo de IA. Nos está dando una mirada sin precedentes, de cómo la IA está siendo utilizada activamente para construir la próxima generación de IA.

Alicia
Y la misión de nuestro análisis profundo hoy es desgranar esto porque, sabes, esto no es solo una lista de nuevas características tecnológicas geniales, o una actualización incremental de software.

Beto
No, no.

Alicia
Estamos viendo una aceleración fundamental en cómo se fabrica la inteligencia. Nos estamos moviendo hacia un concepto llamado "auto-mejora recursiva". Y necesitamos entender lo que eso significa realmente para ti, para tu trabajo y solo para el futuro de cómo resolvemos problemas complejos.

AI_Self-Improvement_Evolution_Timeline_1024.png
Se Cierra el Ciclo: La Aceleración Hacia la Auto-Mejora de la IA

Beto
Exacto. Y para entender por qué este informe específico de Anthropic es tan crítico, primero necesitamos definir claramente ese término, sabes, "auto-mejora recursiva".

Alicia
Correcto. Porque suena un poco a ciencia ficción.

Beto
Lo hace. Pero esencialmente significa un sistema de IA capaz de diseñar y desarrollar totalmente de forma autónoma su sucesor.

Alicia
Vaya. Una inteligencia construyendo una inteligencia mayor.

Beto
Precisamente. Y históricamente, hemos confiado en estos puntos de referencia públicos para adivinar qué tan cerca estamos de ese punto. Pero los puntos de referencia públicos solo nos muestran lo que un modelo puede hacer en el vacío. Tener estos datos internos directos de un laboratorio de IA, nos da una imagen mucho más clara y, honestamente, mucho más urgente.

Alicia
Es como mirar debajo del capó.

Beto
Exacto. Estamos viendo la mecánica real de lo que sucede cuando diriges estos sistemas altamente capaces hacia adentro.

Alicia
De acuerdo. Desglosemos esto porque para entender cómo llegamos a ese asombroso número de productividad de 8x que mencionamos, realmente tenemos que mirar la línea de tiempo del papel de la IA en su propia creación.

Beto
Correcto.

Alicia
La duración de las tareas que estos modelos pueden ejecutar de forma autónoma simplemente ha explotado. El informe traza esto y es casi cómico lo rápido que se mueve.

Beto
Lo es.

Alicia
Como, de vuelta entre 2021 y 2023, lo que ahora se siente como historia antigua, los humanos escribían código manualmente, simplemente tecleando en portátiles. Luego, de 2023 a 2025, tuvimos chatbots.

Beto
La era de Copilot.

Alicia
Sí. Exacto. Le pedirías un fragmento. Lo copias, lo pegas, y le corriges los errores de sintaxis tú mismo.

Beto
Correcto.

Alicia
Pero luego llega 2025 a 2026 y los agentes de codificación comienzan a escribir archivos completos por su cuenta.

Beto
Y ahora tenemos agentes autónomos que no solo están escribiendo el código. Lo están ejecutando ellos mismos. Lo están probando y están delegando horas de trabajo complejo a otros agentes especializados.

Alicia
Es increíble.

Beto
Y la evidencia externa valida perfectamente este cambio interno. La duración de una tarea y el modelo de IA puede completar de forma confiable por sí solo solía duplicarse cada siete meses.

Alicia
De acuerdo.

Beto
Ahora se está duplicando cada cuatro meses.

Alicia
El salto en esos números es difícil de asimilar. Veamos los modelos reales por un segundo. En marzo de 2024, Claude Opus 3 podía manejar tareas que le tomaban al humano unos cuatro minutos.

Beto
Correcto.

Alicia
Un año después, Sonnet 3.7 podía hacer una hora y media de trabajo continuo.

Beto
Sí.

Alicia
Y luego en marzo de 2026, Claude Opus 4.6 está manejando tareas que le toman 12 horas.

Beto
Es exponencial.

Alicia
Es como si hubiéramos pasado, de tener una calculadora elegante en nuestro escritorio, a contratar una gran empresa de contadores autónomos que trabajan un turno continuo de 12 horas mientras nosotros dormimos.

Beto
Esa es una gran manera de decirlo.

Alicia
Pero espera, tengo que poner objeción aquí.

Beto
Bien, adelante.

Alicia
Cualquiera que haya usado un chatbot sabe que puede confundirse o, simplemente perder completamente el hilo.

¿Son estas tareas de 12 horas realmente dando como resultado un trabajo confiable y utilizable? ¿O es que la IA solo está generando 12 horas de alucinaciones altamente confiadas que algún pobre ingeniero humano tiene que pasar 14 horas en desenredar?

Beto
No, es una pregunta muy justa. Y el miedo a la deuda técnica automatizada es una preocupación muy real en la industria ahora mismo.

Alicia
Correcto.

Beto
Pero los datos muestran que esto realmente no son alucinaciones. El informe apunta a datos de MBTR. Son una organización que realiza puntos de referencia para tareas de IA de larga duración. Y encontraron que Claude Mythos Preview podría funcionar de forma confiable por al menos 16 horas.

Alicia
Espera, 16 horas seguidas.

Beto
Seguidas. Y el mecanismo de cómo evita alucinar durante ese largo tramo es fascinante.

Alicia
¿Cómo lo logra?

Beto
Bueno, en lugar de solo generar un largo flujo de texto, el sistema utiliza un bucle agente.

Alicia
¿Qué quiere decir?

Beto
Lo que significa que pausa, consulta sus propios pasos anteriores. Ejecuta una prueba, lee el mensaje de error y luego ajusta su memoria interna basándose en eso.

Alicia
Oh, wow.

Beto
Sí. Así que se está auto-verificando constantemente en la realidad del código que está escribiendo.

Alicia
Así que revisa su propio trabajo. En lugar de simplemente adivinar ciegamente durante horas seguidas.

Beto
Precisamente. Y la limitación aquí es que 16 horas es solo el límite superior de lo que el benchmark de MIR es capaz de medir actualmente.

Alicia
¿Estás en serio?

Beto
Sí. Los modelos están saturando las pruebas más rápido de lo que podemos inventar nuevas. Vemos lo mismo con el SWE-Bench, que prueba la corrección de errores de software del mundo real.

Alicia
Correcto.

Beto
Y el CORE-Bench, que prueba la reproducción de artículos científicos complejos. Estos sistemas pasaron de obtener puntuaciones de un solo dígito a saturar completamente los puntos de referencia en menos de dos años.

Alicia
Eso es una locura.

Beto
La IA está haciendo el trabajo de verdad.

Alicia
Muy bien. Así que los puntos de referencia externos demuestran que la IA puede mantenerse despierta y concentrada por 16 horas.

Beto
Sí.

Alicia
Pero pasar una prueba estéril en un entorno controlado, es muy diferente de navegar por una base de código corporativa heredada y desordenada.

Beto
Oh, totalmente diferente.

Alicia
Entonces, ¿qué pasa cuando Anthropic obliga al sistema a arreglar su propio motor? Básicamente estamos viendo el fin de la sudoración y la ingeniería.

Beto
Lo estamos viendo.

Alicia
En marzo de 2026, Anthropic retiró a sus equipos de investigación. El empleado promedio estimó que estaban produciendo aproximadamente cuatro veces más resultados usando Mythos Preview de lo que habrían producido sin ellos.

Beto
Y ese multiplicador de riesgo se traduce en algunos logros reales asombrosos, en gran parte debido a cómo la IA retiene la información.

Alicia
¿Qué quieres decir?

Beto
Hay una anécdota específica de abril de 2026 que ilustra esto perfectamente. Claude envió más de 800 correcciones individuales que redujeron una clase específica de errores de API en un factor de 1000.

Alicia
Un factor de 1000.

Beto
Sí. Y el ingeniero humano que supervisaba este proceso estimó que a una persona le tomaría cuatro años hacer ese mismo trabajo.

Alicia
Cuatro años, y Claude lo hizo en ... lo que son como un par de horas.

Beto
Exacto. Y piensa en por qué los errores de API son tan difíciles para los humanos.

Alicia
Correcto.

Beto
Tienes que navegar por una docena de archivos interconectados. Rastreas datos que fluyen a través de diferentes sistemas. Y si te distraes con un correo electrónico, ...

Alicia
... pierdes todo tu hilo de pensamiento.

Beto
Sí. La carga cognitiva es demasiado alta. Pero un modelo de IA puede retener toda la arquitectura en su memoria activa simultáneamente.

Alicia
Y no olvida dónde estaba.

Beto
Correcto. Ve las dependencias ocultas como un mapa, lo que facilita detectar dónde un cambio en un archivo rompe una integración en otro.

Alicia
Y aparentemente la calidad del código aguanta incluso cuando las cosas se vuelven totalmente caóticas.

Beto
Sí.

Alicia
El informe señala que en las tareas abiertas más complejas, aquellas donde incluso el ingeniero humano no está totalmente seguro de cómo debería verse la respuesta final, la tasa de éxito de Claude alcanzó el 76% en mayo de 2026.

Beto
Lo cual es increíblemente alto para ese nivel de ambigüedad.

Alicia
Correcto. Y hubo este incidente donde una actualización rutinaria comenzó a colapsar decenas de miles de trabajos de entrenamiento.

Beto
Oh, escenario de pesadilla total.

Alicia
Exacto. Un ingeniero señaló el incidente en vivo con básicamente solo algo de contexto de texto y acceso a clúster.

Beto
Y aquí es donde el mecanismo de depuración de la IA se vuelve verdaderamente sobrehumano. Un ingeniero humano en pánico, probaría una hipótesis a la vez. Es un proceso lineal.

Alicia
Pero Claude probó sistemáticamente la configuración del entorno, aisló esa bandera de depuración increíblemente oscura que estaba causando el fallo, la reprodujo y confirmó la solución.

Beto
En dos horas.

Alicia
Dos horas. Eso normalmente serían dos o tres días de trabajo humano de pánico.

Beto
Fácilmente.

Alicia
Porque, a diferencia del humano, Claude podía activar instantáneamente micro-entornos paralelos, ejecutar docenas de scripts de depuración al mismo tiempo, y simplemente agregar los resultados en segundos.

Beto
Sí.

Alicia
El informe incluso señala que una revisión automatizada de Claude sobre la base de código histórica de Anthropic habría detectado aproximadamente un tercio de los errores que causaron incidentes pasados.

Beto
Es sistemáticamente mejor encontrando la aguja en el pajar porque puede mirar cada pieza del paja simultáneamente.

Alicia
Pero seguramente esa métrica de líneas de código que hablamos al principio de la inmersión es un poco engañosa.

Beto
¿Cómo es eso?

Alicia
Bueno, si un humano produce código tan rápido, suele ser una pesadilla hinchada de mantener. ¿No se considera históricamente que medir líneas de código es una métrica terrible para la productividad real?

Beto
Sí, absolutamente.

Alicia
Se siente como si solo estuviéramos midiendo qué tan rápido puede teclear la IA, no cuánto valor está creando realmente.

Beto
Lo fascinante aquí es que Anthropic realmente afirma exactamente lo mismo en su informe.

Alicia
Oh, ¿de verdad?

Beto
Sí, admiten que las líneas de código es una medida imperfecta fuertemente sesgada hacia la cantidad, sobre la calidad.

Alicia
OK.

Beto
Pero aquí está el matiz crítico. La calidad ya se ha puesto al día.

Alicia
Lo ha hecho.

Beto
Hay un consenso amplio en Anthropic de que el código escrito por Claude alcanzó la paridad de calidad con el código escrito por humanos a finales de 2025.

Alicia
Vaya.

Beto
Y más importante aún, esperan que el código generado por la IA sea estrictamente mejor que el código humano dentro del año.

Alicia
Así que estamos pasando, de un mundo de creación de código, a una curación de código.

Beto
Exacto.

Alicia
El papel del humano en la ingeniería está cambiando rápidamente, alejándose de escribir cualquier cosa y moviéndose puramente hacia una función de revisión y supervisión.

Beto
Esa es la nueva realidad. Tú curas el resultado. No lo creas.

Alicia
Pero espera, si el IDE está escribiendo código que es estrictamente mejor que el código humano y el humano es solo un revisor, ¿cómo puede un humano revisar código de manera efectiva, si no hiciera la investigación subyacente para entender el problema en primer lugar?

Beto
Ese es un buen punto.

Alicia
Quiero decir, la ingeniería se trata de ejecutar un objetivo conocido. Pero ¿qué pasa con la ciencia real? ¿Está la IA tomando el control de la investigación?

Beto
Aquí es donde comenzamos a ver la verdadera base de la auto-mejora recursiva. El informe detalla cómo Claude realmente ejecuta experimentos.

Alicia
OK.

Beto
Le dan una tarea: "optimizar el código que entrena un pequeño modelo de IA, hacerlo funcionar lo más rápido posible, mientras sigue pasando las comprobaciones de corrección".

Alicia
Parece sencillo.

Beto
Históricamente, un investigador humano altamente cualificado podría lograr una aceleración de 4x en esta tarea en unas cuatro a ocho horas.

Alicia
OK.

Beto
Para abril de 2026, Mythos Preview estaba logrando una aceleración de 52x.

Alicia
52x.

Beto
Sí. En menos de un año, la IA pasó, de ser una asistente útil, a ser completamente sobrehumana y ejecutar un bucle experimental.

Alicia
Una aceleración de 52x. Eso es honestamente, es difícil de procesar.

Beto
Lo es.

Alicia
Y no solo está optimizando código existente. Ejecutaron este experimento de investigación de seguridad increíblemente complejo y abierto para ver si un modelo débil podría supervisar a uno fuerte.

Beto
Correcto.

Alicia
Durante el transcurso de 800 horas y unos $18,000 en costos de cómputo, estos agentes de Claude diseñaron los experimentos ellos mismos.

Beto
Piensa en esa escala.

Alicia
Pero ¿cómo no se quedaría atascada en un bucle de probar la misma idea fallida durante 800 horas?

Beto
Se reduce a la memoria jerárquica y a las transferencias de agentes.

Alicia
OK, ¿qué significa eso?

Beto
El sistema utiliza principalmente un agente gestor que tiene el objetivo de investigación general. Este gestor delega tareas específicas de codificación, o prueba, a agentes trabajadores.

Alicia
Como un laboratorio real.

Beto
Exacto. Y cuando un agente trabajador llega a un callejón sin salida, escribe un resumen de lo que falló y se lo pasa de vuelta al gestor.

Alicia
Oh, eso es inteligente.

Beto
El gestor luego actualiza el cuaderno global. Así que durante 800 horas, no solo están probando cosas aleatorias. Están explorando sistemáticamente un espacio de hipótesis, probando ideas, compartiendo hallazgos con otros agentes, e iterando.

Alicia
Y los resultados realmente hablan por sí mismos. Los agentes terminaron recuperando el 97% de la brecha de rendimiento en esta tarea.

Beto
Sí.

Alicia
Cuando dos investigadores humanos probaron exactamente lo mismo durante una semana, solo recuperaron el 23%.

Beto
La métrica más reveladora aquí, sin embargo, podría ser lo que el informe llama "gusto por la investigación".

Alicia
Gustos de investigación.

Beto
Sí. Cuando estás haciendo investigación novedosa, las cosas salen mal. Te caes en un agujero de conejo. Miraron sesiones donde los investigadores humanos se desviaron del camino. Y probaron si una IA podía elegir un siguiente paso mejor para poner la investigación de nuevo en marcha.

Alicia
OK, así que desarrollar gustos por la investigación es como navegar por un laberinto masivo.

Beto
Sí.

Alicia
En 2025, la IA solo se estaba topando al azar con paredes. Pero para 2026, es como si la IA hubiera desarrollado una brújula interna, reconociendo los patrones sutiles de un callejón sin salida antes de que siquiera camine por el pasillo.

Beto
Esa es una forma perfecta de visualizarlo. A finales de 2025, la IA eligió el mejor camino, el 51% de las veces, básicamente un lanzamiento de moneda.

Alicia
Correcto.

Beto
Para abril de 2026, Mythos Preview superó la elección humana el 64% de las veces.

Alicia
Vaya.

Beto
La IA está desarrollando un juicio real.

Alicia
Es como si estuviéramos haciendo la transición a ser ejecutivos de cine.

Beto
Ejecutivos de cine.

Alicia
Sí. Ya no operas la cámara. No ajustas la iluminación. Ni siquiera escribes el guión. Solo estás sentado en una gran silla, iluminando los proyectos con luz verde.

Beto
Esa es una analogía muy buena.

Alicia
Pero sigo pensando en el costo cultural que esto implica. Piensa en tu propio lugar de trabajo. Piensa en la última vez que ayudaste a un compañero a salir de un aprieto. Pasas horas desenredando un desorden juntos. Le debes un café. Construyes confianza.

Beto
El elemento humano.

Alicia
Exacto. El informe llama a esto "la economía de los regalos". ¿Qué pasa con la cultura de tu empresa cuando esa fricción se elimina por completo?

Beto
Desaparece.

Alicia
Hay una cita de un empleado que simplemente sudaba pavor existencial. Dijeron que cuando la IA funciona perfectamente, se sienten totalmente innecesarios.

Beto
Sí.

Alicia
Y cuando las cosas se rompen, se dan cuenta de que han perdido completamente el contexto para siquiera saber cómo arreglarlas.

Beto
Es un cambio psicológico profundo. Los humanos ahora están aferrándose a la idea de que nuestra ventaja comparativa es ver el panorama general.

Alicia
Correcto. Esos eran los visionarios.

Beto
Exacto. Nos decimos a nosotros mismos que la IA puede manejar los detalles, pero tenemos la visión general. Pero lo que muestran los datos sobre gustos por la investigación es que la brecha en el pensamiento de panorama general se está cerrando rápidamente.

Alicia
Eso es aterrador.

Beto
A medida que las ventanas de contexto y el razonamiento de la IA crecen, su imagen también se hace más grande.

Alicia
Lo que nos obliga a preguntarnos a dónde conduce esto realmente. Con los humanos siendo empujados cada vez más arriba en la cadena de abstracción, de la codificación a la investigación, a simplemente dar direcciones, ¿cuál es el objetivo final?

Beto
Bueno, Anthropic esboza tres futuros posibles para el trabajo y la sociedad.

Alicia
OK, veamos el escenario uno, la curva S. Esta es la idea de que las tendencias se estancan y las capacidades de la IA se estancan.

Beto
Sí. Y el mecanismo para un estancamiento podría ser físico o arquitectónico. Podríamos simplemente quedarnos sin energía para alimentar estos centros de datos o podríamos chocar contra los límites de la arquitectura transformer en sí misma.

Alicia
Espera, ¿qué hace que la arquitectura transformer sea un límite?

Beto
Bueno, el transformer es la estructura subyacente de los modelos de lenguaje actuales.

Alicia
Correcto.

Beto
Pero tiene algo llamado "límite de escalado cuadrático". A medida que aumentas la cantidad de contexto, como el tamaño de la base de código o la longitud de la tarea, la potencia computacional requerida para procesarlo no solo se duplica. Se cuadruplica.

Alicia
Oh, vaya.

Beto
Eventualmente, la memoria del modelo se degrada y simplemente cuesta demasiada computación mantener el contexto. Así que el desarrollo podría chocar contra un muro.

Alicia
Pero incluso si choca contra un muro hoy, el impacto ya es asombroso.

Beto
Absolutamente.

Alicia
El informe menciona Project Glasswing usando el modelo Mythos Preview actual, que encontró más de 10,000 vulnerabilidades de software críticas en los sistemas más importantes del mundo en solo semanas. Piensa en eso. Incluso si la IA nunca se vuelve más inteligente de lo que es a mediados de 2026, el cuello de botella ya se ha desplazado de encontrar problemas a parcharlos.

Beto
Cierto. Pero Anthropic considera que ese primer escenario es poco probable.

Alicia
OK.

Beto
El escenario dos es "la eficiencia compuesta". En este mundo, el desarrollo de la IA se vuelve en su mayor parte automatizado y los humanos existen solo para dar dirección.

Alicia
Así que son equipos supercargados.

Beto
Exacto. Las implicaciones para la economía en general son masivas. Una empresa de 100 personas podría operar con la producción de una organización de 10,000 personas porque cada empleado se sienta en la cima de una pirámide de agentes autónomos.

Alicia
Y luego está el escenario tres, "la auto-mejora recursiva completa".

Beto
Este es el punto más grande.

Alicia
Es el mundo donde la IA diseña totalmente sus propios sucesores. El ritmo del avance ya no está determinado por el pensamiento humano. Está determinado enteramente por cuánta potencia computacional tengas. Los humanos son movidos totalmente a la supervisión y la validación. Los humanos podrían conducir a esas máquinas de gracia amorosa, grandes avances en ciencia y medicina, o podría conducir a una pérdida total de control si los protocolos de alineación de seguridad fallan.

Beto
Esto plantea una pregunta importante sobre los límites de la aceleración en los escenarios dos y tres.

Alicia
OK.

Beto
Tenemos que mirar a la ley de Amdahl. Es un concepto de la informática, pero se aplica perfectamente a las organizaciones humanas que enfrentan una automatización rápida.

Alicia
¿Qué es?

Beto
La ley de Amdahl establece que acelerar una parte de un proceso solo mueve el cuello de botella a otro lugar.

Alicia
OK. Tiene sentido.

Beto
Si una IA puede generar 10,000 líneas de código perfecto en un minuto, pero un humano todavía tiene que revisarlo para asegurarse de que las líneas cumplan con los objetivos de la empresa, ...

Alicia
Entonces la revisión humana se convierte en el límite de velocidad definitivo.

Beto
Exacto. No has hecho todo el sistema exponencialmente más rápido. Solo has atascado otra parte de la tubería.

Alicia
Me encanta ese concepto. Es como ensanchar una autopista a 10 carriles solo para crear un atasco de tráfico absolutamente épico porque dejaste una sola rampa de salida en el extremo.

Beto
Esa es una analogía perfecta.

Alicia
Y piensa en tu propio trabajo por un segundo. Si tuvieras un ejército de agentes haciendo toda tu ejecución, redactando todos tus correos electrónicos, escribiendo todos tus informes, analizando todos tus datos, ¿qué nuevo cuello de botella te convertirías?

Beto
Correcto.

Alicia
¿Tendrías siquiera la capacidad cognitiva para revisar y aprobar todo ese resultado?

Beto
Casi seguro que no, por lo que en el escenario tres, donde el laboratorio está literalmente funcionando a la velocidad de cómputo, la fricción entre la velocidad de la IA y el procesamiento humano, se convierte en un problema social crítico. Si ocurre la auto-mejora recursiva, la IA avanza más rápido de lo que los humanos pueden verificar su seguridad o utilidad. ¿Cómo navegamos de forma segura esta colisión?

Alicia
Bueno, la solución propuesta por Anthropic es una desaceleración o pausa coordinada y verificable a nivel global para el desarrollo de la IA.

Beto
Básicamente, frenar, para que la sociedad puede alcanzar a la tecnología.

Alicia
Pero son muy claros, en que una pausa unilateral, donde solo una empresa decida detenerse por la bondad de su corazón, no funciona. Si Anthropic pausa, solo cambia quién está a la cabeza.

Beto
Requiere un tratado coordinado, muy parecido a los tratados de armas nucleares del siglo XX.

Alicia
Pero verificar una pausa de la IA, es significativamente más difícil que contar silos nucleares, ¿cierto?

Beto
Oh, absolutamente. El entrenamiento para los modelos de IA simplemente utiliza enormes cantidades de potencia informática, que es de propósito general.

Alicia
Correcto.

Beto
Un centro de datos entrenando superinteligencia, se ve exactamente igual desde fuera que un centro de datos renderizando una película blockbuster, o gestionando la logística global.

Alicia
Eso es salvaje.

Beto
Las entradas son fáciles de ocultar, y el incentivo para desertar en secreto es enorme, porque el primero en lograr la auto-mejora recursiva, básicamente se lleva todo.

Alicia
Anthropic dice que están organizando conversaciones en los próximos meses con responsables políticos, sociedad civil y otros laboratorios de IA, para intentar construir estos sistemas de verificación, antes de que sea demasiado tarde.

Beto
Es una tarea grande.

Alicia
Pero aquí es donde se pone realmente interesante, porque la tensión central de esta inmersión profunda no es solo sobre tratados internacionales, o el seguimiento de la potencia informática. Se trata del ritmo de tu vida diaria, que finalmente choca de frente con un laboratorio de IA funcionando a la velocidad de la luz.

Beto
Estamos mirando un futuro cercano donde el "99% de la sudoración que hace la genialidad" como dijo Thomas Edison, está totalmente automatizada. La lucha del descubrimiento, las largas noches en el laboratorio ejecutando experimentos fallidos, los dolores de probar y error, todo podría ser subcontratado a agentes de auto-mejora recursiva.

Alicia
Y eso nos deja con la profunda pregunta que masticar mientras cerramos hoy. Si la auto-mejora recursiva realmente funciona, si inevitablemente resuelve nuestros desafíos científicos, médicos y de ingeniería sin que tengamos que levantar un dedo, ¿cómo encontrarán los seres humanos significado en su autoestima?

Gran parte de la experiencia humana está definida por la lucha por comprender el mundo y construir cosas para mejorarlo.

Beto
Así es, realmente.

Alicia
Si ya no somos los constructores, si ese ingeniero de software 8x de repente es solo un espectador viendo cómo el código vuela, ¿en quién nos convertiremos?

lunes, 11 de mayo de 2026

Habilidades de los Agentes

 
 

El texto presentado examina el surgimiento de las habilidades de los agentes, definidas como artefactos procedimentales reutilizables que ayudan a los agentes de modelos de lenguaje grandes (LLM) a salvar la brecha entre el acceso directo a las herramientas y la ejecución confiable de tareas. Si bien los agentes estándar suelen tener dificultades con la consistencia, los sistemas centrados en habilidades externalizan el conocimiento práctico en módulos estructurados que coordinan herramientas, memoria y razonamiento. La investigación organiza estas capacidades en un ciclo de vida de cuatro etapas: representación, adquisición, recuperación y evolución. Las habilidades se clasifican según sus recursos subyacentes, que van desde instrucciones basadas en texto hasta código ejecutable y formatos híbridos. Además, las fuentes describen diversos métodos de adquisición, incluidos aquellos derivados de la experiencia humana, experiencias previas, tareas específicas o corpus externos. En definitiva, estos documentos abogan por una transición hacia ecosistemas de habilidades robustos para mejorar la escalabilidad y el mantenimiento de los sistemas inteligentes autónomos.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications", por Yingli Zhou, y colegas. Publicado el 8 de Mayo de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Imagina que, en lugar de limitarse a responder pasivamente tus preguntas, tu IA de pronto empezara a escribir sus propios manuales permanentes de instrucciones.

Beto
Sí, enseñándose a sí misma a gestionar tu calendario o a reservar tus vuelos.

Alicia
Reescribiendo su propio código sin que tú lo pidas siquiera. Ya no es solo hipotético. Estamos ante un cambio de paradigma masivo en la IA.

Beto
De verdad lo es. Es una reestructuración fundamental de lo que esperamos que haga una máquina.

Alicia
Bien. Bienvenidos a un nuevo análisis profundo. Hoy exploramos un artículo académico muy fascinante de 2026. Es de investigadores de la Chinese University of Hong Kong, Shenzhen, y se titula "Una encuesta exhaustiva sobre habilidades de agente".

Beto
Es un trabajo importantísimo porque traza esta transición que estamos viviendo, pasando de la recuperación pasiva de conocimiento, a la ejecución activa en el mundo real.

Alicia
Exacto. Durante mucho tiempo hemos pensado en los grandes modelos de lenguaje como una enciclopedia básicamente pasiva. Preguntas algo y recibes una respuesta.

Beto
Como un diccionario muy inteligente.

Alicia
Claro. Pero este artículo muestra cómo la IA está moviéndose de solo saber cosas, a hacerlas autónomamente en el mundo real. Vamos a desentrañar cómo estos agentes están desarrollando su propia "memoria muscular", esos procedimientos reutilizables que llaman "habilidades de agente".

Beto
Y ya sea que te prepares para una reunión técnica, que intentes automatizar tus flujos de trabajo diarios ...

Alicia
O que simplemente sientas una curiosidad intensa por el futuro de la IA, entender este cambio es totalmente crucial para ti. Es la diferencia entre tratar a la IA como un buscador, y tratarla como un colega digital real.

Bien, vamos a desglosarlo.


Habilidades de los Agentes: La "Memoria Muscular" de la IA Autónoma

Beto
Para entender realmente qué es una "habilidad de agente", primero tenemos que ver el problema con el que se toparon los ingenieros, el muro al que llegaron.

Alicia
Lo que el artículo llama "la brecha procedimental".

Beto
Exacto. Es la brecha procedimental. Porque desde hace unos años, los desarrolladores han estado conectando herramientas directamente a los modelos de IA. Les dan navegadores web, intérpretes de código, APIs de reserva de vuelos, lo que sea.

Alicia
Pensando que simplemente darle la herramienta a la IA sería suficiente.

Beto
Claro. La suposición era: la IA entiende el lenguaje, tiene la herramienta, naturalmente descubrirá cómo hacer el trabajo.

Alicia
Pero el artículo apunta que dar acceso es increíblemente insuficiente. A medida que las tareas se vuelven complejas, esperar que la IA averigüe exactamente cómo usar esa herramienta desde cero cada vez que surge la tarea conduce a errores.

Beto
Sí: alta latencia, alucinaciones, fragilidad severa.

Alicia
Es como darle a un completo novato una sierra eléctrica cara.

Beto
Ah, buena comparación.

Alicia
Exacto. La herramienta es estupenda, poderosa. Pero sin la habilidad, el saber hacer —medir, cortar y, ya sabes, protocolos básicos de seguridad— va a ser un desastre total.

Beto
Te vas a cortar un dedo.

Alicia
Exacto. La herramienta por sí sola no confiere las habilidades de carpintería.

Beto
Y es ahí donde las habilidades de agente salvan la brecha. Los investigadores definen una habilidad como "un artefacto procedimental reutilizable". Básicamente codifica ese conocimiento de “cómo hacer” en un paquete.

Alicia
Es, en esencia, la "memoria muscular" del agente.

Beto
Exacto. Le dice al agente cuándo actuar, cómo ejecutar una herramienta específica y, crucialmente, cómo manejar fallos. Empaqueta instrucciones, código ejecutable y condiciones disparadoras. Así no tiene que razonar desde cero cada vez.

Alicia
Lo que ahorra muchísimo cómputo. Y el artículo destaca sistemas como OpenClaw, Manus y Claude Code que ya están haciendo esto.

Beto
Si lo conectamos con el panorama más amplio —y hay una gran figura en el artículo, la figura uno— traza la evolución de las habilidades. Empieza con habilidades de supervivencia humanas encarnadas como la caza.


Evolución histórica de las habilidades, desde la supervivencia humana encarnada y la artesanía hasta la ingeniería, la industria, los sistemas de habilidades digitales y de la era de los agentes.

Alicia
Sí, como hacer fuego, ese tipo de cosas.

Beto
Sí. Luego pasa a habilidades industriales, a habilidades digitales como la programación. Y ahora la línea del tiempo llega a las habilidades de agente. Las máquinas están acumulando experiencia como lo hacemos nosotros.

Alicia
Es alucinante pensarlo. Un momento, me quedé enganchada en algo. Si los agentes necesitan esta memoria muscular para evitar empezar desde cero, ¿de dónde salen estas habilidades? ¿Cómo se almacenan?

Beto
Estructuralmente se almacenan de tres maneras principales. Están las basadas en texto, que son como procedimientos operativos estándar o listas de verificación. Las basadas en código, que son scripts ejecutables. Y los sistemas híbridos que usan ambos.

Pero cómo las adquieren es una parte realmente fascinante. Hay cuatro grandes categorías de adquisición.

Alicia
OK. ¿Cuál es la primera?

Beto
La primera es derivada de humanos. Eso es cuando expertos escriben explícitamente las reglas. Como médicos que elaboran una plantilla diagnóstica para que la IA la siga.

Alicia
Claro, pero humanos escribiendo reglas a mano no escala, ¿verdad?

Beto
No. Lo que nos lleva a la segunda categoría: derivada de la experiencia. Aquí los agentes aprenden de sus éxitos y fracasos pasados.

Alicia
Oh, wow. Aprender de sus propios errores.

Beto
Sí. El artículo referencia un sistema llamado Reflexion. Básicamente, si un agente intenta una tarea y falla, analiza el fallo y escribe una breve regla correctiva.

Alicia
¿Para que la próxima vez no cometa el mismo error?

Beto
Exacto. Y hay otro llamado Voyager, que retiene trayectorias de código exitosas. A medida que explora un entorno y tiene éxito en algo, congela ese camino en una habilidad permanente.

Alicia
Es brillante. ¿Y si enfrenta un problema totalmente nuevo? Algo que nunca ha visto.

Beto
Entonces entra la adquisición derivada de la tarea. El agente genera esencialmente una habilidad personalizada sobre la marcha para resolver esa restricción nueva específica.

Alicia
Y si funciona, la conserva.

Beto
Sí. Y la cuarta categoría es derivada de corpus. Aquí es donde extrae de enormes conjuntos de datos externos.

Alicia
Espera. ¿Como leer internet?

Beto
Sí, como escanear los write-ups de competiciones en Kaggle. Observa cómo los mejores científicos de datos humanos resuelven problemas, abstrae sus métodos y convierte esos patrones en habilidades reutilizables para sí mismo.

Alicia
Espera, espera. Si un agente solo hojea foros de Kaggle o aprende de sus fallos aleatorios, ¿cómo sabemos que no está memorizando basura?

Beto
Es una preocupación muy justa.

Alicia
Claro. Si extrae una habilidad que funciona pero es súper ineficiente, no quieres que la use para siempre.

Beto
Y los investigadores lo reconocen. Por eso el proceso de adquisición tiene una fase rigurosa de selección. Los sistemas deben filtrar realmente su historial de ejecución.

Alicia
¿Cómo funciona eso? ¿Se califica a sí mismo?

Beto
Algo así, sí. Analiza métricas de resultado. Elimina trazas ruidosas, fallidas o ineficientes. Y solo empaqueta las interacciones exitosas y de alta calidad en memoria estructurada. La basura se descarta o se mantiene como una restricción negativa, como un recordatorio de qué no hacer.

Alicia
Bien, tiene control de calidad. Pero eso conduce a otra pesadilla logística. Supongamos que nuestro agente adquiere y filtra decenas de miles de habilidades. El artículo menciona repositorios como SkillNet y SkillsMP, ¿no?

Beto
Exacto. Bibliotecas masivas.

Alicia
Entonces le das un prompt. ¿Cómo no se queda congelado buscando el procedimiento correcto entre 100.000 opciones?

Beto
Ese es el gran dilema de búsqueda y ejecución. El artículo separa claramente la solución en dos etapas: recuperación, que reduce el conjunto, y selección, que elige la habilidad exacta.

Alicia
Hablemos de recuperación primero. ¿Cómo la reduce?

Beto
Generalmente usa dos métodos. Recuperación densa, que empata el significado semántico o la “vibra” conceptual de tu prompt.

Alicia
Así, si digo “limpia mi bandeja de entrada”, busca conceptos como correo y clasificación.

Beto
Exacto. Y el otro método es recuperación dispersa, que busca coincidencias exactas de palabras clave o APIs. Normalmente necesitas un híbrido de ambos para quedar con una lista corta de habilidades candidatas.

Alicia
Aquí es donde se pone realmente interesante si miras la segunda etapa: selección. Elegir la habilidad final no se trata solo de encontrar la coincidencia textual más relevante, porque estas habilidades hacen cosas reales. Consumen cómputo, llevan tiempo, cuestan dinero real.

Beto
Sí, diste justo con el dilema. Se llama selección consciente de costo y utilidad.

Alicia
Bien. Porque solo porque un agente pueda usar una habilidad enorme y cara, de múltiples pasos, para responder una pregunta, no significa que deba hacerlo si una simple habilidad de búsqueda en texto hace exactamente lo mismo.

Beto
Exacto. Una IA debe ponderar el beneficio esperado de una habilidad frente a su riesgo y su costo. Es como no contratar a un ingeniero estructural para clavar un solo clavo.

Alicia
Funciona, pero es un desperdicio enorme. ¿Cómo aprende el agente cuál usar?

Beto
El artículo describe algo llamado "reordenamiento impulsado por retroalimentación". El agente actualiza sus preferencias en función de si una habilidad tuvo éxito o fracasó o costó demasiado en el pasado. Mantiene un libro de cuentas, básicamente.

Alicia
Mientras más la uses, más eficiente se vuelve económicamente.

Beto
Completamente, adapta su propia política de selección.

Alicia
Lo que nos lleva a la etapa final del ciclo de vida de una habilidad: ese bucle de retroalimentación aprendiendo del éxito, el fracaso y el coste en tokens. Significa que la biblioteca de habilidades no es solo un disco duro estático.

Beto
No, es un ecosistema vivo y en evolución continua. El artículo traza una analogía con el refinamiento humano. Como un jugador de ajedrez que afina su juego tras una derrota, o un médico que actualiza sus métodos tras un caso raro. Los agentes de IA pasan por una evolución de habilidades.

Alicia
Y hay pasos específicos para esto, ¿verdad? Como la revisión.

Beto
Sí, la revisión es el primer paso: reescribir el artefacto de la habilidad basándose en nueva retroalimentación. Pero no puedes actualizar código operacional a ciegas ...

Alicia
... porque podrías romper otra cosa.

Beto
Correcto. Por eso el siguiente paso es la validación. Probar si la nueva habilidad realmente funciona de forma segura.

Alicia
OK. Esta parte me dejó alucinada. El artículo menciona las Memento-Skills. Que usan rollbacks con pruebas unitarias. Como si el agente probara una habilidad revisada en un sandbox y falla, simplemente viaja en el tiempo y restaura la versión anterior y segura.

Beto
Exacto. Tiene que demostrar matemáticamente que la nueva versión es mejor o más segura antes de convertirse en una mejora permanente. Y solo después de pasar la validación pasa a la evolución del repositorio. Es decir, hundir la habilidad actualizada en una biblioteca global compartida para que otros agentes la usen.

Alicia
Bien, pero ¿qué pasa si se cuela una mala habilidad? Si estos agentes se actualizan y comparten habilidades globalmente entre plataformas, ¿no están arriesgando una contaminación generalizada?

Beto
Ese es el escenario de pesadilla.

Alicia
Sí. ¿Y si un agente aprende un atajo para gestionar almacenamiento que simplemente borra correos no leídos?

Beto
Esto plantea una pregunta importante y es uno de los grandes desafíos abiertos que identifica el artículo. Lo llaman "habilidades envenenadas".

Alicia
Habilidades envenenadas. Suena ominoso.

Beto
Lo es. Es lógica maliciosa o simplemente muy defectuosa que puede ocultarse en documentación de terceros. Si tu agente descarga una habilidad envenenada porque obtuvo altas puntuaciones de relevancia, podría ejecutar acciones inseguras directamente en tu máquina.

Alicia
Porque lo trata como memoria muscular de confianza: no lo cuestiona, lo ejecuta.

Beto
Exacto. Eso subraya la absoluta necesidad de gobernanza en tiempo de ejecución.

Alicia
¿Cómo se ve eso en la práctica?

Beto
Significa que necesitamos límites estrictos de permisos, detección de contaminación y un sistema para aislar y retirar de forma segura las habilidades peligrosas antes de que se propaguen y causen estragos. Tenemos que evaluar a estos agentes de forma distinta en adelante.

Alicia
Claro. Ya no podemos calificarlos solo por si acertaron la respuesta final a una trivia.

Beto
No. Tenemos que calificarlos por si eligieron una habilidad segura, rentable y confiable para llegar allí. Es evaluar el juicio, no solo el conocimiento.

Alicia
Wow. Bien. Hoy hemos cubierto muchísimo terreno. Empezamos con la brecha procedimental: por qué solo darle una herramienta a una IA no es suficiente.

Beto
La analogía de "la sierra eléctrica".

Alicia
Exacto. Y vimos cómo los agentes adquieren su propia memoria muscular digital, recuperan los procedimientos correctos de bibliotecas masivas y evolucionan constantemente esas habilidades según los costes y la retroalimentación del mundo real.

Beto
Los LLM del mañana no solo procesarán lenguaje. Estarán construyendo y compartiendo cajas de herramientas operativas.

Alicia
Entonces, ¿qué significa todo esto para ti, oyente?

La forma en que interactúas con la IA va a cambiar fundamentalmente. Vas a gestionar agentes que tienen su propia experiencia especializada. Tu trabajo no será ya darles instrucciones paso a paso.

Beto
No. Será mucho más sobre curar sus conjuntos de habilidades y darles objetivos de alto nivel para que los ejecuten.

Alicia
Exacto. Tratarlos como una fuerza laboral digital.

Pero quiero dejarte con un último pensamiento provocador para que lo mastiques. Hablamos de la evolución del repositorio, donde los agentes comparten habilidades actualizadas a través de un ecosistema sincronizado masivo, ....

Beto
... la biblioteca global.

Alicia
Correcto. Si millones de agentes de IA generan, refinan y comparten habilidades procedimentales a una velocidad que supera con creces la validación humana, ¿en qué momento ese ecosistema de habilidades se convierte en una nueva especie de cultura digital económica?

Si se están enseñando entre sí a operar en el mundo, ¿cómo nos aseguramos de que la memoria muscular que desarrollan esté alineada con los valores humanos?

Es un concepto salvaje para tratar de comprenderlo. Gracias por acompañarnos en este análisis profundo.

miércoles, 15 de abril de 2026

Informe Stanford 2026: IA en Ciencia

 
 

El texto presentado describe la rápida integración de la inteligencia artificial en diversos campos científicos, destacando 2025 como un año clave para los flujos de trabajo de investigación autónomos. Si bien la IA tradicionalmente ha ayudado en el análisis de datos, ahora está evolucionando hacia sistemas multiagente capaces de generar hipótesis, diseñar experimentos e incluso producir artículos revisados por pares. Se observan avances significativos en biología estructural, predicción meteorológica y ciencia de los materiales, impulsados por nuevos conjuntos de datos masivos y modelos fundamentales especializados. A pesar de estos avances, evaluaciones rigurosas revelan una brecha persistente entre los resultados generados por la IA y la fiabilidad de los expertos humanos, particularmente en la replicación de investigaciones complejas. Además, el informe subraya que la validación experimental sigue siendo un obstáculo crítico, ya que la capacidad de la IA para proponer descubrimientos supera actualmente la capacidad de la comunidad científica para ponerlos a prueba. En definitiva, el panorama está cambiando hacia una infraestructura de IA colaborativa, impulsada principalmente por instituciones académicas y gubernamentales, en lugar de solo por la industria.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: AI Index Report 2026 - Chapter 5 - Science. Publicado el 13 de Abril de 2026.

El resumen, la transcripción, la traducción, y las voces fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.

Escúchalo aquí, mientras lees la transcripción (abajo):

O escúchalo en Spotify.


Transcripción

Alicia
Ya sabes, normalmente cuando imaginamos un avance científico, nos imaginamos este momento muy específico, casi cinematográfico.

Beto
Oh, totalmente.

Alicia
Claro. Como que te imaginas al investigador exhausto con la bata blanca. Está encorvado sobre un microscopio a las dos de la mañana y de repente jadea porque por fin ha encontrado esa pieza faltante del rompecabezas. Es una imagen profundamente humana.

Beto
Sí. Es el clásico momento "Eureka". Innatamente vemos la ciencia como un esfuerzo profundamente humano impulsado totalmente por la intuición humana, noches sin dormir y pura perseverancia.

Alicia
Verdad. Pero a partir de abril de 2026, esa imagen está efectivamente muerta.

Beto
De verdad lo está.

Alicia
Bienvenidos al análisis profundo de hoy. Hoy abrimos el informe AI Index 2026 de Stanford HAI recién publicado. Nos vamos a centrar en el capítulo cinco, que está enteramente dedicado al estado de la ciencia. Y los datos que estamos viendo gritan una cosa innegable: la IA ya no es sólo el microscopio. Se está convirtiendo en el investigador.


IA en Ciencia en 2025: Surge el colega científico de IA

Beto
El cambio de paradigma aquí es monumental. Es enorme. Y para realmente situarlo, deberíamos mirar brevemente hacia atrás cómo llegamos a este punto exacto, porque no surgió de la nada.

Alicia
No, para nada.

Beto
La comunidad científica realmente pasó a una marcha completamente nueva tras el Premio Nobel de Química de 2024.

Alicia
Oh, claro. Por el plegamiento de proteínas.

Beto
Exacto. Cuando Demis Hassabis, John Jumper, y David Baker ganaron ese premio por su trabajo en la predicción de estructuras proteicas impulsada por IA, fue un momento totalmente trascendental. El comité Nobel esencialmente validó la IA no sólo como un truco computacional interesante, sino como un motor fundamental del descubrimiento biológico.

Alicia
Fue un enorme sello de aprobación.

Beto
Lo fue. Y si combinas esa inmensa validación con cosas como el Centro Europeo de Pronósticos Meteorológicos a Medio Plazo desplegando con éxito modelos meteorológicos de IA en operaciones diarias, pues tienes la base para la absoluta explosión de progreso que estamos viendo ahora mismo.

Alicia
Así que retrocedamos un poco. Porque antes de meternos en los avances específicos y salvajes de este informe, necesitamos comprender el volumen físico de integración de IA que está ocurriendo en todas las disciplinas.

Beto
Las cifras son asombrosas.

Alicia
De verdad son una avalancha. Por ejemplo, sólo en 2025, el número de publicaciones relacionadas con IA en las ciencias naturales alcanzó aproximadamente 80,150.

Beto
Vaya.

Alicia
Sí, eso es un incremento del 26% respecto a 2024.

Beto
Un cuarto del campo moviéndose en un solo año. Es una locura. Y cuando miras la producción total, dependiendo del campo específico, la IA ahora representa entre el 5.8% y el 8.8% de toda la investigación científica publicada globalmente.

Alicia
Lo que no suena a mucho hasta que miras la historia.

Beto
Para poner esa escala en perspectiva, en 2010 ese número estaba por debajo del 1%.

Alicia
Literalmente un error de redondeo.

Beto
Exactamente. Entonces era una metodología de nicho. Ahora es el motor.

Alicia
Lo que realmente me sorprendió del informe, sin embargo, es quién está liderando ese avance. Habría apostado por física pura o, no sé, ciencias de la computación. Pero las Ciencias de la Tierra actualmente tienen la mayor tasa de penetración de IA con un 8.8%.

Beto
Lo cual en realidad tiene perfecto sentido si consideras la mecánica cruda de las Ciencias de la Tierra.

Alicia
¿Cómo es eso?

Beto
Campos como la meteorología y la climatología dependen de estas redes globales de satélites y sensores que han estado volcando petabytes de datos estructurados a servidores durante décadas.

Alicia
Oh, y a la IA le encanta los datos estructurados.

Beto
Se alimenta de ellos. El informe de Stanford destaca algo mucho más fundamental que está pasando con todos estos datos. Nos estamos alejando de usar la IA para optimizar pasos individuales aislados en una tubería.

Alicia
Como solo limpiar imágenes de satélite o detectar un patrón aislado.

Beto
Exacto. Estamos pasando, de eso, a usar la IA para ejecutar todo el flujo de trabajo científico de extremo a extremo.

Alicia
El informe cita nuestro trabajo meteorológico para esto y el contraste es asombroso. Tradicionalmente, la predicción numérica del tiempo depende de una tubería masiva y compleja con docenas de pasos discretos diseñados por humanos.

Beto
Sí, muchas piezas móviles.

Alicia
Claro. Tienes ecuaciones de física, dinámica de fluidos y termodinámica todo ensamblado meticulosamente. Pero ArtVark Weather llegó y completamentó barrió esa tubería tradicional. La reemplazaron por un único sistema de aprendizaje automático.

Beto
Simplemente mira los datos meteorológicos pasados y predice los datos meteorológicos futuros de un solo golpe.

Alicia
Exacto. La diferencia entre mejorar una línea de montaje de una fábrica con trabajadores humanos más rápidos frente a derribar toda la fábrica y reemplazarla con una sola impresora 3D masiva que escupe el producto terminado.

Beto
Es una gran manera de decirlo. Elude por completo los pasos físicos diseñados por humanos y simplemente encuentra los patrones estadísticos subyacentes en la atmósfera.

Alicia
Lo que en realidad me lleva a una objeción importante que tuve al leer sobre estos reemplazos de flujo de trabajo. Si la IA está tomando sistemas enteros de extremo a extremo, ¿los científicos humanos van a convertirse simplemente en gestores de laboratorios para software?

Beto
Esa es una preocupación muy común.

Alicia
Quiero decir, ¿nos vamos a quedar sentados supervisando racks de servidores mientras la IA hace la ciencia real?

Beto
Esa es la ansiedad máxima en el campo ahora mismo. Pero pasa por alto una matización crucial sobre cómo aprenden realmente estos sistemas.

Alicia
OK. ¿Cuál es la matización?

Beto
Bueno, los avances más claros e innegables están ocurriendo en dominios científicos que ya poseen una enorme, profundamente organizada infraestructura de datos. Hablamos de campos como la biología estructural, la física y la química, donde los seres humanos han pasado generaciones catalogando las reglas de la realidad.

Alicia
Exacto. Las ciencias duras.

Beto
Sí. La IA no está generando marcos conceptuales totalmente novedosos de la nada. No está inventando las matemáticas de una nueva dimensión.

Alicia
Está sintetizando lo que ya existe.

Beto
Exacto. Está sintetizando las enormes cantidades de datos que ya hemos estructurado. En escala y velocidad, algo que físicamente no podemos igualar.

Alicia
Así que necesita que la mesa esté puesta antes de poder comerse el banquete.

Beto
Precisamente. Acelera la síntesis de datos existentes, en lugar de reemplazar la capacidad humana para saltos conceptuales fundamentales.

Alicia
Aquí es donde se pone realmente interesante, porque el informe desglosa exactamente dónde está ocurriendo esta aceleración. Y hay una sorpresa enorme escondida en la sección de biología.

Beto
Oh, esto es fascinante.

Alicia
En el mundo tecnológico más amplio, constantemente nos dicen que los modelos de IA más grandes siempre son mejores. Más grande es mejor, ¿no? En biología molecular ahora mismo, modelos más pequeños están superando activamente a los enormes.

Beto
Esto cambia por completo la narrativa de fuerza bruta computacional que hemos estado escuchando durante años.

Alicia
Exacto. Miremos el benchmark ProteinGym, que prueba qué tan bien una IA puede predecir los efectos de mutaciones en proteínas. Un modelo llamado MSA Pairformer ocupó el primer lugar. Ahora, si pensamos en parámetros como las conexiones digitales o sinapsis en el cerebro de una IA, las vías que usa para procesar información, MSA Pairformer sólo tiene 111 millones de ellas.

Beto
Eso es diminuto en términos actuales.

Alicia
Es minúsculo. Y aun así venció a métodos significativamente más grandes anteriores. Y vemos exactamente lo mismo en genómica con un modelo llamado GPN-STAR. Opera con apenas 200 millones de parámetros. Y superó por completo a un modelo masivo que corría con 40 mil millones de parámetros.

Beto
El mecanismo detrás de esto es simplemente genial. Cuando entrenas un modelo de lenguaje de propósito general para escribir correos o, no sé, poesía, el lenguaje humano es increíblemente desordenado.

Alicia
Oh, totalmente. Jerga, modismos, todo eso.

Beto
Está lleno de matices, ambigüedad y contexto cultural. Para entender todo ese desorden, la IA necesita un cerebro de miles de millones de parámetros. Pero los datos biológicos como el ADN y las secuencias de aminoácidos funcionan mucho más como un alfabeto finito y altamente estructurado.

Alicia
Las reglas de la biología molecular son estrictas.

Beto
Muy estrictas. Tener una arquitectura muy refinada y datos biológicos increíblemente limpios y curados importa mucho más que simplemente lanzar miles de millones de parámetros al problema.

Alicia
Esa eficiencia biológica está impulsando lo que parece ser la frontera más emocionante en las ciencias de la vida ahora mismo: la célula virtual.

El informe de Stanford destaca modelos como Evo 2 del ARC Institute y AlphaGenome de DeepMind. Evo 2 por sí solo fue entrenado en Open Genome 2, que es un conjunto de datos que contiene 9.3 billones de pares de bases de ADN curado de todos los dominios de la vida.

Beto
La ambición de la célula virtual no es sólo mapear el ADN. Es predecir las respuestas celulares a cosas como fármacos nuevos o mutaciones genéticas enteramente in silico.

Alicia
Probablemente debamos definir eso un segundo porque se oye mucho "wet lab" e "in silico" en este espacio.

"Wet lab" es tu ciencia física tradicional. Estás en una sala con pipetas, placas de Petri, reactivos químicos y células vivas reales.

Beto
Te ensucias las manos.

Alicia
Exacto. Mientras que "in silico" significa realizar el experimento completamente dentro de una simulación por computador.

Beto
Y si puedes simular con precisión cómo una célula compleja reaccionará a un nuevo compuesto químico in silico antes de poner un pie en un wet lab, la velocidad a la que podemos descubrir nuevos medicamentos se vuelve exponencial.

Alicia
Evitas meses de prueba y error físico.

Beto
Exacto.

Alicia
Y las implicaciones de velocidad son simplemente asombrosas en todos los frentes.

Volviendo a las Ciencias de la Tierra, hablamos de cómo tiene la mayor penetración de IA y los modelos fundacionales que están construyendo son aterradoramente rápidos.

Beto
Realmente lo son.

Alicia
El informe detalla FourCastNet 3. Este sistema genera un pronóstico global del tiempo a 60 días con un detalle bastante fino, como resolución de 2.5 grados, en menos de 4 minutos.

Beto
Utilizando sólo una GPU, una sola unidad de procesamiento gráfico.

Alicia
Esa es la parte más loca. Los enfoques anteriores requerían supercomputadoras del tamaño de una sala que trabajaban durante horas para hacer esto. FourCastNet 3 corre entre 8 y 60 veces más rápido que esos métodos tradicionales.

Beto
La ganancia de eficiencia es casi difícil de comprender.

Alicia
Podrías literalmente sentarte en tu escritorio, ejecutar docenas de posibles escenarios meteorológicos globales de dos meses para seguir la trayectoria potencial de un huracán y terminar antes de que tu café de la mañana se enfríe.

Beto
Y la astronomía está viendo un salto de infraestructura muy similar. El campo acaba de lanzar AION-1, que opera como el primer modelo fundacional de la astronomía.

Alicia
Oh, wow.

Beto
Sí, lo entrenaron con más de 200 millones de objetos celestes extraídos de cinco grandes encuestas astronómicas. Así que en lugar de que cada universidad construya sus propias herramientas aisladas, todo el campo se está moviendo hacia construir infraestructura fundacional de IA compartida a la que cualquier investigador pueda acceder.

Alicia
Pero si hablamos de capacidad bruta, mi dato favorito absoluto está en la sección de física. Es un agente de IA llamado Physics Supernova.

Beto
Oh, este es salvaje.

Alicia
Este agente literalmente participó en la Olimpiada Internacional de Física 2025. Ahora, estos no son solo ecuaciones de enchufar y resolver. Estos problemas requieren razonamiento lógico en múltiples pasos, conciencia espacial y aplicación conceptual profunda de las leyes de la física.

Beto
Son notoriamente difíciles para los humanos.

Alicia
Claro. Y Physics Supernova obtuvo 23.5 de 30. Quedó en el puesto 14 de 406 participantes humanos alcanzando el equivalente del nivel de medalla de oro.

Beto
Es simplemente increíble.

Alicia
Ahora tenemos una IA que puede razonablemente superar a algunos de los estudiantes de física más brillantes del planeta en problemas complejos.

Beto
Es una demostración asombrosa de procesamiento lógico. Creo que realmente necesitamos pisar el freno aquí.

Alicia
OK, para el tren del hype. Lo entiendo. Porque si estás sentado oyendo que la IA está ganando olimpiadas de física y prediciendo con precisión dos meses de clima global en cuatro minutos, tienes que preguntarte por qué no ha curado todas las enfermedades importantes y ha resuelto la fusión fría a estas alturas.

Beto
Exacto. Lo fascinante aquí es el enorme correctivo de realidad que exponen los benchmarks de 2025. Cuando miras debajo del capó de estos sistemas de extremo a extremo, hay una brecha evidente entre producción científica plausible y trabajo científico fiable.

Alicia
Sí, no son perfectos.

Beto
Los modelos pueden realizar actos aislados brillantes de cálculo, pero tropiezan violentamente cuando se trata de consistencia básica.

Alicia
Esto trae a colación la paradoja ChemBench, que honestamente me voló la cabeza. ChemBench es un benchmark de evaluación que contiene más de 2700 pares de preguntas y respuestas a través de distintas disciplinas de la química.

Beto
Una prueba muy exhaustiva.

Alicia
Claro. Y los modelos de vanguardia, los mejores que tenemos, en realidad superaron el promedio de expertos humanos en estas preguntas. Están superando a químicos profesionales en conjunto.

Beto
En las cosas realmente difíciles.

Alicia
Sí. Pero inexplicablemente, fallan de forma consistente en las tareas más básicas y fundamentales de la química. Me gusta pensarlo como contratar a un chef con estrella Michelin que puede ejecutar a la perfección un soufflé complejo, delicado y con muchas capas, pero que de alguna manera consigue activar la alarma de humo quemando una tostada todas las mañanas.

Beto
El fenómeno del "tostar-pan quemado" es la manera perfecta de visualizarlo. Y el mecanismo detrás de por qué ocurre esto es crucial. Los grandes modelos de lenguaje operan prediciendo el siguiente token más probable basándose en sus datos de entrenamiento.

Alicia
En realidad, no saben lo que están diciendo.

Beto
Exacto. No entienden inherente las propiedades físicas de los químicos de los que hablan. Así que una IA podría recitar fácilmente una vía de síntesis compleja porque memorizó un artículo avanzado específico de sus datos de entrenamiento.

Alicia
Claro.

Beto
Pero si le preguntas una cuestión de estequiometría ligeramente novedosa que requiere una comprensión fundamentada básica de la masa física, alucina completamente una respuesta, porque le falta un modelo fundamental de la realidad física.

Alicia
Y esa falta de anclaje físico, causa problemas enormes cuando pedimos a la IA hacer ciencia de extremo a extremo.

Beto
Realmente lo hace.

Alicia
El informe destaca un benchmark llamado ReplicationBench, que prueba la capacidad de una IA para replicar los hallazgos de artículos de astrofísica computacional. Los modelos de frontera puntúan por debajo del 20%.

Beto
Menos de uno de cada cinco intentos tiene éxito.

Alicia
Eso es terrible.

Beto
Lo es. Y vemos la misma falla estructural en Univert, que evalúa agentes de grandes modelos de lenguaje en preguntas de observación terrestre. Los agentes sólo alcanzaron un 33% de precisión. Peor aún, cuando estos agentes intentaron escribir el código Python necesario para procesar los datos de satélite, su código falló el 58% de las veces. La máquina literalmente rompe su propia tubería.

Alicia
Espera, más de la mitad de las veces el software simplemente se cae.

Beto
Sí. Y esto resalta una diferencia estructural profunda, en cómo se está desarrollando la IA para la ciencia, comparada con la IA en nuestros teléfonos. Los modelos fundacionales de propósito general, los que escriben correos o generan arte, están dominados por gigantes tecnológicas que raspan internet entero.

Alicia
Cierto. Tienen datos infinitos.

Beto
Pero los modelos de IA para la ciencia, provienen principalmente de instituciones académicas y gubernamentales. Los conjuntos de datos de ciencias de la Tierra, por ejemplo, provienen casi íntegramente de agencias espaciales públicas y universidades.

Alicia
Que es un grupo más pequeño.

Beto
Lo es. Estos datos son altamente especializados, increíblemente densos y fuertemente escrutados. Cuando una IA de propósito general alucina una línea en un poema, se considera creativa.

Alicia
Cierto.

Beto
Cuando una IA científica pierde un signo menos y una línea de código destinada a procesar datos de presión atmosférica, toda la tubería de investigación multimillonaria se colapsa. La precisión aquí no es negociable.

Alicia
Entonces, si los modelos individuales son estas entidades brillantes, pero tremendamente poco fiables, que siguen quemando la tostada, ¿cómo está la comunidad científica arreglando esto realmente? Porque el informe muestra que claramente están progresando a pesar de esas enormes tasas de fallo.

Beto
Bueno, el campo se dio cuenta de que confiar en un único agente de IA es un callejón sin salida. La solución a la que están llegando es flujos de trabajo multiagente.

Alicia
OK. Esencialmente es armar una cuadrilla tipo "Ocean's Eleven", pero para investigación científica.

Beto
En realidad es una analogía bastante precisa.

Alicia
Bien. Así que en lugar de pedirle a una IA solitaria que tenga la idea, escriba el código, y analice los datos, activas un equipo de agentes de IA especializados. Asignas a un agente a no hacer otra cosa que rastrear los últimos 20 años de literatura científica.

Beto
Exacto.

Alicia
Un segundo agente escribe el código Python basado en esa literatura.

Un tercer agente diseña los parámetros experimentales.

Y un cuarto agente simplemente actúa como escéptico revisando constantemente el trabajo de los otros tres y señalando errores lógicos.

Beto
Y esa especialización cambia por completo la dinámica de fiabilidad. El ejemplo más destacado de los datos de 2025 es el co-Scientist de IA de Google. Utiliza un marco que llaman "Generate-Debate-Evolve" loop.

Alicia
Generate-Debate-Evolve. ¿Cómo funciona eso?

Beto
El Agente A genera una hipótesis biológica basada en un conjunto de datos. El Agente B inmediatamente la debate, intentando activamente destruir la hipótesis comprobándola contra las leyes conocidas de la física y la biología.

Alicia
Hace de abogado del diablo.

Beto
Exacto. El Agente A toma esa crítica y evoluciona la hipótesis. Es un bucle iterativo a alta velocidad que imita el riguroso proceso de revisión por pares de un laboratorio humano.

Alicia
¿Y funciona mejor?

Beto
Los resultados son innegables. El co-científico de Google alcanzó un 78.4% de precisión en el conjunto GPQA Diamond, que es una de las pruebas de nivel doctoral más notoriamente difíciles que existen.

Alicia
Vaya, casi un 80%.

Beto
Y mejor aún, sus hipótesis fueron validadas en tres áreas biomédicas reales y distintas.

Alicia
Lo que suena fenomenal. Pero luego miras otro benchmark importante en el informe llamado PaperArena. PaperArena es una prueba que evalúa a estos agentes en preguntas reales y complejas de investigación, requiriéndoles buscar literatura, usar herramientas computacionales y llegar a respuestas novedosas.

Beto
Es una prueba muy práctica.

Alicia
Sí. En una configuración multiagente, Gemini 2.5 Pro tuvo el mejor desempeño, pero sólo alcanzó una tasa de acierto del 38.8%. Cuando leí eso por primera vez pensé: espera, ¿38.8%? Eso suena completamente desastroso para un sistema al que llamamos co-científico. ¿Se considera eso bueno?

Beto
Sé que suena bajo, pero para entender por qué los investigadores consideran el 38.8% una victoria enorme, tienes que mirar la línea base. La línea base de expertos PhD humanos en ese mismo benchmark es 83.5%.

Alicia
OK. Así que el mejor sistema de IA del mundo, con múltiples agentes, todavía está alcanzando menos de la mitad de lo que un experto PhD humano logra en estas tareas científicas de extremo a extremo.

Beto
Exacto. La IA definitivamente no está reemplazando al PhD humano por ahora. Sin embargo, lo que PaperArena probó más allá de toda duda es el poder de la arquitectura.

Alicia
El enfoque de la cuadrilla de atraco.

Beto
Exacto. En todos los frentes, las configuraciones multiagente superaron consistentemente a los agentes solitarios por dos a cuatro puntos porcentuales. La cuadrilla es demostrablemente más fiable que el operativo solitario, aunque todavía falle la mayoría de las veces.

Alicia
Y estamos viendo hitos enormes que prueban que esta arquitectura multiagente es el plano para el futuro. El informe detalla AI Scientist V2, de Sakana. Este sistema produjo el primer artículo totalmente generado por IA que fue aceptado en un taller académico revisado por pares, ICLR.

Beto
Eso es un gran logro.

Alicia
Realmente lo es. Y no usó plantillas codificadas por humanos. La IA generó la idea original, escribió el código experimental, ejecutó las pruebas, interpretó los datos y redactó el manuscrito final.

Beto
Totalmente de forma autónoma.

Alicia
Pero me dejó aún más sorprendida otro sistema llamado Kosmos. Kosmos no sólo escribió un artículo. Básicamente vivió en el laboratorio. Pusieron en marcha este sistema multiagente y corrió de forma autónoma hasta 12 horas seguidas.

Beto
Y en esa media jornada ejecutó 42,000 líneas de código. Estuvo constantemente leyendo, iterando y depurando su propio software, mientras simultáneamente analizaba 1,500 artículos científicos diferentes.

Alicia
Los colaboradores humanos que monitoreaban a Cosmos declararon que una sola corrida de 12 horas aproximaba seis meses de esfuerzo de investigación humana tradicional.

Beto
Condensar medio año de iteración en una sola tarde.

Alicia
Entonces, ¿qué significa todo esto cuando nos detenemos y miramos el tablero completo?

Si miramos el capítulo cinco del informe AI Index de Stanford, la conclusión central es absoluta: la IA está haciendo con éxito el salto de ser una herramienta analítica a convertirse en el motor fundamental del flujo de trabajo de la ciencia moderna.

Beto
Indudablemente.

Alicia
Estamos presenciando saltos asombrosos en velocidad, escala y la mera capacidad de procesar billones de pares de bases biológicos o mapear cientos de millones de galaxias. El experto humano sigue siendo el ancla crucial.

Beto
Todavía nos necesitan.

Alicia
Definitivamente necesitamos al PhD humano para diseñar los parámetros y supervisar los bucles de debate multiagente. Y, lo más importante, para atrapar la tostada quemada antes de que prenda fuego al laboratorio. Los sistemas no pueden confiarse por completo para operar de extremo a extremo de forma aislada todavía.

Beto
Si conectamos esto con la imagen más amplia del progreso humano, nos topamos con el cuello de botella inmóvil definitivo. Y ese cuello de botella, no es la potencia informática, ni el almacenamiento de datos.

Alicia
¿Qué es?

Beto
El cuello de botella es el mundo físico mismo.

Alicia
El "wet lab", la realidad material.

Beto
Exacto. La IA puede proponer computacionalmente cinco millones de estructuras moleculares nuevas para mañana por la mañana. Puede hipotetizar reacciones celulares totalmente nuevas o sugerir cientos de dianas farmacológicas desconocidas en una tarde in silico.

Alicia
Claro.

Beto
Pero la validación experimental, tomar esa brillante hipótesis digital y probar que funciona en un wet lab físico, o realizar ensayos clínicos humanos de varios años para asegurar que un fármaco sea seguro, sigue siendo increíblemente caro, tedioso y sujeto a las inmutables leyes del tiempo.

Alicia
No puedes avanzar el tiempo.

Beto
No, no puedes. El informe de Stanford apunta específicamente que mientras sistemas como AI Scientist V2 pueden escribir un flujo interminable de artículos plausibles, la lista de descubrimientos de IA, que han sido realmente confirmados experimentalmente, en el mundo real, sigue siendo sorprendentemente corta.

Alicia
Porque físicamente no podemos probar las cosas tan rápido como la IA las inventa. En descubrimiento de fármacos, puedes simular un enlace proteína-ligando en milisegundos. Pero los ensayos clínicos para determinar si esa molécula realmente cura a un paciente sin efectos secundarios siempre tomarán años. Simplemente no puedes acelerar la biología humana.

Beto
Estamos logrando cerrar la brecha entre la ideación digital y la realidad física. Pero la realidad física tiene un límite de velocidad estricto.

Alicia
Lo que nos deja con una tensión realmente fascinante. Y quiero dejarte con un pensamiento final para que lo mastiques mientras digieres todos estos números.

Si un sistema multiagente como Kosmos ahora puede literalmente condensar seis meses de codificación de investigación humana en una sola ejecución de 12 horas, ¿qué pasa cuando el principal cuello de botella para el progreso humano ya no sea nuestra falta de ideas?

Beto
Es una pregunta profunda.

Alicia
¿Qué le ocurre a la sociedad cuando nuestro mayor obstáculo es simplemente nuestra incapacidad física para probar el enorme volumen de teorías brillantes que nuestras máquinas están vomitando antes de la hora del almuerzo? ¿Vamos a ahogarnos en genialidad no verificada?

Beto
Hemos pasado siglos tanteando en la oscuridad, buscando desesperadamente una sola pieza brillante del rompecabezas. Ahora la máquina está tirando un millón de piezas brillantes sobre la mesa cada día.

Alicia
De repente, ese investigador solitario, a las dos de la mañana, ya no está luchando por encontrar un avance, está enterrado bajo una montaña de ellos.

Beto
Muchas gracias por acompañarnos en este análisis profundo del informe AI Index de Stanford.

Sigue leyendo, sigue explorando y sigue cuestionando los datos que te rodean. Nos vemos la próxima vez.