Mostrando las entradas para la consulta Diamond ordenadas por relevancia. Ordenar por fecha Mostrar todas las entradas
Mostrando las entradas para la consulta Diamond ordenadas por relevancia. Ordenar por fecha Mostrar todas las entradas

miércoles, 25 de febrero de 2009

Jared Diamond y el Colapso de Sociedades

Jared Diamond nos explica por qué colapsan las sociedades. 


Factores identificados en el pasado:
* destrucción del medio ambiente
* cambio y factores climáticos
* relaciones con los vecinos (vecinos enemigos, o amigos que se van o colapsan)
* factores políticos, económicos, sociales,etc

Esto explica el colapso de algunas sociedades antiguas tales como:
* los Mayas (de Mexico, Guatemala, y Honduras)
* los Anasazi
* polinesios de la isla de Pascua (destruyen su medio ambiente; terminan cometiendo canibalismo)

En tiempos modernos, han colapsado estas:
* la Unión Soviética
* Yugoslavia
* Rwanda
* Haití (se quedó sin árboles; miren la imagen del satélite)
* Norse (Vikingos) de Islandia

En las sociedades modernas se ven algunas a punto de colapsar:
* Australia (cambio climático)
* Colombia (en guerra civil)
* EEUU (clima, consumerismo, guerras, élites aisladas de los problemas)
* Filipinas (no tendrá árboles dentro de 5 años)
* Indonesia (deforestación)
* se divisa un colapso global

Cómo es posible que no hayan visto lo que estaban haciendo?
* Fallan en percibir los problemas
* Fallan en solucionar los problemas, una vez que los han identificado
- conflicto de intereses en las élites
* Es difícil cambiar valores obsoletos atrincherados
- la identidad británica en Australia, por ejemplo

El resultado (de que países sobrevivirán) lo veremos dentro de pocas décadas; finalmente se resuelven en:
* guerras,
* enfermedades, o,
* hambres.

"En un mundo con recursos limitados, los únicos que creen en crecimiento ilimitado son los idiotas y los economistas".

Video de su discurso en Google:
[duración: 1 hora 14 mins]


Referencias:
"Why Societies Collapse", Jared Diamond, video en TEDTalks
"How Societies Fail and Sometimes Succeed", Jared Diamond, video en Google
"Collapse: How Societies Fail or Succeed", Jared Diamond, libro en Amazon
"The Third Chimpanzee", Jared Diamond, libro en Amazon
"Guns, Germs, and Steel", Jared Diamond, libro en Amazon

martes, 1 de septiembre de 2009

La Cultura de la Muerte

Todos estamos interesados en entender la historia pasada, y la razón y causa que conduce a los acontecimientos futuros. Para el efecto, acudimos a establecer paralelos conceptuales, metáforas, que nos ayuden a simplificar y a identificar patrones.

Después de estudiar bastante, leyendo libros, y escuchando conferencias, logramos identificar algunas de las voces lúcidas, los líderes intelectuales del mundo (desafortunadamente ignorados por los líderes políticos). Así Alvin Toffler nos habla sobre las olas históricas; Jacques Attali visualiza el hiper-imperio que termina en hiper-conflicto; Chalmers Johnson y Joseph Stiglitz nos hablan sobre el imperio endeudado; Naomi Klein explica la "doctrina del Shock"; Jared Diamond escribe sobre el colapso de sociedades; Tariq Ali, sobre la erosión de los derechos humanos; y David C Korten, sobre los Paradigmas de Vida y Muerte; y como ellos, hay otros muchos autores que dejamos sin mencionar. 


 En los últimos 10 años hemos visto los desastres sociales y económicos causados por las ansias bélicas del imperio anglo-americano, y la privatización de la guerra. Académicos tales como Noam Chomsky nos ha expuesto las tramas de las élites que quieren perpetuar la cultura de la muerte, y nos ha explicado cómo, al mundo se le controla por tres formas de poder (político, económico e ideológico). Viendo las últimas noticias notamos lo que ya sabemos: que los demócratas se diferencian poco de los republicanos, y que la agenda imperial no ha cambiado; ahora el imperio se prepara para arrebatar los recursos naturales de Latinoamérica, con las propuestas bases en Colombia. La estrategia es siempre la misma: dividir y conquistar; causar conflictos, internos y externos, y mantener a las masas adormecidas con la adicción al entretenimiento.


La llamada "democracia capitalista" es simplemente una fachada para desposeer a los individuos de sus derechos, y dárselos a las corporaciones. Es un sistema de robo institucionalizado; una "cleptocracia", con un mercado tipo casino, que usa (y depende de) la guerra (militarismo keynesiano) como motor para mantener al capitalismo funcionando.  


 Bajo las leyes actuales, tiene más derechos una compañía, que una persona. ¿Quiénes pagan por la muerte de mujeres y niños en el mundo en conflicto? ... generaciones posteriores a quienes les han robado sus recursos ... heredando pobreza y esclavitud. ¿Quiénes pagan por los famosos "bailouts" para rescatar a las compañías fracasadas? La siguiente generación de ciudadanos, en impuestos elevados.


Y ahora, con los movimientos de globalización, vemos cómo las compañías se expanden por el mundo, causan estragos, y no se responsabilizan frente a nadie. Lo vemos, una y otra vez en los desastres ecológicos, en las crisis financieras, y en la privatización de la guerra. En la universidades no enseñan valores morales; y en las casas tampoco. 


En unificationtheory.com, vemos una teoría interesante, que dice que los problemas no empezaron con la revolución industrial, ni con el descubrimiento de América, sino van mucho más atrás en la historia de la humanidad, y se remontan a la Edad de Bronce.

Antes de la edad de Bronce, sucedió el Neolítico, la tercera edad de piedra, la era paradisíaca de la humanidad, donde se domestican los animales, se desarrolla la agricultura, la cerámica y el arte.

 Con la edad de los metales surgen los imperios que masacran a sus vecinos. La edad de Bronce trae las guerras, y la imposición de culturas de la muerte, que se suceden una tras otra, hasta llegar a donde estamos (en occidente: Egipto, Asiria, Babilonia, Medo-Persia, Grecia, Roma, Anglo-América). Oro, plata, bronce, hierro, ametralladoras, y, bombas atómicas. La pesadilla de Nabucodonosor ... (Daniel 2:31-45)


El Homo sapiens se prepara a desaparecer, para darle paso a un ser superior, mecánico, el robot de inteligencia artificial. (No se queja, no le da hambre, no requiere pago). Los sistemas biológicos se ven reemplazados por los sistemas mecánicos, de metal. Las culturas de vida, arte, artesanía, agricultura, se ven reemplazadas por una cultura de metal y muerte: armas (política), moneda (economía), y silicio (informática: Internet y robots), que destruye sistemáticamente al planeta y a los individuos. 


Deprimente, pero quedan todavía algunas ideas positivas, que nos pueden sacar del "atolladero". Las discutiremos en otra oportunidad.


Referencias:

"Dos Paradigmas: Vida o Muerte", nota pasada en mi blog
"Hiper-Imperio", nota pasada en mi blog
"Paradox of History: Social Worlds vs Technological Ecosystems", en UnificationTheory.com
"US Privatizes Colombian War with its Transnational Mercenaries, por Eva Golinger
"La Doctrina Obama ante la Depresión más Grande de la Historia", en América Latina en Movimiento
"La Crisis está empezando", Michel Husson (PDF)
"Bush's Third Term", por David Swanson
Derrame de petróleo, en la wikipedia
Deforestación, en la wikipedia
Guerras, en la wikipedia
"The Corporation", Mark Acbar (DVD)
"The Corporation: The Pathological Pursuit of Profit and Power", Joel Bakan (libro) en Amazon

domingo, 18 de octubre de 2009

Ray Kurtzweil y la Singularidad

El futurólogo Ray Kurtzweil, graduado en Ciencias de la Computación en MIT, y creador de la marca de sintetizadores musicales que lleva su nombre, nos habla sobre la "Singularidad Tecnológica". 


 El concepto de singularidad tecnológica se relaciona con Inteligencia Artificial que es capaz de mejorarse a si misma. En un futuro cercano, se predice que habrá una explosión exponencial de conocimiento, en el que las máquinas llegarán a ser mucho más inteligentes que los seres humanos.


Esta idea está basada en una extrapolación de la famosa ley de Moore, que dice que la densidad y capacidad de circuitos integrados se duplica cada dos años. La ley de Moore ha sido válida para el hardware durante los últimos 30 años. Kurtzweil la aplica a la información, y a otras tecnologías (computación, genética, cerebro, energía, nano-tecnología, robótica), y predice que en 25 años estas tecnologías serán un billón de veces más poderosas de lo que las conocemos actualmente. 

Todos los procesos físicos se pueden simular por computador. El cerebro humano es un proceso físico, así que se puede simular por computador.

Para el año 2029 ya habremos descifrado todos los secretos del cerebro humano. Habremos hecho ingeniería reversa a todas las regiones del cerebro, y habremos modelado y simulado estas regiones. Podremos desarrollar software que simulen todas las capacidades cerebrales, incluyendo los aspectos emosionales. De hecho, ya tenemos al alcance de unos pocos clicks, casi todo el conocimiento humano.

 Entre los varios proponentes de la ideas de la singularidad tecnológica, algunos predicen que surge la posibilidad para cooperación trans-humana (humano-máquina), que nos ayuda a amplificar el conocimiento. Se ven ya aplicaciones prácticas en los campos de "realidad aumentada", ingeniería genética, drogas inteligentes, interfaces cerebro-máquina, etc.


Esta explosión de tecnologías y conocimiento, tienen el potencial para mejorar significativamente la calidad de vida de los seres humanos. Al mismo tiempo, si cae en manos perversas, tiene el potencial de acabar con el planeta.

El Dr Kurtzweil propone que para el 2045 alcanzaremos la singularidad, y ve este fenómeno como algo positivo y desde un punto de vista optimista. Aunque admite que la tecnología ha siempre sido un "sable de dos filos", desde la era del fuego. ¿Qué peligros futuros podrían surgir?

Un peligro potencial de crear máquinas super-inteligentes es que pudieran llegar a la conclusión de que no somos necesarios, y decidan terminar con la vida humana (Berglas, 2008). Adicionalmente, el peligro de las tecnologías del siglo 21, robótica, nanotecnología y genética, es que estas se reproducen, tienen el potencial de destruir la biosfera, y pueden construirse fácilmente por compañías privadas o por laboratorios militares (Bill Joy, 2000). 


 Por otro lado, el Dr.Jared Diamond, MD, sugiere que quizás no logremos alcanzar la singularidad. En su libro "Colapso: Cómo las Sociedades deciden Fracasar o Tener Exito" dice que las sociedades alcanzan un límite auto-impuesto cuando se exceden en el uso del medio ambiente y el consumo de recursos estratégicos (maderas, tierras, agua). Esto crea un feedback positivo que eventualmente lleva al colapso sociológico y su capacidad tecnológica retrocede.


El sueño del Dr Kurtzweil es que lleguemos al punto en el que gradualmente seamos reemplazados por tecnología robótica, que es cuando alcancemos inmortalidad, al ser capaces de descargar nuestra conciencia en una máquina. Esto es a lo que él se refiere como "La Era de las Máquinas Espirituales". (Estamos al principio de este paso, al ser ahora capaces de tener implantes electrónicos en nuestro cuerpo). 

Algunos críticos (Richard Dooling) de esta última idea dicen que la singularidad es equivalente a "la doctrina del rapto para los tecnócratas", y la descartan como puro mito.

En su discurso en 2009 en TED, el Dr Kurtzweil anunció la creación de una nueva universidad llamada "Singularity University" para que expertos (a nivel postgrado y ejecutivos) en diferentes ramas de la ciencia, se reúnan e inspiren la exploración de este tema más a fondo. Estará localizada en el centro de NASA Ames en Silicon Valley. Ahí discutirán lo último que se conoce en bio-, nano-, info-, Inteligencia Artificial y campos relacionados, de manera inter-disciplinaria. Se enfocarán hacia los grandes desafíos de la humanidad. Se espera crear redes de ex-alumnos y facultad, para mantenerse en contacto, y promover la creación de empresas nuevas y proyectos de investigación en direcciones novedosas.

Referencias:
Ray Kurtzweil, en la wikipedia
Singularidad Tecnologica, en la wikipedia
"Artificial Intelligence will Kill Our Grandchildren", Berglas 2008
KurtzweilAI.net
Singularity University
"Why the Future Doesn't Need Us", Bill Joy (Wired Magazine)
"Ray Kurtzweil Explains the Coming Singularity", discurso en www.bigthink.com (YouTube)
"Ray Kurtzweil: A University for the Coming Singularity", discurso en TED (YouTube)
"The Singularity is Near: When Humans Transcend Biology", Ray Kurtzweil (2006), libro en Amazon
"The Age of Spiritual Machines", Ray Kurtzweil (2000), libro en Amazon
"El futuro: la fusión del alma y la tecnología", programa en español (27 min)

domingo, 7 de diciembre de 2025

Kimi K2

 
 

Hoy les traigo un resumen a otro modelo de razonamiento nuevo, Kimi K2, de código abierto, especializado para crear agentes autónomos. Está ganando popularidad debido a sus puntajes altos en los benchmarks y su diseño innovador.

Enlace al artículo científico, para aquellos que quieran profundizar en el tema: "Kimi K2: Open Agentic Intelligence", por el Equipo Kimi. Publicado el 28 de Julio del 2025.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Entonces, si has estado observando la evolución de los grandes modelos de lenguaje, sabes que el juego ha cambiado fundamentalmente. Ya no nos impresiona un modelo que solo puede predecir la siguiente palabra.

Beto
Para nada. Ese frente entero se ha movido. Realmente estamos entrando de lleno en esta era de lo que la gente llama "inteligencia agentiva".

Alicia
Y ese es el cambio de paradigma clave, ¿no?

Beto
Lo es. Una inteligencia agentiva significa que avanzamos hacia modelos que pueden, de forma autónoma, percibir, planificar, razonar y — esta es la parte crucial — actuar en entornos complejos.

Alicia
Es la diferencia entre un modelo que es un brillante analista y uno que es un colaborador capaz que realmente puede llevar un proyecto a cabo.

Beto
Exacto. Ejecutar un proyecto de múltiples pasos por su cuenta.

Alicia
Y liderando esa carga en el mundo del código abierto, haciendo esas capacidades accesibles a todo el mundo, es el tema del análisis de hoy. En Kimi K2 estamos abriendo el informe técnico sobre este enorme modelo de "Mezcla de Expertos" (MoE), y, sinceramente, las especificaciones son salvajes.

Beto
Oh, son absolutamente salvajes. Kimi K2 presume de este tamaño colosal: 1,04 billones de parámetros. Pero ese número es un poco engañoso, ¿no? Porque lo diseñaron con este increíble giro de eficiencia. Es ultra-escaso.

Alicia
Así que para cualquier token individual que procesas, solo se activan una fracción de esos parámetros.

Beto
Una fracción diminuta. Solo 32.000 millones de parámetros se activan realmente.

Alicia
Así que obtienes la potencia de rendimiento de un “cerebro” de billón de parámetros sin el coste de cómputo demencial que normalmente asociarías con eso. Es genial.

Beto
Lo es. Esa optimización es básicamente la piedra angular de todo el proyecto.

Alicia
Nuestra misión hoy, entonces, es desmenuzar el recorrido de Kimi K2. Específicamente, queremos ver las tres innovaciones clave que les permitieron preentrenar este modelo de forma estable a esa escala masiva, y luego cómo lo entrenaron para obtener resultados de vanguardia, especialmente en tareas prácticas como uso de herramientas y programación.


Resultados de Kimi K2

Beto
Y para enmarcar el contexto para quien nos escucha: el equipo de Kimi estaba afrontando un desafío que realmente todos los grandes laboratorios están enfrentando ahora mismo.

  • Primero, ¿cómo gestionas escala masiva y alta eficiencia al mismo tiempo?
  • Segundo, ¿cómo mantienes que el modelo siga aprendiendo cuando, francamente, el suministro de nuevos datos humanos de alta calidad está estancándose?

Alicia
Rápido. ¿Verdad? Si quieres que un modelo aprenda a actuar en el mundo, tiene que aprender activamente. A través de la interacción, probando y fallando; no puede aprender pasivamente de texto estático para siempre. El propio entrenamiento tuvo que convertirse en una innovación.

Beto
Bien. Desempaquetemos este plano para la estabilidad porque sin él, todo el proyecto de billón de parámetros simplemente explota.

Tenemos la arquitectura: 3,04 billones de parámetros en total, solo 32.000 millones activados. Está usando este diseño MoE ultra-escaso, activando solo ocho de 384 expertos disponibles por pasada.

Alicia
Eso lo hace altamente paralelizable. Ahí es donde obtienes la velocidad y la eficiencia. Pero al escalar ese tipo de arquitectura, especialmente en preentrenamiento, la estabilidad se convierte en una preocupación enorme y constante. El más pequeño error numérico puede simplemente compondar de forma loca.

Beto
Ese es exactamente el desafío que enfrentaron. Querían usar el optimizador token-eficiente Muon, que generalmente es más rápido y mejor converge.

Alicia
Pero es notorio por esto: puede conducir a inestabilidad catastrófica en el entrenamiento, lo que llaman "exploding attention-logits". ¿Puedes desglosarlo?

Beto
Sí, piensa en ello como un avión yendo supersónico. A medida que empujas los límites de velocidad y escala, la presión, los cálculos internos, todo empieza a volverse violentamente inestable. Ahora imagina que muy dentro del mecanismo de atención del modelo, las partes que deciden qué es importante empiezan a crecer exponencialmente. Y eventualmente simplemente obtienes un pico de pérdida completo. Tu entrenamiento se arruina.

Alicia
Entonces, ¿cómo resolvió esto el equipo de Kimi? ¿Cuál fue su cortafuegos técnico?

Beto
La solución es la innovación número uno. El optimizador MuonClip es un matrimonio realmente ingenioso. Mantuvieron la velocidad del algoritmo Muon, pero integraron este mecanismo quirúrgico de estabilidad que llamaron QK-Clip.

Alicia
QK-Clip suena como un seguro de seguridad. ¿Cómo funciona?

Beto
Es una intervención muy elegante. Funciona reescalando los pesos de las proyecciones de queries y keys justo después de una actualización de parámetros. Pero aquí está la parte ingeniosa: no lo hace todo el tiempo.

Alicia
Oh, solo cuando es necesario.

Beto
Exactamente. Solo interviene si el max-logit de atención — ese pequeño valor que señala inestabilidad — excede un umbral preestablecido. Para Kimi K2, fijaron ese umbral, τ, en 100. Es mínimo. Solo interviene en el último segundo para acotar suavemente el crecimiento.

Alicia
Si construyes sistemas a esta escala, la prueba de estabilidad es probablemente el detalle más importante en todo este informe. Y aquí es donde se vuelve asombroso. La documentación dice que el entrenamiento de Kimi K2 no tuvo picos de pérdida en todo el proceso de consumir 15,5 billones de tokens.

Beto
Hagamos una pausa en eso. 15,5 billones de tokens. Es una cantidad de datos casi inconcebible. Y mantener total estabilidad numérica a lo largo de toda esa corrida es, simplemente, sin precedentes para un MoE de este tamaño. MuonClip claramente funcionó.

Alicia
Absolutamente. Esa estabilidad luego les liberó para perseguir la innovación número dos, que se trata de maximizar la inteligencia que podían exprimir de cada token individual.

Beto
Como dijimos, los datos humanos de alta calidad son finitos. Podrías repetirlos, claro. Pero eso solo lleva al sobreajuste con rendimientos decrecientes.

Alicia
Estás peleando ese trade-off. Necesitas exponer al modelo lo suficiente a los datos para que aprenda, pero no tantas veces que simplemente lo memorice todo y no pueda generalizar.

Beto
Y su solución fue generar nuevo contenido a partir de sus datos existentes.

Alicia
Y ahí es donde entra la reformulación de datos.

Beto
Precisamente. Diseñaron una estrategia de generación de datos sintéticos. No se limitaron a traducir o resumir. Pasaron los datos por una canalización de reformulación de alta calidad, enfocándose en dominios como conocimiento y matemáticas.

Alicia
Así que son los mismos hechos presentados en diferentes estilos, tonos y perspectivas.

Beto
Exacto. Variaciones de alta fidelidad del texto original.

Alicia
Eso suena un poco abstracto, pero sus propios estudios de ablación hacen la propuesta de valor cristalina. Tomaron una tarea estándar de conocimiento, QA simple. Si simplemente repetían los datos crudos 10 veces y entrenaban el modelo durante 10 épocas, ¿cuál fue el resultado?

Beto
La precisión fue 23,76%. Eso es tu rendimiento decreciente clásico.

Alicia
OK. Pero luego probaron la estrategia de reformulación.

Beto
Compáralo. Reformularon los datos 10 veces y luego entrenaron el modelo por solo una época en esos datos sintéticamente aumentados. La precisión saltó a 28,94%.

Alicia
Wow. Eso es un incremento de casi cinco puntos porcentuales en precisión con una décima parte del tiempo de entrenamiento. Y no estás arriesgando sobreajustar al material original. Simplemente demuestra que la reformulación sintética es una forma poderosa y viable de aumentar tus datos.

Beto
Bien. Ahora pasamos del pre-entrenamiento central, de construir este cerebro estable y eficiente, a la fase de post-entrenamiento. Y aquí es donde enseñan al modelo a convertirse en un agente sofisticado. Capaz de planificación de múltiples pasos y uso de herramientas externas. Aquí es donde el caucho realmente se encuentra con la carretera.

Alicia
Lo es. Este es el meollo de la inteligencia agentiva porque estas capacidades de alto nivel — planificación, uso de herramientas, recuperación de errores— son realmente raras en los datos web. Quiero decir, los humanos no suelen escribir todo su proceso paso a paso cuando usan, por ejemplo, un software complejo. Así que tienes que sintetizar esos datos.

Beto
Por eso construyeron una canalización de síntesis de datos agentiva increíblemente robusta. Es como una máquina de tres etapas para generar estos problemas de práctica para la IA.

La etapa uno es simplemente construir el universo de herramientas. Crearon un repositorio masivo. Tiene más de 3.000 herramientas MCP (Model Context Protocols) reales. Y luego lo complementaron con más de 20.000 herramientas sintéticas.

Alicia
Y estas cubren de todo, ¿verdad? Comercio financiero, control de robots.

Beto
Todo. Comercio financiero, APIs de control robótico, aplicaciones de software complejas. Es increíblemente diverso.

Alicia
Bien. Eso es la etapa uno. La etapa dos es generar los escenarios. No puedes simplemente tener una herramienta. Necesitas una razón para usarla.

Beto
Correcto. Hay miles de agentes virtuales distintos con prompts de sistema diferentes como “eres un asesor financiero cauteloso” o “eres un solucionador de bugs agresivo”. Y luego emparejaron esos agentes con tareas que tenían rúbricas de éxito explícitas.

Alicia
Y luego la etapa tres es la generación de trayectorias. Esto es simular los diálogos ida y vuelta reales.

Beto
Exacto. Usan un simulador de herramientas sofisticado que actualiza el estado del entorno después de cada llamada a la herramienta para que se sienta realista.

Alicia
Pero la simulación tiene sus límites. No puedes realmente simular la realidad desordenada de escribir código que simplemente falla, ¿puedes?

Beto
No puedes. Absolutamente no. Y por eso hicieron este enfoque híbrido vital. Para tareas de programación y software donde necesitas ejecución verificable, usaron sandboxes de ejecución reales.

Alicia
Así que el modelo realmente ejecuta el código, ¿verdad?

Beto
Sí. El sandbox ejecuta el código. Proporciona errores de compilación reales o retroalimentación de éxito. Asegura que el modelo esté aprendiendo de la autenticidad desordenada del mundo real de programar.

Alicia
Así que una vez que tuvieron ese tesoro de datos agentivos auténticos, pasaron al fine-tuning con aprendizaje por refuerzo (RL). ¿Por qué es tan crítico RL aquí comparado con, digamos, solo "afinamiento supervisado" ("supervised fine-tuning", SFT)?

Beto
SFT enseña imitación. RL enseña toma de decisiones secuencial. El comportamiento agentivo trata sobre una secuencia de acciones que conducen a una meta y SFT simplemente no captura bien esa consecuencia a largo plazo.

Alicia
Es miope.

Beto
Lo es. RL permite al modelo aprender no solo qué hacer a continuación, sino qué acciones conducen a una alta recompensa en toda la tarea y mejora la generalización y la eficiencia de tokens porque el modelo aprende a priorizar acciones que realmente mueven la aguja.

Alicia
Eso tiene sentido perfecto.

Y esto nos lleva a la innovación número tres. El marco RL conjunto, que usa de forma inteligente dos tipos diferentes de recompensas según la tarea.

Beto
Correcto. Para dominios objetivamente verificables, piensa en matemáticas, STEM (ciencia, tecnología, ingeniería, matemáticas), programación, usan lo que llaman "recompensas verificables" (RLVR). Estas son recompensas duras. El resultado es medible por máquina, como un intérprete de código que indica éxito o un solucionador matemático que confirma una respuesta.

Alicia
Pero, ¿qué pasa cuando la tarea es subjetiva, como escribir una historia o responder una pregunta abierta donde no hay una única respuesta correcta?

Beto
Ahí entra la recompensa de rúbrica de autocrítica. Para esas tareas subjetivas, el modelo básicamente se convierte en su propio juez. Genera múltiples salidas y luego realiza evaluaciones críticas por pares contra un conjunto de rúbricas realmente complejo.

Alicia
¿Así que se está calificando a sí mismo?

Beto
De una forma muy sofisticada. Las rúbricas incluyen valores centrales, como la claridad, pero también reglas prescriptivas diseñadas para evitar comportamientos negativos como “reward hacking” o respuestas ambiguas.

Alicia
El modelo se está enseñando alineamiento usando su propio sistema de puntuación interna. Es meta-aprendizaje en su máxima expresión.

Beto
Lo es. Y añadieron dos optimizaciones clave más en el algoritmo RL mismo.

Alicia
La primera suena como una buena lección para todos nosotros: control de presupuesto.

Beto
Ah, sí. Es restricción editorial. Hicieron cumplir un presupuesto máximo de tokens por muestra durante el entrenamiento RL. Esto es crítico porque impide que el modelo genere tokens sin fin. El equivalente IA de divagar. Lo obliga a ser conciso y eficaz.

Alicia
Así que no hay relleno ni titubeos. La eficiencia se recompensa.

Beto
Exactamente. Y en segundo lugar, usan la pérdida PTX, que es una pérdida auxiliar. Esto es básicamente para combatir el olvido catastrófico. Asegura que el modelo no olvide todo lo valioso que aprendió durante el pre-entrenamiento mientras se especializa en estas nuevas tareas agentivas. Mantiene su poder de generalización.

Alicia
Entonces, ¿qué significa todo esto cuando miramos las puntuaciones brutas de rendimiento? El veredicto es bastante claro. Kimi K2 Instruct es estado del arte entre los modelos de código abierto. Y está cerrando de manera decisiva la brecha con gigantes propietarios como Claude 4 y GPT-4.1.

Beto
Y su entrenamiento especializado para agentes realmente brilla en esas tareas multi-paso complejas. Pero para quien nos escucha, deberíamos aclarar un término que hemos estado usando: modelos “no reflexivos”.

Alicia
Sí. Definámoslo.

Beto
En el contexto de estos benchmarks, “non-thinking” (no reflexivo) se refiere simplemente a la ejecución en una sola pasada. El modelo recibe el prompt, recibe la tarea y genera la respuesta final de una sola vez.

Alicia
Sin segundas oportunidades.

Beto
Sin autocorrección interna, sin reflexión, sin marcos multi-agente. Muchos modelos propietarios usan ahora esos pasos internos de reflexión para subir sus puntuaciones. Las puntuaciones de Kimi K2 se logran sin esa muleta, lo que las hace aún más impresionantes.

Alicia
Bien. Con ese contexto, miremos los benchmarks de ingeniería de software. Y SWE-bench Verified, que es esta prueba agentiva brutalmente difícil.

Beto
Trata de arreglar bugs del mundo real, es dura.

Alicia
Kimi K2 alcanzó una tasa de éxito en un solo intento del 65,8%.

Beto
Eso es simplemente, es absolutamente dominante en ese ajuste de “una sola pasada”. Para poner ese 65,8% en perspectiva, aplasta el 38,8% de DeepSeek-V3, e incluso supera el 54,6% de GPT-4.1 en el mismo setting no reflexivo.

Alicia
Entonces está demostrando esta habilidad sin precedentes en reparación compleja de código.

Beto
Y comprensión, sí.

Alicia
Y sus capacidades generalizadas de uso de herramientas mantienen esa ventaja. En τ2Bench alcanzó 66,1% y en ACEBench 76,5%. Estos números simplemente confirman su fortaleza, no solo en codificación, sino en uso de herramientas impulsado por agentes en escenarios de múltiples turnos de todo tipo.

Beto
Pero tienes razón, no es solo un especialista. Es un generalista muy sólido. Sus puntuaciones de razonamiento son fenomenales. En GBQA-Diamond, que es esencialmente un benchmark de razonamiento a nivel de posgrado, alcanza 75,1%. Eso lidera todas las demás líneas base no reflexivas.

Alicia
Lo que muestra que el preentrenamiento fundamental, los datos y la arquitectura, están a un nivel muy alto.

Beto
Lo están.

Alicia
Pero mientras estas puntuaciones técnicas son esenciales para nosotros, la validación final para ti, el aprendiz, es la preferencia real del usuario. Quiero decir, ¿realmente se siente mejor usarlo?

Beto
Ese es el verdadero test. Y para eso miramos el ranking LMS-YS Arena, que se basa en miles de comparaciones directas cara a cara por usuarios reales.

Alicia
¿Y qué destaca ahí?

Beto
En el leaderboard del 17 de julio de 2025, Kimi K2 Instruct se ubicó como el modelo de código abierto número uno disponible al público. Y quedó quinto en el ranking general del gráfico completo, compitiendo directamente contra todos los modelos propietarios, basado en más de 3.000 votos de usuarios. Eso confirma su calidad práctica y utilidad tanto en inglés como en chino. Quiero decir, esa es la señal más fuerte que puedes obtener de que la tecnología es prácticamente efectiva.

Alicia
Entonces, ¿cuál es la síntesis general aquí?

Kimi K2 representa realmente esta integración exitosa de escala masiva — esos billones de parámetros — con estabilidad radical de entrenamiento gracias a MuonClip, y luego este aprendizaje autodirigido altamente sofisticado ...

Beto
... a través de datos sintéticos de reformulación y ese marco RL conjunto.

Alicia
Para ti, el curioso, este modelo significa un gran paso. La IA de código abierto está avanzando tan rápido. Está pasando de la generación simple de texto y entrando profundamente en dominios prácticos orientados a tareas: ingeniería de software, razonamiento complejo, uso de herramientas.

Beto
Estas son capacidades que están siendo accesibles mediante pesos abiertos. Está nivelando el campo de juego a lo grande.

Alicia
Sin embargo, el equipo de Kimi fue muy honesto sobre las limitaciones internas que encontraron, lo cual siempre señala hacia dónde debe ir la investigación a continuación.

Beto
Absolutamente. Señalaron que el modelo a veces genera demasiados tokens en tareas de razonamiento realmente difíciles, o cuando la definición de la herramienta está dada o es poco clara; ese control de presupuesto ayuda, pero no es perfecto.

Alicia
¿Lo que puede llevar a salidas truncadas o subóptimas?

Beto
Correcto. Y también, aunque sobresale dentro de un framework agentivo de codificación, tratar de hacerle construir un proyecto de software completo y multiarchivo con un prompt de una sola pasada, todavía no es su mejor caso de uso. Aún necesitas ese entorno agentivo envolvente.

Alicia
Y eso nos lleva a un pensamiento final provocador, que se centra en la tensión en ese marco RL conjunto, específicamente el mecanismo de recompensa de autocrítica que detallaste antes.

Beto
Es una elección de diseño fascinante. Ese sistema, por su propia naturaleza, penaliza intencionalmente la auto-cuestionación y el lenguaje ambiguo.

Alicia
Así que no le gustan los “tal vez” o los “parece que...”.

Beto
No, recompensa la decisión, la finalización confiada de la tarea. Y a medida que construimos estos agentes altamente capaces, exigimos confianza, ¿no? Necesitamos que hagan el trabajo.

Alicia
Que sean decididos. Pero la pregunta sigue: si los entrenamos para penalizar la titubez y la auto-cualificación, ¿cómo equilibramos esa necesidad de acción confiada con la honestidad intelectual de mostrar una incertidumbre calibrada? Especialmente cuando una situación es genuinamente ambigua o los datos están incompletos.

Beto
Esa tensión, esa tensión entre confianza e incertidumbre. Eso es lo que va a definir la próxima ola de desarrollo avanzado de agentes.

miércoles, 15 de abril de 2026

Informe Stanford 2026: IA en Ciencia

 
 

El texto presentado describe la rápida integración de la inteligencia artificial en diversos campos científicos, destacando 2025 como un año clave para los flujos de trabajo de investigación autónomos. Si bien la IA tradicionalmente ha ayudado en el análisis de datos, ahora está evolucionando hacia sistemas multiagente capaces de generar hipótesis, diseñar experimentos e incluso producir artículos revisados por pares. Se observan avances significativos en biología estructural, predicción meteorológica y ciencia de los materiales, impulsados por nuevos conjuntos de datos masivos y modelos fundamentales especializados. A pesar de estos avances, evaluaciones rigurosas revelan una brecha persistente entre los resultados generados por la IA y la fiabilidad de los expertos humanos, particularmente en la replicación de investigaciones complejas. Además, el informe subraya que la validación experimental sigue siendo un obstáculo crítico, ya que la capacidad de la IA para proponer descubrimientos supera actualmente la capacidad de la comunidad científica para ponerlos a prueba. En definitiva, el panorama está cambiando hacia una infraestructura de IA colaborativa, impulsada principalmente por instituciones académicas y gubernamentales, en lugar de solo por la industria.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: AI Index Report 2026 - Chapter 5 - Science. Publicado el 13 de Abril de 2026.

El resumen, la transcripción, la traducción, y las voces fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.

Escúchalo aquí, mientras lees la transcripción (abajo):

O escúchalo en Spotify.


Transcripción

Alicia
Ya sabes, normalmente cuando imaginamos un avance científico, nos imaginamos este momento muy específico, casi cinematográfico.

Beto
Oh, totalmente.

Alicia
Claro. Como que te imaginas al investigador exhausto con la bata blanca. Está encorvado sobre un microscopio a las dos de la mañana y de repente jadea porque por fin ha encontrado esa pieza faltante del rompecabezas. Es una imagen profundamente humana.

Beto
Sí. Es el clásico momento "Eureka". Innatamente vemos la ciencia como un esfuerzo profundamente humano impulsado totalmente por la intuición humana, noches sin dormir y pura perseverancia.

Alicia
Verdad. Pero a partir de abril de 2026, esa imagen está efectivamente muerta.

Beto
De verdad lo está.

Alicia
Bienvenidos al análisis profundo de hoy. Hoy abrimos el informe AI Index 2026 de Stanford HAI recién publicado. Nos vamos a centrar en el capítulo cinco, que está enteramente dedicado al estado de la ciencia. Y los datos que estamos viendo gritan una cosa innegable: la IA ya no es sólo el microscopio. Se está convirtiendo en el investigador.


IA en Ciencia en 2025: Surge el colega científico de IA

Beto
El cambio de paradigma aquí es monumental. Es enorme. Y para realmente situarlo, deberíamos mirar brevemente hacia atrás cómo llegamos a este punto exacto, porque no surgió de la nada.

Alicia
No, para nada.

Beto
La comunidad científica realmente pasó a una marcha completamente nueva tras el Premio Nobel de Química de 2024.

Alicia
Oh, claro. Por el plegamiento de proteínas.

Beto
Exacto. Cuando Demis Hassabis, John Jumper, y David Baker ganaron ese premio por su trabajo en la predicción de estructuras proteicas impulsada por IA, fue un momento totalmente trascendental. El comité Nobel esencialmente validó la IA no sólo como un truco computacional interesante, sino como un motor fundamental del descubrimiento biológico.

Alicia
Fue un enorme sello de aprobación.

Beto
Lo fue. Y si combinas esa inmensa validación con cosas como el Centro Europeo de Pronósticos Meteorológicos a Medio Plazo desplegando con éxito modelos meteorológicos de IA en operaciones diarias, pues tienes la base para la absoluta explosión de progreso que estamos viendo ahora mismo.

Alicia
Así que retrocedamos un poco. Porque antes de meternos en los avances específicos y salvajes de este informe, necesitamos comprender el volumen físico de integración de IA que está ocurriendo en todas las disciplinas.

Beto
Las cifras son asombrosas.

Alicia
De verdad son una avalancha. Por ejemplo, sólo en 2025, el número de publicaciones relacionadas con IA en las ciencias naturales alcanzó aproximadamente 80,150.

Beto
Vaya.

Alicia
Sí, eso es un incremento del 26% respecto a 2024.

Beto
Un cuarto del campo moviéndose en un solo año. Es una locura. Y cuando miras la producción total, dependiendo del campo específico, la IA ahora representa entre el 5.8% y el 8.8% de toda la investigación científica publicada globalmente.

Alicia
Lo que no suena a mucho hasta que miras la historia.

Beto
Para poner esa escala en perspectiva, en 2010 ese número estaba por debajo del 1%.

Alicia
Literalmente un error de redondeo.

Beto
Exactamente. Entonces era una metodología de nicho. Ahora es el motor.

Alicia
Lo que realmente me sorprendió del informe, sin embargo, es quién está liderando ese avance. Habría apostado por física pura o, no sé, ciencias de la computación. Pero las Ciencias de la Tierra actualmente tienen la mayor tasa de penetración de IA con un 8.8%.

Beto
Lo cual en realidad tiene perfecto sentido si consideras la mecánica cruda de las Ciencias de la Tierra.

Alicia
¿Cómo es eso?

Beto
Campos como la meteorología y la climatología dependen de estas redes globales de satélites y sensores que han estado volcando petabytes de datos estructurados a servidores durante décadas.

Alicia
Oh, y a la IA le encanta los datos estructurados.

Beto
Se alimenta de ellos. El informe de Stanford destaca algo mucho más fundamental que está pasando con todos estos datos. Nos estamos alejando de usar la IA para optimizar pasos individuales aislados en una tubería.

Alicia
Como solo limpiar imágenes de satélite o detectar un patrón aislado.

Beto
Exacto. Estamos pasando, de eso, a usar la IA para ejecutar todo el flujo de trabajo científico de extremo a extremo.

Alicia
El informe cita nuestro trabajo meteorológico para esto y el contraste es asombroso. Tradicionalmente, la predicción numérica del tiempo depende de una tubería masiva y compleja con docenas de pasos discretos diseñados por humanos.

Beto
Sí, muchas piezas móviles.

Alicia
Claro. Tienes ecuaciones de física, dinámica de fluidos y termodinámica todo ensamblado meticulosamente. Pero ArtVark Weather llegó y completamentó barrió esa tubería tradicional. La reemplazaron por un único sistema de aprendizaje automático.

Beto
Simplemente mira los datos meteorológicos pasados y predice los datos meteorológicos futuros de un solo golpe.

Alicia
Exacto. La diferencia entre mejorar una línea de montaje de una fábrica con trabajadores humanos más rápidos frente a derribar toda la fábrica y reemplazarla con una sola impresora 3D masiva que escupe el producto terminado.

Beto
Es una gran manera de decirlo. Elude por completo los pasos físicos diseñados por humanos y simplemente encuentra los patrones estadísticos subyacentes en la atmósfera.

Alicia
Lo que en realidad me lleva a una objeción importante que tuve al leer sobre estos reemplazos de flujo de trabajo. Si la IA está tomando sistemas enteros de extremo a extremo, ¿los científicos humanos van a convertirse simplemente en gestores de laboratorios para software?

Beto
Esa es una preocupación muy común.

Alicia
Quiero decir, ¿nos vamos a quedar sentados supervisando racks de servidores mientras la IA hace la ciencia real?

Beto
Esa es la ansiedad máxima en el campo ahora mismo. Pero pasa por alto una matización crucial sobre cómo aprenden realmente estos sistemas.

Alicia
OK. ¿Cuál es la matización?

Beto
Bueno, los avances más claros e innegables están ocurriendo en dominios científicos que ya poseen una enorme, profundamente organizada infraestructura de datos. Hablamos de campos como la biología estructural, la física y la química, donde los seres humanos han pasado generaciones catalogando las reglas de la realidad.

Alicia
Exacto. Las ciencias duras.

Beto
Sí. La IA no está generando marcos conceptuales totalmente novedosos de la nada. No está inventando las matemáticas de una nueva dimensión.

Alicia
Está sintetizando lo que ya existe.

Beto
Exacto. Está sintetizando las enormes cantidades de datos que ya hemos estructurado. En escala y velocidad, algo que físicamente no podemos igualar.

Alicia
Así que necesita que la mesa esté puesta antes de poder comerse el banquete.

Beto
Precisamente. Acelera la síntesis de datos existentes, en lugar de reemplazar la capacidad humana para saltos conceptuales fundamentales.

Alicia
Aquí es donde se pone realmente interesante, porque el informe desglosa exactamente dónde está ocurriendo esta aceleración. Y hay una sorpresa enorme escondida en la sección de biología.

Beto
Oh, esto es fascinante.

Alicia
En el mundo tecnológico más amplio, constantemente nos dicen que los modelos de IA más grandes siempre son mejores. Más grande es mejor, ¿no? En biología molecular ahora mismo, modelos más pequeños están superando activamente a los enormes.

Beto
Esto cambia por completo la narrativa de fuerza bruta computacional que hemos estado escuchando durante años.

Alicia
Exacto. Miremos el benchmark ProteinGym, que prueba qué tan bien una IA puede predecir los efectos de mutaciones en proteínas. Un modelo llamado MSA Pairformer ocupó el primer lugar. Ahora, si pensamos en parámetros como las conexiones digitales o sinapsis en el cerebro de una IA, las vías que usa para procesar información, MSA Pairformer sólo tiene 111 millones de ellas.

Beto
Eso es diminuto en términos actuales.

Alicia
Es minúsculo. Y aun así venció a métodos significativamente más grandes anteriores. Y vemos exactamente lo mismo en genómica con un modelo llamado GPN-STAR. Opera con apenas 200 millones de parámetros. Y superó por completo a un modelo masivo que corría con 40 mil millones de parámetros.

Beto
El mecanismo detrás de esto es simplemente genial. Cuando entrenas un modelo de lenguaje de propósito general para escribir correos o, no sé, poesía, el lenguaje humano es increíblemente desordenado.

Alicia
Oh, totalmente. Jerga, modismos, todo eso.

Beto
Está lleno de matices, ambigüedad y contexto cultural. Para entender todo ese desorden, la IA necesita un cerebro de miles de millones de parámetros. Pero los datos biológicos como el ADN y las secuencias de aminoácidos funcionan mucho más como un alfabeto finito y altamente estructurado.

Alicia
Las reglas de la biología molecular son estrictas.

Beto
Muy estrictas. Tener una arquitectura muy refinada y datos biológicos increíblemente limpios y curados importa mucho más que simplemente lanzar miles de millones de parámetros al problema.

Alicia
Esa eficiencia biológica está impulsando lo que parece ser la frontera más emocionante en las ciencias de la vida ahora mismo: la célula virtual.

El informe de Stanford destaca modelos como Evo 2 del ARC Institute y AlphaGenome de DeepMind. Evo 2 por sí solo fue entrenado en Open Genome 2, que es un conjunto de datos que contiene 9.3 billones de pares de bases de ADN curado de todos los dominios de la vida.

Beto
La ambición de la célula virtual no es sólo mapear el ADN. Es predecir las respuestas celulares a cosas como fármacos nuevos o mutaciones genéticas enteramente in silico.

Alicia
Probablemente debamos definir eso un segundo porque se oye mucho "wet lab" e "in silico" en este espacio.

"Wet lab" es tu ciencia física tradicional. Estás en una sala con pipetas, placas de Petri, reactivos químicos y células vivas reales.

Beto
Te ensucias las manos.

Alicia
Exacto. Mientras que "in silico" significa realizar el experimento completamente dentro de una simulación por computador.

Beto
Y si puedes simular con precisión cómo una célula compleja reaccionará a un nuevo compuesto químico in silico antes de poner un pie en un wet lab, la velocidad a la que podemos descubrir nuevos medicamentos se vuelve exponencial.

Alicia
Evitas meses de prueba y error físico.

Beto
Exacto.

Alicia
Y las implicaciones de velocidad son simplemente asombrosas en todos los frentes.

Volviendo a las Ciencias de la Tierra, hablamos de cómo tiene la mayor penetración de IA y los modelos fundacionales que están construyendo son aterradoramente rápidos.

Beto
Realmente lo son.

Alicia
El informe detalla FourCastNet 3. Este sistema genera un pronóstico global del tiempo a 60 días con un detalle bastante fino, como resolución de 2.5 grados, en menos de 4 minutos.

Beto
Utilizando sólo una GPU, una sola unidad de procesamiento gráfico.

Alicia
Esa es la parte más loca. Los enfoques anteriores requerían supercomputadoras del tamaño de una sala que trabajaban durante horas para hacer esto. FourCastNet 3 corre entre 8 y 60 veces más rápido que esos métodos tradicionales.

Beto
La ganancia de eficiencia es casi difícil de comprender.

Alicia
Podrías literalmente sentarte en tu escritorio, ejecutar docenas de posibles escenarios meteorológicos globales de dos meses para seguir la trayectoria potencial de un huracán y terminar antes de que tu café de la mañana se enfríe.

Beto
Y la astronomía está viendo un salto de infraestructura muy similar. El campo acaba de lanzar AION-1, que opera como el primer modelo fundacional de la astronomía.

Alicia
Oh, wow.

Beto
Sí, lo entrenaron con más de 200 millones de objetos celestes extraídos de cinco grandes encuestas astronómicas. Así que en lugar de que cada universidad construya sus propias herramientas aisladas, todo el campo se está moviendo hacia construir infraestructura fundacional de IA compartida a la que cualquier investigador pueda acceder.

Alicia
Pero si hablamos de capacidad bruta, mi dato favorito absoluto está en la sección de física. Es un agente de IA llamado Physics Supernova.

Beto
Oh, este es salvaje.

Alicia
Este agente literalmente participó en la Olimpiada Internacional de Física 2025. Ahora, estos no son solo ecuaciones de enchufar y resolver. Estos problemas requieren razonamiento lógico en múltiples pasos, conciencia espacial y aplicación conceptual profunda de las leyes de la física.

Beto
Son notoriamente difíciles para los humanos.

Alicia
Claro. Y Physics Supernova obtuvo 23.5 de 30. Quedó en el puesto 14 de 406 participantes humanos alcanzando el equivalente del nivel de medalla de oro.

Beto
Es simplemente increíble.

Alicia
Ahora tenemos una IA que puede razonablemente superar a algunos de los estudiantes de física más brillantes del planeta en problemas complejos.

Beto
Es una demostración asombrosa de procesamiento lógico. Creo que realmente necesitamos pisar el freno aquí.

Alicia
OK, para el tren del hype. Lo entiendo. Porque si estás sentado oyendo que la IA está ganando olimpiadas de física y prediciendo con precisión dos meses de clima global en cuatro minutos, tienes que preguntarte por qué no ha curado todas las enfermedades importantes y ha resuelto la fusión fría a estas alturas.

Beto
Exacto. Lo fascinante aquí es el enorme correctivo de realidad que exponen los benchmarks de 2025. Cuando miras debajo del capó de estos sistemas de extremo a extremo, hay una brecha evidente entre producción científica plausible y trabajo científico fiable.

Alicia
Sí, no son perfectos.

Beto
Los modelos pueden realizar actos aislados brillantes de cálculo, pero tropiezan violentamente cuando se trata de consistencia básica.

Alicia
Esto trae a colación la paradoja ChemBench, que honestamente me voló la cabeza. ChemBench es un benchmark de evaluación que contiene más de 2700 pares de preguntas y respuestas a través de distintas disciplinas de la química.

Beto
Una prueba muy exhaustiva.

Alicia
Claro. Y los modelos de vanguardia, los mejores que tenemos, en realidad superaron el promedio de expertos humanos en estas preguntas. Están superando a químicos profesionales en conjunto.

Beto
En las cosas realmente difíciles.

Alicia
Sí. Pero inexplicablemente, fallan de forma consistente en las tareas más básicas y fundamentales de la química. Me gusta pensarlo como contratar a un chef con estrella Michelin que puede ejecutar a la perfección un soufflé complejo, delicado y con muchas capas, pero que de alguna manera consigue activar la alarma de humo quemando una tostada todas las mañanas.

Beto
El fenómeno del "tostar-pan quemado" es la manera perfecta de visualizarlo. Y el mecanismo detrás de por qué ocurre esto es crucial. Los grandes modelos de lenguaje operan prediciendo el siguiente token más probable basándose en sus datos de entrenamiento.

Alicia
En realidad, no saben lo que están diciendo.

Beto
Exacto. No entienden inherente las propiedades físicas de los químicos de los que hablan. Así que una IA podría recitar fácilmente una vía de síntesis compleja porque memorizó un artículo avanzado específico de sus datos de entrenamiento.

Alicia
Claro.

Beto
Pero si le preguntas una cuestión de estequiometría ligeramente novedosa que requiere una comprensión fundamentada básica de la masa física, alucina completamente una respuesta, porque le falta un modelo fundamental de la realidad física.

Alicia
Y esa falta de anclaje físico, causa problemas enormes cuando pedimos a la IA hacer ciencia de extremo a extremo.

Beto
Realmente lo hace.

Alicia
El informe destaca un benchmark llamado ReplicationBench, que prueba la capacidad de una IA para replicar los hallazgos de artículos de astrofísica computacional. Los modelos de frontera puntúan por debajo del 20%.

Beto
Menos de uno de cada cinco intentos tiene éxito.

Alicia
Eso es terrible.

Beto
Lo es. Y vemos la misma falla estructural en Univert, que evalúa agentes de grandes modelos de lenguaje en preguntas de observación terrestre. Los agentes sólo alcanzaron un 33% de precisión. Peor aún, cuando estos agentes intentaron escribir el código Python necesario para procesar los datos de satélite, su código falló el 58% de las veces. La máquina literalmente rompe su propia tubería.

Alicia
Espera, más de la mitad de las veces el software simplemente se cae.

Beto
Sí. Y esto resalta una diferencia estructural profunda, en cómo se está desarrollando la IA para la ciencia, comparada con la IA en nuestros teléfonos. Los modelos fundacionales de propósito general, los que escriben correos o generan arte, están dominados por gigantes tecnológicas que raspan internet entero.

Alicia
Cierto. Tienen datos infinitos.

Beto
Pero los modelos de IA para la ciencia, provienen principalmente de instituciones académicas y gubernamentales. Los conjuntos de datos de ciencias de la Tierra, por ejemplo, provienen casi íntegramente de agencias espaciales públicas y universidades.

Alicia
Que es un grupo más pequeño.

Beto
Lo es. Estos datos son altamente especializados, increíblemente densos y fuertemente escrutados. Cuando una IA de propósito general alucina una línea en un poema, se considera creativa.

Alicia
Cierto.

Beto
Cuando una IA científica pierde un signo menos y una línea de código destinada a procesar datos de presión atmosférica, toda la tubería de investigación multimillonaria se colapsa. La precisión aquí no es negociable.

Alicia
Entonces, si los modelos individuales son estas entidades brillantes, pero tremendamente poco fiables, que siguen quemando la tostada, ¿cómo está la comunidad científica arreglando esto realmente? Porque el informe muestra que claramente están progresando a pesar de esas enormes tasas de fallo.

Beto
Bueno, el campo se dio cuenta de que confiar en un único agente de IA es un callejón sin salida. La solución a la que están llegando es flujos de trabajo multiagente.

Alicia
OK. Esencialmente es armar una cuadrilla tipo "Ocean's Eleven", pero para investigación científica.

Beto
En realidad es una analogía bastante precisa.

Alicia
Bien. Así que en lugar de pedirle a una IA solitaria que tenga la idea, escriba el código, y analice los datos, activas un equipo de agentes de IA especializados. Asignas a un agente a no hacer otra cosa que rastrear los últimos 20 años de literatura científica.

Beto
Exacto.

Alicia
Un segundo agente escribe el código Python basado en esa literatura.

Un tercer agente diseña los parámetros experimentales.

Y un cuarto agente simplemente actúa como escéptico revisando constantemente el trabajo de los otros tres y señalando errores lógicos.

Beto
Y esa especialización cambia por completo la dinámica de fiabilidad. El ejemplo más destacado de los datos de 2025 es el co-Scientist de IA de Google. Utiliza un marco que llaman "Generate-Debate-Evolve" loop.

Alicia
Generate-Debate-Evolve. ¿Cómo funciona eso?

Beto
El Agente A genera una hipótesis biológica basada en un conjunto de datos. El Agente B inmediatamente la debate, intentando activamente destruir la hipótesis comprobándola contra las leyes conocidas de la física y la biología.

Alicia
Hace de abogado del diablo.

Beto
Exacto. El Agente A toma esa crítica y evoluciona la hipótesis. Es un bucle iterativo a alta velocidad que imita el riguroso proceso de revisión por pares de un laboratorio humano.

Alicia
¿Y funciona mejor?

Beto
Los resultados son innegables. El co-científico de Google alcanzó un 78.4% de precisión en el conjunto GPQA Diamond, que es una de las pruebas de nivel doctoral más notoriamente difíciles que existen.

Alicia
Vaya, casi un 80%.

Beto
Y mejor aún, sus hipótesis fueron validadas en tres áreas biomédicas reales y distintas.

Alicia
Lo que suena fenomenal. Pero luego miras otro benchmark importante en el informe llamado PaperArena. PaperArena es una prueba que evalúa a estos agentes en preguntas reales y complejas de investigación, requiriéndoles buscar literatura, usar herramientas computacionales y llegar a respuestas novedosas.

Beto
Es una prueba muy práctica.

Alicia
Sí. En una configuración multiagente, Gemini 2.5 Pro tuvo el mejor desempeño, pero sólo alcanzó una tasa de acierto del 38.8%. Cuando leí eso por primera vez pensé: espera, ¿38.8%? Eso suena completamente desastroso para un sistema al que llamamos co-científico. ¿Se considera eso bueno?

Beto
Sé que suena bajo, pero para entender por qué los investigadores consideran el 38.8% una victoria enorme, tienes que mirar la línea base. La línea base de expertos PhD humanos en ese mismo benchmark es 83.5%.

Alicia
OK. Así que el mejor sistema de IA del mundo, con múltiples agentes, todavía está alcanzando menos de la mitad de lo que un experto PhD humano logra en estas tareas científicas de extremo a extremo.

Beto
Exacto. La IA definitivamente no está reemplazando al PhD humano por ahora. Sin embargo, lo que PaperArena probó más allá de toda duda es el poder de la arquitectura.

Alicia
El enfoque de la cuadrilla de atraco.

Beto
Exacto. En todos los frentes, las configuraciones multiagente superaron consistentemente a los agentes solitarios por dos a cuatro puntos porcentuales. La cuadrilla es demostrablemente más fiable que el operativo solitario, aunque todavía falle la mayoría de las veces.

Alicia
Y estamos viendo hitos enormes que prueban que esta arquitectura multiagente es el plano para el futuro. El informe detalla AI Scientist V2, de Sakana. Este sistema produjo el primer artículo totalmente generado por IA que fue aceptado en un taller académico revisado por pares, ICLR.

Beto
Eso es un gran logro.

Alicia
Realmente lo es. Y no usó plantillas codificadas por humanos. La IA generó la idea original, escribió el código experimental, ejecutó las pruebas, interpretó los datos y redactó el manuscrito final.

Beto
Totalmente de forma autónoma.

Alicia
Pero me dejó aún más sorprendida otro sistema llamado Kosmos. Kosmos no sólo escribió un artículo. Básicamente vivió en el laboratorio. Pusieron en marcha este sistema multiagente y corrió de forma autónoma hasta 12 horas seguidas.

Beto
Y en esa media jornada ejecutó 42,000 líneas de código. Estuvo constantemente leyendo, iterando y depurando su propio software, mientras simultáneamente analizaba 1,500 artículos científicos diferentes.

Alicia
Los colaboradores humanos que monitoreaban a Cosmos declararon que una sola corrida de 12 horas aproximaba seis meses de esfuerzo de investigación humana tradicional.

Beto
Condensar medio año de iteración en una sola tarde.

Alicia
Entonces, ¿qué significa todo esto cuando nos detenemos y miramos el tablero completo?

Si miramos el capítulo cinco del informe AI Index de Stanford, la conclusión central es absoluta: la IA está haciendo con éxito el salto de ser una herramienta analítica a convertirse en el motor fundamental del flujo de trabajo de la ciencia moderna.

Beto
Indudablemente.

Alicia
Estamos presenciando saltos asombrosos en velocidad, escala y la mera capacidad de procesar billones de pares de bases biológicos o mapear cientos de millones de galaxias. El experto humano sigue siendo el ancla crucial.

Beto
Todavía nos necesitan.

Alicia
Definitivamente necesitamos al PhD humano para diseñar los parámetros y supervisar los bucles de debate multiagente. Y, lo más importante, para atrapar la tostada quemada antes de que prenda fuego al laboratorio. Los sistemas no pueden confiarse por completo para operar de extremo a extremo de forma aislada todavía.

Beto
Si conectamos esto con la imagen más amplia del progreso humano, nos topamos con el cuello de botella inmóvil definitivo. Y ese cuello de botella, no es la potencia informática, ni el almacenamiento de datos.

Alicia
¿Qué es?

Beto
El cuello de botella es el mundo físico mismo.

Alicia
El "wet lab", la realidad material.

Beto
Exacto. La IA puede proponer computacionalmente cinco millones de estructuras moleculares nuevas para mañana por la mañana. Puede hipotetizar reacciones celulares totalmente nuevas o sugerir cientos de dianas farmacológicas desconocidas en una tarde in silico.

Alicia
Claro.

Beto
Pero la validación experimental, tomar esa brillante hipótesis digital y probar que funciona en un wet lab físico, o realizar ensayos clínicos humanos de varios años para asegurar que un fármaco sea seguro, sigue siendo increíblemente caro, tedioso y sujeto a las inmutables leyes del tiempo.

Alicia
No puedes avanzar el tiempo.

Beto
No, no puedes. El informe de Stanford apunta específicamente que mientras sistemas como AI Scientist V2 pueden escribir un flujo interminable de artículos plausibles, la lista de descubrimientos de IA, que han sido realmente confirmados experimentalmente, en el mundo real, sigue siendo sorprendentemente corta.

Alicia
Porque físicamente no podemos probar las cosas tan rápido como la IA las inventa. En descubrimiento de fármacos, puedes simular un enlace proteína-ligando en milisegundos. Pero los ensayos clínicos para determinar si esa molécula realmente cura a un paciente sin efectos secundarios siempre tomarán años. Simplemente no puedes acelerar la biología humana.

Beto
Estamos logrando cerrar la brecha entre la ideación digital y la realidad física. Pero la realidad física tiene un límite de velocidad estricto.

Alicia
Lo que nos deja con una tensión realmente fascinante. Y quiero dejarte con un pensamiento final para que lo mastiques mientras digieres todos estos números.

Si un sistema multiagente como Kosmos ahora puede literalmente condensar seis meses de codificación de investigación humana en una sola ejecución de 12 horas, ¿qué pasa cuando el principal cuello de botella para el progreso humano ya no sea nuestra falta de ideas?

Beto
Es una pregunta profunda.

Alicia
¿Qué le ocurre a la sociedad cuando nuestro mayor obstáculo es simplemente nuestra incapacidad física para probar el enorme volumen de teorías brillantes que nuestras máquinas están vomitando antes de la hora del almuerzo? ¿Vamos a ahogarnos en genialidad no verificada?

Beto
Hemos pasado siglos tanteando en la oscuridad, buscando desesperadamente una sola pieza brillante del rompecabezas. Ahora la máquina está tirando un millón de piezas brillantes sobre la mesa cada día.

Alicia
De repente, ese investigador solitario, a las dos de la mañana, ya no está luchando por encontrar un avance, está enterrado bajo una montaña de ellos.

Beto
Muchas gracias por acompañarnos en este análisis profundo del informe AI Index de Stanford.

Sigue leyendo, sigue explorando y sigue cuestionando los datos que te rodean. Nos vemos la próxima vez.