martes, 21 de julio de 2026

Predicción de avances científicos con IA

 
 

Esta investigación presenta CUSP, un conjunto de herramientas de evaluación especializadas diseñado para medir la capacidad de los modelos de IA de vanguardia para predecir futuros avances científicos en ocho disciplinas. Si bien los modelos actuales demuestran una alta capacidad retrospectiva para razonar sobre el conocimiento establecido, el estudio revela una asimetría significativa en sus capacidades prospectivas. Los modelos suelen identificar con éxito mecanismos plausibles para futuros descubrimientos, pero no logran evaluar con precisión su viabilidad ni predecir el momento exacto en que ocurrirán. Incluso con datos históricos relevantes, estos sistemas presentan errores sistemáticos, como un exceso de confianza y una tendencia a predecir avances mucho más tarde de lo que realmente suceden. En definitiva, los autores argumentan que la predicción científica es una capacidad distinta del razonamiento científico y debe evaluarse por separado para garantizar que la IA se utilice eficazmente en la priorización de la investigación y la toma de decisiones.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Scientific reasoning does not reliably translate into scientific forecasting in frontier AI", por Sean Wu y colegas. Publicado el 21 de Mayo de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Bienvenidos a nuestro análisis profundo de hoy. Estoy realmente entusiasmada de tenerlos con nosotros hoy, especialmente porque nuestra misión en esta ocasión es responder a una pregunta candente que probablemente está rondando en su mente.

Beto
Sí, si están prestando atención a la tecnología ahora mismo, definitivamente está en su mente.

Alicia
Correcto, porque probablemente están confiando en la inteligencia artificial para mantenerse a la vanguardia. Quiero decir, todos lo hacemos. Vemos cómo estos modelos fronterizos superan el examen de la barra. Escriben código impecable. Resumen enormes cantidades de datos en segundos. Y la expectativa natural es la omnisciencia.

Beto
Es la ilusión del Oráculo. Le introduces a una IA un millón de artículos de física y esperas que funcione como una bola de cristal.

Alicia
Exacto. Esperas que señale el horizonte hasta que exactamente sepas dónde va a ocurrir el próximo gran avance. Pero la pregunta es: ¿puede realmente predecir el futuro del descubrimiento científico?

Beto
Y esa es una pregunta crítica para cualquiera que intente navegar este espacio hoy. Si están buscando usar la IA para priorizar su propia investigación, dirigir su capital de inversión o, ya saben, simplemente decidir en qué campo estudiar a continuación, realmente necesitan entender el límite aquí.

Alicia
El límite entre lo que ya sabe y lo que puede adivinar.

Beto
Correcto. El límite entre el conocimiento retrospectivo de una IA y su capacidad de pronóstico. Porque la suposición es que predecir el siguiente paso lógico en un campo científico debería ser, bueno, solo matemáticas complejas para estos modelos.

Alicia
Pero esa es exactamente la suposición que estamos desafiando hoy.

Estamos explorando este fascinante nuevo estudio de investigadores de Oxford, Stanford, el Instituto Allen para la IA y Sakana AI, específicamente Sean Wu y sus colegas.

Beto
Es un artículo muy riguroso. Se titula "El razonamiento científico no se traduce de manera confiable en pronóstico científico en la IA fronteriza".

Alicia
Lo cual es una frase larga. Pero vamos a desglosarlo.

AI_Reasoning_Versus_Scientific_Prediction_1024.png
La brecha en la predicción mediante IA: por qué el razonamiento no equivale a la predicción en la ciencia de vanguardia.

Alicia
Y estamos analizando seis de los modelos fronterizos más avanzados disponibles hoy: tenemos GPT 5.4, Claude Sonnet 4.5, DeepSeek R1, LLaMA 3.3.

Beto
Los pesos pesados.

Alicia
Sí, la punta de lanza absoluta. Y voy a lanzarles un hecho sorprendente de inmediato. Mientras que estos modelos de IA poseen capacidades casi sobrehumanas para entender la mecánica de los descubrimientos científicos pasados, son sorprendentemente terribles para predecir lo que va a suceder después.

Beto
Terrible es casi quedarse corto. En algunos casos, son literalmente peores que un lanzamiento de moneda.

Alicia
Lo que simplemente destroza esa ilusión del oráculo de la IA.

Beto
Realmente lo hace. La asimetría entre esas dos capacidades es profunda. La competencia retrospectiva. Es decir, la capacidad de mapear el pasado simplemente no equivale a la capacidad de mirar hacia el futuro.

Alicia
Tengo que admitirlo, cuando leí eso por primera vez, fui muy escéptica. Quiero decir, ¿cómo puedes siquiera probar la capacidad de una IA para predecir el futuro sin simplemente, ya sabes, hacerle una pregunta y esperar una década para ver si era correcta?

Beto
Esa es la parte difícil. Pero la metodología aquí es lo que me enganchó inicialmente. Los investigadores no solo le hicieron preguntas vagas a la IA sobre coches voladores o curar el envejecimiento. Construyeron esta suite de pruebas masiva y muy rigurosa.

Alicia
Okay, desglosémosla porque es salvaje.

Beto
Sí, la llaman CUSP. Significa "Programa Científico Invisible Condicionado por Corte" ("Cutoff-Conditioned Unseen Scientific Program").

Alicia
¿Condicionado por corte, verdad?

Beto
Y lo que hicieron fue recopilar 4,760 eventos científicos altamente específicos y verificables. Y esto es a través de ocho disciplinas diferentes.

Alicia
Estamos hablando de biología, química, ...

Beto
... inteligencia artificial, ciencias ambientales, física, todo el espectro.

Alicia
No. Quiero destacar ese término "Condicionado por Corte" para ustedes, los oyentes, porque esa es la genialidad absoluta de la suite CUSP. Los investigadores tomaron descubrimientos científicos reales que ocurrieron estrictamente después de la fecha de corte de los datos de entrenamiento de la IA.

Beto
Exacto. Así que desde la perspectiva de la IA, estos descubrimientos son literalmente el futuro.

Alicia
El modelo no tiene absolutamente ninguna manera de haber memorizado la respuesta porque el artículo ni siquiera había sido publicado cuando se entrenó al modelo.

Beto
Los modelos están operando esencialmente en una cápsula del tiempo como una prueba ciega.

Alicia
Así que están en esta cápsula del tiempo y luego los investigadores probaron estos modelos a través de cuatro dimensiones distintas para ver si podían anticipar estos avances no vistos.

Beto
Sí, cuatro dimensiones. La primera es la viabilidad ("feasibility"). Muy simplemente, ¿realmente va a suceder este avance científico específico? Solo sí o no.

Alicia
Okay, bastante sencillo.

Beto
Luego, la segunda dimensión es la mecánica ("mechanistic"). Esta pregunta pide cómo sucederá el avance al proporcionar una selección de opción múltiple de posibles vías técnicas.

Alicia
Espera, déjame detenerte ahí. Así que la prueba mecánica es básicamente un examen de opción múltiple para métodos científicos.

Beto
Esa es una forma perfecta de enmarcarlo. La IA mira algunas maneras diferentes en que se podría resolver un problema y tiene que elegir la que realmente funciona.

Alicia
Entendido.

Beto
Luego, la tercera dimensión es el diseño de la solución ("solution design"), que es mucho, mucho más difícil. Es una tarea abierta donde la IA debe diseñar realmente el método para resolver el problema desde cero.

Alicia
No hay opción múltiple en la que apoyarse.

Beto
Escribe una página en blanco.

Alicia
Sí.

Beto
Y la dimensión final es la predicción temporal ("temporal prediction"). Esto pide al modelo que prediga exactamente cuándo se publicará este avance o será observable públicamente.

Alicia
Así que tenemos el si, el cómo, el diseño y el cuándo.

Y aquí es donde estoy genuinamente confundida por los resultados. Los datos muestran que en la predicción mecánica, esa prueba de opción múltiple del cómo, los modelos lo hicieron increíblemente bien.

Beto
Oh, lo dominaron. GPT 5.4 alcanzó una precisión del 79.2%.

Alicia
Lo cual es una puntuación fenomenal.

Beto
Realmente lo es. Demuestra que cuando se le presenta a un modelo una vía científica correcta junto con distractores plausibles pero incorrectos, reconoce la física o biología subyacente que hace funcionar la respuesta correcta.

Alicia
Así que entiende profundamente las mecánicas estructurales de la ciencia.

Beto
Sí, exactamente.

Alicia
Pero luego le preguntas a ese mismo modelo, la pregunta de viabilidad, ese simple sí o no, ¿se logrará realmente este avance? Y el rendimiento cae en picada.

Beto
Cae a casi azar. Los modelos rondaron justo alrededor del 50%.

Alicia
Un lanzamiento de moneda.

Beto
Un lanzamiento literal de moneda. Y en ciertas tareas, los modelos avanzados rinden peor que una línea base trivial. Como una línea base donde un sistema simplemente, por defecto, responde "no" a cada pregunta derrota a la IA fronteriza.

Alicia
Quiero decir, eso no tiene sentido para mí. Suena como tener un mecánico brillante que puede mirar un plano y decirte exactamente cómo funciona un motor de coche revolucionario, hasta el nivel molecular de la inyección de combustible. Pero si le preguntas a ese mismo mecánico, si alguien realmente va a construirme motor este año, simplemente se encoge de hombros y adivina al azar. ¿Cómo puede entender las mecánicas tan perfectamente, pero fallar en una pregunta básica de sí o no sobre si realmente va a suceder?

Beto
La analogía del mecánico captura perfectamente la limitación, creo. Porque se reduce a cómo los modelos de lenguaje grande representan el conocimiento. Evalúan la solidez estructural del texto o los conceptos.

Alicia
Okay, así que saben lo que se ve bien en el papel.

Beto
Exacto. Cuando se les hace una pregunta de opción múltiple, pueden mapear la relación semántica entre el problema y la solución matemáticamente correcta.

Alicia
Pero preguntar si sucederá, es diferente.

Beto
Es totalmente diferente. Preguntar si una solución se realizará, requiere modelado del mundo. Requiere pesar contextualmente la realidad, como saber si los científicos humanos tienen realmente la financiación, o el interés, o las herramientas prácticas, para ejecutar esa idea estructuralmente sólida.

Alicia
Okay, así que si los modelos entienden las mecánicas tan bien, lógicamente deberían poder construir la solución ellos mismos, ¿verdad?

Beto
Uno pensaría así.

Alicia
Lo que nos lleva a esa tercera prueba, el diseño de solución abierta. Estamos viendo la parte de respuesta libre de este estudio ahora. Y los números aquí son salvajes. Incluso el modelo de mejor rendimiento, GPT 5.4, solo obtuvo alrededor de cinco de diez cuando se le pidió diseñar una solución desde cero.

Beto
Y desglosando esa puntuación específica, revela honestamente, uno de los hallazgos más importantes de todo el estudio.

Alicia
Aquí es donde se pone realmente interesante.

Beto
Sí, los investigadores identifican lo que llaman "la brecha de viabilidad de alineación" ("alignment feasibility gap"). Cuando la IA genera una solución de respuesta libre a un problema científico, esa solución casi siempre obtiene una puntuación muy alta en viabilidad.

Alicia
Significa que la ciencia es sólida.

Beto
Totalmente sólida. La química funciona en el papel. Es una propuesta técnicamente plausible.

Alicia
Pero la IA obtiene una puntuación increíblemente baja en alineación.

Beto
Correcto, porque la alineación mide si la brillante propuesta plausible de la IA es realmente la que los científicos humanos terminaron usando para lograr el gran avance en el mundo real.

Alicia
Y no lo es.

Beto
Casi nunca. Las ideas de la IA casi nunca son lo que los seres humanos hacen en la práctica.

Alicia
El estudio proporciona un ejemplo específico de farmacología que finalmente me hizo entender esto. El desafío se refería al receptor muopioide.

Beto
El problema clásico.

Alicia
Correcto. Los científicos querían diseñar un método para un nuevo agonista. Es decir, un medicamento que proporciona el intenso alivio del dolor de la morfina o la fentanilo, pero sin los efectos secundarios peligrosos como la depresión respiratoria.

Beto
Sí, encontrar una manera de separar el alivio del dolor de la falla respiratoria es una búsqueda masiva y continua en la investigación del manejo del dolor.

Alicia
Así que los investigadores le pidieron a GPT 5.4 que diseñara un método para lograr este gran avance. Y la IA escupe esta propuesta increíblemente sofisticada.

Beto
Oh, es una frase larga.

Alicia
Lo es. Sugiere usar un, y estoy leyendo esto textualmente, "un modelo de espacio de estado bayesiano mecánico alimentado con datos de biosensores de alta resolución temporal y que lo incrusta en un ciclo de química medicinal generativa".

Beto
Suena impresionante.

Alicia
Espera. Para aquellos de nosotros que no pasamos nuestros fines de semana en laboratorios de farmacología computacional, ¿qué demonios significa eso?

Beto
Desglosémoslo a su esencia. La IA está sugiriendo un enfoque impulsado por la probabilidad computacional pura. Un modelo bayesiano esencialmente utiliza la probabilidad y los datos pasados para actualizar constantemente sus suposiciones.

Así que la IA quiere ejecutar simulaciones de computadora masivas, procesando datos de alta resolución de los biosensores y usando un algoritmo para generar digitalmente la estructura química perfecta.

Alicia
Así que es una solución de software muy pesada matemáticamente, hermosa y compleja.

Beto
Exacto. Muy cerebro de IA.

Alicia
Suena como algo sacado de una novela de ciencia ficción. Pero el gran avance humano, el que los científicos reales lograron en la realidad para resolver esto, fue completamente diferente.

Beto
Radicalmente diferente.

Alicia
Los humanos utilizaron un marco de diseño de ligando resuelto en estado cinético, que por lo que entiendo se traduce en humanos ajustando y optimizando físicamente compuestos químicos en un laboratorio húmedo para estabilizar selectivamente vías específicas en el receptor.

Beto
Correcto. Fue un enfoque bioquímico tangible y práctico.

Alicia
¿Una simulación?

Beto
No, para nada. Y el contraste allí es tan revelador. La IA busca el espacio latente de todas las soluciones matemáticamente y científicamente plausibles. Porque es un motor computacional y naturalmente se inclina hacia métodos altamente complejos y pesados computacionalmente.

Alicia
Porque piensa como una computadora.

Beto
Piensa en términos de algoritmos y simulaciones. Pero los científicos humanos operan bajo restricciones del mundo real. Se basan en equipos de laboratorio físico existentes. Están limitados por su impulso experimental anterior, sus presupuestos de subvenciones, ya saben, su experiencia física.

Alicia
Los humanos usan lo que ya saben cómo construir en un laboratorio físico. No simplemente iniciamos una simulación de supercomputadora masiva si tenemos un equipo de químicos que son realmente buenos mezclando compuestos y vasos de precipitados.

Beto
Exacto. La IA falla por completo en modelar la realidad desordenada y no lineal del esfuerzo científico humano. Simplemente produce una teoría científica estadísticamente óptima.

Alicia
Y eso explica la enorme brecha de viabilidad y alineación.

Beto
Sí. La IA puede inventar ciencia plausible todo el día. Pero no puede inventar la ciencia que los humanos realmente elegirán hacer.

Alicia
Estoy poniéndome en el lugar del oyente ahora, y puedo escuchar la objeción inmediata a todo esto.

Beto
¿La objeción de Google?

Alicia
Sí. Espera, ¿no es esta solo una prueba injusta? Si me encierras en una habitación sin internet y me dices que prediga el futuro de la física basándome solo en lo que leí hace dos años, voy a fallar.

Beto
Claro. Cualquiera lo haría.

Alicia
Entonces, ¿estamos seguros de que estos modelos son realmente malos para pronosticar, o solo necesitan permiso para usar la búsqueda web para tender el puente?

Beto
Probar esa objeción exacta fue el siguiente paso lógico para los investigadores. Necesitaban aislar si esto era una falla fundamental de razonamiento o solo un problema de recuperación de datos.

Alicia
Correcto. Los datos faltantes.

Beto
Así que ejecutaron un experimento controlado donde le dieron a los modelos acceso a la búsqueda web. Pero para mantenerlo justo, restringieron los parámetros de búsqueda para que la IA solo pudiera extraer información publicada estrictamente antes de la fecha de corte del evento científico que estaba tratando de predecir.

Alicia
Así que se les permite rastrear los archivos históricos, leer cada artículo de procedimiento y revisar las noticias hasta esa fecha. Pero aún no pueden ver la respuesta real del futuro.

Beto
Exacto. Y los resultados fueron dobles. Primero, dar a los modelos acceso a la web mejoró su rendimiento.

Alicia
Okay. Así que eso tiene sentido.

Beto
Confirmó la existencia de una brecha de conocimiento. Los modelos base no recuerdan perfectamente cada pieza de información con la que fueron entrenados. Así que permitirles buscar en la web les ayuda a extraer el contexto histórico necesario.

Alicia
Así que más datos sí los hace un poco más inteligentes sobre el pasado.

Beto
Sí, lo hace. Pero el segundo hallazgo es donde se expone la verdadera limitación. Incluso con acceso a toda esa información histórica extra, una enorme brecha de pronóstico permaneció.

Alicia
No solucionó el problema de la predicción.

Beto
Para nada. Proporcionar todos los hechos no convirtió mágicamente a la IA en una buena pronosticadora. Para poner números, cuando se probó a GPT 5.4 en la tarea de predicción de fechas con acceso completo a la web, la brecha de pronóstico, es decir, el error predictivo que permaneció incluso después de tener todos los datos históricos, fue más de seis veces mayor que su brecha de conocimiento.

Alicia
Vaya. Estoy luchando por entender cómo es posible. Si tiene todas las piezas del rompecabezas sobre la mesa, ¿por qué no puede juntarlas para ver la imagen final?

Beto
Porque la predicción científica requiere una capacidad cognitiva distinta. No es meramente un subproducto de tener una memoria enciclopédica masiva. Para ilustrar esto, se presenta la realidad definitiva de prueba con participantes humanos.

Alicia
Sí, me encanta esta parte.

Beto
Establecieron un punto de referencia humano utilizando expertos en el dominio, enfocándose específicamente en los avances científicos relacionados con la IA en la suite CUSP. Y colocaron a estos expertos humanos bajo exactamente las mismas condiciones de información restringida que la IA.

Alicia
Así que les dieron a los humanos exactamente los mismos paquetes de evidencia que recibieron los GPTs durante su búsqueda web restringida.

Beto
Campo de juego nivelado.

Alicia
Un campo de juego completamente nivelado. Y bajo esas condiciones idénticas, los humanos superaron gravemente a la IA. En las preguntas binarias de viabilidad, simplemente preguntando "sí o no, ¿esto va a suceder?", los humanos obtuvieron un 73%.

Beto
En comparación con GPT 4, que fue 52.5%.

Alicia
Así que los humanos están prediciendo activamente el futuro mientras que la IA está esencialmente lanzando una moneda.

Beto
Exacto. Y en las preguntas mecánicas, los humanos alcanzaron el 67% en comparación con el 40% de la IA.

Alicia
Esa es una diferencia marcada.

Beto
Lo es. Y la conclusión, para ustedes que están escuchando ahora, es vital. Los expertos humanos poseen una capacidad predictiva intuitiva que la IA fronteriza actual carece fundamentalmente.

Alicia
Porque un científico humano no solo lee los datos.

Beto
Correcto. Sienten el impulso de un campo. Saben qué equipos de investigación están bien financiados. Escuchan la charla informal en las conferencias. Entienden la fricción práctica de lo que es realmente alcanzable.

Alicia
Así que si eres un ejecutivo evaluando una nueva propuesta tecnológica de una startup, o estás planeando la hoja de ruta de cinco años de tu empresa, conectar una IA a búsqueda web en vivo no soluciona su incapacidad central para pronosticar.

Beto
Realmente no lo hace.

Alicia
Puede extraer hechos, pero carece de la intuición humana para decirles si la tecnología realmente sobrevivirá al contacto con la realidad. Y mirando de cerca las estadísticas de humanos versus IA, revela algo más fascinante.

Beto
Sí, las fallas sistemáticas.

Alicia
Correcto. La IA no está cometiendo solo errores aleatorios. Cuando analizas los fallos, te das cuenta de que la IA está cometiendo tipos muy específicos de errores.

Beto
Los errores son altamente sistemáticos, lo que nos lleva a analizar los sesgos internos de estos modelos fronterizos. Los investigadores categorizan los fallos en tres fallas sistemáticas distintas.

Alicia
Vamos a revisarlas.

Beto
La primera ley se conoce como "valores previos de respuesta" ("response priors").

Alicia
En términos simples, esto es si la personalidad del modelo por defecto se inclina por ser un optimista perpetuo o un pesimista estricto.

Beto
Exacto. Cuando se ve obligado a adivinar si un gran avance va a suceder, los modelos no sopesan la evidencia de manera neutral. Los modelos como LLaMA 3.3 y GPT 5.4 favorecen fuertemente las respuestas afirmativas.

Alicia
Los optimistas.

Beto
Son optimistas perpetuos. Asumen que casi todo avance científico es viable.

Por el contrario, otros modelos se inclinan fuertemente hacia lo negativo, prediciendo constantemente el fracaso independientemente de la instrucción.

Alicia
¿Hubo algún modelo que estuviera realmente equilibrado?

Beto
En realidad, de todos los modelos evaluados, DeepSeek R1 fue el único que se mantuvo comparativamente equilibrado entre sí y no.

Alicia
Es tan divertido. Es como pedirle consejo a diferentes miembros de tu equipo sobre un proyecto arriesgado. Una persona siempre dice, sí, adelante. Y la otra siempre dice que nunca funcionará.

Beto
Sí.

Alicia
Ninguno de los dos está analizando realmente la situación específica. Simplemente están recurriendo a los comportamientos de entrenamiento reforzado.

Beto
Eso es exactamente lo que está sucediendo. Y recurrir a esos comportamientos sin reconocer sus propias limitaciones conduce directamente a la segunda falla importante.

Alicia
Exceso de confianza ("Overconfidence").

Beto
Exceso de confianza. Los investigadores cuantificaron esto usando el "error de calibración esperado" ("expected calibration error", o ECE).

Alicia
Okay, necesitamos desglosar el ECE por un momento. ¿Cómo medimos siquiera la confianza de un algoritmo?

Beto
Bueno, el error de calibración esperado mide la brecha entre cuán confiado afirma una IA y cuán precisa es realmente.

Alicia
Ah, ya veo.

Beto
Piénsalo como un humano que afirma estar 100% seguro de una respuesta, pero solo tiene razón el 50% del tiempo. Está mal calibrado.

Alicia
Correcto.

Beto
En las tareas de opción múltiple mecánicas donde la IA es fuerte, su ECE es bajo, está bien calibrada. Sabe cuándo sabe la respuesta.

Alicia
Pero en las tareas de pronóstico.

Beto
En las tareas de viabilidad y pronóstico, el ECE se dispara dramáticamente. Los modelos frecuentemente dan la respuesta completamente incorrecta, pero la afirman con una certeza inquebrantable.

Alicia
Están confiadamente equivocados.

Beto
Peligrosamente así.

Alicia
Lo cual es posiblemente el tipo de error incorrecto más peligroso si estás confiando en esa salida para inteligencia empresarial o investigación académica. Quiero decir, si solo dijera que "no sabe", podrías sortearlo, pero dice mentiras con convicción.

Beto
Realmente lo hace. Y luego tenemos la tercera falla sistemática, que es quizás la más interesante desde una perspectiva sociológica.

Alicia
Conservadurismo temporal ("Temporal conservatism").

Beto
Sí, o realización retrasada. En general, cada modelo asume constantemente que el progreso científico humano es mucho más lento de lo que realmente es en la realidad.

Alicia
Creen que simplemente estamos arrastrando los pies.

Beto
Sistemáticamente. Siempre que se les pide a un modelo que prediga la fecha en que un gran avance será observable públicamente, su suposición es casi siempre significativamente baja.

Alicia
¿Tenemos un ejemplo de eso?

Beto
Sí. El estudio destaca una prueba utilizando el "punto de referencia de IA verificada por el mundo" ("OS world verified AI benchmark").

Alicia
Okay. Así que como recordatorio, "el punto de referencia del mundo" es una prueba que mide qué tan bien pueden interactuar los agentes de IA autónomos con entornos de computadora, como navegar por menús o completar tareas en un escritorio.

Beto
Correcto. Y el hecho crítico es que el punto de referencia superó en realidad un 83%, en mayo de 2026.

Alicia
Okay.

Beto
Pero cuando los investigadores pidieron a los modelos que predijeran cuándo se alcanzaría ese hito, todos y cada uno de ellos retrasaron drásticamente el cronograma.

Alicia
¿Cuán tarde adivinaron?

Beto
GPT-4 adivinó que no sucedería hasta 13 meses después. DeepSeek-R1 adivinó 17 meses tarde. Todos reconocieron que el hito era mecánicamente factible, pero subestimaron gravemente la velocidad del progreso impulsado por los humanos.

Alicia
Los modelos son ciegos a la velocidad compuesta de la innovación humana. Y esta ceguera temporal no se limita solo a los puntos de referencia de IA, ¿verdad?

Los investigadores realizaron una prueba de cápsula del tiempo para predecir las emisiones globales de CO2 para 2027.

Beto
Lo hicieron. Y debemos ser claros aquí que en este caso, estamos observando estrictamente las proyecciones estadísticas, los modelos emitieron basándose en datos históricos. No estamos haciendo una declaración política.

Alicia
Absolutamente. Solo estamos registrando el comportamiento del modelo. Se les encargó proyectar una métrica global compleja.

Beto
Correcto. Y todos los modelos identificaron con éxito la tendencia macroeconómica de que las emisiones aumentarían, pero sus predicciones sobre el ritmo de ese aumento variaron salvajemente.

Alicia
Dependiendo del modelo.

Beto
Sí. LLaMA 3.3 proyectó la curva de crecimiento más pronunciada y agresiva, mientras que Claude Sonnet 4.5 fue la más conservadora, prediciendo una trayectoria mucho más plana.

Alicia
Pero independientemente de la curva que eligieron, el problema central permanece. Todos lucharon por mapear sus modelos matemáticos internos a la línea de tiempo física real de la realidad. La fricción del mundo real los atrapa.

Beto
Siempre vuelve a la fricción del mundo real.

Alicia
Y ese concepto de fricción del mundo real se conecta perfectamente con la restricción alucinada en el experimento de búsqueda web. Esto fue honestamente la falla más reveladora de todo el estudio para mí.

Beto
Ah, la prueba del tamaño de partícula. Es la ilustración perfecta de por qué la coincidencia de patrones semánticos no es lo mismo que la lógica deductiva.

Alicia
Correcto. Así que los investigadores querían ver si la IA prestaría atención a restricciones físicas limitantes específicas. Le preguntaron a GPT 5.4 si se lograría un efecto catalizador determinado.

Beto
Pero secretamente insertaron una condición altamente específica en la instrucción.

Alicia
Sí. Preguntaron si este efecto catalizador dominaría para tamaños de partícula por debajo de dos nanómetros.

Beto
Y ese límite de dos nanómetros es una restricción física crítica que cambia toda la química del problema.

Alicia
Exacto. Así que la IA usa su acceso a la búsqueda web, encuentra un artículo importante que discute este efecto catalizador general, regresa y dice con confianza que se alcanzó el umbral.

Beto
Ignoró la restricción.

Alicia
Ignoró por completo la restricción por debajo de los dos nanómetros que los investigadores habían metido en la instrucción. Esencialmente, alucinó una confirmación. ¿Por qué un modelo fronterizo avanzado hace una omisión tan flagrante?

Beto
Porque el modelo está realizando una coincidencia de patrones semánticos, no un razonamiento deductivo riguroso. Escanea los resultados de la búsqueda web, ve la frase metal, interacciones metálicas, ve soporte de óxido y mide la proximidad semántica de esas palabras a la instrucción.

Alicia
Así que solo está buscando asociaciones de palabras.

Beto
Básicamente sí, los temas amplios coinciden, así que declara la victoria. Carece de la arquitectura lógica requerida para detenerse y decir: "espera, el artículo que acabo de leer no menciona explícitamente el límite de dos nanómetros. Por lo tanto, esta afirmación específica sigue sin verificarse".

Alicia
Solo quiere proporcionar una respuesta afirmativa útil basada en la proximidad.

Beto
Está tratando de apaciguar al usuario, no de verificar leyes físicas.

Alicia
Así que reunamos todo esto. Si eres nuestro oyente, la persona que intenta mantenerse bien informada, tal vez estés preparando una reunión de estrategia, o decidiendo dónde asignar un presupuesto de investigación para el próximo trimestre, ¿Cómo deberían tratar prácticamente estos modelos de IA fronterizos, basándote en estos datos?

Beto
Con cautela, con mucha cautela.

Alicia
Mi conclusión es que deben tratar a la IA como el historiador y diagnóstico más brillante del mundo. Quiero decir, si le entregas a un modelo un artículo científico terminado o un plano finalizado, puede explicarte las mecánicas subyacentes con una claridad impresionante.

Beto
Oh, absolutamente. Puede resumir el estado del arte sin fallos.

Alicia
Pero no es una bola de cristal. No puede decirte de manera confiable si una tecnología especulativa se construirá realmente. Probablemente propondrá una solución que es matemáticamente hermosa pero prácticamente inútil para los humanos, y casi seguramente te dirá que el progreso tardará más en llegar de lo que realmente lo hará.

Beto
Esa es una gran conclusión.

Alicia
Pero quiero dejarlo en sus manos por última vez. ¿Cuál es la mayor conclusión filosófica de este estudio?

Beto
La última reflexión que les dejaré es considerar lo que el fallo de la IA realmente revela sobre nosotros.

Alicia
¿Cómo es eso?

Beto
Bueno, el hecho de que la IA pueda generar soluciones increíblemente lógicas y científicamente viables que los científicos humanos simplemente no terminan usando, sugiere algo profundo sobre el descubrimiento humano. Nos obliga a preguntar: ¿está el progreso científico impulsado por algo inherentemente incomputable?

Alicia
¿Como qué?

Beto
Quizás es nuestra terquedad, ¿saben?. Nuestra dependencia de la intuición física, la política de laboratorio, o simplemente la serendipia pura que dicta el futuro de la ciencia. O tal vez es simplemente que la IA aún no ha aprendido cómo modelar la realidad desordenada, hermosa y no lineal de cómo los seres humanos realmente trabajan juntos en un laboratorio del mundo real.

Alicia
Eso es fascinante. A veces, la variable más importante en el laboratorio no es ni siquiera los datos. Es el científico.

Beto
Exacto.

Alicia
Así que la próxima vez que le pidan a una IA que prediga el futuro, recuerden, sabe exactamente cómo funciona el motor, pero no tiene ni idea de si alguien realmente va a dar la llave.