Este artículo de investigación presenta RRBench, un nuevo marco de código abierto diseñado para evaluar cómo los agentes de IA implementados localmente manejan la preparación de datos complejos para estudios longitudinales. Tradicionalmente, los investigadores tienen prohibido el uso de IA basada en la nube debido a las estrictas regulaciones de privacidad de datos que rodean la información personal sensible. Para abordar esto, los autores probaron varios modelos de lenguaje grandes de código abierto en hardware de consumo para ver si podían limpiar y armonizar conjuntos de datos de forma autónoma utilizando el lenguaje de programación R. El estudio encontró que los modelos de mejor rendimiento lograron una alta precisión, recreando correctamente aproximadamente el 85,9 % de las variables requeridas y completando con éxito la mayoría de las tareas. Sin embargo, los autores enfatizan que, si bien la IA puede reducir significativamente el trabajo manual, la supervisión humana sigue siendo esencial para detectar "errores silenciosos" que podrían comprometer los resultados científicos. En definitiva, el trabajo demuestra una vía segura para integrar la IA con agentes en entornos de investigación restringidos sin comprometer la gobernanza de datos.
Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks", por Mack Nixon y colegas. Publicado el 24 de Julio de 2026.
El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.
El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.
Resumen
Beto
¿Alguna vez se ha encontrado completamente sepultado por una tarea tediosa y repetitiva?
Alicia
Oh, sí, creo que todos lo hemos hecho.
Beto
Correcto. Sabes exactamente el tipo de trabajo administrativo, esa clase de trabajo que agota la mente, ese tipo de trabajo de oficina que absolutamente tiene que hacerse.
Alicia
Pero te impide hacer el trabajo significativo.
Beto
Exacto. El trabajo para el que realmente fuiste contratado en primer lugar. Así que si estás asintiendo ahora mismo, quiero que imagines 250 años-persona de esa sensación exacta.
Alicia
Lo cual es una cantidad asombrosa de tiempo.
Beto
Es salvaje. Dos y medio siglos de esfuerzo agotador y duplicado. Porque, bueno, esa es la realidad para los investigadores que trabajan ahora con conjuntos de datos masivos y altamente sensibles.
Alicia
De verdad lo es. Es la columna vertebral poco glamurosa de todo descubrimiento científico.
Beto
Sí, y hoy nuestra inmersión profunda se basa en este fascinante artículo de investigación de julio de 2026. Fue producido por investigadores del University College London y la University of Bristol.
Alicia
Correcto. Titulado, "Programación agéntica sin la nube".
Beto
Sí. Y está echando un vistazo muy duro a uno de los mayores cuellos de botella en la ciencia moderna, que es la preparación de datos.
Alicia
Porque antes de que puedas buscar curas para enfermedades o comprender grandes tendencias sociales, tienes que limpiar los datos.
Beto
Es totalmente fundacional.
Alicia
Exacto. Y lo que explora este artículo es cómo los científicos están tratando de automatizar este proceso realmente agónico usando agentes de IA.
Beto
Pero no están mirando a cualquier IA.
Alicia
No, no, están probando específicamente modelos de IA de código abierto y gran peso (open-weight) que los investigadores pueden ejecutar localmente, como enteramente en sus propias computadoras portátiles.
Beto
Lo cual es enorme.
Así que la misión de nuestra inmersión profunda de hoy es explorar cómo estos modelos locales podrían ahorrar décadas de trabajo humano.
Alicia
Sin romper algunas de las leyes de privacidad más estrictas del planeta.
Beto
Correcto. Y cuando miras la magnitud del tiempo que podría ahorrar aquí, es genuinamente asombroso. Quiero decir, si esto funciona, podría cambiar completamente el ritmo en que ocurren los avances científicos.
Alicia
Ciertamente podría, pero también introduce una complejidad inmensa.
Beto
Oh, seguro.
Alicia
Porque no estamos hablando solo de números disparados en una hoja de cálculo o de corregir unos pocos errores tipográficos, estamos hablando de estandarizar vidas humanas desordenadas y caóticas en puntos de datos ordenados y analizables.
Beto
Lo cual es inherentemente desordenado.
Alicia
Exacto. Y como veremos, ese es un desafío profundo para una inteligencia artificial.
Beto
Okay. Así que desglosemos esto un poco. Antes de mirar la solución de IA, realmente necesitamos establecer por qué este problema específico está paralizando a la ciencia ahora mismo.

IA Local: Una solución segura para la preparación de datos sensitivos
Alicia
Oh, correcto. Y por qué la IA estándar no puede simplemente aparecer y arreglarlo.
Beto
Sí. El tipo de IA que tú y yo usamos todos los días en internet. Porque los investigadores estiman que la preparación de datos lleva alrededor de tres meses para un solo estudio científico.
Alicia
Tres meses solo de trabajo de preparación.
Beto
Correcto. Así que si escalas eso a mil proyectos de investigación, obtienes esos 250 años-persona de esfuerzo.
Alicia
Solo increíble. Son 250 años dedicados a hacer cosas como encontrar las variables correctas, recodificar respuestas de encuestas y manejar datos faltantes.
Beto
Y fusionar conjuntos de datos, ¿correcto?
Alicia
Sí, fusionar conjuntos de datos masivos. Es esencialmente el mismo trabajo siendo realizado una y otra vez por diferentes equipos.
Beto
En lugares completamente diferentes.
Alicia
Exacto. Todos tratando de darle sentido a la misma información sin procesar.
Beto
Y resulta que los humanos son bastante malos en este tipo de trabajo repetitivo.
Alicia
Realmente lo somos.
Beto
El artículo cita, de hecho, un estudio reciente que mira revistas importantes de economía y ciencias políticas. Y encontraron errores de codificación en el 25% de los artículos que evaluaron.
Alicia
Uno de cada cuatro.
Beto
Uno de cada cuatro artículos importantes tenía un error en cómo se prepararon los datos.
Alicia
Lo cual es alarmante, honestamente. Pero ya sabes, no es totalmente sorprendente cuando piensas en la carga cognitiva involucrada aquí.
Beto
Sí, solo esta fatiga pura.
Alicia
Exacto. Los humanos experimentan fatiga, aburrimiento, nuestra atención divaga. Quiero decir, cuando eres un investigador mirando miles y miles de filas de datos categóricos durante semanas seguidas ...
Beto
... Todo se difumina.
Alicia
Correcto. Un pequeño error manual de codificación es casi inevitable. Tocas la tecla equivocada o lees mal una etiqueta de categoría.
Beto
Pero esos pequeños errores se desprenden en cascada.
Alicia
Lo hacemos. Y pueden sesgar conclusiones científicas enteras.
Beto
Así que creo que la pregunta obvia que podrías estar haciendo ahora mismo es por qué no usar un modelo de nube fronteriza masivo.
Alicia
Correcto. Simplemente lo tiras en ChatGPT, o Claude.
Beto
Sí, simplemente tiras los datos desordenados en una IA empresarial y le pides que los limpie. Pero hay un gran obstáculo aquí.
Alicia
Un obstáculo muy grande.
Beto
Los investigadores están tratando con datos poblacionales longitudinales.
Alicia
Lo cual es altamente, altamente sensible.
Beto
Correcto. Cosas como registros de salud electrónicos, o encuestas increíblemente detalladas que rastrean a personas durante décadas.
Alicia
Y debido a esa sensibilidad extrema, hay reglas de gobernanza de datos increíblemente estrictas en vigor. Es para proteger a las personas.
Beto
Como debería ser.
Alicia
Absolutamente. Simplemente no puedes transmitir datos personales a nivel individual a un servicio de nube de terceros.
Beto
Es una violación masiva de la privacidad simplemente subir la historia médica de alguien a un servidor de IA comercial.
Alicia
Correcto. Este tipo de datos generalmente tiene que permanecer dentro de lo que se denomina "entornos de investigación de confianza" ("Trusted Resource Environments", o TREs).
Beto
Y los TREs son esencialmente esta pared digital segura y cerrada.
Alicia
Correcto. Tienen acceso a internet muy restringido. No puedes simplemente abrir un navegador web y hacer ping a un servidor externo.
Beto
Porque los datos literalmente no pueden salir de la bóveda.
Alicia
Correcto. O al menos tienen que permanecer en un aislamiento seguro hacia la máquina local.
Beto
Okay. Así que es como imaginar tener acceso a un chef celebridad con una estrella Michelin mundialmente famosa.
Alicia
Okay. Me gusta esto. La IA en la nube.
Beto
Correcto. La IA en la nube es el chef celebridad que podría preparar todas tus comidas perfectamente. Pero legalmente, no se te permite sacar tus ingredientes de tu propia cocina.
Alicia
Y al chef no se le permite entrar a tu casa.
Beto
Exacto. Así que no puedes usar al chef celebridad en absoluto. Básicamente tienes que encontrar a un chef muy capaz que esté dispuesto a vivir y trabajar completamente dentro de tu casa sin salir jamás.
Alicia
Y ese chef representa estos modelos de código abierto desplegados localmente.
Beto
Sí. Pero la gran pregunta es, ¿estos chefs locales son realmente lo suficientemente habilidosos para manejar un menú científico de una estrella Michelin?
Alicia
Y eso es exactamente lo que los investigadores del UCL y Bristol se propusieron responder.
Beto
Okay. Así que para averiguar si estos modelos locales son realmente lo suficientemente buenos, tenemos que mirar exactamente cómo los probaron.
Alicia
Correcto. Porque no le pidieron a la IA que escribiera un guion simple en el vacío.
Beto
Eso sería demasiado fácil.
Alicia
Demasiado fácil. Porque estaban forzando a la IA a navegar por una línea de tiempo de 18 años de vida humana, no podían simplemente usar una ventana de chat estándar. Tenían que darle a la IA un espacio de trabajo dedicado. Así que construyeron este marco de evaluación agotador y altamente específico llamado RRBench.
Beto
RRBench. Y usan datos del mundo real para esta prueba también.
Alicia
Sí.
Beto
El estudio de cohorte Next Steps.
Alicia
Oh, sí, la forma. Next Steps es un estudio de cohorte británico muy famoso. Rastró a un grupo de jóvenes desde la edad de 14 años hasta principios de sus 30.
Beto
Vaya.
Alicia
Así que tienes este conjunto de datos increíblemente rico y complejo que abarca 18 años de desarrollo humano.
Beto
Y los investigadores curaron qué, 20 tareas distintas de preparación de datos de esta cohorte.
Alicia
Sí. 20 tareas, que finalmente involucraron la creación de 102 variables diferentes.
Beto
Cosas como el índice de masa corporal, el sexo, la etnicidad, el ingreso familiar, ese tipo de cosas.
Alicia
Exacto. Y para darle a la IA ese espacio de trabajo, como hablamos, usan algo llamado "SmolAgents".
Beto
SmolAgents, que es un nombre muy gracioso.
Alicia
Lo es, pero es un marco de agentes muy potente, ligero y agente.
Beto
¿Qué significa eso en la práctica?
Alicia
Básicamente, es un sistema que permite que el modelo de IA subyacente no solo escriba un trozo de código y lo entregue, sino que realmente ejecute ese código de forma iterativa.
Beto
Oh, así que puede revisar su propio trabajo.
Alicia
Exacto. Puede ejecutar el código, ver si produce un mensaje de error, leer ese error y luego intentar arreglarlo todo en un ciclo cerrado.
Beto
Eso es increíble.
Alicia
Y crucialmente, forzaron a la IA a escribir este código en R.
Beto
Que es el lenguaje de programación estadística preferido de las ciencias de la salud, ¿verdad?
Alicia
Correcto. Y esto es de hecho un obstáculo adicional.
Beto
¿Por qué?
Alicia
Porque la mayoría de los modelos de IA están fuertemente entrenados en Python, no en R. Hay mucho más código de Python en internet para que aprendan.
Beto
Oh, tiene sentido. Así que usar el marco de SmolAgents es como la diferencia entre un estudiante que entrega un primer borrador de una prueba masiva y simplemente se va, versus un estudiante que escribe un borrador, lo revisa contra la rúbrica de calificación del profesor, se da cuenta de que cometió un error de cálculo, lo borra e intenta de nuevo hasta que lo consigue bien.
Alicia
Sí.
Beto
Y hace todo eso antes de que siquiera veas el artículo final.
Alicia
Esa es una forma perfecta de verlo. Se le dieron las instrucciones y los metadatos a la IA.
Beto
Para aclarar por un segundo, los metadatos son básicamente solo los datos sobre los datos.
Alicia
Correcto. En este caso, estaban formateados en JSON.
Beto
Que es solo una forma altamente organizada y estandarizada de etiquetar información digital.
Alicia
Sí. Así que un programa de computadora puede leerlo fácilmente. Así que la IA lee esto como una archivadora digital de metadatos y se pone a trabajar escribiendo su script en R.
Beto
Tengo que hacer una pausa aquí, sin embargo, porque estoy jugando el papel de abogado del diablo: Escribir código para calcular el índice de masa corporal o simplemente encontrar el sexo de alguien en una encuesta digital, parece ser una tarea absolutamente sencilla para la IA moderna.
Alicia
En la superficie, parece demasiado fácil.
Beto
¿Por qué se considera esta el obstáculo definitivo?
Alicia
Bueno, tienes que recordar la realidad de rastrear a seres humanos durante 18 años. Es una pesadilla estadística absoluta.
Beto
Okay.
Alicia
Se conoce en el campo como "fusión multi-onda" ("multi-wave merging").
Beto
Okay. Vamos a recorrer cómo funciona la fusión multi-onda en la práctica. Porque imagino que rastrear a un adolescente hasta la edad adulta se vuelve bastante desordenado.
Alicia
Increíblemente desordenado. Okay. Imagina a un participante específico en este estudio. Llamémosle Alex.
Beto
Okay, Alex.
Alicia
A la edad de 14 años, que es la primera ola de la encuesta, los padres de Alex llenan el formulario.
Beto
Correcto. Porque es un niño.
Alicia
Exacto. Podrían marcar una casilla para su etnicidad de una lista específica de 10 opciones. Luego lo encuestas de nuevo a la edad de 16, 20, 25 y 32. Pero la gente omite encuestas. Quizás Alex se retira a la edad de 20 y regresa a los 25.
Beto
Ah, así que hay lagunas.
Alicia
Lagunas enormes. Y además, la forma en que se hace una pregunta cambia con el tiempo.
Beto
Oh, ya veo.
Alicia
A la edad de 32, Alex es un adulto llenando la encuesta él mismo. Y para entonces, el gobierno podría haber actualizado sus estándares demográficos.
Beto
Así que las opciones son totalmente diferentes.
Alicia
Correcto. Así que ahora la pregunta de etnicidad tiene 25 categorías de opción múltiple diferentes en lugar de las originales 10.
Beto
Oh, vaya. Así que la IA tiene que escribir una lógica que mire a través de todas estas diferentes olas de tiempo, priorice qué respuesta usar si entran en conflicto, y luego reconcilie todas esas estructuras de codificación heterogéneas.
Alicia
Exacto. Y las estructuras de codificación heterogéneas solo significan diferentes sistemas de numeración para exactamente el mismo concepto.
Beto
Correcto.
Alicia
La IA tiene que darse cuenta de que la categoría tres en el año 2004 significa exactamente lo mismo que la categoría 12 en el año 2022.
Beto
Eso es salvaje.
Alicia
Y luego tiene que fusionarlo todo en una única variable limpia y estandarizada.
Beto
Y tiene que hacer todo esto sin ver realmente los datos privados de la vida de Alex.
Alicia
Correcto. Solo puede mirar los metadatos JSON, solo las etiquetas que describen las preguntas de la encuesta.
Beto
Eso es mucho más que solo escribir una fórmula matemática. Eso es literalmente navegar por una taxonomía cambiante de la vida humana durante dos décadas.
Alicia
Exacto.
Beto
Así que cómo funcionaron realmente los modelos en esta confrontación. ¿Quién pasó y quién falló?
Alicia
Bueno, probaron ocho modelos de código abierto diferentes.
Beto
Okay.
Alicia
Estos modelos van desde 8 mil millones hasta 35 mil millones de parámetros.
Beto
Y para dar contexto, puedes pensar que los parámetros son aproximadamente equivalentes a las sinapsis en el cerebro de una IA.
Alicia
Correcto. Esa es una buena manera de imaginarlo. Cuantos más parámetros tiene un modelo, más complejos patrones y relaciones puede reconocer.
Pero lo crucial aquí es que un modelo de 35 mil millones de parámetros aún puede ejecutarse en hardware de consumo de alta gama.
Beto
Correcto. Así que no necesitas una inmensa granja de servidores corporativos para ejecutarlo. Literalmente puede ejecutarse en la misma habitación que tú.
Alicia
Exacto. Y el ganador del grupo fue un modelo llamado Gemma-4-31b.
Beto
Gemma-4-31b. Impresionante. ¿Qué tan bien lo hizo?
Alicia
Lo hizo muy bien. Completó el 75% de las tareas complejas en una sola pasada de agente.
Beto
Lo que significa que no necesitó ninguna intervención humana en absoluto.
Alicia
Correcto. Y logró un rendimiento de variable equilibrado del 85.9%.
Beto
Vaya.
Alicia
Lo que significa que creó con éxito y precisión la gran mayoría de esas 102 variables, navegando todas esas fusiones multi-onda complejas.
Beto
Pero hay un matiz realmente interesante aquí en lo que la IA fue buena versus lo que realmente tuvo dificultades.
Alicia
Sí, lo hay.
Beto
Porque no todos funcionaron por igual en todo.
Alicia
No, para nada. La IA es absolutamente excelente con conceptos universales.
Beto
Cosas como el sexo, la etnicidad y el BMI ("Body-Mass Index").
Alicia
Correcto. ¿Y por qué? Porque esos conceptos tienen definiciones estándar, casi universales que existen en todas partes en los datos de entrenamiento subyacentes de la IA.
Beto
Oh, porque leyó toda internet.
Alicia
Básicamente, sí. El modelo ha leído millones de documentos de internet sobre cómo calcular un BMI.
Beto
Sabe la matemática.
Alicia
Correcto. Pero tuvieron serios problemas con lógica específica de encuestas.
Beto
Oh, ya veo. Así que sabe qué es un BMI porque es un estándar médico. Pero no tendría ni idea de cómo una encuesta británica específica de como 2004 decidió categorizar algo tan regional como la tenencia de vivienda.
Alicia
O la educación. Exacto. Esas son variables hiperespecíficas donde la definición depende completamente de las reglas únicas de ese estudio británico específico.
Beto
Correcto. No hay una página de Wikipedia universal sobre cómo hizo este estudio.
Alicia
Exacto. La IA no pudo confiar en su conocimiento general del mundo. Tenía que confiar solo en los metadatos JSON proporcionados en la instrucción (prompt).
Beto
Lo cual resultó ser increíblemente difícil.
Alicia
Lo hizo. De hecho, ninguno de los modelos completó totalmente la tarea de tenencia de vivienda en ninguna de las ejecuciones.
Beto
Ni uno solo. Vaya. También tenemos que hablar sobre el fallo completo en el grupo, sin embargo.
Alicia
Oh, sí.
Beto
El modelo llamado Gemma-4-E4B. No logró producir ningún resultado válido, como 0%.
Alicia
Fallo completo.
Beto
Pero el artículo señala que no fue realmente porque no pudo codificar.
Alicia
No fue un fallo de codificación en absoluto. Cuando los investigadores miraron los registros backend, Gemma-4-E4B estaba escribiendo nuestro código R perfectamente.
Beto
Espera, ¿en serio? Entonces, ¿por qué obtuvo un 0?
Alicia
Porque no pudo seguir las reglas de formato estrictas requeridas por la interfaz de la herramienta de agentes pequeños.
Beto
Oh, vaya.
Alicia
Simplemente no pudo producir sus respuestas en la estructura exacta que exigía el marco. Así que el sistema rechazó su código cada vez.
Beto
Eso es salvaje.
Alicia
Sí.
Beto
Es un gran recordatorio de que la inteligencia bruta simplemente no es suficiente, ¿correcto? Y la IA tiene que ser capaz de usar las herramientas que se le dan dentro de un entorno digital muy rígido.
Alicia
Exacto. Pero mirando los resultados de los otros modelos, lo fascinante aquí es que la principal diferencia entre los mejores rendidores y los modelos más débiles no fue realmente la completitud.
Beto
¿Qué quieres decir?
Alicia
Bueno, incluso los modelos más débiles intentaron hacer más del 95% de las variables. No simplemente se rindieron a una salida de página en blanco. La principal diferencia fue la corrección. Los modelos más débiles eran increíblemente confiados, pero completamente equivocados.
Beto
Así que simplemente alucinaban.
Alicia
Sí. Alucinaban pasos de preprocesamiento plausibles pero totalmente incorrectos. Inventaban lógica de registro que no se alineaba en absoluto con los metadatos.
Beto
Y realmente tenemos que recordar cuáles son estos modelos en esencia para entender por qué hacen eso.
Alicia
Correcto. Son básicamente solo motores de texto predictivo increíblemente sofisticados.
Beto
Sí. Exacto.
Alicia
Así que cuando carecen del contexto adecuado, como las reglas específicas para la tenencia de vivienda británica, no suelen decir simplemente, "oye, no lo sé".
Beto
No, odian decir que no saben.
Alicia
Correcto. Simplemente adivinan el siguiente paso lógico estadísticamente más probable basado en su entrenamiento, incluso si está completamente fabricado.
Beto
Ese es precisamente el mecanismo. Están tratando de completar un patrón. Y si el verdadero patrón no es claro a partir de los metadatos, simplemente inventarán un patrón que parezca estadísticamente normal.
Alicia
Así que, ¿qué significa todo esto para los investigadores? Quiero decir, en la escuela, obtener un 85.9%, que es lo que obtuvo el modelo GEMMA ganador, es una B sólida.
Beto
Estarías encantada.
Alicia
Estarías feliz con eso. Pero en la investigación científica, si la IA se equivoca completamente en el 14 o 15% de las variables, ¿no es eso un fallo catastrófico?
Beto
Esa es la pregunta crítica. Y realmente cambia nuestro enfoque de solo mirar la precisión de la codificación, a mirar los resultados científicos reales del mundo.
Alicia
Correcto. ¿Qué pasa cuando ejecutas un estudio científico en datos que están equivocados en un 15%?
Así que para averiguar, los investigadores realizaron análisis de regresión descendente ("downstream regression analyses").
Beto
Okay. Y un análisis de regresión es básicamente solo una forma elegante y estadística de medir cuánto una cosa influye en otra, ¿verdad? Como cuánto impacta el nivel educativo de una persona en sus ingresos futuros.
Alicia
Eso es exactamente. Así que usaron los datos limpios por la IA para ejecutar estos estudios científicos simulados, tratando de predecir cosas como el BMI y los ingresos.
Beto
Okay.
Alicia
Y luego compararon esos resultados con la verdad fundamental ("ground truth").
Beto
Que son los datos limpios por expertos humanos reales.
Alicia
Correcto. Los resultados que obtienes cuando usas los datos que fueron limpiados impecablemente por expertos humanos durante muchos meses.
Beto
Okay. Y esto es realmente preocupante cuando miras los resultados.
Alicia
Lo es.
Beto
El mejor modelo, Gemma4-31B, produjo coeficientes de regresión que eran idénticos a los científicos humanos.
Alicia
Correcto. Fue una coincidencia perfecta para esas pruebas específicas.
Beto
Pero luego probaron los datos limpios por el modelo válido de peor rendimiento, que fue Ministral-3-14B.
Alicia
Sí.
Beto
Y este modelo introdujo lo que el artículo llama "errores silenciosos" ("silent errors").
Alicia
Y los errores silenciosos son simplemente aterradores para la ciencia de datos.
Beto
¿Por qué son tan aterradores?
Alicia
Porque cuando Minisral-3-14B ejecutó su código, no se bloqueó. No salieron luces de advertencia.
Beto
Todo parecía bien.
Alicia
Todo parecía perfectamente bien. Las variables que se produjeron parecían perfectamente formadas y plausibles. No sabrías que algo estuviera mal a menos que revisaras cada celda de datos contra la verdad fundamental humana.
Beto
Vaya. Así que veamos el error específico que cometió. Ministral cometió un pequeño error en cómo manejó los datos faltantes para una pregunta sobre ingresos.
Alicia
Correcto.
Beto
En la encuesta, los valores faltantes, como si alguien simplemente se negó a responder la pregunta, se suponía que debían codificarse como uno negativo.
Alicia
Exacto.
Beto
Pero Ministral los codificó como uno positivo.
Alicia
Un solo signo menos. Eso es todo lo que se perdió.
Beto
Pero ¿por qué sucede eso? Quiero decir, ¿por qué una IA avanzada simplemente dejaría un signo menos?
Alicia
Se reduce a cómo los modelos de lenguaje procesan realmente la información.
Beto
Okay.
Alicia
No leen los números como lo hace una calculadora. Descomponen el texto en fragmentos llamados tokens.
Beto
Correcto. Tokens.
Alicia
Dependiendo de la arquitectura del modelo, un signo menos adjunto a un número podría tratarse como un token completamente separado o podría agruparse extrañamente con el número en sí.
Beto
Oh, ya veo.
Alicia
Si el modelo no entiende matemáticamente la relación entre los tokens en ese contexto específico, puede simplemente abandonar un símbolo al escribir el código final.
Beto
Pero aquí es donde se pone realmente loco. Ese pequeño error de tokenización causó un efecto mariposa masivo en el resultado científico.
Alicia
Lo hizo.
Beto
Porque cuando ejecutaron los modelos de regresión para ver cómo afecta la actividad económica a los ingresos, los datos humanos mostraron un impacto negativo de aproximadamente 38 libras británicas.
Alicia
Correcto.
Beto
Pero los datos de la IA invirtieron completamente la dirección.
Alicia
Lo invirtieron completamente.
Beto
Mostró un impacto positivo de 10 libras. Un error silencioso revirtió completamente los hallazgos científicos.
Alicia
Es increíble.
Beto
Es como imaginar a un ingeniero estructural que coloca un punto decimal incorrectamente en un plano.
Alicia
Oh, esa es una buena analogía.
Beto
Correcto. El puente se ve perfectamente seguro en el papel. La matemática parece cuadrar de un vistazo, pero colapsa bajo el peso del primer coche.
Alicia
Exacto.
Beto
Si la IA se ve perfectamente confiada y no podemos ver estos errores sin revisar cada celda de todos modos, ¿cómo podemos confiar en estos sistemas?
Alicia
Bueno, no podemos confiar en ellos ciegamente. Esa es la principal conclusión. Y eso nos lleva a cómo integramos esta tecnología en el futuro.
Beto
Correcto. Porque si los errores silenciosos son tan peligrosos, ¿abandonamos la IA por completo para la investigación sensible?
Alicia
Los investigadores argumentan que no, no la abandonamos.
Beto
Pero tenemos que cambiar fundamentalmente cómo visualizamos su uso.
Alicia
Sí. El estudio forzó a la IA a ser totalmente autónoma solo para encontrar sus límites absolutos.
Beto
Solo para ver qué sucedería.
Alicia
Exacto. Pero en el mundo real, ningún científico va a presionar ejecutar y publicar los resultados en una revista médica.
Beto
Yo esperaría que no lo hiciera.
Alicia
Correcto. El futuro que ellos ven es un modelo copiloto.
Beto
Modelo copiloto.
Alicia
El agente de IA local básicamente actúa como un asistente junior muy capaz.
Beto
Así que navega a través de los 250 años de tedio.
Alicia
Sí. Escribe el primer borrador de los complejos scripts en R y trata con todas esas desordenadas fusiones multi-onda.
Beto
Pero luego un experto humano revisa el código, lo depura y valida la lógica.
Alicia
Exacto. Se mantiene al humano firmemente en el circuito para atrapar los signos menos perdidos.
Beto
Y el estudio demostró que cómo interactúa el humano con la IA al principio es totalmente crítico.
Alicia
Absolutamente. Probaron diferentes diseños de prompts (instrucciones).
Beto
Correcto. Y cuando usan lo que llaman "prompts ligeros", que tenían menos detalle e instrucciones explícitas, el rendimiento de todos los modelos bajó significativamente.
Alicia
La IA no pudo simplemente adivinar lo que quería el científico. Dependió mucho de metadatos claros y bien estructurados.
Beto
Y esto se conecta con un movimiento más amplio en la ciencia de datos llamado los principios FAIR, ¿no?
Alicia
Lo hace. FAIR significa hacer que los datos sean encontrables ("Findable"), accesibles ("Accessible"), interoperables ("Interoperable") y reutilizables ("Reusable").
Beto
Lo cual tiene sentido.
Alicia
Correcto. Los modelos de IA solo pueden limpiar los datos con precisión si los metadatos que describen esos datos están meticulosamente organizados.
Beto
Así que si el humano no define claramente lo que significa "la tenencia de vivienda" en el archivo JSON, ...
Alicia
... entonces la IA simplemente va a alucinar.
Beto
Lo que apunta a un cambio realmente fascinante en dónde se gastará el trabajo humano.
Alicia
Lo hace.
Beto
¿Significa esto que el cuello de botella futuro en la ciencia no es realmente construir modelos de IA más grandes y más inteligentes? Será sobre los humanos haciendo el trabajo aburrido, meticuloso y organizativo.
Alicia
Como convertirse en arquitectos de metadatos.
Beto
Sí. Convertirse en arquitectos de metadatos para que la IA pueda hacer la computación.
Alicia
Ciertamente apunta en esa dirección. Realmente tienes que saber cómo estructurar el entorno para que la IA tenga éxito.
Beto
Correcto.
Alicia
Y si conectamos esto con la imagen más amplia, los investigadores sugieren que el próximo gran salto no es solo un copiloto.
Beto
Oh, ¿qué es?
Alicia
Son sistemas multiagente especializados.
Beto
Vaya. Okay.
Alicia
En lugar de que una IA intente hacerlo todo, tienes un agente planificador que lee los metadatos y diseña una estrategia.
Beto
Okay, dividiendo el trabajo.
Alicia
Exacto. Le entrega esa estrategia a un agente codificador que realmente escribe el script en R.
Y luego un agente revisor completamente separado ejecuta el código, busca esos errores silenciosos, busca distribuciones inverosibles en los datos y los marca para el humano.
Beto
Así que es básicamente todo un laboratorio virtual trabajando dentro de tu computadora portátil local, completamente aislado de internet.
Alicia
Completamente aislado. Lo que permite a los investigadores, que trabajan bajo los marcos de gobernanza más restrictivos, acceder al poder de la IA sin arriesgar una violación de la privacidad.
Beto
Eso es simplemente increíble. Y el tiempo ahorrado por estos agentes locales podría redirigirse hacia analizar realmente los datos.
Alicia
Hacer preguntas más grandes, realizar investigaciones más ambiciosas con múltiples conjuntos de datos.
Beto
Es un verdadero cambio de paradigma para las ciencias cuantitativas de la salud y sociales.
Alicia
Lo es.
Beto
Así que para resumir todo para ti, ejecutar IA de código abierto en hardware de consumo local ya no es un sueño imposible.
Alicia
Para nada.
Beto
Es una forma altamente viable y segura para saltarse meses de agotadora limpieza de datos. Modelos como Gemma-4-31B ya son capaces de hacer el trabajo pesado y navegar por datos longitudinales complejos.
Alicia
Pero, y este es un gran pero, debemos mantener a un humano en el circuito para estructurar los metadatos FAIR.
Beto
Y atrapar esos aterradores errores silenciosos.
Alicia
Exacto. Tenemos que seguir siendo los arquitectos del proceso, incluso cuando entregamos el trabajo manual.
Beto
Absolutamente.
Pero, ya sabes, quiero dejarte al oyente con un pensamiento provocador final para reflexionar. Algo que se basa en esta investigación pero la lleva un paso más allá.
Vimos hoy que la IA tuvo dificultades con la lógica humana personalizada y sobresalió en conceptos universales.
Alicia
Correcto.
Beto
Así que si los agentes de IA se convierten en la herramienta estándar para preparar y armonizar todos los datos humanos, si son los que deciden cómo fusionar las categorías heterogéneas y desordenadas de nuestras vidas en variables estándar ordenadas.
Alicia
Oh, veo a dónde vas.
Beto
¿Se conformarán nuestros futuros conjuntos de datos científicos sutilmente con la forma en que la IA prefiere categorizar el mundo?
Alicia
Vaya. Esa es una pregunta profunda. Porque si una IA siempre favorece la definición más simple y universal, solo porque es más fácil de codificar, podríamos perder el matiz de las experiencias humanas regionales o altamente específicas.
Beto
Exacto. En nuestra prisa por ahorrar 250 años de tedio, podríamos dejar accidentalmente que los modelos de lenguaje dicten la taxonomía subyacente del comportamiento humano durante generaciones venideras.
Alicia
Eso es algo a reflexionar.
Beto
Comenzamos este análisis profundo hablando sobre el alivio de descargar tareas tediosas. Pero tenemos que asegurarnos de que no estemos descargando nuestra definición de humanidad en el proceso.
Muchas gracias por acompañarnos en la inmersión profunda de hoy. Sigan cuestionando los datos a su alrededor, y los encontraremos la próxima vez.