Mostrando entradas con la etiqueta Co-pilot. Mostrar todas las entradas
Mostrando entradas con la etiqueta Co-pilot. Mostrar todas las entradas

viernes, 24 de julio de 2026

Programación Agéntica Sin la Nube

 
 

Este artículo de investigación presenta RRBench, un nuevo marco de código abierto diseñado para evaluar cómo los agentes de IA implementados localmente manejan la preparación de datos complejos para estudios longitudinales. Tradicionalmente, los investigadores tienen prohibido el uso de IA basada en la nube debido a las estrictas regulaciones de privacidad de datos que rodean la información personal sensible. Para abordar esto, los autores probaron varios modelos de lenguaje grandes de código abierto en hardware de consumo para ver si podían limpiar y armonizar conjuntos de datos de forma autónoma utilizando el lenguaje de programación R. El estudio encontró que los modelos de mejor rendimiento lograron una alta precisión, recreando correctamente aproximadamente el 85,9 % de las variables requeridas y completando con éxito la mayoría de las tareas. Sin embargo, los autores enfatizan que, si bien la IA puede reducir significativamente el trabajo manual, la supervisión humana sigue siendo esencial para detectar "errores silenciosos" que podrían comprometer los resultados científicos. En definitiva, el trabajo demuestra una vía segura para integrar la IA con agentes en entornos de investigación restringidos sin comprometer la gobernanza de datos.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks", por Mack Nixon y colegas. Publicado el 24 de Julio de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
¿Alguna vez se ha encontrado completamente sepultado por una tarea tediosa y repetitiva?

Alicia
Oh, sí, creo que todos lo hemos hecho.

Beto
Correcto. Sabes exactamente el tipo de trabajo administrativo, esa clase de trabajo que agota la mente, ese tipo de trabajo de oficina que absolutamente tiene que hacerse.

Alicia
Pero te impide hacer el trabajo significativo.

Beto
Exacto. El trabajo para el que realmente fuiste contratado en primer lugar. Así que si estás asintiendo ahora mismo, quiero que imagines 250 años-persona de esa sensación exacta.

Alicia
Lo cual es una cantidad asombrosa de tiempo.

Beto
Es salvaje. Dos y medio siglos de esfuerzo agotador y duplicado. Porque, bueno, esa es la realidad para los investigadores que trabajan ahora con conjuntos de datos masivos y altamente sensibles.

Alicia
De verdad lo es. Es la columna vertebral poco glamurosa de todo descubrimiento científico.

Beto
Sí, y hoy nuestra inmersión profunda se basa en este fascinante artículo de investigación de julio de 2026. Fue producido por investigadores del University College London y la University of Bristol.

Alicia
Correcto. Titulado, "Programación agéntica sin la nube".

Beto
Sí. Y está echando un vistazo muy duro a uno de los mayores cuellos de botella en la ciencia moderna, que es la preparación de datos.

Alicia
Porque antes de que puedas buscar curas para enfermedades o comprender grandes tendencias sociales, tienes que limpiar los datos.

Beto
Es totalmente fundacional.

Alicia
Exacto. Y lo que explora este artículo es cómo los científicos están tratando de automatizar este proceso realmente agónico usando agentes de IA.

Beto
Pero no están mirando a cualquier IA.

Alicia
No, no, están probando específicamente modelos de IA de código abierto y gran peso (open-weight) que los investigadores pueden ejecutar localmente, como enteramente en sus propias computadoras portátiles.

Beto
Lo cual es enorme.

Así que la misión de nuestra inmersión profunda de hoy es explorar cómo estos modelos locales podrían ahorrar décadas de trabajo humano.

Alicia
Sin romper algunas de las leyes de privacidad más estrictas del planeta.

Beto
Correcto. Y cuando miras la magnitud del tiempo que podría ahorrar aquí, es genuinamente asombroso. Quiero decir, si esto funciona, podría cambiar completamente el ritmo en que ocurren los avances científicos.

Alicia
Ciertamente podría, pero también introduce una complejidad inmensa.

Beto
Oh, seguro.

Alicia
Porque no estamos hablando solo de números disparados en una hoja de cálculo o de corregir unos pocos errores tipográficos, estamos hablando de estandarizar vidas humanas desordenadas y caóticas en puntos de datos ordenados y analizables.

Beto
Lo cual es inherentemente desordenado.

Alicia
Exacto. Y como veremos, ese es un desafío profundo para una inteligencia artificial.

Beto
Okay. Así que desglosemos esto un poco. Antes de mirar la solución de IA, realmente necesitamos establecer por qué este problema específico está paralizando a la ciencia ahora mismo.

Agentic_Coding_without_the_Cloud_1024.png
IA Local: Una solución segura para la preparación de datos sensitivos

Alicia
Oh, correcto. Y por qué la IA estándar no puede simplemente aparecer y arreglarlo.

Beto
Sí. El tipo de IA que tú y yo usamos todos los días en internet. Porque los investigadores estiman que la preparación de datos lleva alrededor de tres meses para un solo estudio científico.

Alicia
Tres meses solo de trabajo de preparación.

Beto
Correcto. Así que si escalas eso a mil proyectos de investigación, obtienes esos 250 años-persona de esfuerzo.

Alicia
Solo increíble. Son 250 años dedicados a hacer cosas como encontrar las variables correctas, recodificar respuestas de encuestas y manejar datos faltantes.

Beto
Y fusionar conjuntos de datos, ¿correcto?

Alicia
Sí, fusionar conjuntos de datos masivos. Es esencialmente el mismo trabajo siendo realizado una y otra vez por diferentes equipos.

Beto
En lugares completamente diferentes.

Alicia
Exacto. Todos tratando de darle sentido a la misma información sin procesar.

Beto
Y resulta que los humanos son bastante malos en este tipo de trabajo repetitivo.

Alicia
Realmente lo somos.

Beto
El artículo cita, de hecho, un estudio reciente que mira revistas importantes de economía y ciencias políticas. Y encontraron errores de codificación en el 25% de los artículos que evaluaron.

Alicia
Uno de cada cuatro.

Beto
Uno de cada cuatro artículos importantes tenía un error en cómo se prepararon los datos.

Alicia
Lo cual es alarmante, honestamente. Pero ya sabes, no es totalmente sorprendente cuando piensas en la carga cognitiva involucrada aquí.

Beto
Sí, solo esta fatiga pura.

Alicia
Exacto. Los humanos experimentan fatiga, aburrimiento, nuestra atención divaga. Quiero decir, cuando eres un investigador mirando miles y miles de filas de datos categóricos durante semanas seguidas ...

Beto
... Todo se difumina.

Alicia
Correcto. Un pequeño error manual de codificación es casi inevitable. Tocas la tecla equivocada o lees mal una etiqueta de categoría.

Beto
Pero esos pequeños errores se desprenden en cascada.

Alicia
Lo hacemos. Y pueden sesgar conclusiones científicas enteras.

Beto
Así que creo que la pregunta obvia que podrías estar haciendo ahora mismo es por qué no usar un modelo de nube fronteriza masivo.

Alicia
Correcto. Simplemente lo tiras en ChatGPT, o Claude.

Beto
Sí, simplemente tiras los datos desordenados en una IA empresarial y le pides que los limpie. Pero hay un gran obstáculo aquí.

Alicia
Un obstáculo muy grande.

Beto
Los investigadores están tratando con datos poblacionales longitudinales.

Alicia
Lo cual es altamente, altamente sensible.

Beto
Correcto. Cosas como registros de salud electrónicos, o encuestas increíblemente detalladas que rastrean a personas durante décadas.

Alicia
Y debido a esa sensibilidad extrema, hay reglas de gobernanza de datos increíblemente estrictas en vigor. Es para proteger a las personas.

Beto
Como debería ser.

Alicia
Absolutamente. Simplemente no puedes transmitir datos personales a nivel individual a un servicio de nube de terceros.

Beto
Es una violación masiva de la privacidad simplemente subir la historia médica de alguien a un servidor de IA comercial.

Alicia
Correcto. Este tipo de datos generalmente tiene que permanecer dentro de lo que se denomina "entornos de investigación de confianza" ("Trusted Resource Environments", o TREs).

Beto
Y los TREs son esencialmente esta pared digital segura y cerrada.

Alicia
Correcto. Tienen acceso a internet muy restringido. No puedes simplemente abrir un navegador web y hacer ping a un servidor externo.

Beto
Porque los datos literalmente no pueden salir de la bóveda.

Alicia
Correcto. O al menos tienen que permanecer en un aislamiento seguro hacia la máquina local.

Beto
Okay. Así que es como imaginar tener acceso a un chef celebridad con una estrella Michelin mundialmente famosa.

Alicia
Okay. Me gusta esto. La IA en la nube.

Beto
Correcto. La IA en la nube es el chef celebridad que podría preparar todas tus comidas perfectamente. Pero legalmente, no se te permite sacar tus ingredientes de tu propia cocina.

Alicia
Y al chef no se le permite entrar a tu casa.

Beto
Exacto. Así que no puedes usar al chef celebridad en absoluto. Básicamente tienes que encontrar a un chef muy capaz que esté dispuesto a vivir y trabajar completamente dentro de tu casa sin salir jamás.

Alicia
Y ese chef representa estos modelos de código abierto desplegados localmente.

Beto
Sí. Pero la gran pregunta es, ¿estos chefs locales son realmente lo suficientemente habilidosos para manejar un menú científico de una estrella Michelin?

Alicia
Y eso es exactamente lo que los investigadores del UCL y Bristol se propusieron responder.

Beto
Okay. Así que para averiguar si estos modelos locales son realmente lo suficientemente buenos, tenemos que mirar exactamente cómo los probaron.

Alicia
Correcto. Porque no le pidieron a la IA que escribiera un guion simple en el vacío.

Beto
Eso sería demasiado fácil.

Alicia
Demasiado fácil. Porque estaban forzando a la IA a navegar por una línea de tiempo de 18 años de vida humana, no podían simplemente usar una ventana de chat estándar. Tenían que darle a la IA un espacio de trabajo dedicado. Así que construyeron este marco de evaluación agotador y altamente específico llamado RRBench.

Beto
RRBench. Y usan datos del mundo real para esta prueba también.

Alicia
Sí.

Beto
El estudio de cohorte Next Steps.

Alicia
Oh, sí, la forma. Next Steps es un estudio de cohorte británico muy famoso. Rastró a un grupo de jóvenes desde la edad de 14 años hasta principios de sus 30.

Beto
Vaya.

Alicia
Así que tienes este conjunto de datos increíblemente rico y complejo que abarca 18 años de desarrollo humano.

Beto
Y los investigadores curaron qué, 20 tareas distintas de preparación de datos de esta cohorte.

Alicia
Sí. 20 tareas, que finalmente involucraron la creación de 102 variables diferentes.

Beto
Cosas como el índice de masa corporal, el sexo, la etnicidad, el ingreso familiar, ese tipo de cosas.

Alicia
Exacto. Y para darle a la IA ese espacio de trabajo, como hablamos, usan algo llamado "SmolAgents".

Beto
SmolAgents, que es un nombre muy gracioso.

Alicia
Lo es, pero es un marco de agentes muy potente, ligero y agente.

Beto
¿Qué significa eso en la práctica?

Alicia
Básicamente, es un sistema que permite que el modelo de IA subyacente no solo escriba un trozo de código y lo entregue, sino que realmente ejecute ese código de forma iterativa.

Beto
Oh, así que puede revisar su propio trabajo.

Alicia
Exacto. Puede ejecutar el código, ver si produce un mensaje de error, leer ese error y luego intentar arreglarlo todo en un ciclo cerrado.

Beto
Eso es increíble.

Alicia
Y crucialmente, forzaron a la IA a escribir este código en R.

Beto
Que es el lenguaje de programación estadística preferido de las ciencias de la salud, ¿verdad?

Alicia
Correcto. Y esto es de hecho un obstáculo adicional.

Beto
¿Por qué?

Alicia
Porque la mayoría de los modelos de IA están fuertemente entrenados en Python, no en R. Hay mucho más código de Python en internet para que aprendan.

Beto
Oh, tiene sentido. Así que usar el marco de SmolAgents es como la diferencia entre un estudiante que entrega un primer borrador de una prueba masiva y simplemente se va, versus un estudiante que escribe un borrador, lo revisa contra la rúbrica de calificación del profesor, se da cuenta de que cometió un error de cálculo, lo borra e intenta de nuevo hasta que lo consigue bien.

Alicia
Sí.

Beto
Y hace todo eso antes de que siquiera veas el artículo final.

Alicia
Esa es una forma perfecta de verlo. Se le dieron las instrucciones y los metadatos a la IA.

Beto
Para aclarar por un segundo, los metadatos son básicamente solo los datos sobre los datos.

Alicia
Correcto. En este caso, estaban formateados en JSON.

Beto
Que es solo una forma altamente organizada y estandarizada de etiquetar información digital.

Alicia
Sí. Así que un programa de computadora puede leerlo fácilmente. Así que la IA lee esto como una archivadora digital de metadatos y se pone a trabajar escribiendo su script en R.

Beto
Tengo que hacer una pausa aquí, sin embargo, porque estoy jugando el papel de abogado del diablo: Escribir código para calcular el índice de masa corporal o simplemente encontrar el sexo de alguien en una encuesta digital, parece ser una tarea absolutamente sencilla para la IA moderna.

Alicia
En la superficie, parece demasiado fácil.

Beto
¿Por qué se considera esta el obstáculo definitivo?

Alicia
Bueno, tienes que recordar la realidad de rastrear a seres humanos durante 18 años. Es una pesadilla estadística absoluta.

Beto
Okay.

Alicia
Se conoce en el campo como "fusión multi-onda" ("multi-wave merging").

Beto
Okay. Vamos a recorrer cómo funciona la fusión multi-onda en la práctica. Porque imagino que rastrear a un adolescente hasta la edad adulta se vuelve bastante desordenado.

Alicia
Increíblemente desordenado. Okay. Imagina a un participante específico en este estudio. Llamémosle Alex.

Beto
Okay, Alex.

Alicia
A la edad de 14 años, que es la primera ola de la encuesta, los padres de Alex llenan el formulario.

Beto
Correcto. Porque es un niño.

Alicia
Exacto. Podrían marcar una casilla para su etnicidad de una lista específica de 10 opciones. Luego lo encuestas de nuevo a la edad de 16, 20, 25 y 32. Pero la gente omite encuestas. Quizás Alex se retira a la edad de 20 y regresa a los 25.

Beto
Ah, así que hay lagunas.

Alicia
Lagunas enormes. Y además, la forma en que se hace una pregunta cambia con el tiempo.

Beto
Oh, ya veo.

Alicia
A la edad de 32, Alex es un adulto llenando la encuesta él mismo. Y para entonces, el gobierno podría haber actualizado sus estándares demográficos.

Beto
Así que las opciones son totalmente diferentes.

Alicia
Correcto. Así que ahora la pregunta de etnicidad tiene 25 categorías de opción múltiple diferentes en lugar de las originales 10.

Beto
Oh, vaya. Así que la IA tiene que escribir una lógica que mire a través de todas estas diferentes olas de tiempo, priorice qué respuesta usar si entran en conflicto, y luego reconcilie todas esas estructuras de codificación heterogéneas.

Alicia
Exacto. Y las estructuras de codificación heterogéneas solo significan diferentes sistemas de numeración para exactamente el mismo concepto.

Beto
Correcto.

Alicia
La IA tiene que darse cuenta de que la categoría tres en el año 2004 significa exactamente lo mismo que la categoría 12 en el año 2022.

Beto
Eso es salvaje.

Alicia
Y luego tiene que fusionarlo todo en una única variable limpia y estandarizada.

Beto
Y tiene que hacer todo esto sin ver realmente los datos privados de la vida de Alex.

Alicia
Correcto. Solo puede mirar los metadatos JSON, solo las etiquetas que describen las preguntas de la encuesta.

Beto
Eso es mucho más que solo escribir una fórmula matemática. Eso es literalmente navegar por una taxonomía cambiante de la vida humana durante dos décadas.

Alicia
Exacto.

Beto
Así que cómo funcionaron realmente los modelos en esta confrontación. ¿Quién pasó y quién falló?

Alicia
Bueno, probaron ocho modelos de código abierto diferentes.

Beto
Okay.

Alicia
Estos modelos van desde 8 mil millones hasta 35 mil millones de parámetros.

Beto
Y para dar contexto, puedes pensar que los parámetros son aproximadamente equivalentes a las sinapsis en el cerebro de una IA.

Alicia
Correcto. Esa es una buena manera de imaginarlo. Cuantos más parámetros tiene un modelo, más complejos patrones y relaciones puede reconocer.

Pero lo crucial aquí es que un modelo de 35 mil millones de parámetros aún puede ejecutarse en hardware de consumo de alta gama.

Beto
Correcto. Así que no necesitas una inmensa granja de servidores corporativos para ejecutarlo. Literalmente puede ejecutarse en la misma habitación que tú.

Alicia
Exacto. Y el ganador del grupo fue un modelo llamado Gemma-4-31b.

Beto
Gemma-4-31b. Impresionante. ¿Qué tan bien lo hizo?

Alicia
Lo hizo muy bien. Completó el 75% de las tareas complejas en una sola pasada de agente.

Beto
Lo que significa que no necesitó ninguna intervención humana en absoluto.

Alicia
Correcto. Y logró un rendimiento de variable equilibrado del 85.9%.

Beto
Vaya.

Alicia
Lo que significa que creó con éxito y precisión la gran mayoría de esas 102 variables, navegando todas esas fusiones multi-onda complejas.

Beto
Pero hay un matiz realmente interesante aquí en lo que la IA fue buena versus lo que realmente tuvo dificultades.

Alicia
Sí, lo hay.

Beto
Porque no todos funcionaron por igual en todo.

Alicia
No, para nada. La IA es absolutamente excelente con conceptos universales.

Beto
Cosas como el sexo, la etnicidad y el BMI ("Body-Mass Index").

Alicia
Correcto. ¿Y por qué? Porque esos conceptos tienen definiciones estándar, casi universales que existen en todas partes en los datos de entrenamiento subyacentes de la IA.

Beto
Oh, porque leyó toda internet.

Alicia
Básicamente, sí. El modelo ha leído millones de documentos de internet sobre cómo calcular un BMI.

Beto
Sabe la matemática.

Alicia
Correcto. Pero tuvieron serios problemas con lógica específica de encuestas.

Beto
Oh, ya veo. Así que sabe qué es un BMI porque es un estándar médico. Pero no tendría ni idea de cómo una encuesta británica específica de como 2004 decidió categorizar algo tan regional como la tenencia de vivienda.

Alicia
O la educación. Exacto. Esas son variables hiperespecíficas donde la definición depende completamente de las reglas únicas de ese estudio británico específico.

Beto
Correcto. No hay una página de Wikipedia universal sobre cómo hizo este estudio.

Alicia
Exacto. La IA no pudo confiar en su conocimiento general del mundo. Tenía que confiar solo en los metadatos JSON proporcionados en la instrucción (prompt).

Beto
Lo cual resultó ser increíblemente difícil.

Alicia
Lo hizo. De hecho, ninguno de los modelos completó totalmente la tarea de tenencia de vivienda en ninguna de las ejecuciones.

Beto
Ni uno solo. Vaya. También tenemos que hablar sobre el fallo completo en el grupo, sin embargo.

Alicia
Oh, sí.

Beto
El modelo llamado Gemma-4-E4B. No logró producir ningún resultado válido, como 0%.

Alicia
Fallo completo.

Beto
Pero el artículo señala que no fue realmente porque no pudo codificar.

Alicia
No fue un fallo de codificación en absoluto. Cuando los investigadores miraron los registros backend, Gemma-4-E4B estaba escribiendo nuestro código R perfectamente.

Beto
Espera, ¿en serio? Entonces, ¿por qué obtuvo un 0?

Alicia
Porque no pudo seguir las reglas de formato estrictas requeridas por la interfaz de la herramienta de agentes pequeños.

Beto
Oh, vaya.

Alicia
Simplemente no pudo producir sus respuestas en la estructura exacta que exigía el marco. Así que el sistema rechazó su código cada vez.

Beto
Eso es salvaje.

Alicia
Sí.

Beto
Es un gran recordatorio de que la inteligencia bruta simplemente no es suficiente, ¿correcto? Y la IA tiene que ser capaz de usar las herramientas que se le dan dentro de un entorno digital muy rígido.

Alicia
Exacto. Pero mirando los resultados de los otros modelos, lo fascinante aquí es que la principal diferencia entre los mejores rendidores y los modelos más débiles no fue realmente la completitud.

Beto
¿Qué quieres decir?

Alicia
Bueno, incluso los modelos más débiles intentaron hacer más del 95% de las variables. No simplemente se rindieron a una salida de página en blanco. La principal diferencia fue la corrección. Los modelos más débiles eran increíblemente confiados, pero completamente equivocados.

Beto
Así que simplemente alucinaban.

Alicia
Sí. Alucinaban pasos de preprocesamiento plausibles pero totalmente incorrectos. Inventaban lógica de registro que no se alineaba en absoluto con los metadatos.

Beto
Y realmente tenemos que recordar cuáles son estos modelos en esencia para entender por qué hacen eso.

Alicia
Correcto. Son básicamente solo motores de texto predictivo increíblemente sofisticados.

Beto
Sí. Exacto.

Alicia
Así que cuando carecen del contexto adecuado, como las reglas específicas para la tenencia de vivienda británica, no suelen decir simplemente, "oye, no lo sé".

Beto
No, odian decir que no saben.

Alicia
Correcto. Simplemente adivinan el siguiente paso lógico estadísticamente más probable basado en su entrenamiento, incluso si está completamente fabricado.

Beto
Ese es precisamente el mecanismo. Están tratando de completar un patrón. Y si el verdadero patrón no es claro a partir de los metadatos, simplemente inventarán un patrón que parezca estadísticamente normal.

Alicia
Así que, ¿qué significa todo esto para los investigadores? Quiero decir, en la escuela, obtener un 85.9%, que es lo que obtuvo el modelo GEMMA ganador, es una B sólida.

Beto
Estarías encantada.

Alicia
Estarías feliz con eso. Pero en la investigación científica, si la IA se equivoca completamente en el 14 o 15% de las variables, ¿no es eso un fallo catastrófico?

Beto
Esa es la pregunta crítica. Y realmente cambia nuestro enfoque de solo mirar la precisión de la codificación, a mirar los resultados científicos reales del mundo.

Alicia
Correcto. ¿Qué pasa cuando ejecutas un estudio científico en datos que están equivocados en un 15%?

Así que para averiguar, los investigadores realizaron análisis de regresión descendente ("downstream regression analyses").

Beto
Okay. Y un análisis de regresión es básicamente solo una forma elegante y estadística de medir cuánto una cosa influye en otra, ¿verdad? Como cuánto impacta el nivel educativo de una persona en sus ingresos futuros.

Alicia
Eso es exactamente. Así que usaron los datos limpios por la IA para ejecutar estos estudios científicos simulados, tratando de predecir cosas como el BMI y los ingresos.

Beto
Okay.

Alicia
Y luego compararon esos resultados con la verdad fundamental ("ground truth").

Beto
Que son los datos limpios por expertos humanos reales.

Alicia
Correcto. Los resultados que obtienes cuando usas los datos que fueron limpiados impecablemente por expertos humanos durante muchos meses.

Beto
Okay. Y esto es realmente preocupante cuando miras los resultados.

Alicia
Lo es.

Beto
El mejor modelo, Gemma4-31B, produjo coeficientes de regresión que eran idénticos a los científicos humanos.

Alicia
Correcto. Fue una coincidencia perfecta para esas pruebas específicas.

Beto
Pero luego probaron los datos limpios por el modelo válido de peor rendimiento, que fue Ministral-3-14B.

Alicia
Sí.

Beto
Y este modelo introdujo lo que el artículo llama "errores silenciosos" ("silent errors").

Alicia
Y los errores silenciosos son simplemente aterradores para la ciencia de datos.

Beto
¿Por qué son tan aterradores?

Alicia
Porque cuando Minisral-3-14B ejecutó su código, no se bloqueó. No salieron luces de advertencia.

Beto
Todo parecía bien.

Alicia
Todo parecía perfectamente bien. Las variables que se produjeron parecían perfectamente formadas y plausibles. No sabrías que algo estuviera mal a menos que revisaras cada celda de datos contra la verdad fundamental humana.

Beto
Vaya. Así que veamos el error específico que cometió. Ministral cometió un pequeño error en cómo manejó los datos faltantes para una pregunta sobre ingresos.

Alicia
Correcto.

Beto
En la encuesta, los valores faltantes, como si alguien simplemente se negó a responder la pregunta, se suponía que debían codificarse como uno negativo.

Alicia
Exacto.

Beto
Pero Ministral los codificó como uno positivo.

Alicia
Un solo signo menos. Eso es todo lo que se perdió.

Beto
Pero ¿por qué sucede eso? Quiero decir, ¿por qué una IA avanzada simplemente dejaría un signo menos?

Alicia
Se reduce a cómo los modelos de lenguaje procesan realmente la información.

Beto
Okay.

Alicia
No leen los números como lo hace una calculadora. Descomponen el texto en fragmentos llamados tokens.

Beto
Correcto. Tokens.

Alicia
Dependiendo de la arquitectura del modelo, un signo menos adjunto a un número podría tratarse como un token completamente separado o podría agruparse extrañamente con el número en sí.

Beto
Oh, ya veo.

Alicia
Si el modelo no entiende matemáticamente la relación entre los tokens en ese contexto específico, puede simplemente abandonar un símbolo al escribir el código final.

Beto
Pero aquí es donde se pone realmente loco. Ese pequeño error de tokenización causó un efecto mariposa masivo en el resultado científico.

Alicia
Lo hizo.

Beto
Porque cuando ejecutaron los modelos de regresión para ver cómo afecta la actividad económica a los ingresos, los datos humanos mostraron un impacto negativo de aproximadamente 38 libras británicas.

Alicia
Correcto.

Beto
Pero los datos de la IA invirtieron completamente la dirección.

Alicia
Lo invirtieron completamente.

Beto
Mostró un impacto positivo de 10 libras. Un error silencioso revirtió completamente los hallazgos científicos.

Alicia
Es increíble.

Beto
Es como imaginar a un ingeniero estructural que coloca un punto decimal incorrectamente en un plano.

Alicia
Oh, esa es una buena analogía.

Beto
Correcto. El puente se ve perfectamente seguro en el papel. La matemática parece cuadrar de un vistazo, pero colapsa bajo el peso del primer coche.

Alicia
Exacto.

Beto
Si la IA se ve perfectamente confiada y no podemos ver estos errores sin revisar cada celda de todos modos, ¿cómo podemos confiar en estos sistemas?

Alicia
Bueno, no podemos confiar en ellos ciegamente. Esa es la principal conclusión. Y eso nos lleva a cómo integramos esta tecnología en el futuro.

Beto
Correcto. Porque si los errores silenciosos son tan peligrosos, ¿abandonamos la IA por completo para la investigación sensible?

Alicia
Los investigadores argumentan que no, no la abandonamos.

Beto
Pero tenemos que cambiar fundamentalmente cómo visualizamos su uso.

Alicia
Sí. El estudio forzó a la IA a ser totalmente autónoma solo para encontrar sus límites absolutos.

Beto
Solo para ver qué sucedería.

Alicia
Exacto. Pero en el mundo real, ningún científico va a presionar ejecutar y publicar los resultados en una revista médica.

Beto
Yo esperaría que no lo hiciera.

Alicia
Correcto. El futuro que ellos ven es un modelo copiloto.

Beto
Modelo copiloto.

Alicia
El agente de IA local básicamente actúa como un asistente junior muy capaz.

Beto
Así que navega a través de los 250 años de tedio.

Alicia
Sí. Escribe el primer borrador de los complejos scripts en R y trata con todas esas desordenadas fusiones multi-onda.

Beto
Pero luego un experto humano revisa el código, lo depura y valida la lógica.

Alicia
Exacto. Se mantiene al humano firmemente en el circuito para atrapar los signos menos perdidos.

Beto
Y el estudio demostró que cómo interactúa el humano con la IA al principio es totalmente crítico.

Alicia
Absolutamente. Probaron diferentes diseños de prompts (instrucciones).

Beto
Correcto. Y cuando usan lo que llaman "prompts ligeros", que tenían menos detalle e instrucciones explícitas, el rendimiento de todos los modelos bajó significativamente.

Alicia
La IA no pudo simplemente adivinar lo que quería el científico. Dependió mucho de metadatos claros y bien estructurados.

Beto
Y esto se conecta con un movimiento más amplio en la ciencia de datos llamado los principios FAIR, ¿no?

Alicia
Lo hace. FAIR significa hacer que los datos sean encontrables ("Findable"), accesibles ("Accessible"), interoperables ("Interoperable") y reutilizables ("Reusable").

Beto
Lo cual tiene sentido.

Alicia
Correcto. Los modelos de IA solo pueden limpiar los datos con precisión si los metadatos que describen esos datos están meticulosamente organizados.

Beto
Así que si el humano no define claramente lo que significa "la tenencia de vivienda" en el archivo JSON, ...

Alicia
... entonces la IA simplemente va a alucinar.

Beto
Lo que apunta a un cambio realmente fascinante en dónde se gastará el trabajo humano.

Alicia
Lo hace.

Beto
¿Significa esto que el cuello de botella futuro en la ciencia no es realmente construir modelos de IA más grandes y más inteligentes? Será sobre los humanos haciendo el trabajo aburrido, meticuloso y organizativo.

Alicia
Como convertirse en arquitectos de metadatos.

Beto
Sí. Convertirse en arquitectos de metadatos para que la IA pueda hacer la computación.

Alicia
Ciertamente apunta en esa dirección. Realmente tienes que saber cómo estructurar el entorno para que la IA tenga éxito.

Beto
Correcto.

Alicia
Y si conectamos esto con la imagen más amplia, los investigadores sugieren que el próximo gran salto no es solo un copiloto.

Beto
Oh, ¿qué es?

Alicia
Son sistemas multiagente especializados.

Beto
Vaya. Okay.

Alicia
En lugar de que una IA intente hacerlo todo, tienes un agente planificador que lee los metadatos y diseña una estrategia.

Beto
Okay, dividiendo el trabajo.

Alicia
Exacto. Le entrega esa estrategia a un agente codificador que realmente escribe el script en R.

Y luego un agente revisor completamente separado ejecuta el código, busca esos errores silenciosos, busca distribuciones inverosibles en los datos y los marca para el humano.

Beto
Así que es básicamente todo un laboratorio virtual trabajando dentro de tu computadora portátil local, completamente aislado de internet.

Alicia
Completamente aislado. Lo que permite a los investigadores, que trabajan bajo los marcos de gobernanza más restrictivos, acceder al poder de la IA sin arriesgar una violación de la privacidad.

Beto
Eso es simplemente increíble. Y el tiempo ahorrado por estos agentes locales podría redirigirse hacia analizar realmente los datos.

Alicia
Hacer preguntas más grandes, realizar investigaciones más ambiciosas con múltiples conjuntos de datos.

Beto
Es un verdadero cambio de paradigma para las ciencias cuantitativas de la salud y sociales.

Alicia
Lo es.

Beto
Así que para resumir todo para ti, ejecutar IA de código abierto en hardware de consumo local ya no es un sueño imposible.

Alicia
Para nada.

Beto
Es una forma altamente viable y segura para saltarse meses de agotadora limpieza de datos. Modelos como Gemma-4-31B ya son capaces de hacer el trabajo pesado y navegar por datos longitudinales complejos.

Alicia
Pero, y este es un gran pero, debemos mantener a un humano en el circuito para estructurar los metadatos FAIR.

Beto
Y atrapar esos aterradores errores silenciosos.

Alicia
Exacto. Tenemos que seguir siendo los arquitectos del proceso, incluso cuando entregamos el trabajo manual.

Beto
Absolutamente.

Pero, ya sabes, quiero dejarte al oyente con un pensamiento provocador final para reflexionar. Algo que se basa en esta investigación pero la lleva un paso más allá.

Vimos hoy que la IA tuvo dificultades con la lógica humana personalizada y sobresalió en conceptos universales.

Alicia
Correcto.

Beto
Así que si los agentes de IA se convierten en la herramienta estándar para preparar y armonizar todos los datos humanos, si son los que deciden cómo fusionar las categorías heterogéneas y desordenadas de nuestras vidas en variables estándar ordenadas.

Alicia
Oh, veo a dónde vas.

Beto
¿Se conformarán nuestros futuros conjuntos de datos científicos sutilmente con la forma en que la IA prefiere categorizar el mundo?

Alicia
Vaya. Esa es una pregunta profunda. Porque si una IA siempre favorece la definición más simple y universal, solo porque es más fácil de codificar, podríamos perder el matiz de las experiencias humanas regionales o altamente específicas.

Beto
Exacto. En nuestra prisa por ahorrar 250 años de tedio, podríamos dejar accidentalmente que los modelos de lenguaje dicten la taxonomía subyacente del comportamiento humano durante generaciones venideras.

Alicia
Eso es algo a reflexionar.

Beto
Comenzamos este análisis profundo hablando sobre el alivio de descargar tareas tediosas. Pero tenemos que asegurarnos de que no estemos descargando nuestra definición de humanidad en el proceso.

Muchas gracias por acompañarnos en la inmersión profunda de hoy. Sigan cuestionando los datos a su alrededor, y los encontraremos la próxima vez.

martes, 14 de julio de 2026

Exposición ocupacional a la IA

 
 

Este artículo de investigación analiza el error de medición inherente al uso de registros de conversaciones de plataformas de IA para estimar la exposición ocupacional a la IA. Los autores demuestran que estos registros no son representativos de la fuerza laboral en general, ya que ciertas profesiones, particularmente en los campos de la informática y las matemáticas, están significativamente sobrerrepresentadas en comparación con su proporción real de empleo. Dado que las puntuaciones derivadas de la plataforma confunden la aplicabilidad a nivel de tarea con la base de usuarios específica de la plataforma, cambiar la fuente de datos puede alterar drásticamente los resultados del mercado laboral, llegando incluso a invertir el signo de las estimaciones de empleo. Para abordar este problema, el estudio introduce un procedimiento de reponderación de la fuerza laboral que alinea los datos de la plataforma con las proporciones de la Oficina de Estadísticas Laborales, lo que atenúa significativamente las estimaciones de exposición previas. En definitiva, los hallazgos sugieren que, si bien los datos de la plataforma revelan cómo interactúan los usuarios activos con la IA, son menos fiables para predecir la sustitución de empleos o la demanda laboral en toda la economía. Las mediciones basadas en estos registros pueden subestimar sistemáticamente los riesgos en ocupaciones vulnerables donde la visibilidad de la plataforma es baja debido al acceso o la adopción limitados.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Who Uses AI? Platforms, Workforce, and AI Exposure", por Michelle Yin y Burhan Ogut. Publicado el 20 de Mayo de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Bienvenidos a nuestro análisis profundo de hoy. Si quieren saber si la inteligencia artificial va a robarles el trabajo, necesitan buenos datos.

Alicia
Definitivamente necesitan buenos datos.

Beto
Correcto. Pero antes de que lleguemos a los datos que, de hecho, tenemos sobre IA ahora mismo, quiero que empieces imaginando una ciudad enorme y extensa.

Alicia
Bien. La estoy imaginando.

Beto
Imagina que has sido contratada por el alcalde para averiguar cuál es el método de transporte más popular en toda esta metrópolis.

Alicia
Correcto. Necesitas números concretos.

Beto
Exacto. Necesitas números concretos. Así que tomas tu portafolio, sales al campo y pasas un mes encuestando a decenas de miles de personas.

Alicia
Vaya. Bien. Una encuesta grande.

Beto
Una encuesta enorme. Compilas resultados. Haces los cálculos y presentas con orgullo tus hallazgos al consejo municipal. Y les dices que el 95% de la ciudad depende del metro.

Alicia
Y el alcalde probablemente esté encantado.

Beto
Sí. El alcalde está impactado. El presupuesto se reescribe por completo para financiar más trenes. Todos aplauden, pero hay un problema.

Alicia
Normalmente hay uno.

Beto
Hiciste cada una de esas encuestas mientras estabas físicamente dentro de un vagón de metro.

Alicia
Oh, hombre. Quiero decir, es realmente el punto ciego definitivo. Tienes esta montaña de datos.

Beto
Sí. Decenas de miles de puntos de datos.

Alicia
Tal vez millones incluso. Y eso te da una falsa sensación de seguridad. Pero el entorno donde recolectaste esos datos, dictó completamente las respuestas que obtuviste.

Beto
Correcto. No mediste la ciudad en absoluto.

Alicia
Exacto. Solo mediste a las personas que ya habían comprado un boleto.

Beto
Y hoy vamos a explorar cómo ese mismo punto ciego está distorsionando por completo nuestra visión del futuro del trabajo. Quiero decir, todos, desde periodistas hasta responsables políticos y tu propio jefe, están tratando desesperadamente de predecir qué trabajos va a reemplazar, o revolucionar la IA.

Alicia
Es lo único de lo que la gente está hablando ahora mismo.

Beto
Así es. Y para hacer esto, están usando enormes cantidades de registros de chat de plataformas de IA como Claude, ChatGPT y Co-pilot. Pero hay un sesgo oculto masivo en este día.

Alicia
Un gran sesgo.

Beto
Así que estamos desempacando este fascinante artículo de 2026 de Michelle Yen y Berhan Ogut titulado "¿Quién usa la IA? Selección de plataformas y la medición de la exposición ocupacional a la IA". Y nuestra misión hoy es mostrarles cómo mirar los datos de uso de IA podría estar cegándonos a los trabajadores que realmente están en riesgo.

Fixing_AI_Workforce_Data_Biases_1024.png
La Trampa de las Mediciones de IA: ¿Por qué datos de las Plataformas No Representan a la Fuerza Laboral?

Alicia
Tengo que decir que es una llamada de atención masiva para la economía laboral.

Beto
Lo es.

Alicia
Porque para entender por qué este artículo está sacudiendo tanto las cosas, tienen que mirar cómo los investigadores han intentado históricamente predecir la automatización.

Beto
Correcto.

Alicia
Durante mucho tiempo, los economistas básicamente estaban adivinando lo que la IA podría hacer.

Beto
Solo haciendo suposiciones.

Alicia
Prácticamente, sí. Sacaban una base de datos gubernamental de descripciones de puestos de trabajo, miraban las capacidades de los modelos de IA y simplemente hipotetizaban. Decían: "bueno, un paralegal lee documentos y ChatGPT lee documentos. Así que ese trabajo está altamente expuesto".

Beto
Pero recientemente la tendencia ha cambiado por completo, ¿verdad? La investigación se ha cansado de adivinar.

Alicia
Exacto.

Beto
Lo cual tiene sentido. Quiero decir, si yo soy un investigador, no quiero sentarme en una torre de marfil adivinando lo que podría hacer una herramienta. Quiero ver lo que la gente está haciendo realmente con ella en el mundo real.

Alicia
Ese fue el cambio de mentalidad exacto. Ahora, los investigadores quieren ver lo que la IA está haciendo en el terreno. Así que recurren a registros reales de conversaciones anonimadas de Anthropic Claude, ChatGPT de OpenAI y Microsoft Co-pilot.

Beto
Están mirando las indicaciones reales ("prompts").

Alicia
Sí. Toman estos millones de indicaciones diarias y las mapean de nuevo a tareas laborales específicas. Así que si un montón de indicaciones parecen programación en Python, lo mapean a ingeniería de software.

Beto
Correcto.

Alicia
Si las indicaciones parecen pronóstico financiero, lo mapean a analistas financieros. Y a partir de ahí, calculan una puntuación de exposición para diferentes ocupaciones.

Beto
Okay, vamos a desgranar esto por un segundo. Espera, ¿es esto como tratar de averiguar el método de transporte más popular en una ciudad entera, pero solo haces tu encuesta dentro de un vagón de metro?

Alicia
Eso es exactamente lo que es.

Beto
Por supuesto, los datos van a decir que "todo el mundo viaja en tren". Solo estás hablando con las personas que ya están conectadas a la plataforma de IA.

Alicia
Lo fascinante aquí es que esta dinámica crea lo que los economistas llaman "error de medición no clásico".

Beto
No clásico.

Alicia
Sí. Normalmente, cuando los investigadores hablan de "error de medición", se refieren a ruido aleatorio.

Beto
Como un error de tipografía, o algo así.

Alicia
Exacto. Imagina que estás redactando resultados de una encuesta y accidentalmente presionas la tecla equivocada varias veces. Un error aquí, un fallo allá. Es aleatorio. Así que si tu tamaño de muestra es lo suficientemente grande, esos errores aleatorios se cancelan entre sí.

Beto
Y tu promedio final sigue siendo básicamente preciso.

Alicia
Correcto. Eso es "error clásico".

Pero el "error de medición no clásico" significa que el error no es aleatorio en absoluto.

Beto
Es estructural.

Alicia
Sí. El error está sistemáticamente ligado a la misma cosa que están tratando de medir.

Beto
Déjame asegurarme de que lo estoy captando.

Alicia
Sí.

Beto
Es como tratar de averiguar la dieta diaria promedio de los estadounidenses. Pero solo les repartes tu encuesta a personas que salen de una tienda de comestibles veganas de alta gama.

Alicia
Oh, esa es una analogía perfecta.

Beto
El error no es aleatorio. Vas a mirar los datos y declararás con confianza que el 90% de los estadounidenses comen tofu todos los días.

Alicia
Correcto. Porque la ubicación de tu encuesta está inextricablemente ligada al hábito que estás midiendo.

Beto
Porque solo estás preguntando a veganos.

Alicia
Exacto. La puntuación de exposición a la IA derivada de la plataforma está mezclando en secreto dos cosas totalmente diferentes.

Beto
Okay. ¿Qué son?

Alicia
Bueno, está midiendo la tarea real que la IA es capaz de hacer. Sí. Pero simultáneamente está midiendo la composición demográfica de las personas que casualmente tienen el tiempo, el dinero y la inclinación para iniciar sesión en esa plataforma específica.

Beto
Así que el error está fuertemente correlacionado con las mismas ocupaciones que adoptaron la IA temprano.

Alicia
Sí.

Beto
Okay. Entonces, estás diciendo que los datos están sesgados. ¿Qué tan malo es este efecto del vagón de metro en la vida real? ¿Quién está generando realmente todos estos registros de chat que los investigadores están usando para predecir nuestro futuro económico?

Alicia
Es salvaje cuando miras el desglose. Tomemos a los trabajadores en ocupaciones de informática y matemáticas.

Beto
Tales como, desarrolladores de software, científicos de datos, actuarios.

Alicia
Exacto. ¿Te apetece adivinar qué porcentaje de la fuerza laboral total de EE. UU. representan realmente?

Beto
Quiero decir, se sienten en todas partes en línea, pero en el mundo físico real ... No lo sé. Tal vez 5% o 10%.

Alicia
Intenta 3.4%.

Beto
¿En serio? ¿Solo 3.4?

Alicia
Sí. Son una pequeña porción de la torta de empleo general en los Estados Unidos. Pero cuando Yin y Ogut miraron los datos de Anthropics Quad, esos mismos trabajadores de informática y matemáticas generaron el 32.3% de todas las conversaciones de los consumidores en la plataforma.

Beto
Espera. Un grupo que representa poco más del 3% del mundo real está ocupando casi un tercio de los datos de IA.

Alicia
Casi un tercio. Y se sesga aún más cuando miras los datos empresariales.

Beto
¿Quieren decir como las cuentas de nivel empresarial?

Alicia
Sí. Para los canales empresariales de Claude, las ocupaciones de informática y matemáticas representaron un asombroso 51.7% de todas las conversaciones.

Beto
No puede ser.

Alicia
Más de la mitad de todo el conjunto de datos está siendo generado por el 3% de la fuerza laboral.

Beto
Así que si un economista laboral alimenta esos datos empresariales en su modelo predictivo, el modelo va a gritar que el desarrollo de software es el trabajo más expuesto en la Tierra.

Alicia
Porque son la gente más ruidosa en la sala.

Beto
Exacto. ¿Qué hay del otro extremo del espectro? La gente que no está en la sala.

Alicia
Veamos a los trabajadores de preparación y servicio de alimentos. Representan el 8.8% de la fuerza laboral de EE. UU.

Beto
Así que casi tres veces más grandes que el grupo de informática y matemáticas.

Alicia
Correcto. Pero solo generan un 0.7% de las conversaciones.

Beto
Vaya. Eso es prácticamente cero.

Alicia
Lo es. Si comparas la proporción de densidad de conversación con la densidad real de empleo en diferentes grupos laborales importantes, abarca un factor de 72.

Beto
Un factor de 72. La brecha entre la gente que usa las herramientas y la gente que trabaja en la economía real es simplemente masiva.

Alicia
Es un cañón.

Beto
Puedes pensar, bueno, tal vez otras plataformas tengan una base de usuarios más equilibrada. No todos usan Claude. Quizás Copilot o ChatGPT se parezca más al mundo real.

Alicia
Microsoft Copilot, de hecho, tiene una base de usuarios un poco más cercana a la fuerza laboral real, que Claude o ChatGPT.

Beto
Probablemente porque está integrado en el software de oficina estándar, ¿verdad? Como Excel.

Alicia
Probablemente. Sí. Pero incluso entonces, Yin y Ogut encontraron que ninguna plataforma se correlaciona con la Oficina de Estadísticas Laborales. La participación de empleo es mayor que una insignificante 0.33.

Beto
Espera, con una, siendo una coincidencia perfecta.

Alicia
Una siendo una coincidencia perfecta. Cero siendo ninguna coincidencia en absoluto. Las plataformas simplemente no se parecen a la economía real.

Beto
Aquí es donde se pone realmente interesante. Porque Yin y Ogut no se detuvieron solo en señalar la discrepancia demográfica. Decidieron hacer un experimento para ver cuánto perturba estos datos sesgados nuestras predicciones económicas reales.

Alicia
Correcto. Querían ver los efectos secundarios.

Beto
Sí. Montaron un modelo económico estándar. El tipo exacto de investigadores que usan para asesorar a los gobiernos sobre cómo afectará la IA al empleo. Y mantuvieron las matemáticas exactamente iguales. Mantuvieron todos los parámetros exactamente iguales.

Alicia
Lo único que cambiaron fue la fuente de los registros de chat que alimentaban el modelo.

Beto
Exacto. Cambiaron datos de consumidores de Claude, por datos de Claude empresarial.

Alicia
Y ten en cuenta que es el mismo proveedor de IA, el mismo modelo de lenguaje subyacente, la misma rúbrica para mapear tareas a trabajos.

Beto
Correcto. La única diferencia es el nivel de precios. Los datos de consumidores reflejan a usuarios individuales que pagan por una cuenta personal, mientras que los datos empresariales reflejan a empresas que compran asientos para su fuerza laboral.

Alicia
Y cuando hicieron ese cambio, la estimación descendente sobre el empleo no solo cambió ligeramente. De hecho, revirtió su signo.

Beto
Revirtió. Eso es una locura.

Alicia
El modelo alimentado con datos de consumidores concluyó que la exposición a la IA perjudica el empleo, lo que lleva a pérdidas de trabajo. Pero el mismo modelo alimentado con datos empresariales concluyó que la exposición a la IA ayuda al empleo, lo que lleva al crecimiento del empleo.

Beto
En general, solo cambiar la entrada de la plataforma cambió las estimaciones de empleo de ChatGPT por un factor de 1.9.

Alicia
Realmente necesitamos hacer una pausa y pensar en por qué sucede eso, porque expone la falla central en cómo pensamos sobre estos datos.

Beto
Sí.

Alicia
¿Por qué los datos empresariales mostrarían que la IA ayuda al empleo mientras que los datos de consumo muestran que lo está perjudicando? Piensa en cómo se compran y usan realmente estas herramientas en el mundo real.

Beto
Yo asumiría que se reduce básicamente a quién tiene la tarjeta de crédito.

Alicia
Precisamente. Bueno, se trata de la motivación detrás de la compra. Cuando una gran empresa compra miles de licencias empresariales para Co-pilot o Claude, generalmente les está dando esas licencias a sus empleados existentes.

Beto
Para hacerlos más rápidos.

Alicia
Correcto. El objetivo es hacer que su fuerza laboral actual sea más productiva, capaz de manejar un mayor volumen. Ese impulso en la productividad a menudo se correlaciona con el crecimiento de la empresa, lo que puede llevar a más contrataciones. Es aumentación.

Beto
Pero los datos de los consumidores son totalmente diferentes. Si yo fuera un consultor de marketing independiente, o un pequeño empresario, y pago 20 dólares al mes por mi propia cuenta de ChatGPT.

Alicia
¿Qué estás haciendo con ella?

Beto
Podría estar usándola para escribir textos para que no tenga que contratar a un redactor independiente.

Alicia
Exacto.

Beto
La estoy usando para eludir la contratación de ayuda humana por completo. Eso es sustitución.

Alicia
Lo cual nos dice algo increíblemente profundo sobre la investigación en la que confiamos. Si tu predicción macroeconómica completa, si la IA crea o destruye empleos, se invierte por completo basándose en el nivel de precios del chat que estés estudiando.

Beto
Entonces tu métrica no está capturando un hecho universal estable sobre la economía.

Alicia
No, no lo está. Solo está reflejando el marketing de la plataforma, su estrategia de precios y su curva específica de adopción por parte del usuario.

Beto
Los datos que estamos usando para predecir el futuro del trabajo humano son esencialmente solo un "espejo de casa de diversión" que refleja la base de clientes actual de Silicon Valley.

Alicia
Un "espejo de casa de diversión" es la forma perfecta de describirlo.

Beto
Pero Yin y Ogut no solo señalaron el problema y se fueron. De hecho, intentaron arreglar el espejo, lo que nos lleva a la siguiente parte de su investigación.

Alicia
Sí.

Beto
¿Cómo arreglas un conjunto de datos que está tan sesgado estructuralmente?

Alicia
Hicieron lo que llaman "un ejercicio de reponderación de la fuerza laboral".

Beto
Okay. ¿Cómo funciona eso?

Alicia
Bueno, como sabemos que los datos brutos de estas plataformas de IA están sesgados, y sabemos exactamente cómo están sesgados en comparación con los datos de las estadísticas laborales del mundo real, podemos forzar matemáticamente al espejo a reflejar la realidad.

Beto
Oh, ya veo.

Alicia
Ajustaron los datos de la plataforma para que la densidad de ocupación en su modelo coincidiera con la densidad real de la fuerza laboral en los Estados Unidos.

Beto
Básicamente dijeron, "matemáticamente bajemos el volumen de los desarrolladores de software."

Alicia
"... y subamos el volumen de los trabajadores de preparación de alimentos".

Beto
Correcto. Así que la influencia que tienen en el modelo predictivo coincide con su huella real en el mundo real.

Alicia
Sí.

Beto
Y los resultados de hacer eso son simplemente drásticos. Cuando reponderaron los datos, el impacto estimado de la exposición a la IA cayó un 42% para los datos de Microsoft Co-pilot.

Alicia
Y para los datos compuestos de Anthropic, el impacto estimado se desplomó hasta en un 93%.

Beto
93%.

Alicia
Los datos se aplanaron tanto que las pérdidas de trabajo masivas que los investigadores estaban prediciendo efectivamente desaparecieron en el aire. Hablando matemáticamente, el riesgo cayó a casi cero.

Beto
Eso es salvaje.

Alicia
Casi la mitad de la magnitud publicada del impacto proyectado de la IA en el crecimiento del empleo simplemente desapareció cuando corrigieron por quién estaba realmente en la sala haciendo la encuesta.

Beto
Pero para mí, la parte más loca de este ejercicio de reponderación es lo que pasó con la clasificación de los trabajos que creemos que están más en riesgo.

Alicia
Oh, el cambio en las clasificaciones es fascinante. Si miras los registros de chat brutos y sin corregir, afirman que los trabajos más expuestos a la IA fueron asistencia estadística, actuarios y programadores de computadoras.

Beto
Lo cual tiene sentido, intuitivamente, ¿verdad? Si solo miras los datos brutos, esas son las personas que están generando todos los registros. Son los que le piden a la IA que escriba código, construya modelos financieros y analice datos.

Alicia
Pero espera, así que si yo soy una asistente estadística, la única razón por la que parezco estar en el cuchillo es porque fui la que estaba usando activamente la IA para hacer mi trabajo.

Beto
Sí. Porque después de que corrigieron los datos para reflejar la fuerza laboral real, las clasificaciones se invirtieron por completo. La asistencia estadística se desplomó 340 puestos.

Alicia
Básicamente se salieron del mapa de los trabajos más expuestos.

Beto
Y lo que tomó su lugar en la cima de la lista una vez que se tuvo en cuenta el mundo real ...

Alicia
¿Quieres revelarlo?

Beto
El representante de servicio al cliente subió 145 puestos.

Alicia
Vaya.

Beto
Los empleados de oficina subieron 132 puestos. La cajera se movió a la cima. Los trabajos que creemos que están más expuestos a la IA son en realidad solo trabajos bien pagados y altamente cualificados que casualmente están usando las herramientas intensamente ahora mismo.

Alicia
Correcto.

Beto
Pero la exposición estructural real reside en ocupaciones de servicio de nivel medio masivo que simplemente no están entrando en los chatbots hoy en día.

Alicia
Esto plantea una pregunta importante, sin embargo. ¿Estamos midiendo la capacidad de la IA para realizar tareas? ¿O simplemente estamos midiendo quién tiene el acceso y el privilegio para adoptar la IA ahora mismo?

Beto
Esa es la pregunta de un millón de dólares.

Alicia
Los autores hacen una distinción crucial aquí que tenemos que entender. Los datos brutos de la plataforma miden la aumentación entre usuarios activos. Nos muestran cómo la gente que ya tiene acceso a la herramienta, que está sentada en un escritorio con una computadora, la está usando para aumentar su trabajo diario.

Beto
Correcto. Haciéndose más rápidos.

Alicia
Pero no mide con precisión la sustitución en la fuerza laboral en general.

Beto
Permíteme contradecir eso por un segundo, porque quiero ser el defensor del Diablo aquí.

Alicia
Sí.

Beto
Puedo escuchar a alguien escuchando esto y pensando, "¿no podrían argumentar que si los programadores y actuarios están usando constantemente las herramientas, entonces sus trabajos son realmente los más expuestos?"

Alicia
Okay. Veo a dónde vas.

Beto
Si un desarrollador de software está usando una asistente de codificación de IA 50 veces al día para escribir Python, ¿no están automatizando sus propias tareas? ¿Eso no los pone en el cuchillo?

Alicia
Es una pregunta totalmente justa, y es la trampa exacta en la que caen muchos periodistas, pero confunde la adopción con el reemplazo.

Beto
Okay, explica eso.

Alicia
Piensa en cómo está trabajando ese programador realmente. Solo porque usa una asistente de codificación de IA, no significa que su trabajo esté siendo sustituido. Simplemente podría estar escribiendo código el doble de rápido, lo que le permite asumir proyectos más grandes. La IA es solo una herramienta en su cinturón de herramientas.

Beto
Oh, ya veo.

Alicia
Ahora, compáralo con un representante de servicio al cliente. Piensa en la última vez que llamaste a una aerolínea masiva, o una compañía de telecomunicaciones para disputar un cargo o cambiar un vuelo.

Beto
Oh, normalmente termino gritando al representante por teléfono mientras un agente de voz de IA intenta solucionar problemas con mi router.

Alicia
Exacto. Ya estás interactuando con un sistema de IA. Ese trabajo humano de "back end" está desapareciendo. Departamentos enteros están siendo reemplazados por sistemas de IA corporativa que operan en el "back end".

Beto
Eso es muy cierto.

Alicia
Ese representante de servicio al cliente está altamente expuesto a la sustitución, pero son completamente invisibles en los registros de uso de la plataforma, porque no son los que están activamente solicitando a ChatGPT o Claude. La empresa desplegó la IA para reemplazarlos. El trabajador no la adoptó para aumentar su trabajo.

Beto
Las personas que van a ser reemplazadas no son necesariamente las que están jugando con los chatbots. Eso es cierto. Y eso nos lleva a por qué esto no es solo un debate académico sobre matemáticas de hojas de cálculo o cómo clasificamos trabajos en una publicación de blog.

Alicia
Correcto. Hay apuestas masivas aquí.

Beto
Cuando cometemos este error de medición, hay enormes consecuencias financieras en el mundo real para las personas más vulnerables de nuestra economía.

Alicia
Porque la fuerza laboral visible de la plataforma, las personas cuyos trabajos aparecen en los datos brutos, representan drásticamente a trabajadores con salarios altos y títulos de licenciatura. Los datos están fuertemente sesgados hacia profesionales urbanos y altamente educados que están sentados en escritorios.

Beto
Lo que significa que los algoritmos y los modelos ignoran por completo a todos los demás.

Alicia
Los ignoran por completo.

Beto
Los trabajadores económicamente vulnerables, como los de cuidado personal, preparación de alimentos, logística de mantenimiento de edificios, son prácticamente invisibles en estos datos. Y el artículo señala algo realmente importante aquí.

Alicia
Sí, la demografía de esos grupos.

Beto
Exacto. Estos trabajadores a menudo tienen salarios mucho más bajos, menor seguridad laboral y tasas estadísticamente más altas de discapacidad o grave angustia económica. Son los que menos pueden permitirse un cambio repentino en el mercado laboral.

Alicia
Necesitan una red de seguridad más que nadie.

Beto
Y son exactamente las personas a las que nuestros modelos predictivos son completamente ciegos.

Alicia
Para ilustrar lo peligroso que es este punto ciego en la práctica, Yin y Ogut realizaron una simulación brillante en el artículo.

Beto
Me encantó esta parte.

Alicia
Preguntaron, "¿qué pasaría si un gobierno decidiera lanzar un fondo de recapacitación de 10 mil millones de dólares para ayudar a los trabajadores cuyos trabajos están amenazados por la IA?"

Beto
En la superficie, eso suena como una política fantástica. Pero una red de seguridad de 10 mil millones de dólares para ayudar a la gente a pivotar a nuevas carreras antes de que la automatización los aniquile.

Alicia
Suena genial hasta que miras cómo el gobierno decide quién recibe el dinero. Imagina que los responsables políticos usen los datos brutos de la plataforma de IA para dirigir los fondos.

Beto
Miran los registros de chat.

Alicia
Miran los registros y dicen: "bueno, los datos dicen que los desarrolladores de software y los actuarios son los más expuestos. Así que necesitamos dirigir nuestros recursos de recapacitación allí".

Beto
¿Y qué sucede?

Alicia
La simulación muestra que si un gobierno hiciera eso, desasignaría 3.87 mil millones de dólares.

Beto
3.87 mil millones de dólares.

Alicia
Casi el 39% de todo el fondo se canalizaría directamente a ocupaciones de alto salario y alta educación.

Beto
Así que ¿qué significa todo esto? Significa que casi 4 mil millones de dólares destinados a ayudar a los trabajadores desplazados y vulnerables actuarían efectivamente como un subsidio gubernamental para personas que ya tienen títulos de licenciatura, que ya ganan salarios por encima de la mediana y que probablemente están usando la IA para obtener ascensos.

Alicia
Es completamente al revés.

Beto
Mientras tanto, el trabajador de almacén o el representante de servicio al cliente cuyo trabajo está siendo silenciosamente automatizado en el "back end" no recibe absolutamente nada porque los datos brutos dijeron que no estaban en riesgo.

Alicia
Esa es la verdadera tragedia de equivocarse en las matemáticas. Pero cuando los investigadores aplicaron la regla de reponderación, ...

Beto
... esa corrección matemática.

Alicia
Correcto. Cuando corrigieron matemáticamente los datos para que coincidieran con la fuerza laboral real de EE. UU., esos 3.87 mil millones de dólares se desviaron adecuadamente de los programadores y actuarios.

Beto
Eso es genial.

Alicia
Bajó en la escalera de ingresos hacia los trabajadores de salario medio y bajo que realmente enfrentaron el mayor riesgo de desplazamiento laboral estructural.

Beto
Ves, lees un titular sobre los trabajos más expuestos a la IA. Tienes que darte cuenta de que esos titulares no son solo curiosidades para fiestas de cócteles. La política, la financiación gubernamental, los currículos educativos y los recursos corporativos están siendo dirigidos por esos titulares.

Alicia
Exacto. El dinero real está en juego.

Beto
Si una escuela de comercio comunitario decide renovar todo su programa vocacional basándose en registros de chat brutos, van a preparar a los estudiantes para la realidad equivocada. Ahora mismo, debido a esta trampa de medición, el dinero y la atención se están canalizando hacia las personas que probablemente estarán bien.

Alicia
Si conectamos esto con la imagen más amplia, las clasificaciones políticas construidas a partir del uso seleccionado de la plataforma, nunca deben ser tratadas como clasificaciones del riesgo real de la fuerza laboral. Solo porque un trabajador tiene baja visibilidad en una plataforma de IA no significa que esté a salvo de la IA. Puede significar simplemente que carecen de acceso a las herramientas, o peor aún, que sus tareas específicas ya han sido silenciosamente automatizadas y desplazadas por software empresarial sin que ellos mismos hayan iniciado sesión en un chatbot para dejar un rastro de datos.

Beto
Básicamente estamos mirando un panel que solo nos dice la temperatura del motor de los coches de lujo en la carril rápida mientras el resto de la autopista está completamente sin contar.

Alicia
Esa es una buena manera de decirlo.

Ahora, es importante aclarar que los autores del artículo no están diciendo que deberíamos tirar los registros de chat. Estos datos son increíblemente valiosos para cosas específicas. Nos dan una mirada, en tiempo real, sin precedentes, de cómo los usuarios activos están aplicando la IA a tareas complejas, a una escala que nunca hemos visto antes. Pero tenemos que reconocer lo que realmente representan los datos.

Beto
¿Qué es?

Alicia
Representan una porción altamente seleccionada y privilegiada de la población que son adoptadores tempranos de una nueva tecnología.

Beto
Es el vagón de metro.

Alicia
Es el vagón de metro. Y si quieres entender toda la red de transporte de la ciudad, eventualmente tienes que bajar del tren y mirar las calles. Tenemos que corregir matemáticamente los datos que tenemos, y necesitamos emparejarlos con las encuestas amplias que capturan lo que está sucediendo en fábricas, tiendas minoristas y centros de llamadas. De lo contrario, cualquier estimación que hagamos sobre la exposición macroeconómica a la IA es realmente solo una medición de la composición demográfica de los primeros adoptadores de tecnología.

Beto
Así que para recapitular nuestra inmersión profunda de hoy, los economistas laborales e investigadores están confiando cada vez más en los registros de chat de IA de lugares como Claude y ChatGPT para predecir el futuro del mercado laboral.

Alicia
Lo cual es un gran cambio en cómo lo hacían antes.

Beto
Correcto. Pero aunque esos datos son increíbles para ver lo que los usuarios activos y altamente educados están haciendo con la tecnología para acelerar sus flujos de trabajo, son terribles para predecir el riesgo total de la fuerza laboral.

Alicia
Porque solo miran a los usuarios.

Beto
Porque los datos solo reflejan a los usuarios activos de la plataforma, crean un punto ciego masivo que oculta a los millones de trabajadores de nivel medio y servicio que realmente están en el mayor riesgo de ser sustituidos. Si no corregimos matemáticamente estos datos para que coincidan con la economía real, corremos el riesgo de ignorar por completo a las personas más vulnerables de la fuerza laboral. Y podríamos terminar desasignando miles de millones de dólares en fondos de política y recapacitación a las personas que menos lo necesitan.

Alicia
Las matemáticas son increíblemente claras una vez que levantas el telón. Cuando reponderas los datos para reflejar la realidad, las alarmas para los trabajos de tecnología bien remunerados se calman significativamente. Y la verdadera exposición estructural de cajeros, empleados y representantes de servicio al cliente queda en el foco.

Beto
Queremos dejarles con una última perspectiva para reflexionar sobre su día. Pasamos este tiempo explorando cómo confiar en los registros de chat generados por usuarios sesga completamente nuestro entendimiento sobre el impacto de la IA en el trabajo humano. Pero piensen en cuánto de nuestro mundo moderno está construido sobre datos generados por usuarios que interactúan con plataformas digitales.

Alicia
Oh, vaya.

Beto
Desde aplicaciones de atención médica que rastrean síntomas, hasta software financiero que monitorea los hábitos de gasto, hasta algoritmos de planificación urbana, mapeando el tráfico de la ciudad basado en el GPS del teléfono inteligente. Si nuestra visión completa del impacto futuro de la IA está siendo moldeada exclusivamente por las personas que ya son lo suficientemente privilegiadas para construirla y usarla, ¿qué otros grandes cambios económicos estamos completamente ciegos simplemente porque las personas afectadas no están generando datos para las empresas de tecnología?

Alicia
Es un pensamiento ligeramente aterrador.

Beto
Así que la próxima vez que lean un titular declarando con confianza una nueva tendencia basada en millones de puntos de datos, hagan una pausa y pregúntense, ¿quién hizo realmente la encuesta? ¿Y si son solo las personas que están sentadas en el vagón de metro?