Mostrando entradas con la etiqueta desarrollo de software. Mostrar todas las entradas
Mostrando entradas con la etiqueta desarrollo de software. Mostrar todas las entradas

sábado, 29 de agosto de 2026

Copilot en el desarrollo colaborativo de software de código abierto

Este estudio investiga cómo GitHub Copilot, una herramienta de IA generativa, influye en el desarrollo colaborativo de software de código abierto (OSS) mediante el análisis de datos de proyectos y métricas de uso propietarias. Los investigadores descubrieron que, si bien la adopción de la IA aumenta las contribuciones de código en casi un 6 % e impulsa la participación de los desarrolladores, también conlleva un aumento del 8 % en el tiempo de coordinación debido a debates de código más intensos. Esto genera una disyuntiva importante: la IA facilita la generación de contenido más rápida, pero complica el proceso de integración dentro de equipos descentralizados. El impacto es notablemente desigual, ya que los desarrolladores principales experimentan mayores ganancias de productividad y menores retrasos en la coordinación en comparación con los desarrolladores periféricos, quienes enfrentan mayores dificultades para integrar su código. En definitiva, el artículo sugiere que, si bien la IA proporciona un beneficio neto para la producción de proyectos, puede transformar fundamentalmente la gobernanza y la estructura social de las comunidades de código abierto. Para mantener una amplia participación, los autores argumentan que las comunidades podrían necesitar nuevas estrategias de gestión para manejar el mayor volumen de contribuciones asistidas por IA.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "The Impact of Generative AI on Collaborative Open-Source Software Development: Evidence from GitHub Copilot". Por Fangchen Song y colegas. Publicado el 12 de Agosto de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Está bien, vamos a desglosar esto. Se suponía que la IA generativa era una varita mágica. La agitabas y ¡pum!, tu factura de software, tu plan de marketing está escrito y tus informes legales han sido redactados.

Beto
Correcto, el milagro de la productividad absoluta.

Alicia
Exacto. Pero según este nuevo y masivo conjunto de datos de GitHub, desplegar IA en un entorno de equipo es, en realidad, mucho menos como encontrar una varita mágica y mucho más como contratar a un interno increíblemente rápido y altamente cafeinado.

Beto
Esa es una muy buena manera de decirlo.

Alicia
Correcto. Producen una cantidad masiva de trabajo en solo tiempo récord. Pero también requieren una supervisión monumental y una discusión interminable y comprobación doble para asegurarse de que no rompan accidentalmente todo tu sistema mientras tú no lo estabas viendo.

Beto
Lo cual es una prueba de realidad que necesitamos desesperadamente ahora mismo. Porque la narrativa predominante ha sido esta idea simplista de que la IA hace el trabajo y los trabajadores humanos simplemente pueden tomarse el resto del día libre.

Alicia
Correcto. Y por eso estamos haciendo un análisis profundo en esto hoy. Estamos explorando un próximo artículo de investigación de la Universidad de Texas, en Austin. Se titula "El Impacto de la IA Generativa en el Desarrollo Colaborativo de Software de Código Abierto". La evidencia proviene de GitHub Copilot.

Beto
Es un estudio fascinante.

Alicia
Lo es. Así que nuestra misión para esta inmersión profunda es mirar más allá del bombo, ¿verdad? La idea de que "la IA me hace más rápido". Y queremos examinar los cuellos de botella ocultos e inesperados que la IA crea cuando los humanos intentan trabajar juntos. Y aún más sorprendentemente, vamos a explorar cómo esta tecnología está remodelando fundamentalmente quién tiene el poder en una comunidad profesional.

Beto
Sí. Ese cambio en la dinámica de poder es enorme.

AI_Reshaping_Open-Source_Collaboration_1024.png

Alicia
Sí. Para realmente entender el cuello de botella, primero tenemos que establecer la capacidad potencial base. Porque para ser justos con nuestros internos altamente cafeinados, sí consiguen hacer mucho trabajo.

Beto
Lo consiguen absolutamente. Y la magnitud de los datos aquí lo demuestra. Los investigadores no solo atendieron a unas pocas docenas de programadores. Analizaron un conjunto de datos masivo que abarca desde enero de 2021 hasta diciembre de 2022, mirando más de 7,600 proyectos activos de software de código abierto.

Alicia
Vaya. Eso es una muestra masiva.

Beto
Oh, completamente. Y al rastrear la adopción de GitHub Copilot, que funciona como un programador de pareja de IA, encontraron un aumento del 5.9% en las contribuciones de código a nivel de proyecto.

Alicia
Vale.

Beto
Y para ser específicos, eso significa un aumento del 5.9% en las solicitudes de extracción (pull requests) fusionadas exitosamente, que es código que ha sido revisado, aceptado e integrado en el producto final.

Alicia
Vaya. Un salto de casi el 6% en código totalmente aceptado e integrado en todos estos proyectos descentralizados. Eso es masivo. Pero cuando revisé la metodología, mi lectura fue que este impulso no provino solo de que los programadores existentes escribieran más rápido. Fue en realidad una expansión de dos frentes.

Beto
Ese es el detalle crucial. En economía, dividimos este tipo de crecimiento en el margen extensivo y el margen intensivo.

Alicia
Sí, extensivo e intensivo.

Beto
Correcto. El margen extensivo se trata de la cantidad pura de participantes. Así que los datos mostraron un aumento del 3.4% en el número de desarrolladores únicos que contribuían activamente con código.

Alicia
Oh, vaya.

Beto
Sí. Así que la introducción de la IA trajo en realidad a mucha más gente a la mesa, que de otro modo podrían haberse quedado al margen.

Alicia
Es interesante.

Beto
Y luego tienes el margen intensivo, que mide cuánto trabajo está produciendo realmente cada individuo. Y eso también tuvo un repunte con un aumento del 2.1% en la cantidad de código que cada desarrollador individual logró escribir.

Alicia
Así que tienes una multitud más grande de personas, y cada persona en esa multitud está produciendo más resultados.

Beto
Exacto.

Alicia
Pero la psicología subyacente de por qué sucede esto en un entorno de código abierto es lo que encontré tan intrigante. Los investigadores filtran esto a través de algo llamado "el marco de costo-beneficio y valor esperado". Porque, quiero decir, en un trabajo normal, tu jefe te dice que uses IA, así que la usas.

Pero el código abierto es totalmente voluntario. Nadie está obligando a estos desarrolladores a trabajar gratis.

Beto
Lo que significa que tenemos que mirar su cálculo interno. Un desarrollador solo ofrece su tiempo voluntariamente si los beneficios esperados de contribuir superan los costos esperados. E históricamente, los costos son increíblemente altos. Tienes que gastar una cantidad masiva de esfuerzo mental solo para entender una base de código desde la lógica de un problema, y luego teclear meticulosamente la sintaxis correcta.

Alicia
Correcto, sin cometer un solo error tipográfico que lo rompa todo.

Beto
Exacto. Pero la IA generativa altera fundamentalmente esa ecuación, al reducir esos costos esperados. Se encarga de la escritura repetitiva. Recuerda la sintaxis básica, y autocompleta las cosas mundanas.

Alicia
Sí, entiendo la reducción de costos. La IA reduce drásticamente la barrera de entrada.

Pero permíteme que cuestione el lado del beneficio de ese marco. El artículo argumenta que la IA aumenta los beneficios percibidos de participar. Pero espera, si la IA está escribiendo el código esencialmente, ¿por qué un desarrollador obtendría un impulso en su reputación por eso, o sentiría alguna satisfacción intrínseca?

Beto
Esa es una pregunta justa.

Alicia
¿No están básicamente tomando crédito por el trabajo de un robot? Quiero decir, si uso una calculadora para resolver una ecuación matemática compleja, no de repente me siento como un genio matemático.

Beto
Entiendo completamente ese escepticismo. Pero si conectamos esto con la realidad de la ingeniería de software compleja, el valor central del desarrollador no está realmente en la escritura física de la sintaxis. Está en la ideación, la resolución de problemas y la arquitectura de alto nivel. Piénsalo como ser un arquitecto de un rascacielos. Si alguien te entrega una máquina milagrosa que dibuja instantáneamente los planos perfectos para cualquier diseño que conceptualices, no te sientes como un fraude. Te sientes liberado.

Alicia
Correcto. Porque no estás atascado con una regla dibujando líneas rectas durante horas. Realmente estás diseñando el edificio.

Beto
Exactamente el mismo principio. La IA libera el ancho de banda mental del desarrollador. En lugar de estancarse en los detalles mundanos y frustrantes de cómo teclear una función específica, pueden echar toda su energía en lo que esa función debería lograr para el ecosistema de software en general.

Alicia
Eso tiene mucho sentido.

Beto
Correcto. Les permite explorar soluciones novedosas, abordar desafíos arquitectónicos más grandes y experimentar con ideas complejas. Quizás no tenían tiempo o energía para intentarlo antes.

Así que un costo de participación drásticamente menor, más una recompensa intrínseca mucho mayor por la resolución de problemas de alto nivel.

Alicia
Esto equivale a un aumento masivo en el volumen de código generado.

Beto
Exacto.

Alicia
Bien. Eso tiene todo el sentido porque el costo de generar esas grandes ideas se desplomó casi a cero, el volumen puro de código que se enviaba a dispararse.

Beto
Sí.

Alicia
Pero aquí es donde chocamos con el conflicto central de los datos. Y realmente, la tensión central de todo este análisis profundo.

Beto
Oh, sí. Aquí vamos.

Alicia
El desarrollo de software no es un deporte en solitario. No escribes código brillante, lo lanzas en un vacío y dices que terminaste. Tiene que ser revisado, debatido e integrado con el trabajo que cientos de otras personas están haciendo simultáneamente. Y es exactamente donde este tren de productividad de IA desbocado choca contra un muro de ladrillos masivo.

Beto
Realmente lo hace. Cuando leí este artículo por primera vez, tuve que leer la estadística del cuello de botella principal dos veces. Sí, porque en la superficie, se siente tan completamente contraintuitivo para la promesa de la IA. A pesar de lo increíblemente rápido que se estaba generando todo este código, el tiempo de coordinación, que es el tiempo promedio que tarda la comunidad en revisar, discutir y aceptar una pieza de código, en realidad aumentó en un 8%.

Alicia
Un 8% de carga en el tiempo de coordinación.

Así que la IA acelera salvajemente la fase de creación, pero ralentiza severamente la coordinación de esto.

Beto
Y para entender por qué los engranajes de repente se detienen allí, tenemos que verlo a través de la lente de la "teoría de la coordinación". Si estás en un entorno corporativo tradicional, normalmente tienes una estructura jerárquica, ¿correcto? Un jefe o un gerente sénior dicta el flujo de trabajo. Asigna tareas muy específicas y toma decisiones unilaterales para resolver conflictos.

Alicia
Correcto. Simplemente dicen que lo hagas de esta manera.

Beto
Exacto. Pero el software de código abierto es profundamente descentralizado. No hay un jefe dictando órdenes. La comunidad depende completamente de la discusión entre pares para resolver conflictos e integrar tareas interdependientes.

Alicia
Así que cuando inyectas una IA que infla drásticamente el volumen de ideas complejas en un sistema descentralizado que depende de la conversación, esencialmente bloqueas los canales de comunicación.

Beto
Oh, completamente. Los números que detallan ese bloqueo son asombrosos. Los investigadores rastrearon un aumento del 6.5% en el volumen total de comentarios por envío de código.

Alicia
Vaya.

Beto
Y hubo un aumento del 1.7% en el número de personas únicas que se sumaron a esos hilos de comentarios. Y un aumento del 5.9% en el número de comentarios hechos por desarrollador. Cada persona está hablando mucho más.

Alicia
Y noté que no solo estaban lanzando más emojis o diciendo, "se ve bien".

Los investigadores usaron una herramienta de análisis de texto llamada "Latent Dirichlet Allocation", o LDA ("asignación de distribución latente") para analizar más de 5 millones de comentarios de solicitudes de extracción. Y lo que hace el algoritmo LDA, es mirar grandes bloques de texto y agrupar palabras que aparecen frecuentemente juntas para identificar temas subyacentes.

Así que no era solo contar cuántas veces alguien decía "bug". Mostró que la diversidad real de los temas debatidos se expandió significativamente.

Beto
Lo cual es un hallazgo crucial. La IA estaba ayudando a los desarrolladores a generar tantas aproximaciones diferentes, a utilizar tantas bibliotecas diferentes, y a proponer tantas arquitecturas alternativas, que la comunidad tuvo que pasar por muchos más ciclos iterativos de debate solo para llegar a un consenso sobre qué camino tomar.

Alicia
Es como organizar una reunión de lluvia de ideas corporativa. Imagina que tienes un equipo de 10 personas. Y históricamente, todos aportan una idea bastante buena a la mesa. Discuten 10 ideas, eligen una, van a almorzar.

Pero ahora, gracias a la IA, cada persona entra en esa sala con 10 ideas increíbles, complejas y totalmente desarrolladas.

Beto
Oh, hombre.

Alicia
Correcto. La fase de generación fue ligera y rápida. Y todos se sienten como un genio absoluto. Pero esa reunión ahora va a tomar cuatro horas agotadoras porque tienes que debatir, hacer referencias cruzadas y conciliar una montaña de nuevas perspectivas antes de que puedas decidir qué hacer.

Beto
Esa es la analogía perfecta. Y recuerda, en un sistema de código abierto descentralizado, nadie puede simplemente golpear un mazo y decir, vamos con la idea número 42, reunión terminada.

Alicia
Correcto, no hay jefe.

Beto
Correcto. Ese proceso de conciliación requiere una discusión escrita intensa y prolongada.

Alicia
Así que si el proceso de revisión está tardando 8% más, y las secciones de comentarios están inundadas de debates arquitectónicos complejos, mi primera suposición fue que los revisores sénior, los veteranos que gestionan estos proyectos, están completamente abrumados, o tal vez simplemente están siendo perezosos porque confían en la IA para hacer la revisión por ellos.

Beto
Esa sería la suposición lógica.

Alicia
Pero los datos muestran algo completamente diferente. Y esto revela una división estructural muy profunda en cómo la IA impacta a diferentes tipos de trabajadores.

Beto
Me iría un paso más allá y diría que esta es la revelación más profunda de todo el estudio.

Alicia
¿De verdad?

Beto
Sí. Los proyectos de código abierto generalmente consisten en dos tipos distintos de colaboradores. Tienes desarrolladores principales (core) y desarrolladores periféricos.

Los desarrolladores principales son los internos. Son los arquitectos del proyecto. Contribuyen de manera constante. Mantienen la base de código. Y poseen una profunda comprensión histórica de la visión a largo plazo del proyecto.

Los desarrolladores periféricos, por otro lado, son los forasteros. Son colaboradores irregulares que pueden aparecer para arreglar un error específico o añadir una característica menor. Pero no tienen familiaridad profunda con la estructura general o la historia del proyecto.

Alicia
Y el primer mito importante que esta data desmantela es, que los desarrolladores principales, esos internos, ralentizaron su proceso de revisión porque absolutamente no lo hicieron.

Beto
No, para nada.

Alicia
Su volumen de revisión en realidad aumentó un 5.9%. Hicieron más revisiones, participaron en más discusiones y exhibieron una productividad de revisión general más alta.

Beto
Estaban trabajando más duro que nunca solo para gestionar la avalancha de código nuevo.

Pero el hallazgo más impactante es, ¿quién se benefició realmente más de las capacidades de generación de la IA?

Alicia
Correcto.

Beto
Pensarías que la IA ayudaría más a los desarrolladores periféricos, ¿correcto? Para ayudarlos a ponerse al día.

Alicia
Sí, eso es lo que yo asumiría.

Beto
Pero la IA favoreció enormemente a los desarrolladores principales. La proporción de código fusionado exitosamente proveniente de los internos aumentó en un 6.5%.

Alicia
Espera, ¿entonces los internos que ya tenían el poder y el conocimiento se llevaron aún más de la porción? ¿Por qué funcionó la IA tan bien para ellos?

Beto
Todo se reduce al contexto. Los desarrolladores principales tienen conocimiento institucional profundo, porque conocen la evolución histórica del proyecto: por qué se tomaron ciertas decisiones extrañas hace tres años, o cómo interactúan diferentes módulos. Saben exactamente cómo solicitarle a la IA que genere cambios arquitectónicos grandes y complejos que se alineen perfectamente con las dependencias existentes únicas del proyecto.

Alicia
Así que cuando un desarrollador principal envía su código asistido por IA, encaja como una pieza de rompecabezas faltante. La comunidad lo mira, dice, sí, encaja perfectamente y lo fusiona sin necesidad de un gran debate.

Beto
Precisamente.

Pero para los desarrolladores periféricos, que tienen una historia muy diferente, ciertamente estaban usando la IA para escribir y enviar más código. Pero su tiempo promedio de fusión relativo, el tiempo que pasaron atrapados en el purgatorio de la coordinación, discutiendo en los comentarios, saltó en un 5.4%.

Alicia
Permíteme adivinar. Es porque carecen de ese contexto institucional.

Beto
Exacto. Los investigadores se refieren a esto como "el problema de la aclaración del contexto". Los desarrolladores periféricos simplemente no conocen la historia desordenada del proyecto. Así que encienden Copilot y la IA les ayuda a escribir una pieza de código hermosa y elegante increíblemente rápido.

Alicia
Correcto.

Beto
Pero la IA en sí solo está mirando la solicitud inmediata. Tampoco sabe la historia arquitectónica específica de este proyecto en particular. Así que el desarrollador periférico termina generando lo que los investigadores llaman "código ciego al contexto".

Alicia
Correcto. Para ponerle cara a esto, imagina a un desarrollador periférico hipotético llamado Dave.

Beto
Correcto.

Alicia
Dave encuentra un proyecto de código abierto, quiere añadir una característica nueva y genial, y usa la IA para escribir 500 líneas de código impecable usando la biblioteca de software más nueva y llamativa. Lo envía, sintiéndose genial.

Beto
Naturalmente.

Alicia
Pero Sarah, un desarrollador principal, lo revisa y se da cuenta de que, aunque el código es técnicamente brillante en un vacío, este proyecto específico utiliza una biblioteca más antigua y diferente para la gestión de memoria debido a una decisión heredada tomada hace cuatro años.

Beto
Correcto.

Alicia
Así que el código de Dave es totalmente ciego al contexto.

Beto
Exacto. Y ahora Sarah tiene que saltar a los comentarios y escribir un ensayo de tres párrafos explicando cuatro años de arquitectura histórica a Dave.

Alicia
Oh, hombre.

Beto
Y luego explicarle las 10 cosas específicas que necesita cambiar para que su brillante código de IA encaje en su realidad desordenada.

Alicia
Correcto.

Beto
Ahora, multiplica días por 1000, y puedes ver exactamente cómo los investigadores probaron esto. Al mirar el contenido de esos hilos de comentarios masivos, vieron que las discusiones no eran sobre arreglar errores tipográficos. Eran ejercicios profundos y que consumían mucho tiempo de aclaración del contexto. La IA dio a los desarrolladores periféricos su increíble velocidad, pero no pudo darle conocimiento institucional.

Alicia
Aquí es donde se pone realmente interesante. Porque cuando generalmente hablamos de IA en el "Zeitgeist" cultural, la vemos como este gran igualador, ¿correcto?

Beto
Absolutamente.

Alicia
Pensamos que es una herramienta que ayuda a un empleado junior a ponerse al día con el veterano, haciendo el trabajo pesado. Pero esta investigación muestra que en realidad ha consolidado el poder de los internos.

Beto
Lo hace.

Alicia
¿Significa esto que el conocimiento institucional es ahora la habilidad más valiosa que una persona puede tener?

Beto
Creo que los datos respaldan fuertemente esa conclusión.

A medida que la IA comoditiza el acto básico de la creación, ya sea escribir código, redactar un correo electrónico, o diseñar un logotipo, la prima se desplaza fuertemente hacia el conocimiento contextual: saber qué pedirle a la IA que construya, y saber cómo integrar esa salida en un sistema humano preexistente y complejo, se vuelve exponencialmente más valioso que simplemente poder generar la salida tú mismo.

Alicia
Vaya.

Beto
La IA niveló el campo de juego para la sintaxis básica, pero ampliamente amplió la brecha para la integración a nivel de sistema.

Alicia
Eso es un cambio fascinante en el valor del trabajo humano.

Pero también plantea una pregunta práctica aterradora. Si tienes una acumulación de desarrolladores periféricos inundando el sistema con código ciego al contexto, y tienes un grupo más pequeño de desarrolladores principales tratando frenéticamente de revisarlo, discutirlo e integrarlo todo mientras lidian con una carga del 8% y un tiempo de coordinación, ¿no es el producto final solo un desastre defectuoso y descoordinado?

Beto
Esa es la pregunta definitiva sobre la calidad. Y los datos aquí son maravillosamente matizados. Si solo miras el volumen bruto, el número total de errores y problemas sí aumentó. Los investigadores observaron un aumento del 7% en los problemas totales y un aumento del 5.2% en problemas graves relacionados con errores.

Alicia
Oh, Dios mío. Así que la IA está creando objetivamente más errores y rompiendo cosas. Eso suena como una pesadilla.

Beto
Espera, no es tan apocalíptico.

Alicia
Bien.

Beto
Tienes que mirar la medida normalizada. Sí, el número absoluto de errores aumentó, pero eso es simplemente porque el volumen absoluto de envíos de código aumentó tan drásticamente, cuando los investigadores calcularon los errores y los bugs por solicitud de extracción.

Alicia
Es decir, la calidad normalizada de cada envío individual.

Beto
Exacto. Se mantiene estadísticamente sin cambios.

Alicia
Ah, ya veo. Así que para volver a nuestra analogía del rompecabezas, la calidad de las piezas individuales del rompecabezas no bajó. Simplemente había muchas más piezas de rompecabezas siendo arrojadas a la mesa en general, lo que naturalmente significa que más piezas defectuosas entraron en el mix.

Beto
Ese es el punto clave. La IA no hizo que el código fuera peor. Simplemente aumentó el volumen de todo. El buen código, los errores y las discusiones agotadoras necesarias para arreglar esos errores.

Y esto nos lleva a la conclusión definitiva del análisis cuantitativo del artículo. A pesar de esa carga del 8% en el tiempo de coordinación, a pesar del aumento masivo en los comentarios, y a pesar de la afluencia de código ciego al contexto, el efecto neto general en la productividad sigue siendo positivo.

Alicia
Así que ¿la pura fuerza bruta del auge de la productividad supera la carga de coordinación?

Beto
Sí. Los investigadores midieron la fusión oportuna del código, lo que rastrea cuánto código fue aceptado exitosamente dentro de ventanas de tiempo ajustadas y específicas de un día, tres días y 10 días.

Alicia
Ok.

Beto
En todas esas ventanas, vieron aumentos que oscilaron entre el 3.5% y el 5.1%.

Así que aunque requirió hablar, revisar y fricción significativamente más, la comunidad en su conjunto aún logró enviar código funcional e integrado más rápido de lo que lo hizo antes de que se introdujera la IA.

Alicia
Vaya. Así que si estás escuchando y estás gestionando un equipo ahora mismo, ya sea que estén escribiendo código, redactando documentos legales o preparando un texto de marketing, estos datos deberían ser una llamada de atención masiva.

Beto
Oh, absolutamente.

Alicia
Desplegar IA generativa no solo corta limpiamente la mitad del trabajo de tu equipo para que todos puedan irse temprano. Fundamentalmente cambia dónde reside tu cuello de botella operativo.

Beto
Es un cambio de paradigma completo. Estamos pasando de un mundo donde la restricción principal era la creación, y estamos acelerando hacia un mundo donde la restricción principal es la coordinación y la revisión.

Alicia
Correcto. Si le das a tu equipo creativo una IA para hacerlos más rápidos, podrías encontrarte necesitando contratar más gerentes, más editores y más revisores sénior solo para manejar la avalancha de resultados. Ya no tienes un problema de generación. Tienes un problema de integración. Tu nuevo trabajo a tiempo completo es conciliar todas estas ideas altamente detalladas, hermosamente formateadas, pero ligeramente ciegas al contexto que tu equipo junior está produciendo de repente a velocidad de rayo.

Beto
Y la dura realidad es que, si no ajustas tu estructura organizacional para manejar ese nuevo cuello de botella de integración, toda esa productividad generada por la IA será totalmente inútil. Simplemente se quedará en la bandeja de entrada de un gerente esperando a ser revisada, acumulándose y creando una fricción masiva. Las organizaciones que ganen en esta nueva era no solo serán las que usen la IA para generar más contenido. Serán las que construyan los sistemas de coordinación más robustos y eficientes para integrar realmente ese contenido.

Alicia
Correcto. Quiero dejar a todos con un pensamiento final, ligeramente desconcertante, para que lo piensen hoy.

Beto
Te escuchamos.

Alicia
Hemos establecido claramente que la IA está cambiando el cuello de botella de escribir el trabajo a revisar el trabajo.

Pero los revisores humanos, estos desarrolladores principales, estos gerentes sénior, eventualmente van a llegar a un límite físico absoluto.

Beto
Correcto. Solo pueden hacer tanto.

Alicia
Solo pueden leer tantas envíos ciegos al contexto y escribir tantos comentarios explicativos antes de que se agoten por completo.

Beto
Lo que significa que esa carga de coordinación del 8% no es estática. Eventualmente se convertirá en una carga del 20% o un 50% si el volumen de generación sigue aumentando mientras la capacidad de revisión humana se mantiene exactamente igual.

Alicia
Exacto.

Así que para resolver esta carga de coordinación, es el siguiente paso inevitable construir revisores de IA, o coordinadores de IA que estén entrenados específicamente en el conocimiento institucional profundo y desordenado de una empresa diseñada con el único propósito de evaluar e integrar el trabajo de los generadores de IA.

Beto
Vaya.

Alicia
Y si llegamos a un punto en el que las IAs están generando el trabajo, y otras IAs están revisando, debatiendo y discutiendo el trabajo para forzarlo a alinearse, ¿qué queda exactamente para que haga el humano? ¿Vamos todos a convertirnos en la gente que enchufa las máquinas y miramos las luces parpadeantes?

Beto
Es un punto final lógico profundo y ligeramente aterrador. Quiero decir, trajimos al interno cafeinado para ayudarnos a teclear más rápido. Y pronto podríamos darnos cuenta de que tenemos que contratar a un gerente de IA solo para mantener al interno bajo control.

Alicia
Y de repente, somos nosotros los que vamos a buscar el café.

Bueno, gracias a todos por acompañarnos en esta exploración. Como siempre, sigan cuestionando lo obvio y mantengan sus ojos abiertos para esos cuellos de botella ocultos. Los encontraremos en el próximo análisis profundo.

ABeto

miércoles, 22 de julio de 2026

Experiencia de desarrolladores con IA generativa

 
 

Este estudio emplea un enfoque de métodos mixtos para evaluar cómo interactúan los desarrolladores de software profesionales con la IA generativa (GenAI), más allá de las simples métricas de productividad. Los investigadores observaron a los participantes de SAP mediante sesiones controladas y entornos de trabajo naturales, recopilando encuestas subjetivas, registros de comportamiento y datos fisiológicos. Los resultados revelan que, si bien las sugerencias en el código y las indicaciones basadas en chat mejoran la eficiencia individualmente, la combinación de estos tipos de interacción puede aumentar la carga cognitiva y disminuir el rendimiento. Los desarrolladores generalmente prefieren GenAI para tareas monótonas y estructuradas, como las pruebas unitarias y la depuración, pero desconfían de su precisión en escenarios complejos. Curiosamente, la investigación indica que el uso de IA en actividades de desarrollo intensivo se asocia con una mayor productividad percibida y un menor esfuerzo mental. En definitiva, el estudio sugiere una regla general para seleccionar modos de interacción de IA específicos según la complejidad y la naturaleza de la tarea de programación en cuestión.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Developers' Experience with Generative AI Beyond Productivity Assessment -- Insights from an Empirical Mixed-Methods Field Study", por Charlotte Brandebusemeyer y colegas. Publicado el 9 de Julio de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Imagina que te entregan una herramienta totalmente nueva, ¿verdad? Y promete básicamente hacer tu trabajo por ti.

Alicia
¡Oh, el sueño absoluto!

Beto
Claro. Más rápido, mejor, cero esfuerzo. Así que la enciendes, te sientas, esperas que tus niveles de estrés se desplomen.

Alicia
Así es.

Beto
Pero entonces, de repente, te das cuenta de que en realidad estás trabajando significativamente más duro de lo que trabajabas antes de tener la herramienta.

Alicia
Lo cual es una realización tan salvaje.

Beto
De verdad lo es.

Así que bienvenidos a otro análisis profundo. Nuestra misión hoy es explorar un estudio de campo de métodos mixtos, verdaderamente fascinante y muy riguroso.

Alicia
Sí, este es de la SAP y de la Universidad de Potsdam.

Beto
Exacto. Y estamos observando cómo los desarrolladores de software profesionales realmente experimentan la inteligencia artificial generativa.

Alicia
Herramientas como GitHub CoPilot.

Beto
Claro. Pero en sus entornos de trabajo naturales y cotidianos. No solo en teoría.

Alicia
Y esto tiene implicaciones masivas para los oyentes, porque ya sea que pasen sus días escribiendo código Java complejo o solo usando una asistente de IA para ayudarles a redactar correos electrónicos, ...

Beto
O para organizar su flujo de trabajo. Sí.

Alicia
Claro. Sea lo que sea, los datos de este estudio revelan una gran equivocación que básicamente todos parecemos compartir.

Beto
De verdad lo hacemos.

Alicia
La IA no es un botón mágico fácil. No reduce instantáneamente tu carga mental.

Beto
Quiero decir, yo definitivamente pensé que lo hacía.

Alicia
Claro. Pero en realidad viene con un costo cognitivo realmente sorprendente. Y ese costo depende totalmente de cómo elijas interactuar con ella.

Beto
Bien, desglosémoslo. Porque la forma en que se diseñó este estudio nos da un nivel de visión que rara vez vemos.

Alicia
Sí. Es increíblemente exhaustivo.

GenAI_Dev_Experience_Guide_1024.png
Más allá de la velocidad: Optimización de la experiencia del desarrollador con IA generativa

Beto
No solo enviaron una simple encuesta y preguntaron a la gente cómo se sentían con respecto a la IA.

Alicia
Lo cual hacen la mayoría de las empresas.

Beto
Exacto. Los investigadores tomaron a 22 desarrolladores profesionales de SAP, la mayoría con, creo que entre cinco y diez años de experiencia.

Alicia
Sí. Profesionales experimentados.

Beto
Claro. Y los rastrearon intensamente durante cuatro días.

Alicia
Usaron este increíble enfoque multimodal. Básicamente fusionaron las condiciones estrictas de un laboratorio con el caos absoluto del mundo real.

Beto
Me encanta eso. Entonces, ¿cómo configuraron la parte del laboratorio?

Alicia
Bueno, primero, tuvieron sesiones de recopilación de datos controladas. Los desarrolladores trabajaron en tareas simuladas usando un conjunto de datos llamado HumanEval-X.

Beto
HumanEval-X. Claro, ¿para aquellos de nosotros que no codificamos?

Alicia
Piénsalo como un circuito de obstáculos estandarizado para los modelos de codificación de IA.

Beto
Oh, claro.

Alicia
Sí, le da a los investigadores una línea base fija. De esa manera pueden ver cómo diferentes desarrolladores abordan exactamente los mismos problemas bajo las mismas condiciones.

Beto
Eso tiene sentido. Y estuvieron rastreando muchas cosas durante esto.

Alicia
Oh, absolutamente todo. Estaban grabando sus pantallas, registrando cada pulsación de tecla.

Beto
Vaya.

Alicia
Sí, rastreando sus movimientos del ratón e incluso monitoreando su actividad fisiológica usando pulseras inteligentes.

Beto
Claro, espera, tengo que hablar de estas pulseras porque es mi detalle favorito.

Alicia
Es bastante intenso.

Beto
Literalmente reprodujeron un sonido de bocina fuerte para activar una respuesta de sobresalto en estos desarrolladores.

Alicia
¿Solo soplando una bocina en el laboratorio?

Beto
Claro. Y luego lo siguieron con meditaciones de respiración 4, 7, 8.

Alicia
Solo para establecer sus líneas base fisiológicas antes de que siquiera comenzaran a codificar.

Beto
Porque no puedes medir con precisión si una herramienta está estresando a alguien, a menos que sepas cómo se ve su estado de reposo.

Alicia
Exacto. Es increíblemente riguroso.

Beto
Y luego, después de ese entorno altamente controlado, cambiaron a un caos incontrolado.

Alicia
Claro, de vuelta al mundo real.

Beto
Los desarrolladores simplemente volvieron a su trabajo normal, desordenado y orientado a plazos de entrega durante tres días.

Alicia
Sí.

Beto
Y simplemente registraron lo que estaban haciendo y cómo se sentían.

Alicia
Equilibrar el control experimental con la validez ecológica de esa manera, es simplemente brillante.

Beto
Lo es de verdad.

Alicia
Porque no solo estamos viendo lo que hacen los desarrolladores en un laboratorio estéril cuando saben que los están observando.

Beto
Donde pueden estar en su mejor comportamiento.

Alicia
Exacto. Estamos viendo cómo se comportan cuando están lidiando con bases de código empresariales reales y los jefes presionándoles.

Beto
Así que antes de que veamos los datos objetivos de lo que realmente sucedió en esa fase del mundo real, realmente necesitamos establecer qué esperaban que la IA hiciera por ellos.

Alicia
Porque las expectativas dictan gran parte de la experiencia.

Beto
Completamente. Y al entrar en el estudio, el sentimiento fue altamente optimista.

Alicia
Muy positivo.

Beto
Sí. Y los cuestionarios previos al estudio, casi el 73% de los desarrolladores dijeron que estaban satisfechos, o muy satisfechos, con sus interacciones con herramientas de GenAI hasta ahora.

Alicia
Lo cual es una gran mayoría. Y ninguno está abiertamente insatisfecho, lo cual es raro para un nuevo software empresarial.

Beto
Claro. Normalmente la gente odia aprender software nuevo. Pero sus expectativas sobre cómo funcionaría la herramienta eran increíblemente específicas.

Alicia
Sí. Estuvieron de acuerdo abrumadoramente en que la IA es más útil para tareas monótonas.

Beto
Lo aburrido.

Alicia
Exacto. Estamos hablando de leer código boilerplate, redactar y ejecutar pruebas unitarias y depuración básica.

Beto
Así que cuando se les preguntó sobre qué tan útil es la IA para esas tareas repetitivas en una escala de 1 a 5, la puntuación promedio fue un 4.5.

Alicia
Eso es casi unánime. Cada participante acordó, o estuvo de acuerdo firmemente.

Beto
Lo cual pinta una imagen muy clara. Es como si esperaran que esta tecnología funcionara como un interno junior incansable y altamente competente.

Alicia
Oh, esa es una forma perfecta de verlo.

Beto
Claro. Les entregas el trabajo repetitivo tedioso, el interno lo hace, y tu carga de trabajo abrumadora de repente se vuelve manejable.

Alicia
Quedas libre para concentrarte en la arquitectura de alto nivel, en lo realmente difícil.

Beto
Exacto.

Así que la creencia central aquí es que usar la IA requerirá menos esfuerzo mental que trabajar sin ella.

Alicia
Y esto se relaciona perfectamente con el marco de la experiencia del desarrollador, que a menudo se llama DevX.

Beto
DevX, correcto.

Alicia
Sí. Básicamente nos dice por qué esa expectativa de menor esfuerzo mental es tan crucial. DevX argumenta que el bienestar y la productividad de un desarrollador están profundamente ligados a tres cosas específicas.

Beto
¿Cuáles son?

Alicia
Primero, mantener tu carga cognitiva manejable. Segundo, mantenerse en un estado de flujo concentrado.

Beto
Estar "en la zona".

Alicia
Exacto. Y tercero, tener un bucle de retroalimentación ajustado donde puedan ver instantáneamente si su código funciona o no.

Beto
OK. Así que los desarrolladores asumieron que la IA reduciría su carga cognitiva y los mantendría en ese estado de flujo.

Alicia
Eso fue el sueño, sí.

Beto
Entonces, los datos del mundo real debieron haber sido un shock absoluto para ellos.

Alicia
Completamente voltearon la situación.

Beto
Veamos esa fase incontrolada. Esto es cuando los desarrolladores simplemente estaban haciendo sus trabajos normales durante tres días.

Alicia
Y registraron muchos datos. 445 tareas de trabajo diarias.

Beto
Lo cual los investigadores categorizaron en tres categorías. Había actividades pesadas en desarrollo. Eso es codificación y depuración.

Alicia
El trabajo principal.

Beto
Claro. Luego, actividades pesadas en colaboración, como reuniones y mensajería. Y finalmente, digamos, "otras actividades".

Alicia
Como aprender, leer documentación, o simplemente trabajo administrativo.

Beto
Así que para darles una idea de una semana típica para estos desarrolladores empresariales, realmente solo dedican alrededor del 29% de su tiempo a escribir código.

Alicia
Lo cual siempre sorprende a la gente.

Beto
Claro. Piensas que es todo el día. Luego, un 17% en reuniones y un 14% en depuración.

Alicia
Así que las tareas pesadas en desarrollo son realmente el núcleo de su trabajo, incluso si no es el 100% de su tiempo.

Beto
Exacto. De esas 445 tareas rastreadas, casi el 42% fueron pesadas en desarrollo.

Alicia
Y aquí es donde entra la IA. GenAI, fue utilizada en más de la mitad de esas tareas de desarrollo, alrededor del 54.6%.

Beto
Así que dependen de ella en gran medida. Esa es una parte importante de su flujo de trabajo ahora.

Alicia
Pero aquí está el giro. Cuando los investigadores analizan las calificaciones subjetivas de los desarrolladores sobre qué tan mentalmente agotadoras fueron esas tareas, los resultados contradijeron directamente toda esa expectativa de DevX.

Beto
OK, entonces, ¿cómo midieron esa fatiga mental?

Alicia
Bueno, para analizar esas calificaciones, los investigadores usan modelos mixtos lineales ("linear mixed-effects models").

Beto
OK, espera, eso suena increíblemente denso.

Alicia
Lo sé, lo sé. Es mucha jerga estadística. Pero esencialmente significa que usan modelado estadístico para filtrar todo el ruido humano.

Beto
Oh, como las diferencias individuales.

Alicia
Exacto. Tiene en cuenta el hecho de que el desarrollador A podría encontrar la codificación naturalmente mucho menos estresante que el desarrollador B.

Beto
Entendido. Así que nivela el campo de juego.

Alicia
Claro. Lo que permite a los investigadores aislar el impacto específico de la IA misma.

Y los modelos revelaron algo completamente contraintuitivo. Usar la IA durante tareas pesadas en desarrollo aumenta activamente la carga cognitiva percibida del desarrollador en comparación con realizar esas mismas tareas sin IA.

Beto
Eso es simplemente alucinante. La media marginal estimada para la carga cognitiva saltó de 4.14 sin IA, a 4.72 con IA.

Alicia
Lo cual es un pico estadísticamente significativo en la carga mental. No es solo un error de redondeo.

Beto
Espera, si los desarrolladores ya están lidiando con una alta carga cognitiva e introducir esta herramienta activamente hace las cosas más difíciles mentalmente, ¿por qué usarla?

Alicia
Esa es la pregunta del millón.

Beto
Quiero decir, ¿no la abandonarían? ¿Por qué la están usando en más de la mitad de sus tareas de codificación si literalmente los está agotando? ¿Eso no derrota por completo el propósito de un asistente?

Alicia
Bueno, esto plantea una pregunta importante. Y los datos nos forzan a separar dos cosas distintas: La mecánica de la interacción versus el valor del resultado.

Beto
Interacción versus resultado, ¿de acuerdo?

Alicia
Correcto. Interactuar con inteligencia artificial inherentemente te cuesta energía mental cada vez.

Beto
Tienes que descubrir cómo hablarle.

Alicia
Exacto. Tienes que descubrir cómo darle indicaciones (prompt). Luego tienes que leer el código que genera, lo cual a menudo es más difícil que leer tu propio código.

Beto
Porque no lo escribiste tú.

Alicia
Claro. Luego tienes que verificar que el código realmente haga lo que quieres sin romper nada más en el sistema. Y finalmente, tienes que integrarlo en tu proyecto existente.

Beto
Eso es mucha cantidad de pasos.

Alicia
Es un gran costo de interacción. Y es fijo. Sucede cada vez que usas la herramienta.

Beto
Así que estás haciendo toda esta gimnasia mental solo para operar la herramienta, lo cual explica perfectamente la mayor carga cognitiva. Pero ¿se traduce ese esfuerzo extra al menos en hacer más trabajo? ¿Son más rápidos?

Alicia
No se sabe automáticamente.

Beto
Oh, vaya.

Alicia
Sí, el estudio encontró que simplemente usar la IA no aumentó la productividad percibida del desarrollador.

Beto
Así que están trabajando más duro sin una ganancia garantizada.

Alicia
A menos que se cumpla una condición específica, las calificaciones de productividad solo aumentaron cuando el resultado de la IA fue considerado, digamos, "útil" por el desarrollador.

Beto
Significa que la calidad del trabajo de la IA tiene que ser increíblemente alta solo para compensar el impuesto mental de gestionarlo desde el principio.

Alicia
Precisamente. Los datos resaltan esta dinámica perfectamente. Si se usó la IA pero no fue útil, la calificación de productividad se mantuvo en 3.27.

Beto
Bastante baja.

Alicia
Pero si la IA fue útil, esa calificación de productividad subió hasta 4.0.

Beto
Así que la recompensa de la productividad solo se materializa si la calidad del resultado compensa completamente ese costo cognitivo inicial pesado.

Alicia
Exacto. Tiene que valer la pena el impuesto de interacción.

Beto
Siento que eso hace que la analogía del interno junior sea aún más precisa.

Alicia
Oh, totalmente.

Beto
Porque piensa en esto: Si dedicas 20 minutos a explicar un pase a un interno, y ellos traen un trabajo perfecto, esos 20 minutos de mentoría valieron absolutamente la pena.

Alicia
Claro. Tu productividad aumenta en general.

Beto
Pero si traen un desastre total, y ahora tienes que pasar una hora desenredándolo y reescribiéndolo tú mismo, simplemente has duplicado tu propia carga de trabajo.

Alicia
Pagaste el impuesto de interacción, pero no recibiste un reembolso por el resultado.

Beto
Eso es muy frustrante, lo cual supongo nos lleva a la parte más práctica de este estudio.

Alicia
Bien. ¿Qué podemos hacer realmente al respecto?

Beto
Si los datos del mundo real muestran un pico masivo en la carga mental, ¿cómo aislamos el costo?

Alicia
Bueno, los investigadores tuvieron que quitar el caos diario. Volvieron a introducir a los desarrolladores en la configuración de laboratorio controlada para probar las interfaces cara a cara.

Beto
Porque la interfaz que elijas básicamente dicta qué tan pesada va a ser esa factura de interacción.

Alicia
Exacto. Y durante estas sesiones controladas, fueron grabados y evaluados usando algo llamado "el índice de carga de tarea de NASA".

Beto
El índice de carga de tarea de NASA. Eso suena serio.

Alicia
Lo es. En lugar de simplemente preguntar una pregunta simple, "¿estuvo difícil esta pregunta?", este índice descompone la fatiga mental en diferentes categorías.

Beto
Oh, eso es inteligente.

Alicia
Sí. Mide cuánta demanda mental tomó una tarea, qué tan apurado se sintió el usuario y, crucialmente, qué tan frustrado se puso.

Beto
Así que es una forma increíblemente rigurosa de averiguar si una herramienta está ayudando, o simplemente volviendo loco al usuario.

Alicia
Exacto. Y bajo esa medición estricta, los desarrolladores tuvieron acceso a dos modos principales de interacción con GitHub CoPilot.

Beto
Desglosemos eso.

Alicia
Claro. Así que tienes sugerencias dentro del código y tienes indicaciones de chat. Y funcionan de manera completamente diferente.

Beto
Bien.

Alicia
Así que las sugerencias son esencialmente autocompletado súper potente. Estás escribiendo en tu editor de código y la IA sugiere las siguientes líneas justo en tu cursor.

Beto
Texto listo para que le des tab.

Alicia
Exacto. Opera con una latencia muy baja, lo que significa que es súper rápido. Y basa sus sugerencias principalmente en el contexto local, solo en el archivo específico en el que estabas trabajando.

Beto
Claro, así es el autocompletado.

La interfaz de chat, por otro lado, es una bestia completamente diferente.

Alicia
Totalmente.

Beto
Es una ventana de diálogo separada que se sitúa al lado de tu pantalla. Funciona mucho más como ChatGPT, ¿verdad?

Alicia
Sí. Escribes una pregunta en lenguaje natural, como cómo arreglo este error. Y te da una respuesta conversacional.

Beto
Pero es más lento, ¿verdad?

Alicia
Tiene mayor latencia. Sí. Le lleva más tiempo generar una respuesta. Pero la compensación es que puede tener en cuenta un contexto mucho más amplio. Puede analizar múltiples archivos diferentes a través de toda la arquitectura de tu proyecto.

Beto
Así que el autocompletado es rápido y local. El chat es lento, pero ve el panorama general.

Alicia
Exacto. Y analizar la grabación de pantalla reveló una división muy marcada en cómo se utilizaron estas herramientas.

Beto
¿Qué encontraron?

Alicia
Los desarrolladores favorecieron fuertemente las sugerencias dentro del código para tareas de codificación simple. 14 de los 20 participantes que usaron Co-Pilot en la sesión controlada usaron sugerencias dentro del código más del 50% del tiempo.

Beto
Para las cosas simples.

Alicia
Claro. La evaluaron como algo que les hacía sentirse más satisfechos y productivos para esas tareas directas.

Beto
Bien. Así que el autocompletado claramente gana para la ejecución simple. Pero ¿qué pasa cuando el desarrollador llega a un muro?

Alicia
Ahí es donde las cosas cambian.

Beto
Por ejemplo, si la base de código fuera un desastre total, o estuvieran lidiando con un error que simplemente no entienden, saber qué escribir después es básicamente imposible.

Alicia
Y el autocompletado se vuelve completamente inútil en ese momento. Es solo adivinar a ciegas.

Beto
Claro. Eso es exactamente cuando abandonan por completo las sugerencias dentro del código.

Alicia
Porque para la exploración de alta complejidad, depuración compleja o la necesidad de una explicación de código confuso, el chat se convirtió en la interfaz obligatoria.

Beto
Y los datos respaldan realmente lo efectivo que es el chat para esas situaciones, ¿no?

Alicia
Lo respaldan. Cuando se mira la precisión de la tarea, es decir, si el desarrollador completó la tarea difícil con éxito, utilizar solo prompts de chat significativamente aumentó la probabilidad de completar la tarea.

Beto
En comparación con no usar la IA en absoluto.

Alicia
Exacto.

Beto
La investigación previa en este espacio, como el trabajo de Barke y sus colegas, identificaron estos como dos modos de trabajo completamente distintos.

Alicia
Sí. Aceleración y exploración.

Beto
Claro. Tienes el modo de aceleración donde sabes exactamente lo que estás haciendo. Tienes el mapa en tu cabeza. Y solo quieres que la máquina lo escriba más rápido.

Alicia
La IA es solo tu mecanógrafa.

Beto
Exacto. Y luego tienes el modo de exploración donde estás atrapado. El camino a seguir es turbio. Y realmente necesitas que la IA te ayude a encontrar una solución.

Alicia
Y el estudio de SAP confirma esa división perfectamente.

Además, encontró que usar cualquiera de esos modos de forma independiente, confiando solo en el autocompletado dentro del código para la aceleración, o confiando solo en la ventana de chat para la exploración.

Beto
Hacer uno u otro.

Alicia
Claro. Hacer eso mejoró la eficiencia del desarrollador, acortó la duración de la tarea y redujo su carga de trabajo percibida en comparación con no usar la IA en absoluto.

Beto
Vaya. Así que eso suena como el descanso mental del que estábamos hablando al principio.

Alicia
Lo es.

Beto
Si usas la herramienta correcta para el trabajo correcto, la carga cognitiva realmente baja.

Alicia
Sí, pero hay una trampa masiva escondida en estos datos.

Beto
Una severa.

Alicia
El desastre ocurre cuando los desarrolladores intentan usar ambos tipos de interacción simultáneamente en una sola tarea.

Beto
Haciéndolos juntos.

Alicia
Sí. Cuando mezclaron el autocompletado con la ventana de chat, todos esos beneficios desaparecieron.

Beto
Simplemente se fueron.

Alicia
Las mejoras de eficiencia fueron completamente borradas, lo que significa que la tarea tomó tanto tiempo como si no hubieran tenido IA en absoluto.

Beto
Oh, vaya.

Alicia
Y sus cargas de trabajo percibidas volvieron a subir hasta la línea base alta, sin IA.

Beto
Aquí es donde se pone realmente interesante, para mí, al menos. Es exactamente como intentar navegar por una ciudad compleja y desconocida con dos voces de GPS diferentes dándote instrucciones al mismo tiempo.

Alicia
Oh, ese es un pensamiento estresante.

Beto
Es terrible. Una voz está gritando, gira a la izquierda ahora, justo en tu oído. Esa es la sugerencia de autocompletado dentro del código exigiendo acción inmediata.

Y luego la otra voz te está dando la visión general de todo el recorrido de 10 millas desde una pantalla completamente separada. Esa es la ventana de chat.

Alicia
Y simplemente terminas paralizado.

Beto
Agotas toda tu energía mental tratando de procesar ambas corrientes de información en lugar de solo conducir el coche.

Alicia
Si conectamos esto con la imagen más grande, el mecanismo detrás de esa parálisis es el costo de cambio cognitivo.

Beto
¿Costos de cambio?

Alicia
Sí. Cada vez que cambias tu atención del flujo rápido y localizado de las sugerencias dentro del código al contexto conversacional más amplio y lento de la ventana de chat, tu cerebro se ve obligado a cambiar de marcha.

Beto
Y cambiar de marcha requiere energía.

Alicia
Mucha. Estás reteniendo código crudo en tu memoria de trabajo mientras lees simultáneamente una explicación en lenguaje natural y luego intentas mapear esa explicación de vuelta al código frente a ti.

Beto
Eso es simplemente una receta para un dolor de cabeza.

Alicia
Lo es de verdad. Esa sobrecarga de memoria de trabajo es una inmensa carga mental.

Beto
Así que basándose en esa sobrecarga de memoria de trabajo, los investigadores proponen una regla empírica muy estricta para cualquiera que interactúe con la IA generativa.

Alicia
Proponen un marco para la alineación del modo de tarea.

Beto
Bien. Enséñanos.

Alicia
Si estás ejecutando un trabajo de baja complejidad, como escribir código boilerplate, hacer tareas repetitivas, debes permanecer en el modo de aceleración.

Beto
Usa las sugerencias de autocompletado de baja latencia dentro del código.

Alicia
Y no abras la ventana de chat.

Beto
Déjala cerrada.

Alicia
Por el otro lado, si estás haciendo una exploración de alta complejidad, depurando un problema complicado, aprendiendo una nueva base de código, debes cambiar al modo de exploración.

Beto
Así que usa la interfaz de chat, tómate tu tiempo e ignora el autocompletado.

Alicia
Exacto. La regla de oro es nunca mezclarlos en la misma tarea.

Beto
Nunca cruces los flujos.

Alicia
Nunca cruces los flujos. Hacerlo solo crea una fricción abrumadora.

Beto
Y entender este costo de cambio cognitivo, esta increíble carga de verificar constantemente lo que está haciendo la IA, realmente ilumina las frustraciones específicas que los desarrolladores expresaron sobre el futuro de la GenAI.

Alicia
Claro. Les preguntan sobre esto en los cuestionarios posteriores al estudio.

Beto
Cuando analizas las respuestas abiertas sobre lo que impulsa su insatisfacción, literalmente todo apunta a un quiebre en la confianza.

Alicia
La confianza es todo con la automatización.

Beto
Lo es. Cualquier cosa que rompa el bucle de retroalimentación y obligue al desarrollador a gastar más energía mental verificando el resultado, se ve como algo muy negativo.

Alicia
Veamos lo que realmente quieren que la IA haga por ellos en el futuro, porque es muy revelador.

Beto
Sí. Los investigadores les dieron una lista completa de opciones.

Alicia
La demanda absoluta más alta fue que la IA generara pruebas unitarias. Justo detrás de eso estaba el análisis de causa raíz y el análisis de código en busca de defectos o vulnerabilidades.

Beto
Básicamente, quieren que la IA se encargue de las tareas monótonas y que consumen mucho tiempo, a las que ya dedican porcentajes de dos dígitos de su semana haciendo manualmente.

Alicia
Observa el hilo conductor en todos esos deseos, sin embargo.

Beto
El costo de la verificación es realmente bajo.

Alicia
Exacto. Si una IA escribe una prueba unitaria y está ligeramente equivocada, ¿qué pasa?

Beto
Las pruebas simplemente fallan.

Alicia
Claro, la prueba falla. Ves exactamente por qué falló y lo arreglas. El bucle de retroalimentación es inmediato y es totalmente seguro.

Beto
Pero mira lo que ni un solo desarrollador de los 22 quiso: No tenían ningún interés en que la IA gestionara permisos de seguridad o gestión de políticas.

Alicia
Lo cual tiene perfecto sentido cuando lo piensas.

Beto
Porque si una IA alucina mientras establece políticas de seguridad para una aplicación empresarial masiva, las consecuencias son catastróficas.

Alicia
No puedes simplemente arreglar un error tipográfico.

Beto
Claro, el costo de verificar esa política de seguridad es tan increíblemente alto y requiere tanta supervisión humana que completamente derrota el propósito de automatizarla en primer lugar.

Alicia
Las alucinaciones fueron citadas como una fuente importante de insatisfacción.

Un desarrollador señaló específicamente su frustración con "código verboso que es difícil de revisar".

Beto
Código verboso.

Alicia
Demasiado texto innecesario.

Otra queja importante fue la sensibilidad al prompt.

Beto
Oh, tener que pedir la misma cosa de cinco maneras diferentes.

Alicia
Sí. El agotador proceso de tener que ajustar tu pregunta una y otra vez solo para que la IA produzca el código que podrías haber escrito tú mismo en dos minutos.

Beto
Yo he estado allí. Cuando una IA alucina o cuando requiere una ingeniería de prompts intensa solo para que salga bien, obliga al humano a dejar de ser un creador y convertirse en un editor a tiempo completo.

Alicia
Y editar es agotador.

Beto
Lo es. El costo mental de leer, comprender y verificar el código generado por la IA eclipsa el tiempo ahorrado al hacer que la IA lo escriba en primer lugar.

Alicia
La herramienta deja de ser ese interno junior útil.

Beto
Y comienza a ser una responsabilidad muy rápida, muy segura, pero totalmente imprudente, que tienes que microgestionar constantemente.

Alicia
Lo que nos deja con una conclusión muy clara para ti, oyente, o realmente cualquiera que intente construir IA en su propia rutina.

Beto
Sí, ¿cuál es el punto clave aquí?

Alicia
Los datos de la SAP prueban que la GenAI es una herramienta increíblemente poderosa. Los participantes estuvieron abrumadoramente de acuerdo en que impulsó su productividad cuando se usó correctamente.

Beto
Así que no es una moda.

Alicia
No es una moda, pero definitivamente tampoco es una varita mágica. Es una herramienta que requiere tu energía mental activa e intencional para funcionar eficazmente.

Beto
Tienes que curar tu propio flujo de trabajo. Trata tu carga cognitiva como un presupuesto diario y no la gastes toda en gestionar la herramienta que se suponía que te iba a salvar.

Alicia
Esa es una gran forma de decirlo.

Beto
Alinea la interfaz de IA correcta con la tarea correcta. Si usas autocompletado para resolver problemas complejos, te encontrarás con un muro.

Alicia
Sí.

Beto
Si usas el chat para escritura simple, te ralentizarás. Y si los mezclas indiscriminadamente, crearás una sobrecarga cognitiva que anula cada beneficio.

Alicia
Y el horizonte hacia el que nos estamos moviendo hace que dominar esto sea aún más crítico.

Beto
Porque las cosas están cambiando rápido.

Alicia
Muy rápido. Ahora, la IA aumenta nuestra carga cognitiva durante tareas complejas porque nosotros, los humanos, tenemos que actuar como los editores definitivos.

Beto
Somos la red de seguridad.

Alicia
Somos los verificadores que cierran la brecha entre el resultado de la IA y la realidad.

Beto
Estamos resolviendo y revisando el código desordenado de los aprendices.

Alicia
Pero la industria se está moviendo rápidamente hacia flujos de trabajo agénticos.

Beto
Flujos de trabajo agénticos, sí.

Alicia
Estamos entrando en una era donde los modelos de IA serán encargados de verificar el trabajo de los demás antes de que siquiera llegue a una pantalla humana.

Beto
Eso es increíble de pensar.

Alicia
Imagina un flujo de trabajo donde una IA escribe el código. Una segunda IA independiente ejecuta la prueba unitaria de ese código. Y una tercera IA revisa el resultado en busca de alucinaciones y fallos de seguridad.

Beto
Bien, entonces, la pregunta definitiva es: ¿nos da finalmente el descanso mental que nos prometieron?

Alicia
Correcto.

Beto
¿O solo desvía nuestra carga cognitiva de la escritura de código por completo y nos convierte a todos en gerentes intermedios exhaustos tratando de arrear a todo un equipo de agentes de IA autónomos?

Alicia
Esperando que no rompan la empresa mientras no estamos mirando.

Beto
Exacto.

Alicia
Esa es la pregunta definitoria para la próxima generación de trabajo de conocimiento.

Beto
Un concepto francamente aterrador de considerar, pero muy real.

Alicia
Sí.

Beto
Bueno, gracias por acompañarnos en este análisis profundo hoy. Tenemos mucho que pensar. Y los encontraremos en el próximo.

martes, 14 de julio de 2026

Exposición ocupacional a la IA

 
 

Este artículo de investigación analiza el error de medición inherente al uso de registros de conversaciones de plataformas de IA para estimar la exposición ocupacional a la IA. Los autores demuestran que estos registros no son representativos de la fuerza laboral en general, ya que ciertas profesiones, particularmente en los campos de la informática y las matemáticas, están significativamente sobrerrepresentadas en comparación con su proporción real de empleo. Dado que las puntuaciones derivadas de la plataforma confunden la aplicabilidad a nivel de tarea con la base de usuarios específica de la plataforma, cambiar la fuente de datos puede alterar drásticamente los resultados del mercado laboral, llegando incluso a invertir el signo de las estimaciones de empleo. Para abordar este problema, el estudio introduce un procedimiento de reponderación de la fuerza laboral que alinea los datos de la plataforma con las proporciones de la Oficina de Estadísticas Laborales, lo que atenúa significativamente las estimaciones de exposición previas. En definitiva, los hallazgos sugieren que, si bien los datos de la plataforma revelan cómo interactúan los usuarios activos con la IA, son menos fiables para predecir la sustitución de empleos o la demanda laboral en toda la economía. Las mediciones basadas en estos registros pueden subestimar sistemáticamente los riesgos en ocupaciones vulnerables donde la visibilidad de la plataforma es baja debido al acceso o la adopción limitados.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Who Uses AI? Platforms, Workforce, and AI Exposure", por Michelle Yin y Burhan Ogut. Publicado el 20 de Mayo de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Bienvenidos a nuestro análisis profundo de hoy. Si quieren saber si la inteligencia artificial va a robarles el trabajo, necesitan buenos datos.

Alicia
Definitivamente necesitan buenos datos.

Beto
Correcto. Pero antes de que lleguemos a los datos que, de hecho, tenemos sobre IA ahora mismo, quiero que empieces imaginando una ciudad enorme y extensa.

Alicia
Bien. La estoy imaginando.

Beto
Imagina que has sido contratada por el alcalde para averiguar cuál es el método de transporte más popular en toda esta metrópolis.

Alicia
Correcto. Necesitas números concretos.

Beto
Exacto. Necesitas números concretos. Así que tomas tu portafolio, sales al campo y pasas un mes encuestando a decenas de miles de personas.

Alicia
Vaya. Bien. Una encuesta grande.

Beto
Una encuesta enorme. Compilas resultados. Haces los cálculos y presentas con orgullo tus hallazgos al consejo municipal. Y les dices que el 95% de la ciudad depende del metro.

Alicia
Y el alcalde probablemente esté encantado.

Beto
Sí. El alcalde está impactado. El presupuesto se reescribe por completo para financiar más trenes. Todos aplauden, pero hay un problema.

Alicia
Normalmente hay uno.

Beto
Hiciste cada una de esas encuestas mientras estabas físicamente dentro de un vagón de metro.

Alicia
Oh, hombre. Quiero decir, es realmente el punto ciego definitivo. Tienes esta montaña de datos.

Beto
Sí. Decenas de miles de puntos de datos.

Alicia
Tal vez millones incluso. Y eso te da una falsa sensación de seguridad. Pero el entorno donde recolectaste esos datos, dictó completamente las respuestas que obtuviste.

Beto
Correcto. No mediste la ciudad en absoluto.

Alicia
Exacto. Solo mediste a las personas que ya habían comprado un boleto.

Beto
Y hoy vamos a explorar cómo ese mismo punto ciego está distorsionando por completo nuestra visión del futuro del trabajo. Quiero decir, todos, desde periodistas hasta responsables políticos y tu propio jefe, están tratando desesperadamente de predecir qué trabajos va a reemplazar, o revolucionar la IA.

Alicia
Es lo único de lo que la gente está hablando ahora mismo.

Beto
Así es. Y para hacer esto, están usando enormes cantidades de registros de chat de plataformas de IA como Claude, ChatGPT y Co-pilot. Pero hay un sesgo oculto masivo en este día.

Alicia
Un gran sesgo.

Beto
Así que estamos desempacando este fascinante artículo de 2026 de Michelle Yen y Berhan Ogut titulado "¿Quién usa la IA? Selección de plataformas y la medición de la exposición ocupacional a la IA". Y nuestra misión hoy es mostrarles cómo mirar los datos de uso de IA podría estar cegándonos a los trabajadores que realmente están en riesgo.

Fixing_AI_Workforce_Data_Biases_1024.png
La Trampa de las Mediciones de IA: ¿Por qué datos de las Plataformas No Representan a la Fuerza Laboral?

Alicia
Tengo que decir que es una llamada de atención masiva para la economía laboral.

Beto
Lo es.

Alicia
Porque para entender por qué este artículo está sacudiendo tanto las cosas, tienen que mirar cómo los investigadores han intentado históricamente predecir la automatización.

Beto
Correcto.

Alicia
Durante mucho tiempo, los economistas básicamente estaban adivinando lo que la IA podría hacer.

Beto
Solo haciendo suposiciones.

Alicia
Prácticamente, sí. Sacaban una base de datos gubernamental de descripciones de puestos de trabajo, miraban las capacidades de los modelos de IA y simplemente hipotetizaban. Decían: "bueno, un paralegal lee documentos y ChatGPT lee documentos. Así que ese trabajo está altamente expuesto".

Beto
Pero recientemente la tendencia ha cambiado por completo, ¿verdad? La investigación se ha cansado de adivinar.

Alicia
Exacto.

Beto
Lo cual tiene sentido. Quiero decir, si yo soy un investigador, no quiero sentarme en una torre de marfil adivinando lo que podría hacer una herramienta. Quiero ver lo que la gente está haciendo realmente con ella en el mundo real.

Alicia
Ese fue el cambio de mentalidad exacto. Ahora, los investigadores quieren ver lo que la IA está haciendo en el terreno. Así que recurren a registros reales de conversaciones anonimadas de Anthropic Claude, ChatGPT de OpenAI y Microsoft Co-pilot.

Beto
Están mirando las indicaciones reales ("prompts").

Alicia
Sí. Toman estos millones de indicaciones diarias y las mapean de nuevo a tareas laborales específicas. Así que si un montón de indicaciones parecen programación en Python, lo mapean a ingeniería de software.

Beto
Correcto.

Alicia
Si las indicaciones parecen pronóstico financiero, lo mapean a analistas financieros. Y a partir de ahí, calculan una puntuación de exposición para diferentes ocupaciones.

Beto
Okay, vamos a desgranar esto por un segundo. Espera, ¿es esto como tratar de averiguar el método de transporte más popular en una ciudad entera, pero solo haces tu encuesta dentro de un vagón de metro?

Alicia
Eso es exactamente lo que es.

Beto
Por supuesto, los datos van a decir que "todo el mundo viaja en tren". Solo estás hablando con las personas que ya están conectadas a la plataforma de IA.

Alicia
Lo fascinante aquí es que esta dinámica crea lo que los economistas llaman "error de medición no clásico".

Beto
No clásico.

Alicia
Sí. Normalmente, cuando los investigadores hablan de "error de medición", se refieren a ruido aleatorio.

Beto
Como un error de tipografía, o algo así.

Alicia
Exacto. Imagina que estás redactando resultados de una encuesta y accidentalmente presionas la tecla equivocada varias veces. Un error aquí, un fallo allá. Es aleatorio. Así que si tu tamaño de muestra es lo suficientemente grande, esos errores aleatorios se cancelan entre sí.

Beto
Y tu promedio final sigue siendo básicamente preciso.

Alicia
Correcto. Eso es "error clásico".

Pero el "error de medición no clásico" significa que el error no es aleatorio en absoluto.

Beto
Es estructural.

Alicia
Sí. El error está sistemáticamente ligado a la misma cosa que están tratando de medir.

Beto
Déjame asegurarme de que lo estoy captando.

Alicia
Sí.

Beto
Es como tratar de averiguar la dieta diaria promedio de los estadounidenses. Pero solo les repartes tu encuesta a personas que salen de una tienda de comestibles veganas de alta gama.

Alicia
Oh, esa es una analogía perfecta.

Beto
El error no es aleatorio. Vas a mirar los datos y declararás con confianza que el 90% de los estadounidenses comen tofu todos los días.

Alicia
Correcto. Porque la ubicación de tu encuesta está inextricablemente ligada al hábito que estás midiendo.

Beto
Porque solo estás preguntando a veganos.

Alicia
Exacto. La puntuación de exposición a la IA derivada de la plataforma está mezclando en secreto dos cosas totalmente diferentes.

Beto
Okay. ¿Qué son?

Alicia
Bueno, está midiendo la tarea real que la IA es capaz de hacer. Sí. Pero simultáneamente está midiendo la composición demográfica de las personas que casualmente tienen el tiempo, el dinero y la inclinación para iniciar sesión en esa plataforma específica.

Beto
Así que el error está fuertemente correlacionado con las mismas ocupaciones que adoptaron la IA temprano.

Alicia
Sí.

Beto
Okay. Entonces, estás diciendo que los datos están sesgados. ¿Qué tan malo es este efecto del vagón de metro en la vida real? ¿Quién está generando realmente todos estos registros de chat que los investigadores están usando para predecir nuestro futuro económico?

Alicia
Es salvaje cuando miras el desglose. Tomemos a los trabajadores en ocupaciones de informática y matemáticas.

Beto
Tales como, desarrolladores de software, científicos de datos, actuarios.

Alicia
Exacto. ¿Te apetece adivinar qué porcentaje de la fuerza laboral total de EE. UU. representan realmente?

Beto
Quiero decir, se sienten en todas partes en línea, pero en el mundo físico real ... No lo sé. Tal vez 5% o 10%.

Alicia
Intenta 3.4%.

Beto
¿En serio? ¿Solo 3.4?

Alicia
Sí. Son una pequeña porción de la torta de empleo general en los Estados Unidos. Pero cuando Yin y Ogut miraron los datos de Anthropics Quad, esos mismos trabajadores de informática y matemáticas generaron el 32.3% de todas las conversaciones de los consumidores en la plataforma.

Beto
Espera. Un grupo que representa poco más del 3% del mundo real está ocupando casi un tercio de los datos de IA.

Alicia
Casi un tercio. Y se sesga aún más cuando miras los datos empresariales.

Beto
¿Quieren decir como las cuentas de nivel empresarial?

Alicia
Sí. Para los canales empresariales de Claude, las ocupaciones de informática y matemáticas representaron un asombroso 51.7% de todas las conversaciones.

Beto
No puede ser.

Alicia
Más de la mitad de todo el conjunto de datos está siendo generado por el 3% de la fuerza laboral.

Beto
Así que si un economista laboral alimenta esos datos empresariales en su modelo predictivo, el modelo va a gritar que el desarrollo de software es el trabajo más expuesto en la Tierra.

Alicia
Porque son la gente más ruidosa en la sala.

Beto
Exacto. ¿Qué hay del otro extremo del espectro? La gente que no está en la sala.

Alicia
Veamos a los trabajadores de preparación y servicio de alimentos. Representan el 8.8% de la fuerza laboral de EE. UU.

Beto
Así que casi tres veces más grandes que el grupo de informática y matemáticas.

Alicia
Correcto. Pero solo generan un 0.7% de las conversaciones.

Beto
Vaya. Eso es prácticamente cero.

Alicia
Lo es. Si comparas la proporción de densidad de conversación con la densidad real de empleo en diferentes grupos laborales importantes, abarca un factor de 72.

Beto
Un factor de 72. La brecha entre la gente que usa las herramientas y la gente que trabaja en la economía real es simplemente masiva.

Alicia
Es un cañón.

Beto
Puedes pensar, bueno, tal vez otras plataformas tengan una base de usuarios más equilibrada. No todos usan Claude. Quizás Copilot o ChatGPT se parezca más al mundo real.

Alicia
Microsoft Copilot, de hecho, tiene una base de usuarios un poco más cercana a la fuerza laboral real, que Claude o ChatGPT.

Beto
Probablemente porque está integrado en el software de oficina estándar, ¿verdad? Como Excel.

Alicia
Probablemente. Sí. Pero incluso entonces, Yin y Ogut encontraron que ninguna plataforma se correlaciona con la Oficina de Estadísticas Laborales. La participación de empleo es mayor que una insignificante 0.33.

Beto
Espera, con una, siendo una coincidencia perfecta.

Alicia
Una siendo una coincidencia perfecta. Cero siendo ninguna coincidencia en absoluto. Las plataformas simplemente no se parecen a la economía real.

Beto
Aquí es donde se pone realmente interesante. Porque Yin y Ogut no se detuvieron solo en señalar la discrepancia demográfica. Decidieron hacer un experimento para ver cuánto perturba estos datos sesgados nuestras predicciones económicas reales.

Alicia
Correcto. Querían ver los efectos secundarios.

Beto
Sí. Montaron un modelo económico estándar. El tipo exacto de investigadores que usan para asesorar a los gobiernos sobre cómo afectará la IA al empleo. Y mantuvieron las matemáticas exactamente iguales. Mantuvieron todos los parámetros exactamente iguales.

Alicia
Lo único que cambiaron fue la fuente de los registros de chat que alimentaban el modelo.

Beto
Exacto. Cambiaron datos de consumidores de Claude, por datos de Claude empresarial.

Alicia
Y ten en cuenta que es el mismo proveedor de IA, el mismo modelo de lenguaje subyacente, la misma rúbrica para mapear tareas a trabajos.

Beto
Correcto. La única diferencia es el nivel de precios. Los datos de consumidores reflejan a usuarios individuales que pagan por una cuenta personal, mientras que los datos empresariales reflejan a empresas que compran asientos para su fuerza laboral.

Alicia
Y cuando hicieron ese cambio, la estimación descendente sobre el empleo no solo cambió ligeramente. De hecho, revirtió su signo.

Beto
Revirtió. Eso es una locura.

Alicia
El modelo alimentado con datos de consumidores concluyó que la exposición a la IA perjudica el empleo, lo que lleva a pérdidas de trabajo. Pero el mismo modelo alimentado con datos empresariales concluyó que la exposición a la IA ayuda al empleo, lo que lleva al crecimiento del empleo.

Beto
En general, solo cambiar la entrada de la plataforma cambió las estimaciones de empleo de ChatGPT por un factor de 1.9.

Alicia
Realmente necesitamos hacer una pausa y pensar en por qué sucede eso, porque expone la falla central en cómo pensamos sobre estos datos.

Beto
Sí.

Alicia
¿Por qué los datos empresariales mostrarían que la IA ayuda al empleo mientras que los datos de consumo muestran que lo está perjudicando? Piensa en cómo se compran y usan realmente estas herramientas en el mundo real.

Beto
Yo asumiría que se reduce básicamente a quién tiene la tarjeta de crédito.

Alicia
Precisamente. Bueno, se trata de la motivación detrás de la compra. Cuando una gran empresa compra miles de licencias empresariales para Co-pilot o Claude, generalmente les está dando esas licencias a sus empleados existentes.

Beto
Para hacerlos más rápidos.

Alicia
Correcto. El objetivo es hacer que su fuerza laboral actual sea más productiva, capaz de manejar un mayor volumen. Ese impulso en la productividad a menudo se correlaciona con el crecimiento de la empresa, lo que puede llevar a más contrataciones. Es aumentación.

Beto
Pero los datos de los consumidores son totalmente diferentes. Si yo fuera un consultor de marketing independiente, o un pequeño empresario, y pago 20 dólares al mes por mi propia cuenta de ChatGPT.

Alicia
¿Qué estás haciendo con ella?

Beto
Podría estar usándola para escribir textos para que no tenga que contratar a un redactor independiente.

Alicia
Exacto.

Beto
La estoy usando para eludir la contratación de ayuda humana por completo. Eso es sustitución.

Alicia
Lo cual nos dice algo increíblemente profundo sobre la investigación en la que confiamos. Si tu predicción macroeconómica completa, si la IA crea o destruye empleos, se invierte por completo basándose en el nivel de precios del chat que estés estudiando.

Beto
Entonces tu métrica no está capturando un hecho universal estable sobre la economía.

Alicia
No, no lo está. Solo está reflejando el marketing de la plataforma, su estrategia de precios y su curva específica de adopción por parte del usuario.

Beto
Los datos que estamos usando para predecir el futuro del trabajo humano son esencialmente solo un "espejo de casa de diversión" que refleja la base de clientes actual de Silicon Valley.

Alicia
Un "espejo de casa de diversión" es la forma perfecta de describirlo.

Beto
Pero Yin y Ogut no solo señalaron el problema y se fueron. De hecho, intentaron arreglar el espejo, lo que nos lleva a la siguiente parte de su investigación.

Alicia
Sí.

Beto
¿Cómo arreglas un conjunto de datos que está tan sesgado estructuralmente?

Alicia
Hicieron lo que llaman "un ejercicio de reponderación de la fuerza laboral".

Beto
Okay. ¿Cómo funciona eso?

Alicia
Bueno, como sabemos que los datos brutos de estas plataformas de IA están sesgados, y sabemos exactamente cómo están sesgados en comparación con los datos de las estadísticas laborales del mundo real, podemos forzar matemáticamente al espejo a reflejar la realidad.

Beto
Oh, ya veo.

Alicia
Ajustaron los datos de la plataforma para que la densidad de ocupación en su modelo coincidiera con la densidad real de la fuerza laboral en los Estados Unidos.

Beto
Básicamente dijeron, "matemáticamente bajemos el volumen de los desarrolladores de software."

Alicia
"... y subamos el volumen de los trabajadores de preparación de alimentos".

Beto
Correcto. Así que la influencia que tienen en el modelo predictivo coincide con su huella real en el mundo real.

Alicia
Sí.

Beto
Y los resultados de hacer eso son simplemente drásticos. Cuando reponderaron los datos, el impacto estimado de la exposición a la IA cayó un 42% para los datos de Microsoft Co-pilot.

Alicia
Y para los datos compuestos de Anthropic, el impacto estimado se desplomó hasta en un 93%.

Beto
93%.

Alicia
Los datos se aplanaron tanto que las pérdidas de trabajo masivas que los investigadores estaban prediciendo efectivamente desaparecieron en el aire. Hablando matemáticamente, el riesgo cayó a casi cero.

Beto
Eso es salvaje.

Alicia
Casi la mitad de la magnitud publicada del impacto proyectado de la IA en el crecimiento del empleo simplemente desapareció cuando corrigieron por quién estaba realmente en la sala haciendo la encuesta.

Beto
Pero para mí, la parte más loca de este ejercicio de reponderación es lo que pasó con la clasificación de los trabajos que creemos que están más en riesgo.

Alicia
Oh, el cambio en las clasificaciones es fascinante. Si miras los registros de chat brutos y sin corregir, afirman que los trabajos más expuestos a la IA fueron asistencia estadística, actuarios y programadores de computadoras.

Beto
Lo cual tiene sentido, intuitivamente, ¿verdad? Si solo miras los datos brutos, esas son las personas que están generando todos los registros. Son los que le piden a la IA que escriba código, construya modelos financieros y analice datos.

Alicia
Pero espera, así que si yo soy una asistente estadística, la única razón por la que parezco estar en el cuchillo es porque fui la que estaba usando activamente la IA para hacer mi trabajo.

Beto
Sí. Porque después de que corrigieron los datos para reflejar la fuerza laboral real, las clasificaciones se invirtieron por completo. La asistencia estadística se desplomó 340 puestos.

Alicia
Básicamente se salieron del mapa de los trabajos más expuestos.

Beto
Y lo que tomó su lugar en la cima de la lista una vez que se tuvo en cuenta el mundo real ...

Alicia
¿Quieres revelarlo?

Beto
El representante de servicio al cliente subió 145 puestos.

Alicia
Vaya.

Beto
Los empleados de oficina subieron 132 puestos. La cajera se movió a la cima. Los trabajos que creemos que están más expuestos a la IA son en realidad solo trabajos bien pagados y altamente cualificados que casualmente están usando las herramientas intensamente ahora mismo.

Alicia
Correcto.

Beto
Pero la exposición estructural real reside en ocupaciones de servicio de nivel medio masivo que simplemente no están entrando en los chatbots hoy en día.

Alicia
Esto plantea una pregunta importante, sin embargo. ¿Estamos midiendo la capacidad de la IA para realizar tareas? ¿O simplemente estamos midiendo quién tiene el acceso y el privilegio para adoptar la IA ahora mismo?

Beto
Esa es la pregunta de un millón de dólares.

Alicia
Los autores hacen una distinción crucial aquí que tenemos que entender. Los datos brutos de la plataforma miden la aumentación entre usuarios activos. Nos muestran cómo la gente que ya tiene acceso a la herramienta, que está sentada en un escritorio con una computadora, la está usando para aumentar su trabajo diario.

Beto
Correcto. Haciéndose más rápidos.

Alicia
Pero no mide con precisión la sustitución en la fuerza laboral en general.

Beto
Permíteme contradecir eso por un segundo, porque quiero ser el defensor del Diablo aquí.

Alicia
Sí.

Beto
Puedo escuchar a alguien escuchando esto y pensando, "¿no podrían argumentar que si los programadores y actuarios están usando constantemente las herramientas, entonces sus trabajos son realmente los más expuestos?"

Alicia
Okay. Veo a dónde vas.

Beto
Si un desarrollador de software está usando una asistente de codificación de IA 50 veces al día para escribir Python, ¿no están automatizando sus propias tareas? ¿Eso no los pone en el cuchillo?

Alicia
Es una pregunta totalmente justa, y es la trampa exacta en la que caen muchos periodistas, pero confunde la adopción con el reemplazo.

Beto
Okay, explica eso.

Alicia
Piensa en cómo está trabajando ese programador realmente. Solo porque usa una asistente de codificación de IA, no significa que su trabajo esté siendo sustituido. Simplemente podría estar escribiendo código el doble de rápido, lo que le permite asumir proyectos más grandes. La IA es solo una herramienta en su cinturón de herramientas.

Beto
Oh, ya veo.

Alicia
Ahora, compáralo con un representante de servicio al cliente. Piensa en la última vez que llamaste a una aerolínea masiva, o una compañía de telecomunicaciones para disputar un cargo o cambiar un vuelo.

Beto
Oh, normalmente termino gritando al representante por teléfono mientras un agente de voz de IA intenta solucionar problemas con mi router.

Alicia
Exacto. Ya estás interactuando con un sistema de IA. Ese trabajo humano de "back end" está desapareciendo. Departamentos enteros están siendo reemplazados por sistemas de IA corporativa que operan en el "back end".

Beto
Eso es muy cierto.

Alicia
Ese representante de servicio al cliente está altamente expuesto a la sustitución, pero son completamente invisibles en los registros de uso de la plataforma, porque no son los que están activamente solicitando a ChatGPT o Claude. La empresa desplegó la IA para reemplazarlos. El trabajador no la adoptó para aumentar su trabajo.

Beto
Las personas que van a ser reemplazadas no son necesariamente las que están jugando con los chatbots. Eso es cierto. Y eso nos lleva a por qué esto no es solo un debate académico sobre matemáticas de hojas de cálculo o cómo clasificamos trabajos en una publicación de blog.

Alicia
Correcto. Hay apuestas masivas aquí.

Beto
Cuando cometemos este error de medición, hay enormes consecuencias financieras en el mundo real para las personas más vulnerables de nuestra economía.

Alicia
Porque la fuerza laboral visible de la plataforma, las personas cuyos trabajos aparecen en los datos brutos, representan drásticamente a trabajadores con salarios altos y títulos de licenciatura. Los datos están fuertemente sesgados hacia profesionales urbanos y altamente educados que están sentados en escritorios.

Beto
Lo que significa que los algoritmos y los modelos ignoran por completo a todos los demás.

Alicia
Los ignoran por completo.

Beto
Los trabajadores económicamente vulnerables, como los de cuidado personal, preparación de alimentos, logística de mantenimiento de edificios, son prácticamente invisibles en estos datos. Y el artículo señala algo realmente importante aquí.

Alicia
Sí, la demografía de esos grupos.

Beto
Exacto. Estos trabajadores a menudo tienen salarios mucho más bajos, menor seguridad laboral y tasas estadísticamente más altas de discapacidad o grave angustia económica. Son los que menos pueden permitirse un cambio repentino en el mercado laboral.

Alicia
Necesitan una red de seguridad más que nadie.

Beto
Y son exactamente las personas a las que nuestros modelos predictivos son completamente ciegos.

Alicia
Para ilustrar lo peligroso que es este punto ciego en la práctica, Yin y Ogut realizaron una simulación brillante en el artículo.

Beto
Me encantó esta parte.

Alicia
Preguntaron, "¿qué pasaría si un gobierno decidiera lanzar un fondo de recapacitación de 10 mil millones de dólares para ayudar a los trabajadores cuyos trabajos están amenazados por la IA?"

Beto
En la superficie, eso suena como una política fantástica. Pero una red de seguridad de 10 mil millones de dólares para ayudar a la gente a pivotar a nuevas carreras antes de que la automatización los aniquile.

Alicia
Suena genial hasta que miras cómo el gobierno decide quién recibe el dinero. Imagina que los responsables políticos usen los datos brutos de la plataforma de IA para dirigir los fondos.

Beto
Miran los registros de chat.

Alicia
Miran los registros y dicen: "bueno, los datos dicen que los desarrolladores de software y los actuarios son los más expuestos. Así que necesitamos dirigir nuestros recursos de recapacitación allí".

Beto
¿Y qué sucede?

Alicia
La simulación muestra que si un gobierno hiciera eso, desasignaría 3.87 mil millones de dólares.

Beto
3.87 mil millones de dólares.

Alicia
Casi el 39% de todo el fondo se canalizaría directamente a ocupaciones de alto salario y alta educación.

Beto
Así que ¿qué significa todo esto? Significa que casi 4 mil millones de dólares destinados a ayudar a los trabajadores desplazados y vulnerables actuarían efectivamente como un subsidio gubernamental para personas que ya tienen títulos de licenciatura, que ya ganan salarios por encima de la mediana y que probablemente están usando la IA para obtener ascensos.

Alicia
Es completamente al revés.

Beto
Mientras tanto, el trabajador de almacén o el representante de servicio al cliente cuyo trabajo está siendo silenciosamente automatizado en el "back end" no recibe absolutamente nada porque los datos brutos dijeron que no estaban en riesgo.

Alicia
Esa es la verdadera tragedia de equivocarse en las matemáticas. Pero cuando los investigadores aplicaron la regla de reponderación, ...

Beto
... esa corrección matemática.

Alicia
Correcto. Cuando corrigieron matemáticamente los datos para que coincidieran con la fuerza laboral real de EE. UU., esos 3.87 mil millones de dólares se desviaron adecuadamente de los programadores y actuarios.

Beto
Eso es genial.

Alicia
Bajó en la escalera de ingresos hacia los trabajadores de salario medio y bajo que realmente enfrentaron el mayor riesgo de desplazamiento laboral estructural.

Beto
Ves, lees un titular sobre los trabajos más expuestos a la IA. Tienes que darte cuenta de que esos titulares no son solo curiosidades para fiestas de cócteles. La política, la financiación gubernamental, los currículos educativos y los recursos corporativos están siendo dirigidos por esos titulares.

Alicia
Exacto. El dinero real está en juego.

Beto
Si una escuela de comercio comunitario decide renovar todo su programa vocacional basándose en registros de chat brutos, van a preparar a los estudiantes para la realidad equivocada. Ahora mismo, debido a esta trampa de medición, el dinero y la atención se están canalizando hacia las personas que probablemente estarán bien.

Alicia
Si conectamos esto con la imagen más amplia, las clasificaciones políticas construidas a partir del uso seleccionado de la plataforma, nunca deben ser tratadas como clasificaciones del riesgo real de la fuerza laboral. Solo porque un trabajador tiene baja visibilidad en una plataforma de IA no significa que esté a salvo de la IA. Puede significar simplemente que carecen de acceso a las herramientas, o peor aún, que sus tareas específicas ya han sido silenciosamente automatizadas y desplazadas por software empresarial sin que ellos mismos hayan iniciado sesión en un chatbot para dejar un rastro de datos.

Beto
Básicamente estamos mirando un panel que solo nos dice la temperatura del motor de los coches de lujo en la carril rápida mientras el resto de la autopista está completamente sin contar.

Alicia
Esa es una buena manera de decirlo.

Ahora, es importante aclarar que los autores del artículo no están diciendo que deberíamos tirar los registros de chat. Estos datos son increíblemente valiosos para cosas específicas. Nos dan una mirada, en tiempo real, sin precedentes, de cómo los usuarios activos están aplicando la IA a tareas complejas, a una escala que nunca hemos visto antes. Pero tenemos que reconocer lo que realmente representan los datos.

Beto
¿Qué es?

Alicia
Representan una porción altamente seleccionada y privilegiada de la población que son adoptadores tempranos de una nueva tecnología.

Beto
Es el vagón de metro.

Alicia
Es el vagón de metro. Y si quieres entender toda la red de transporte de la ciudad, eventualmente tienes que bajar del tren y mirar las calles. Tenemos que corregir matemáticamente los datos que tenemos, y necesitamos emparejarlos con las encuestas amplias que capturan lo que está sucediendo en fábricas, tiendas minoristas y centros de llamadas. De lo contrario, cualquier estimación que hagamos sobre la exposición macroeconómica a la IA es realmente solo una medición de la composición demográfica de los primeros adoptadores de tecnología.

Beto
Así que para recapitular nuestra inmersión profunda de hoy, los economistas laborales e investigadores están confiando cada vez más en los registros de chat de IA de lugares como Claude y ChatGPT para predecir el futuro del mercado laboral.

Alicia
Lo cual es un gran cambio en cómo lo hacían antes.

Beto
Correcto. Pero aunque esos datos son increíbles para ver lo que los usuarios activos y altamente educados están haciendo con la tecnología para acelerar sus flujos de trabajo, son terribles para predecir el riesgo total de la fuerza laboral.

Alicia
Porque solo miran a los usuarios.

Beto
Porque los datos solo reflejan a los usuarios activos de la plataforma, crean un punto ciego masivo que oculta a los millones de trabajadores de nivel medio y servicio que realmente están en el mayor riesgo de ser sustituidos. Si no corregimos matemáticamente estos datos para que coincidan con la economía real, corremos el riesgo de ignorar por completo a las personas más vulnerables de la fuerza laboral. Y podríamos terminar desasignando miles de millones de dólares en fondos de política y recapacitación a las personas que menos lo necesitan.

Alicia
Las matemáticas son increíblemente claras una vez que levantas el telón. Cuando reponderas los datos para reflejar la realidad, las alarmas para los trabajos de tecnología bien remunerados se calman significativamente. Y la verdadera exposición estructural de cajeros, empleados y representantes de servicio al cliente queda en el foco.

Beto
Queremos dejarles con una última perspectiva para reflexionar sobre su día. Pasamos este tiempo explorando cómo confiar en los registros de chat generados por usuarios sesga completamente nuestro entendimiento sobre el impacto de la IA en el trabajo humano. Pero piensen en cuánto de nuestro mundo moderno está construido sobre datos generados por usuarios que interactúan con plataformas digitales.

Alicia
Oh, vaya.

Beto
Desde aplicaciones de atención médica que rastrean síntomas, hasta software financiero que monitorea los hábitos de gasto, hasta algoritmos de planificación urbana, mapeando el tráfico de la ciudad basado en el GPS del teléfono inteligente. Si nuestra visión completa del impacto futuro de la IA está siendo moldeada exclusivamente por las personas que ya son lo suficientemente privilegiadas para construirla y usarla, ¿qué otros grandes cambios económicos estamos completamente ciegos simplemente porque las personas afectadas no están generando datos para las empresas de tecnología?

Alicia
Es un pensamiento ligeramente aterrador.

Beto
Así que la próxima vez que lean un titular declarando con confianza una nueva tendencia basada en millones de puntos de datos, hagan una pausa y pregúntense, ¿quién hizo realmente la encuesta? ¿Y si son solo las personas que están sentadas en el vagón de metro?