Mostrando entradas con la etiqueta Claude. Mostrar todas las entradas
Mostrando entradas con la etiqueta Claude. Mostrar todas las entradas

martes, 14 de julio de 2026

Exposición ocupacional a la IA

 
 

Este artículo de investigación analiza el error de medición inherente al uso de registros de conversaciones de plataformas de IA para estimar la exposición ocupacional a la IA. Los autores demuestran que estos registros no son representativos de la fuerza laboral en general, ya que ciertas profesiones, particularmente en los campos de la informática y las matemáticas, están significativamente sobrerrepresentadas en comparación con su proporción real de empleo. Dado que las puntuaciones derivadas de la plataforma confunden la aplicabilidad a nivel de tarea con la base de usuarios específica de la plataforma, cambiar la fuente de datos puede alterar drásticamente los resultados del mercado laboral, llegando incluso a invertir el signo de las estimaciones de empleo. Para abordar este problema, el estudio introduce un procedimiento de reponderación de la fuerza laboral que alinea los datos de la plataforma con las proporciones de la Oficina de Estadísticas Laborales, lo que atenúa significativamente las estimaciones de exposición previas. En definitiva, los hallazgos sugieren que, si bien los datos de la plataforma revelan cómo interactúan los usuarios activos con la IA, son menos fiables para predecir la sustitución de empleos o la demanda laboral en toda la economía. Las mediciones basadas en estos registros pueden subestimar sistemáticamente los riesgos en ocupaciones vulnerables donde la visibilidad de la plataforma es baja debido al acceso o la adopción limitados.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Who Uses AI? Platforms, Workforce, and AI Exposure", por Michelle Yin y Burhan Ogut. Publicado el 20 de Mayo de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Bienvenidos a nuestro análisis profundo de hoy. Si quieren saber si la inteligencia artificial va a robarles el trabajo, necesitan buenos datos.

Alicia
Definitivamente necesitan buenos datos.

Beto
Correcto. Pero antes de que lleguemos a los datos que, de hecho, tenemos sobre IA ahora mismo, quiero que empieces imaginando una ciudad enorme y extensa.

Alicia
Bien. La estoy imaginando.

Beto
Imagina que has sido contratada por el alcalde para averiguar cuál es el método de transporte más popular en toda esta metrópolis.

Alicia
Correcto. Necesitas números concretos.

Beto
Exacto. Necesitas números concretos. Así que tomas tu portafolio, sales al campo y pasas un mes encuestando a decenas de miles de personas.

Alicia
Vaya. Bien. Una encuesta grande.

Beto
Una encuesta enorme. Compilas resultados. Haces los cálculos y presentas con orgullo tus hallazgos al consejo municipal. Y les dices que el 95% de la ciudad depende del metro.

Alicia
Y el alcalde probablemente esté encantado.

Beto
Sí. El alcalde está impactado. El presupuesto se reescribe por completo para financiar más trenes. Todos aplauden, pero hay un problema.

Alicia
Normalmente hay uno.

Beto
Hiciste cada una de esas encuestas mientras estabas físicamente dentro de un vagón de metro.

Alicia
Oh, hombre. Quiero decir, es realmente el punto ciego definitivo. Tienes esta montaña de datos.

Beto
Sí. Decenas de miles de puntos de datos.

Alicia
Tal vez millones incluso. Y eso te da una falsa sensación de seguridad. Pero el entorno donde recolectaste esos datos, dictó completamente las respuestas que obtuviste.

Beto
Correcto. No mediste la ciudad en absoluto.

Alicia
Exacto. Solo mediste a las personas que ya habían comprado un boleto.

Beto
Y hoy vamos a explorar cómo ese mismo punto ciego está distorsionando por completo nuestra visión del futuro del trabajo. Quiero decir, todos, desde periodistas hasta responsables políticos y tu propio jefe, están tratando desesperadamente de predecir qué trabajos va a reemplazar, o revolucionar la IA.

Alicia
Es lo único de lo que la gente está hablando ahora mismo.

Beto
Así es. Y para hacer esto, están usando enormes cantidades de registros de chat de plataformas de IA como Claude, ChatGPT y Co-pilot. Pero hay un sesgo oculto masivo en este día.

Alicia
Un gran sesgo.

Beto
Así que estamos desempacando este fascinante artículo de 2026 de Michelle Yen y Berhan Ogut titulado "¿Quién usa la IA? Selección de plataformas y la medición de la exposición ocupacional a la IA". Y nuestra misión hoy es mostrarles cómo mirar los datos de uso de IA podría estar cegándonos a los trabajadores que realmente están en riesgo.

Fixing_AI_Workforce_Data_Biases_1024.png
La Trampa de las Mediciones de IA: ¿Por qué datos de las Plataformas No Representan a la Fuerza Laboral?

Alicia
Tengo que decir que es una llamada de atención masiva para la economía laboral.

Beto
Lo es.

Alicia
Porque para entender por qué este artículo está sacudiendo tanto las cosas, tienen que mirar cómo los investigadores han intentado históricamente predecir la automatización.

Beto
Correcto.

Alicia
Durante mucho tiempo, los economistas básicamente estaban adivinando lo que la IA podría hacer.

Beto
Solo haciendo suposiciones.

Alicia
Prácticamente, sí. Sacaban una base de datos gubernamental de descripciones de puestos de trabajo, miraban las capacidades de los modelos de IA y simplemente hipotetizaban. Decían: "bueno, un paralegal lee documentos y ChatGPT lee documentos. Así que ese trabajo está altamente expuesto".

Beto
Pero recientemente la tendencia ha cambiado por completo, ¿verdad? La investigación se ha cansado de adivinar.

Alicia
Exacto.

Beto
Lo cual tiene sentido. Quiero decir, si yo soy un investigador, no quiero sentarme en una torre de marfil adivinando lo que podría hacer una herramienta. Quiero ver lo que la gente está haciendo realmente con ella en el mundo real.

Alicia
Ese fue el cambio de mentalidad exacto. Ahora, los investigadores quieren ver lo que la IA está haciendo en el terreno. Así que recurren a registros reales de conversaciones anonimadas de Anthropic Claude, ChatGPT de OpenAI y Microsoft Co-pilot.

Beto
Están mirando las indicaciones reales ("prompts").

Alicia
Sí. Toman estos millones de indicaciones diarias y las mapean de nuevo a tareas laborales específicas. Así que si un montón de indicaciones parecen programación en Python, lo mapean a ingeniería de software.

Beto
Correcto.

Alicia
Si las indicaciones parecen pronóstico financiero, lo mapean a analistas financieros. Y a partir de ahí, calculan una puntuación de exposición para diferentes ocupaciones.

Beto
Okay, vamos a desgranar esto por un segundo. Espera, ¿es esto como tratar de averiguar el método de transporte más popular en una ciudad entera, pero solo haces tu encuesta dentro de un vagón de metro?

Alicia
Eso es exactamente lo que es.

Beto
Por supuesto, los datos van a decir que "todo el mundo viaja en tren". Solo estás hablando con las personas que ya están conectadas a la plataforma de IA.

Alicia
Lo fascinante aquí es que esta dinámica crea lo que los economistas llaman "error de medición no clásico".

Beto
No clásico.

Alicia
Sí. Normalmente, cuando los investigadores hablan de "error de medición", se refieren a ruido aleatorio.

Beto
Como un error de tipografía, o algo así.

Alicia
Exacto. Imagina que estás redactando resultados de una encuesta y accidentalmente presionas la tecla equivocada varias veces. Un error aquí, un fallo allá. Es aleatorio. Así que si tu tamaño de muestra es lo suficientemente grande, esos errores aleatorios se cancelan entre sí.

Beto
Y tu promedio final sigue siendo básicamente preciso.

Alicia
Correcto. Eso es "error clásico".

Pero el "error de medición no clásico" significa que el error no es aleatorio en absoluto.

Beto
Es estructural.

Alicia
Sí. El error está sistemáticamente ligado a la misma cosa que están tratando de medir.

Beto
Déjame asegurarme de que lo estoy captando.

Alicia
Sí.

Beto
Es como tratar de averiguar la dieta diaria promedio de los estadounidenses. Pero solo les repartes tu encuesta a personas que salen de una tienda de comestibles veganas de alta gama.

Alicia
Oh, esa es una analogía perfecta.

Beto
El error no es aleatorio. Vas a mirar los datos y declararás con confianza que el 90% de los estadounidenses comen tofu todos los días.

Alicia
Correcto. Porque la ubicación de tu encuesta está inextricablemente ligada al hábito que estás midiendo.

Beto
Porque solo estás preguntando a veganos.

Alicia
Exacto. La puntuación de exposición a la IA derivada de la plataforma está mezclando en secreto dos cosas totalmente diferentes.

Beto
Okay. ¿Qué son?

Alicia
Bueno, está midiendo la tarea real que la IA es capaz de hacer. Sí. Pero simultáneamente está midiendo la composición demográfica de las personas que casualmente tienen el tiempo, el dinero y la inclinación para iniciar sesión en esa plataforma específica.

Beto
Así que el error está fuertemente correlacionado con las mismas ocupaciones que adoptaron la IA temprano.

Alicia
Sí.

Beto
Okay. Entonces, estás diciendo que los datos están sesgados. ¿Qué tan malo es este efecto del vagón de metro en la vida real? ¿Quién está generando realmente todos estos registros de chat que los investigadores están usando para predecir nuestro futuro económico?

Alicia
Es salvaje cuando miras el desglose. Tomemos a los trabajadores en ocupaciones de informática y matemáticas.

Beto
Tales como, desarrolladores de software, científicos de datos, actuarios.

Alicia
Exacto. ¿Te apetece adivinar qué porcentaje de la fuerza laboral total de EE. UU. representan realmente?

Beto
Quiero decir, se sienten en todas partes en línea, pero en el mundo físico real ... No lo sé. Tal vez 5% o 10%.

Alicia
Intenta 3.4%.

Beto
¿En serio? ¿Solo 3.4?

Alicia
Sí. Son una pequeña porción de la torta de empleo general en los Estados Unidos. Pero cuando Yin y Ogut miraron los datos de Anthropics Quad, esos mismos trabajadores de informática y matemáticas generaron el 32.3% de todas las conversaciones de los consumidores en la plataforma.

Beto
Espera. Un grupo que representa poco más del 3% del mundo real está ocupando casi un tercio de los datos de IA.

Alicia
Casi un tercio. Y se sesga aún más cuando miras los datos empresariales.

Beto
¿Quieren decir como las cuentas de nivel empresarial?

Alicia
Sí. Para los canales empresariales de Claude, las ocupaciones de informática y matemáticas representaron un asombroso 51.7% de todas las conversaciones.

Beto
No puede ser.

Alicia
Más de la mitad de todo el conjunto de datos está siendo generado por el 3% de la fuerza laboral.

Beto
Así que si un economista laboral alimenta esos datos empresariales en su modelo predictivo, el modelo va a gritar que el desarrollo de software es el trabajo más expuesto en la Tierra.

Alicia
Porque son la gente más ruidosa en la sala.

Beto
Exacto. ¿Qué hay del otro extremo del espectro? La gente que no está en la sala.

Alicia
Veamos a los trabajadores de preparación y servicio de alimentos. Representan el 8.8% de la fuerza laboral de EE. UU.

Beto
Así que casi tres veces más grandes que el grupo de informática y matemáticas.

Alicia
Correcto. Pero solo generan un 0.7% de las conversaciones.

Beto
Vaya. Eso es prácticamente cero.

Alicia
Lo es. Si comparas la proporción de densidad de conversación con la densidad real de empleo en diferentes grupos laborales importantes, abarca un factor de 72.

Beto
Un factor de 72. La brecha entre la gente que usa las herramientas y la gente que trabaja en la economía real es simplemente masiva.

Alicia
Es un cañón.

Beto
Puedes pensar, bueno, tal vez otras plataformas tengan una base de usuarios más equilibrada. No todos usan Claude. Quizás Copilot o ChatGPT se parezca más al mundo real.

Alicia
Microsoft Copilot, de hecho, tiene una base de usuarios un poco más cercana a la fuerza laboral real, que Claude o ChatGPT.

Beto
Probablemente porque está integrado en el software de oficina estándar, ¿verdad? Como Excel.

Alicia
Probablemente. Sí. Pero incluso entonces, Yin y Ogut encontraron que ninguna plataforma se correlaciona con la Oficina de Estadísticas Laborales. La participación de empleo es mayor que una insignificante 0.33.

Beto
Espera, con una, siendo una coincidencia perfecta.

Alicia
Una siendo una coincidencia perfecta. Cero siendo ninguna coincidencia en absoluto. Las plataformas simplemente no se parecen a la economía real.

Beto
Aquí es donde se pone realmente interesante. Porque Yin y Ogut no se detuvieron solo en señalar la discrepancia demográfica. Decidieron hacer un experimento para ver cuánto perturba estos datos sesgados nuestras predicciones económicas reales.

Alicia
Correcto. Querían ver los efectos secundarios.

Beto
Sí. Montaron un modelo económico estándar. El tipo exacto de investigadores que usan para asesorar a los gobiernos sobre cómo afectará la IA al empleo. Y mantuvieron las matemáticas exactamente iguales. Mantuvieron todos los parámetros exactamente iguales.

Alicia
Lo único que cambiaron fue la fuente de los registros de chat que alimentaban el modelo.

Beto
Exacto. Cambiaron datos de consumidores de Claude, por datos de Claude empresarial.

Alicia
Y ten en cuenta que es el mismo proveedor de IA, el mismo modelo de lenguaje subyacente, la misma rúbrica para mapear tareas a trabajos.

Beto
Correcto. La única diferencia es el nivel de precios. Los datos de consumidores reflejan a usuarios individuales que pagan por una cuenta personal, mientras que los datos empresariales reflejan a empresas que compran asientos para su fuerza laboral.

Alicia
Y cuando hicieron ese cambio, la estimación descendente sobre el empleo no solo cambió ligeramente. De hecho, revirtió su signo.

Beto
Revirtió. Eso es una locura.

Alicia
El modelo alimentado con datos de consumidores concluyó que la exposición a la IA perjudica el empleo, lo que lleva a pérdidas de trabajo. Pero el mismo modelo alimentado con datos empresariales concluyó que la exposición a la IA ayuda al empleo, lo que lleva al crecimiento del empleo.

Beto
En general, solo cambiar la entrada de la plataforma cambió las estimaciones de empleo de ChatGPT por un factor de 1.9.

Alicia
Realmente necesitamos hacer una pausa y pensar en por qué sucede eso, porque expone la falla central en cómo pensamos sobre estos datos.

Beto
Sí.

Alicia
¿Por qué los datos empresariales mostrarían que la IA ayuda al empleo mientras que los datos de consumo muestran que lo está perjudicando? Piensa en cómo se compran y usan realmente estas herramientas en el mundo real.

Beto
Yo asumiría que se reduce básicamente a quién tiene la tarjeta de crédito.

Alicia
Precisamente. Bueno, se trata de la motivación detrás de la compra. Cuando una gran empresa compra miles de licencias empresariales para Co-pilot o Claude, generalmente les está dando esas licencias a sus empleados existentes.

Beto
Para hacerlos más rápidos.

Alicia
Correcto. El objetivo es hacer que su fuerza laboral actual sea más productiva, capaz de manejar un mayor volumen. Ese impulso en la productividad a menudo se correlaciona con el crecimiento de la empresa, lo que puede llevar a más contrataciones. Es aumentación.

Beto
Pero los datos de los consumidores son totalmente diferentes. Si yo fuera un consultor de marketing independiente, o un pequeño empresario, y pago 20 dólares al mes por mi propia cuenta de ChatGPT.

Alicia
¿Qué estás haciendo con ella?

Beto
Podría estar usándola para escribir textos para que no tenga que contratar a un redactor independiente.

Alicia
Exacto.

Beto
La estoy usando para eludir la contratación de ayuda humana por completo. Eso es sustitución.

Alicia
Lo cual nos dice algo increíblemente profundo sobre la investigación en la que confiamos. Si tu predicción macroeconómica completa, si la IA crea o destruye empleos, se invierte por completo basándose en el nivel de precios del chat que estés estudiando.

Beto
Entonces tu métrica no está capturando un hecho universal estable sobre la economía.

Alicia
No, no lo está. Solo está reflejando el marketing de la plataforma, su estrategia de precios y su curva específica de adopción por parte del usuario.

Beto
Los datos que estamos usando para predecir el futuro del trabajo humano son esencialmente solo un "espejo de casa de diversión" que refleja la base de clientes actual de Silicon Valley.

Alicia
Un "espejo de casa de diversión" es la forma perfecta de describirlo.

Beto
Pero Yin y Ogut no solo señalaron el problema y se fueron. De hecho, intentaron arreglar el espejo, lo que nos lleva a la siguiente parte de su investigación.

Alicia
Sí.

Beto
¿Cómo arreglas un conjunto de datos que está tan sesgado estructuralmente?

Alicia
Hicieron lo que llaman "un ejercicio de reponderación de la fuerza laboral".

Beto
Okay. ¿Cómo funciona eso?

Alicia
Bueno, como sabemos que los datos brutos de estas plataformas de IA están sesgados, y sabemos exactamente cómo están sesgados en comparación con los datos de las estadísticas laborales del mundo real, podemos forzar matemáticamente al espejo a reflejar la realidad.

Beto
Oh, ya veo.

Alicia
Ajustaron los datos de la plataforma para que la densidad de ocupación en su modelo coincidiera con la densidad real de la fuerza laboral en los Estados Unidos.

Beto
Básicamente dijeron, "matemáticamente bajemos el volumen de los desarrolladores de software."

Alicia
"... y subamos el volumen de los trabajadores de preparación de alimentos".

Beto
Correcto. Así que la influencia que tienen en el modelo predictivo coincide con su huella real en el mundo real.

Alicia
Sí.

Beto
Y los resultados de hacer eso son simplemente drásticos. Cuando reponderaron los datos, el impacto estimado de la exposición a la IA cayó un 42% para los datos de Microsoft Co-pilot.

Alicia
Y para los datos compuestos de Anthropic, el impacto estimado se desplomó hasta en un 93%.

Beto
93%.

Alicia
Los datos se aplanaron tanto que las pérdidas de trabajo masivas que los investigadores estaban prediciendo efectivamente desaparecieron en el aire. Hablando matemáticamente, el riesgo cayó a casi cero.

Beto
Eso es salvaje.

Alicia
Casi la mitad de la magnitud publicada del impacto proyectado de la IA en el crecimiento del empleo simplemente desapareció cuando corrigieron por quién estaba realmente en la sala haciendo la encuesta.

Beto
Pero para mí, la parte más loca de este ejercicio de reponderación es lo que pasó con la clasificación de los trabajos que creemos que están más en riesgo.

Alicia
Oh, el cambio en las clasificaciones es fascinante. Si miras los registros de chat brutos y sin corregir, afirman que los trabajos más expuestos a la IA fueron asistencia estadística, actuarios y programadores de computadoras.

Beto
Lo cual tiene sentido, intuitivamente, ¿verdad? Si solo miras los datos brutos, esas son las personas que están generando todos los registros. Son los que le piden a la IA que escriba código, construya modelos financieros y analice datos.

Alicia
Pero espera, así que si yo soy una asistente estadística, la única razón por la que parezco estar en el cuchillo es porque fui la que estaba usando activamente la IA para hacer mi trabajo.

Beto
Sí. Porque después de que corrigieron los datos para reflejar la fuerza laboral real, las clasificaciones se invirtieron por completo. La asistencia estadística se desplomó 340 puestos.

Alicia
Básicamente se salieron del mapa de los trabajos más expuestos.

Beto
Y lo que tomó su lugar en la cima de la lista una vez que se tuvo en cuenta el mundo real ...

Alicia
¿Quieres revelarlo?

Beto
El representante de servicio al cliente subió 145 puestos.

Alicia
Vaya.

Beto
Los empleados de oficina subieron 132 puestos. La cajera se movió a la cima. Los trabajos que creemos que están más expuestos a la IA son en realidad solo trabajos bien pagados y altamente cualificados que casualmente están usando las herramientas intensamente ahora mismo.

Alicia
Correcto.

Beto
Pero la exposición estructural real reside en ocupaciones de servicio de nivel medio masivo que simplemente no están entrando en los chatbots hoy en día.

Alicia
Esto plantea una pregunta importante, sin embargo. ¿Estamos midiendo la capacidad de la IA para realizar tareas? ¿O simplemente estamos midiendo quién tiene el acceso y el privilegio para adoptar la IA ahora mismo?

Beto
Esa es la pregunta de un millón de dólares.

Alicia
Los autores hacen una distinción crucial aquí que tenemos que entender. Los datos brutos de la plataforma miden la aumentación entre usuarios activos. Nos muestran cómo la gente que ya tiene acceso a la herramienta, que está sentada en un escritorio con una computadora, la está usando para aumentar su trabajo diario.

Beto
Correcto. Haciéndose más rápidos.

Alicia
Pero no mide con precisión la sustitución en la fuerza laboral en general.

Beto
Permíteme contradecir eso por un segundo, porque quiero ser el defensor del Diablo aquí.

Alicia
Sí.

Beto
Puedo escuchar a alguien escuchando esto y pensando, "¿no podrían argumentar que si los programadores y actuarios están usando constantemente las herramientas, entonces sus trabajos son realmente los más expuestos?"

Alicia
Okay. Veo a dónde vas.

Beto
Si un desarrollador de software está usando una asistente de codificación de IA 50 veces al día para escribir Python, ¿no están automatizando sus propias tareas? ¿Eso no los pone en el cuchillo?

Alicia
Es una pregunta totalmente justa, y es la trampa exacta en la que caen muchos periodistas, pero confunde la adopción con el reemplazo.

Beto
Okay, explica eso.

Alicia
Piensa en cómo está trabajando ese programador realmente. Solo porque usa una asistente de codificación de IA, no significa que su trabajo esté siendo sustituido. Simplemente podría estar escribiendo código el doble de rápido, lo que le permite asumir proyectos más grandes. La IA es solo una herramienta en su cinturón de herramientas.

Beto
Oh, ya veo.

Alicia
Ahora, compáralo con un representante de servicio al cliente. Piensa en la última vez que llamaste a una aerolínea masiva, o una compañía de telecomunicaciones para disputar un cargo o cambiar un vuelo.

Beto
Oh, normalmente termino gritando al representante por teléfono mientras un agente de voz de IA intenta solucionar problemas con mi router.

Alicia
Exacto. Ya estás interactuando con un sistema de IA. Ese trabajo humano de "back end" está desapareciendo. Departamentos enteros están siendo reemplazados por sistemas de IA corporativa que operan en el "back end".

Beto
Eso es muy cierto.

Alicia
Ese representante de servicio al cliente está altamente expuesto a la sustitución, pero son completamente invisibles en los registros de uso de la plataforma, porque no son los que están activamente solicitando a ChatGPT o Claude. La empresa desplegó la IA para reemplazarlos. El trabajador no la adoptó para aumentar su trabajo.

Beto
Las personas que van a ser reemplazadas no son necesariamente las que están jugando con los chatbots. Eso es cierto. Y eso nos lleva a por qué esto no es solo un debate académico sobre matemáticas de hojas de cálculo o cómo clasificamos trabajos en una publicación de blog.

Alicia
Correcto. Hay apuestas masivas aquí.

Beto
Cuando cometemos este error de medición, hay enormes consecuencias financieras en el mundo real para las personas más vulnerables de nuestra economía.

Alicia
Porque la fuerza laboral visible de la plataforma, las personas cuyos trabajos aparecen en los datos brutos, representan drásticamente a trabajadores con salarios altos y títulos de licenciatura. Los datos están fuertemente sesgados hacia profesionales urbanos y altamente educados que están sentados en escritorios.

Beto
Lo que significa que los algoritmos y los modelos ignoran por completo a todos los demás.

Alicia
Los ignoran por completo.

Beto
Los trabajadores económicamente vulnerables, como los de cuidado personal, preparación de alimentos, logística de mantenimiento de edificios, son prácticamente invisibles en estos datos. Y el artículo señala algo realmente importante aquí.

Alicia
Sí, la demografía de esos grupos.

Beto
Exacto. Estos trabajadores a menudo tienen salarios mucho más bajos, menor seguridad laboral y tasas estadísticamente más altas de discapacidad o grave angustia económica. Son los que menos pueden permitirse un cambio repentino en el mercado laboral.

Alicia
Necesitan una red de seguridad más que nadie.

Beto
Y son exactamente las personas a las que nuestros modelos predictivos son completamente ciegos.

Alicia
Para ilustrar lo peligroso que es este punto ciego en la práctica, Yin y Ogut realizaron una simulación brillante en el artículo.

Beto
Me encantó esta parte.

Alicia
Preguntaron, "¿qué pasaría si un gobierno decidiera lanzar un fondo de recapacitación de 10 mil millones de dólares para ayudar a los trabajadores cuyos trabajos están amenazados por la IA?"

Beto
En la superficie, eso suena como una política fantástica. Pero una red de seguridad de 10 mil millones de dólares para ayudar a la gente a pivotar a nuevas carreras antes de que la automatización los aniquile.

Alicia
Suena genial hasta que miras cómo el gobierno decide quién recibe el dinero. Imagina que los responsables políticos usen los datos brutos de la plataforma de IA para dirigir los fondos.

Beto
Miran los registros de chat.

Alicia
Miran los registros y dicen: "bueno, los datos dicen que los desarrolladores de software y los actuarios son los más expuestos. Así que necesitamos dirigir nuestros recursos de recapacitación allí".

Beto
¿Y qué sucede?

Alicia
La simulación muestra que si un gobierno hiciera eso, desasignaría 3.87 mil millones de dólares.

Beto
3.87 mil millones de dólares.

Alicia
Casi el 39% de todo el fondo se canalizaría directamente a ocupaciones de alto salario y alta educación.

Beto
Así que ¿qué significa todo esto? Significa que casi 4 mil millones de dólares destinados a ayudar a los trabajadores desplazados y vulnerables actuarían efectivamente como un subsidio gubernamental para personas que ya tienen títulos de licenciatura, que ya ganan salarios por encima de la mediana y que probablemente están usando la IA para obtener ascensos.

Alicia
Es completamente al revés.

Beto
Mientras tanto, el trabajador de almacén o el representante de servicio al cliente cuyo trabajo está siendo silenciosamente automatizado en el "back end" no recibe absolutamente nada porque los datos brutos dijeron que no estaban en riesgo.

Alicia
Esa es la verdadera tragedia de equivocarse en las matemáticas. Pero cuando los investigadores aplicaron la regla de reponderación, ...

Beto
... esa corrección matemática.

Alicia
Correcto. Cuando corrigieron matemáticamente los datos para que coincidieran con la fuerza laboral real de EE. UU., esos 3.87 mil millones de dólares se desviaron adecuadamente de los programadores y actuarios.

Beto
Eso es genial.

Alicia
Bajó en la escalera de ingresos hacia los trabajadores de salario medio y bajo que realmente enfrentaron el mayor riesgo de desplazamiento laboral estructural.

Beto
Ves, lees un titular sobre los trabajos más expuestos a la IA. Tienes que darte cuenta de que esos titulares no son solo curiosidades para fiestas de cócteles. La política, la financiación gubernamental, los currículos educativos y los recursos corporativos están siendo dirigidos por esos titulares.

Alicia
Exacto. El dinero real está en juego.

Beto
Si una escuela de comercio comunitario decide renovar todo su programa vocacional basándose en registros de chat brutos, van a preparar a los estudiantes para la realidad equivocada. Ahora mismo, debido a esta trampa de medición, el dinero y la atención se están canalizando hacia las personas que probablemente estarán bien.

Alicia
Si conectamos esto con la imagen más amplia, las clasificaciones políticas construidas a partir del uso seleccionado de la plataforma, nunca deben ser tratadas como clasificaciones del riesgo real de la fuerza laboral. Solo porque un trabajador tiene baja visibilidad en una plataforma de IA no significa que esté a salvo de la IA. Puede significar simplemente que carecen de acceso a las herramientas, o peor aún, que sus tareas específicas ya han sido silenciosamente automatizadas y desplazadas por software empresarial sin que ellos mismos hayan iniciado sesión en un chatbot para dejar un rastro de datos.

Beto
Básicamente estamos mirando un panel que solo nos dice la temperatura del motor de los coches de lujo en la carril rápida mientras el resto de la autopista está completamente sin contar.

Alicia
Esa es una buena manera de decirlo.

Ahora, es importante aclarar que los autores del artículo no están diciendo que deberíamos tirar los registros de chat. Estos datos son increíblemente valiosos para cosas específicas. Nos dan una mirada, en tiempo real, sin precedentes, de cómo los usuarios activos están aplicando la IA a tareas complejas, a una escala que nunca hemos visto antes. Pero tenemos que reconocer lo que realmente representan los datos.

Beto
¿Qué es?

Alicia
Representan una porción altamente seleccionada y privilegiada de la población que son adoptadores tempranos de una nueva tecnología.

Beto
Es el vagón de metro.

Alicia
Es el vagón de metro. Y si quieres entender toda la red de transporte de la ciudad, eventualmente tienes que bajar del tren y mirar las calles. Tenemos que corregir matemáticamente los datos que tenemos, y necesitamos emparejarlos con las encuestas amplias que capturan lo que está sucediendo en fábricas, tiendas minoristas y centros de llamadas. De lo contrario, cualquier estimación que hagamos sobre la exposición macroeconómica a la IA es realmente solo una medición de la composición demográfica de los primeros adoptadores de tecnología.

Beto
Así que para recapitular nuestra inmersión profunda de hoy, los economistas laborales e investigadores están confiando cada vez más en los registros de chat de IA de lugares como Claude y ChatGPT para predecir el futuro del mercado laboral.

Alicia
Lo cual es un gran cambio en cómo lo hacían antes.

Beto
Correcto. Pero aunque esos datos son increíbles para ver lo que los usuarios activos y altamente educados están haciendo con la tecnología para acelerar sus flujos de trabajo, son terribles para predecir el riesgo total de la fuerza laboral.

Alicia
Porque solo miran a los usuarios.

Beto
Porque los datos solo reflejan a los usuarios activos de la plataforma, crean un punto ciego masivo que oculta a los millones de trabajadores de nivel medio y servicio que realmente están en el mayor riesgo de ser sustituidos. Si no corregimos matemáticamente estos datos para que coincidan con la economía real, corremos el riesgo de ignorar por completo a las personas más vulnerables de la fuerza laboral. Y podríamos terminar desasignando miles de millones de dólares en fondos de política y recapacitación a las personas que menos lo necesitan.

Alicia
Las matemáticas son increíblemente claras una vez que levantas el telón. Cuando reponderas los datos para reflejar la realidad, las alarmas para los trabajos de tecnología bien remunerados se calman significativamente. Y la verdadera exposición estructural de cajeros, empleados y representantes de servicio al cliente queda en el foco.

Beto
Queremos dejarles con una última perspectiva para reflexionar sobre su día. Pasamos este tiempo explorando cómo confiar en los registros de chat generados por usuarios sesga completamente nuestro entendimiento sobre el impacto de la IA en el trabajo humano. Pero piensen en cuánto de nuestro mundo moderno está construido sobre datos generados por usuarios que interactúan con plataformas digitales.

Alicia
Oh, vaya.

Beto
Desde aplicaciones de atención médica que rastrean síntomas, hasta software financiero que monitorea los hábitos de gasto, hasta algoritmos de planificación urbana, mapeando el tráfico de la ciudad basado en el GPS del teléfono inteligente. Si nuestra visión completa del impacto futuro de la IA está siendo moldeada exclusivamente por las personas que ya son lo suficientemente privilegiadas para construirla y usarla, ¿qué otros grandes cambios económicos estamos completamente ciegos simplemente porque las personas afectadas no están generando datos para las empresas de tecnología?

Alicia
Es un pensamiento ligeramente aterrador.

Beto
Así que la próxima vez que lean un titular declarando con confianza una nueva tendencia basada en millones de puntos de datos, hagan una pausa y pregúntense, ¿quién hizo realmente la encuesta? ¿Y si son solo las personas que están sentadas en el vagón de metro?

martes, 23 de junio de 2026

Resumen de la Encuesta para Desarrolladores de Stack Overflow 2025

 
 

La Encuesta para Desarrolladores de Stack Overflow 2025 ofrece un análisis exhaustivo de la industria del software actual, basado en las opiniones de más de 49 000 participantes de todo el mundo. Un aspecto clave del informe de este año es la rápida integración de la IA, con una gran mayoría de programadores que adoptan herramientas automatizadas a pesar del escepticismo persistente sobre su precisión. Si bien el GPT de OpenAI sigue siendo el modelo de lenguaje a gran escala más utilizado, los datos revelan una creciente preferencia por Claude Sonnet de Anthropic y herramientas especializadas como Cargo y uv. Más allá de la automatización, la encuesta destaca un cambio en la dinámica profesional, con una mayor satisfacción laboral y una dependencia continua de los entornos de trabajo remoto. A pesar del auge de la IA, los desarrolladores siguen visitando Stack Overflow con frecuencia para resolver problemas técnicos complejos y acceder a conocimientos verificados por expertos. En definitiva, el informe ilustra una comunidad que se está preparando para un futuro centrado en la IA, manteniendo al mismo tiempo la cautela respecto a la calidad y la seguridad de las nuevas tecnologías.

Enlace a la fuente de esta encuesta, para aquellos interesados en profundizar en el tema: "Stack Overflow 2025 Developer Survey".

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
El 84% de los desarrolladores de software están usando herramientas de IA en este momento, pero aquí está el secreto. La industria tecnológica realmente no quiere admitir que están empezando a resentirlas activamente.

Beto
Sí, es un cambio radical en el tono.

Alicia
Lo es. Bienvenidos de nuevo a todos. Hoy vamos a sumergirnos en la instantánea definitiva del mundo del desarrollo de software. Estamos hablando de la masiva "encuesta de desarrolladores de Stack Overflow para 2025".

Beto
Que es una montaña de datos. Quiero decir, información de más de 49,000 encuestados.

Alicia
En 177 países. Sí. Y nuestra misión para ustedes hoy es, bueno, cortar el ruido ensordecedor del ciclo de noticias tecnológicas. Queremos descubrir cómo están trabajando realmente los desarrolladores ahora mismo, qué herramientas dependen de verdad y, la cruda realidad de la IA en la base de código moderna.

Beto
Correcto. Superando la exageración.

2025_Developer_Survey_Trends_Infographic_1024.png
Encuesta de Desarrolladores 2025: La Brecha de la Confianza en IA y la Evolución de la Tecnología

Alicia
Exactamente. Bien. Vamos a desgranar esto porque quiero empezar con esa contradicción flagrante en los datos. Como dije, la adopción está en auge. El 84% está usando, o planeando usar IA.

Beto
Lo que es un aumento respecto al 76% del año pasado.

Alicia
Sí. Exacto. Pero el sentimiento positivo ha caído. Ha bajado de más del 70% en los últimos dos años a solo un 60% hoy.

Beto
Vaya.

Alicia
Eso invierte completamente el argumento de venta que hemos estado escuchando de todas estas startups de IA. Es como comprar un aparato de cocina elegante nuevo, ¿saben? Lo usas todos los días, pero secretamente lo resientes porque es un dolor de cabeza tan grande de limpiar.

Beto
Esa es una forma perfecta de verlo.

Alicia
Correcto. Entonces, nuestros desarrolladores están experimentando fatiga por la exageración ("hype fatigue"), ¿o hay una falla fundamental en las herramientas mismas?

Beto
Bueno, lo fascinante aquí es que nos obliga a mirar más allá de las métricas de adopción principales y examinar la fricción diaria. Estamos viendo lo que básicamente podemos llamar "el fenómeno casi correcto".

Alicia
El fenómeno casi correcto.

Beto
Sí. Cuando te sumerges en las frustraciones específicas que los desarrolladores están reportando, el problema número uno, y esto lo citan el 66% de los encuestados. Así que una gran mayoría.

Alicia
Sí. Dos tercios.

Beto
Correcto. El problema es lidiar con soluciones de IA que son casi correctas, pero no del todo.

Alicia
Sí.

Beto
Y quiero decir, en la ingeniería de software, "casi correcto" es significativamente más peligroso que "completamente incorrecto".

Alicia
Oh, absolutamente. Porque si un trozo de código está completamente equivocado, tu compilador lo atrapa de inmediato.

Beto
Exacto. La compilación falla.

Alicia
Sí. La compilación falla. Ves el error de sintaxis y simplemente lo reescribes. Pero una función casi correcta generada por un LLM. Quiero decir, podría compilar perfectamente. Incluso podría pasar tu prueba unitaria básica.

Beto
Pero tiene un error.

Alicia
Exacto. Oculta dentro de ese bloque de código esta sutil falla lógica o como una condición de carrera (*race condition*) o una fuga de memoria silenciosa. Y solo sale a la luz cuando el servidor está bajo una carga pesada a las tres de la mañana, tres semanas después.

Beto
Correcto. Lo fascinante aquí es cómo eso cambia la carga cognitiva del desarrollador. Porque escribir código requiere una mentalidad arquitectónica muy creativa. Mantienes el modelo mental de todo el sistema en tu cabeza.

Pero revisar código, especialmente código generado por una máquina, requiere una mentalidad defensiva y adversarial. Básicamente tienes que hacer ingeniería inversa a la lógica de la IA para encontrar las trampas invisibles.

Alicia
Lo cual suena agotador.

Beto
Lo es. Y esto lleva directamente a la segunda mayor frustración de la encuesta. El 45% de los desarrolladores declaran explícitamente que depurar código generado por IA, en realidad consume más tiempo que escribirlo desde cero.

Alicia
Hombre, lo que realmente significa que la fase de luna de miel ha terminado oficialmente.

Beto
Oh, sí.

Alicia
La industria ha entrado en la fase de la ardua labor (*grind phase*). Ya hemos pasado por el truco coqueto de generar código boilerplate en tres segundos. Ahora los equipos están lidiando con la deuda técnica real de mantener todo ese código autogenerado.

Beto
Sí, el mantenimiento es lo difícil.

Alicia
Exacto. Y si estás escuchando esto ahora mismo y has sentido esa fricción donde usas una herramienta para ahorrar tiempo, pero terminas gastando el doble de tiempo haciendo QA en la salida de la herramienta, esta encuesta prueba que no estás solo. Quiero decir, es un problema completamente sistémico.

Beto
Realmente cambia fundamentalmente toda la conversación en torno a la productividad. Hubo simplemente esta desconexión masiva entre la eficiencia de tareas aisladas y la confiabilidad sistémica real.

Alicia
Correcto.

Beto
Y vemos que esa tensión alcanza su punto máximo cuando se les pregunta a los desarrolladores sobre el uso de IA para trabajos estructurales de alto riesgo.

Alicia
Sí. Los números de evasión allí son asombrosos. Como el 76% de los desarrolladores se niegan absolutamente a usar IA para implementación y monitoreo.

Beto
Correcto.

Alicia
Y el 69% no la usarán para la planificación de proyectos.

Pero aquí está la parte loca, en otra parte de los datos: el 69% de los desarrolladores que usan agentes de IA dicen que esas herramientas sí aumentan su productividad personal.

Beto
Correcto. A nivel individual.

Alicia
Sí. Así que hay esta pared masiva aquí: el desarrollador usará IA para autocompletar una sola función, seguro, pero absolutamente no la dejará tocar la tubería de implementación ("deployment pipeline"). ¿Por qué esa pared es tan impenetrable?

Beto
Bueno, si conectamos esto con la imagen más grande, todo se reduce realmente a la mecánica de la confianza y la rendición de cuentas. Si miramos las métricas de confianza en la encuesta, el 46% de los desarrolladores desconfían activamente de la precisión de las herramientas de IA.

Alicia
Casi la mitad.

Beto
Sí. Y solo un microscópico 3% dicen que confían en ellas plenamente.

Alicia
Un 3%, eso es nada.

Beto
Es básicamente cero.

Y para un software empresarial, la implementación es el acto de alta tensión definitivo, ¿verdad? Estás forzando cambios reales a los usuarios en vivo.

Alicia
Sí.

Beto
Si una IA alucina un script de implementación defectuoso y, tira la base de datos de producción, la IA no es despedida.

Alicia
No, por supuesto que no. El desarrollador humano que está a cargo asume la culpa.

Beto
Exacto. La rendición de cuentas no se transfiere a la máquina. Claro. Los ejecutivos pueden mirar un panel y decir, "Oh, mira, nuestras líneas de código están aumentando".

Alicia
Correcto. Las métricas se ven geniales para el jefe.

Beto
Sí. Pero el contribuyente individual conoce el perfil de riesgo real. Simplemente no pueden permitirse pasar horas demostrando la eficacia de una herramienta de IA cuando las apuestas implican tiempo de inactividad del mundo real. El humano sigue completamente en la cuerda floja.

Alicia
Y los datos de la encuesta realmente refuerzan esa realidad, ¿verdad? Les preguntaron a los desarrolladores qué harían en un futuro hipotético donde la IA pueda manejar la mayor parte de las tareas de codificación.

Beto
Oh, esta fue una gran pregunta.

Alicia
Sí. Y el 75% dijo que seguirán pidiendo ayuda a un humano, específicamente cuando, bueno, no confían en las respuestas de la IA.

Beto
Lo cual es básicamente todo el tiempo para lo complejo.

Alicia
Correcto. Podemos llamar a eso el 'premio humano'. Los desarrolladores humanos están cimentando realmente su papel como los árbitros definitivos de la calidad. No están siendo reemplazados. Se están convirtiendo en la red de seguridad obligatoria, lo que desmiente por completo esta tendencia de codificación "vibe" que ha estado dominando a Twitter de la tecnología últimamente.

Beto
Oh, codificación "vibe".

Alicia
Ya sabes el concepto, ¿verdad? Que puedes simplemente escribir un "prompt" de lenguaje natural vago en un LLM, sentarte, ponerte los pies en alto y dejar que la máquina construya todo un ecosistema de software puramente basado en vibras.

Beto
Sí. Los datos proporcionan una realidad muy clara para esa narrativa completa. El 72% de los desarrolladores no están haciendo ninguna forma de codificación "vibe".

Alicia
Vaya.

Beto
Y mi parte favorita es que otro 5% se esforzaron por marcar una casilla diciendo que rechazan enfáticamente el concepto.

Alicia
"Enfáticamente", encontré que los detalles eran tan brillantes que querían asegurarse de que su rechazo fuera oficialmente documentado. Como, "no, definitivamente no estoy haciendo esto", porque la codificación *vibe* esencialmente está tratando de pintar una obra maestra gritando instrucciones vagas a un pintor con los ojos vendados del cuarto de al lado. Quiero decir, puede sonar genial en una publicación de blog, pero la arquitectura de software profesional requiere precisión. Requiere resultados deterministas y una comprensión estructural profunda.

Beto
Correcto. Y este escepticismo se extiende directamente a los agentes de IA también.

Alicia
Que son la obsesión actual del ciclo de la exageración.

Beto
Totalmente. Los agentes están por todas partes. Esos bots autónomos que supuestamente enlazan tareas para completar objetivos complejos. Pero la verdad de la encuesta es que el 52% de los desarrolladores o no usan agentes de IA en absoluto, o se limitan estrictamente a funciones de autocompletar simples.

Alicia
Así que la mayoría simplemente no los está usando como se comercializan.

Beto
Correcto. Y cuando miramos el impacto en la dinámica del equipo, los agentes fallan espectacularmente. Solo el 17% de los desarrolladores están de acuerdo en que los agentes realmente mejoran la colaboración del equipo.

Alicia
Lo cual es una locura porque la ingeniería de software es fundamentalmente un deporte de equipo. Constantemente fusionas código, revisas solicitudes de extracción ("pull requests"), te alineas en la arquitectura. Los agentes ahora mismo solo están jugando un juego solitario localizado. Quiero decir, pueden ayudar a un desarrollador a escribir un script de bash más rápido, pero no se integran en el tejido colaborativo de un equipo de ingeniería.

Beto
De acuerdo, realmente no lo hacen.

Alicia
Pero bueno, aquí está el punto de datos que subvirtió completamente mis expectativas porque algunos desarrolladores están construyendo y usando agentes. Pero no están usando plataformas de IA futuristas para ejecutarlos. Realmente están recurriendo a infraestructura heredada ("legacy infrastructure").

Beto
Sí. Están confiando en herramientas tradicionales probadas en batalla. Porque mira, la IA introduce tanta imprevisibilidad en la capa de aplicación, ¿verdad? Así que los desarrolladores se dan cuenta de que necesitan certeza absoluta en la capa de infraestructura.

Alicia
Eso tiene mucho sentido.

Beto
Sí. Toma la gestión de memoria y datos de IA, por ejemplo. El 43% de los desarrolladores están reutilizando Redis para esto.

Alicia
Redis es solo un almacén de clave-valor tradicional. Quiero decir, ha estado alrededor de más de una década. Pero si lo piensas, la mecánica de un LLM, un LLM es sin estado ("stateless"). Realmente no recuerda tu conversación de un "prompt" a otro.

Beto
Correcto. Empieza de nuevo cada vez que toma una acción.

Alicia
Así que para construir un agente, necesitas una forma ultrarrápida de inyectar toda esa historia de la conversación, la ventana de contexto, en el modelo cada vez que toma una acción. Y Redis proporciona esa recuperación submilésima perfectamente.

Beto
Exacto. Están adaptando las herramientas en las que ya confían implícitamente. Y vemos exactamente el mismo comportamiento y observabilidad.

Alicia
Oh, monitorear los agentes.

Beto
Correcto. Monitorear estos agentes autónomos para asegurar que no se queden atascados en bucles infinitos o empiecen a alucinar datos defectuosos es crítico. Y para hacer eso, el 43% de los desarrolladores están recurriendo a Grafana y Prometheus.

Alicia
Los pilares absolutos de los "devops".

Beto
Exacto. No están comprando estos paneles de monitoreo nativos de IA experimentales. Están poniendo el motor de IA brillante en un chasis. Saben que, de hecho, no se van a caer sobre la autopista.

Alicia
Porque simplemente no confían en que la IA maneje la lógica sistémica. Así que están apostando por una infraestructura sólida y predecible para proteger sus sistemas, lo que realmente explica el titular "no-IA" más grande de toda la encuesta.

Y aquí es donde se pone realmente interesante. Docker acaba de ver un salto del 17% en el uso este año.

Beto
Lo cual es masivo.

Alicia
Es el mayor aumento anual en cualquier tecnología en general. El 71% de todos los encuestados están usando Docker ahora.

Beto
Sí. Y piensa en por qué. Docker proporciona contenedorización. Asegura que una aplicación se ejecute en exactamente el mismo entorno aislado, sin importar dónde se implemente.

Alicia
Correcto.

Beto
Así que en una era donde la IA podría estar inyectando dependencias completamente impredecibles o escribiendo código altamente variable, encapsular ese código dentro de un contenedor Docker no es solo una buena práctica. Es una maniobra defensiva necesaria. Se mueve básicamente de ser una mejor práctica, a un estándar casi universal.

Alicia
Y estamos viendo un cambio masivo en los lenguajes que impulsan esta infraestructura, como Python salta siete puntos. Ahora está en casi un 58% de adopción. Obviamente, es el lenguaje nativo de los ecosistemas de IA y ciencia de datos.

Pero está arrastrando a otros marcos consigo, como FastAPI vio un salto de cinco puntos. Eso señala un cambio estructural real. Los desarrolladores ya no solo usan Python para el cálculo de datos "offline". Lo están usando para construir APIs de producción de alto rendimiento.

Beto
Todo el ecosistema se está coalesciendo en torno a la utilidad ahora mismo.

Beto
Y vemos que esta dinámica se desarrolla aún más intensamente con lo que podemos llamar el efecto "rust halo".

Alicia
El efecto "rust halo". Me encanta eso.

Beto
Sí. Rust está dominando nuevamente los gráficos de sentimiento como el lenguaje más admirado con el 72% de usuarios simplemente amándolo. Pero la admiración trasciende el lenguaje en sí.

Alicia
Se filtra en las herramientas.

Beto
Exacto.

Alicia
Porque el gestor de paquetes de Rust, Cargo, es la herramienta en la nube más admirada con el 71% y luego está este gestor de paquetes de Python llamado uv, que crucialmente fue construido en Rust. Y uv es la etiqueta de Stack Overflow más admirada en toda la encuesta, alcanzando el 74%.

Beto
Correcto. Porque podemos pensar en Rust casi como una cimentación de hormigón vertido. Promete seguridad de memoria sin la carga de rendimiento de la recolección de basura ("garbage collection"). Si sabes que una casa está construida sobre una cimentación de hormigón vertido en lugar de decir "madera podrida", implícitamente confías en que los pisos no se derrumbarán. Así que cuando los desarrolladores ven una herramienta como uv, que está construida en Rust, la asocian inmediatamente con esa misma solidez de rendimiento y seguridad.

Alicia
Bien. Pero permíteme desafiar esa narrativa por un segundo.

Beto
Bien, adelante.

Alicia
Porque estamos mirando estos picos masivos para Docker, Python, Rust y uv. ¿Son los desarrolladores increíblemente caprichosos? ¿Es la industria básicamente solo de "hipsters" persiguiendo cualquier tecnología que esté de moda en "Hacker News" este mes?

Beto
Esa es una pregunta justa. Pero los datos realmente proporcionan un argumento en contra muy claro a toda esa persecución de tendencias.

Alicia
Una sección de "factores decisivos" ("deal breakers").

Beto
Sí. La encuesta incluye una sección sobre factores decisivos: Las razones específicas por las cuales los desarrolladores rechazarán rotundamente una tecnología y se negarán a adoptarla.

El número uno es la seguridad y las preocupaciones de privacidad.

El número dos es el precio prohibitivo.

Alicia
Así que los principales factores decisivos son básicamente la seguridad y el costo.

Beto
Exacto.

Alicia
Mientras tanto, si eres un gerente que intenta forzar herramientas de IA en la pila de tu equipo, tienes que escuchar esto: La falta de IA, o agentes de IA, se clasificó en último lugar en la lista de factores decisivos.

Beto
Número nueve de nueve.

Alicia
A los desarrolladores no les importa si una herramienta carece de un copiloto de IA, siempre y cuando la herramienta sea segura y asequible. Quiero decir, son implacablemente pragmáticos. Valoran una tecnología que resuelve un problema real de manera confiable, por encima de una tecnología exagerada respaldada por miles de millones en capital de riesgo.

Beto
Y ese pragmatismo realmente moldea cómo está evolucionando la comunidad misma. Porque los datos demográficos muestran una industria que está en constante flujo. El 35% de los desarrolladores que tomaron esta encuesta han estado codificando por menos de 10 años.

Alicia
Eso es más de un tercio de la fuerza laboral.

Beto
Correcto. Y un masivo 69% dedicaron tiempo el año pasado específicamente a aprender nuevas tecnologías de codificación.

Alicia
Porque el terreno está constantemente cambiando debajo de ellos, ¿verdad? La constante necesidad de aprendizaje es literalmente un mecanismo de supervivencia en esta industria.

Pero la división generacional en cómo aprenden es realmente llamativa. Los profesionales experimentados todavía dependen en gran medida de leer documentación técnica escrita.

Beto
Sí. La forma de la vieja escuela.

Alicia
Sí. Pero la generación más nueva, las personas que actualmente están aprendiendo a codificar, el 70% de ellas se están volviendo a YouTube. Están buscando activamente aprendizaje visual, y guiado por la comunidad, en lugar de texto estático.

Beto
Y con respecto a la comunidad, estamos viendo un giro verdaderamente fascinante en cómo funciona Stack Overflow en el flujo de trabajo del desarrollador.

Alicia
Sí.

Beto
Porque recuerda, la narrativa predominante durante el último año era que los "chatbots" de IA harían obsoleto a los foros y sitios de preguntas y respuestas. Como, "¿por qué preguntar a un foro cuando puedes simplemente preguntarle a un LLM?"

Alicia
Pero los datos cuentan exactamente la historia opuesta. Stack Overflow sigue siendo la plataforma comunitaria más utilizada y más admirada. Y el giro aquí es el mecanismo que realmente está impulsando ese tráfico. Aproximadamente el 35% de los desarrolladores dicen que sus visitas al sitio son un resultado directo de problemas relacionados con la IA.

Beto
Lo cual vuelve directamente al problema "casi correcto" con el que abrimos.

Alicia
Exacto. La máquina escribe el código. El código falla silenciosamente. El desarrollador no puede hacer ingeniería inversa a la alucinación. Y por lo tanto, van a Stack Overflow para pedirle a un humano que arregle el error de la IA.

Beto
Correcto. Porque cuando un LLM te da un error lógico sutil, no puedes simplemente pedirle al LLM que verifique su propia lógica.

Alicia
No, solo repetirá con confianza el mismo error.

Beto
O inventará uno completamente nuevo.

Así que los desarrolladores están recurriendo a la plataforma específicamente para obtener conocimiento confiado verificado por humanos. La comunidad se ha convertido esencialmente en el departamento de control de calidad para la inteligencia artificial.

Alicia
El departamento de control de calidad de la IA que ilustra perfectamente la tensión entre la tecnología y la realidad física del trabajo. Y la encuesta nos da un vistazo a esa realidad física también, ¿verdad? Por ejemplo, el papel del arquitecto es ahora el cuarto puesto de trabajo más popular.

Beto
Lo cual tiene sentido.

Alicia
Se siente como una reacción directa a toda la complejidad que hemos estado discutiendo, con la IA generando volúmenes masivos de código y microservicios proliferando por todas partes. Las empresas necesitan desesperadamente arquitectos para que organicen el caos y mantengan la integridad estructural de todo el sistema.

Beto
Sí. Y en medio de todo eso, realmente vemos que la satisfacción laboral está aumentando ligeramente.

Alicia
Oh, ¿en serio?

Beto
Sí. El 24% de los desarrolladores reportan estar felices en el trabajo, lo que es un aumento respecto al 20% el año pasado.

Alicia
OK. Un pequeño repunte.

Beto
Sí. Sugiere una ligera estabilización. Los equipos finalmente están encontrando su lugar y estableciendo algunos límites saludables con estas nuevas herramientas.

Alicia
Y los datos del trabajo remoto nos muestran que el entorno físico es tan localizado como la pila tecnológica. No es un estándar global uniforme en absoluto. El 45% de los desarrolladores estadounidenses están totalmente remotos, pero en Alemania, solo el 21% dice que la elección de dónde trabajan es completamente suya.

Beto
Realmente depende en gran medida de la cultura corporativa regional.

Alicia
Exacto. Entonces, ¿qué significa todo esto?

Si destilas todas las 49,000 respuestas en una única verdad, la narrativa no es absolutamente que la IA vaya a reemplazar al departamento de ingeniería. La verdad es que los desarrolladores se están adaptando a la IA con un pragmatismo altamente localizado.

Beto
Muy pragmático.

Alicia
La están usando para lo fácil, el "boilerplate" ("la plantilla"), el autocompletar.

Pero como no confían en la lógica sistémica de la IA, están bloqueando su infraestructura. Están confiando en herramientas probadas en batalla como Docker, almacenes de memoria como Redis y lenguajes seguros de memoria como Rust para mantener la base estable. Y cuando las cosas inevitablemente fallan, están apoyándose más que nunca en las comunidades humanas para verificar la verdad.

Beto
Sí. Y esto plantea una pregunta realmente crítica. Y es el pensamiento que quiero dejar a todos hoy.

Alicia
Okay, escuchémoslo.

Beto
Estamos adoptando todas estas herramientas de IA bajo la promesa de una velocidad sin precedentes, ¿verdad?

Alicia
Correcto. Esa es la promesa.

Beto
Pero si la IA nos hace más rápidos para escribir el borrador inicial del código, mientras simultáneamente nos obliga a pasar significativamente más tiempo depurando errores silenciosos, haciendo ingeniería inversa, casi escribiendo lógica, y luego buscando activamente a expertos humanos para arreglar los errores de la máquina, ¿estamos realmente ahorrando tiempo? ¿O simplemente hemos cambiado nuestra descripción de trabajo principal de ser los escritores de código, a ser los editores de IA?

Alicia
Oh, vaya. Editores de IA. Quiero decir, la carga cognitiva se mueve de mirar un lienzo en blanco a corregir interminablemente una foto panorámica borrosa, casi correcta.

Beto
Exacto. Ya no eres el autor. Eres el auditor.

Alicia
Y eso es una profesión completamente diferente que requiere un conjunto mental totalmente diferente de herramientas. Esa es una excelente estructura para terminar.

Muchas gracias por acompañarnos en este análisis profundo.

Para quienes nos escuchan, hay una inmensa cantidad de datos en la encuesta de desarrolladores de Stack Overflow de 2025. Y los alentamos encarecidamente a que vayan a explorar los mecanismos y las métricas por ustedes mismos.

Sigan cuestionando la exageración, protejan su infraestructura, y los veremos la próxima vez.

lunes, 8 de junio de 2026

Cuando la IA se construye a sí misma

 
 

Anthropic describe una transición hacia la auto-mejora recursiva, donde la inteligencia artificial gestiona cada vez más su propio ciclo de desarrollo. Los datos indican que la automatización impulsada por la IA ya ha acelerado drásticamente la productividad de la programación y la ejecución de la investigación, igualando o superando con frecuencia las capacidades humanas en tareas especializadas. Si bien esta aceleración tecnológica ofrece enormes beneficios potenciales para la ciencia y la salud, también introduce riesgos significativos en cuanto a la supervisión y el control humanos. La empresa identifica una brecha cada vez menor donde los humanos proporcionan principalmente juicios de alto nivel, aunque incluso esta función podría automatizarse en el futuro. En consecuencia, el texto enfatiza la necesidad urgente de marcos de coordinación y seguridad globales para gestionar un futuro en el que los sistemas de IA podrían diseñar de forma autónoma a sus propios sucesores.

Enlace al artículo, para aquellos que quieran profundizar en el tema: "When AI Builds Itself", por Marina Favaro, Jack Clark y colegas de Anthropic. Publicado en Junio de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
Sabes, es salvaje lo rápido que cambia nuestra línea base de lo que se considera normal.

Beto
Oh, absolutamente. Sucede en un abrir y cerrar de ojos.

Alicia
Correcto. Y quiero que imagines, por un segundo, que eres un ingeniero de software, en una empresa tecnológica de primer nivel. Es a mediados de 2026. Te sientas en tu escritorio. Revisas tu código fusionado del trimestre, y te das cuenta de que acabas de enviar ocho veces más código de lo que hiciste solo hace dos años, en 2024. Ocho veces.

Beto
Es un salto masivo.

Alicia
Correcto. Y aquí está el punto clave. A partir de mayo de 2026, más del 80% del código que se está fusionando en la base de código central de tu empresa, ni siquiera fue escrito por ti. No fue escrito por ningún humano. Fue desarrollado enteramente por una IA.

Beto
Y esa clase de métrica, reencuadra por completo nuestra comprensión de la producción humana.

Alicia
Sí, lo hace.

Beto
Estamos viendo un informe exhaustivo, a mediados de 2026, de Anthropic, y está titulado "Cuando la IA se construye a sí misma". Y estos son datos internos, directamente de la frontera absoluta del desarrollo de IA. Nos está dando una mirada sin precedentes, de cómo la IA está siendo utilizada activamente para construir la próxima generación de IA.

Alicia
Y la misión de nuestro análisis profundo hoy es desgranar esto porque, sabes, esto no es solo una lista de nuevas características tecnológicas geniales, o una actualización incremental de software.

Beto
No, no.

Alicia
Estamos viendo una aceleración fundamental en cómo se fabrica la inteligencia. Nos estamos moviendo hacia un concepto llamado "auto-mejora recursiva". Y necesitamos entender lo que eso significa realmente para ti, para tu trabajo y solo para el futuro de cómo resolvemos problemas complejos.

AI_Self-Improvement_Evolution_Timeline_1024.png
Se Cierra el Ciclo: La Aceleración Hacia la Auto-Mejora de la IA

Beto
Exacto. Y para entender por qué este informe específico de Anthropic es tan crítico, primero necesitamos definir claramente ese término, sabes, "auto-mejora recursiva".

Alicia
Correcto. Porque suena un poco a ciencia ficción.

Beto
Lo hace. Pero esencialmente significa un sistema de IA capaz de diseñar y desarrollar totalmente de forma autónoma su sucesor.

Alicia
Vaya. Una inteligencia construyendo una inteligencia mayor.

Beto
Precisamente. Y históricamente, hemos confiado en estos puntos de referencia públicos para adivinar qué tan cerca estamos de ese punto. Pero los puntos de referencia públicos solo nos muestran lo que un modelo puede hacer en el vacío. Tener estos datos internos directos de un laboratorio de IA, nos da una imagen mucho más clara y, honestamente, mucho más urgente.

Alicia
Es como mirar debajo del capó.

Beto
Exacto. Estamos viendo la mecánica real de lo que sucede cuando diriges estos sistemas altamente capaces hacia adentro.

Alicia
De acuerdo. Desglosemos esto porque para entender cómo llegamos a ese asombroso número de productividad de 8x que mencionamos, realmente tenemos que mirar la línea de tiempo del papel de la IA en su propia creación.

Beto
Correcto.

Alicia
La duración de las tareas que estos modelos pueden ejecutar de forma autónoma simplemente ha explotado. El informe traza esto y es casi cómico lo rápido que se mueve.

Beto
Lo es.

Alicia
Como, de vuelta entre 2021 y 2023, lo que ahora se siente como historia antigua, los humanos escribían código manualmente, simplemente tecleando en portátiles. Luego, de 2023 a 2025, tuvimos chatbots.

Beto
La era de Copilot.

Alicia
Sí. Exacto. Le pedirías un fragmento. Lo copias, lo pegas, y le corriges los errores de sintaxis tú mismo.

Beto
Correcto.

Alicia
Pero luego llega 2025 a 2026 y los agentes de codificación comienzan a escribir archivos completos por su cuenta.

Beto
Y ahora tenemos agentes autónomos que no solo están escribiendo el código. Lo están ejecutando ellos mismos. Lo están probando y están delegando horas de trabajo complejo a otros agentes especializados.

Alicia
Es increíble.

Beto
Y la evidencia externa valida perfectamente este cambio interno. La duración de una tarea y el modelo de IA puede completar de forma confiable por sí solo solía duplicarse cada siete meses.

Alicia
De acuerdo.

Beto
Ahora se está duplicando cada cuatro meses.

Alicia
El salto en esos números es difícil de asimilar. Veamos los modelos reales por un segundo. En marzo de 2024, Claude Opus 3 podía manejar tareas que le tomaban al humano unos cuatro minutos.

Beto
Correcto.

Alicia
Un año después, Sonnet 3.7 podía hacer una hora y media de trabajo continuo.

Beto
Sí.

Alicia
Y luego en marzo de 2026, Claude Opus 4.6 está manejando tareas que le toman 12 horas.

Beto
Es exponencial.

Alicia
Es como si hubiéramos pasado, de tener una calculadora elegante en nuestro escritorio, a contratar una gran empresa de contadores autónomos que trabajan un turno continuo de 12 horas mientras nosotros dormimos.

Beto
Esa es una gran manera de decirlo.

Alicia
Pero espera, tengo que poner objeción aquí.

Beto
Bien, adelante.

Alicia
Cualquiera que haya usado un chatbot sabe que puede confundirse o, simplemente perder completamente el hilo.

¿Son estas tareas de 12 horas realmente dando como resultado un trabajo confiable y utilizable? ¿O es que la IA solo está generando 12 horas de alucinaciones altamente confiadas que algún pobre ingeniero humano tiene que pasar 14 horas en desenredar?

Beto
No, es una pregunta muy justa. Y el miedo a la deuda técnica automatizada es una preocupación muy real en la industria ahora mismo.

Alicia
Correcto.

Beto
Pero los datos muestran que esto realmente no son alucinaciones. El informe apunta a datos de MBTR. Son una organización que realiza puntos de referencia para tareas de IA de larga duración. Y encontraron que Claude Mythos Preview podría funcionar de forma confiable por al menos 16 horas.

Alicia
Espera, 16 horas seguidas.

Beto
Seguidas. Y el mecanismo de cómo evita alucinar durante ese largo tramo es fascinante.

Alicia
¿Cómo lo logra?

Beto
Bueno, en lugar de solo generar un largo flujo de texto, el sistema utiliza un bucle agente.

Alicia
¿Qué quiere decir?

Beto
Lo que significa que pausa, consulta sus propios pasos anteriores. Ejecuta una prueba, lee el mensaje de error y luego ajusta su memoria interna basándose en eso.

Alicia
Oh, wow.

Beto
Sí. Así que se está auto-verificando constantemente en la realidad del código que está escribiendo.

Alicia
Así que revisa su propio trabajo. En lugar de simplemente adivinar ciegamente durante horas seguidas.

Beto
Precisamente. Y la limitación aquí es que 16 horas es solo el límite superior de lo que el benchmark de MIR es capaz de medir actualmente.

Alicia
¿Estás en serio?

Beto
Sí. Los modelos están saturando las pruebas más rápido de lo que podemos inventar nuevas. Vemos lo mismo con el SWE-Bench, que prueba la corrección de errores de software del mundo real.

Alicia
Correcto.

Beto
Y el CORE-Bench, que prueba la reproducción de artículos científicos complejos. Estos sistemas pasaron de obtener puntuaciones de un solo dígito a saturar completamente los puntos de referencia en menos de dos años.

Alicia
Eso es una locura.

Beto
La IA está haciendo el trabajo de verdad.

Alicia
Muy bien. Así que los puntos de referencia externos demuestran que la IA puede mantenerse despierta y concentrada por 16 horas.

Beto
Sí.

Alicia
Pero pasar una prueba estéril en un entorno controlado, es muy diferente de navegar por una base de código corporativa heredada y desordenada.

Beto
Oh, totalmente diferente.

Alicia
Entonces, ¿qué pasa cuando Anthropic obliga al sistema a arreglar su propio motor? Básicamente estamos viendo el fin de la sudoración y la ingeniería.

Beto
Lo estamos viendo.

Alicia
En marzo de 2026, Anthropic retiró a sus equipos de investigación. El empleado promedio estimó que estaban produciendo aproximadamente cuatro veces más resultados usando Mythos Preview de lo que habrían producido sin ellos.

Beto
Y ese multiplicador de riesgo se traduce en algunos logros reales asombrosos, en gran parte debido a cómo la IA retiene la información.

Alicia
¿Qué quieres decir?

Beto
Hay una anécdota específica de abril de 2026 que ilustra esto perfectamente. Claude envió más de 800 correcciones individuales que redujeron una clase específica de errores de API en un factor de 1000.

Alicia
Un factor de 1000.

Beto
Sí. Y el ingeniero humano que supervisaba este proceso estimó que a una persona le tomaría cuatro años hacer ese mismo trabajo.

Alicia
Cuatro años, y Claude lo hizo en ... lo que son como un par de horas.

Beto
Exacto. Y piensa en por qué los errores de API son tan difíciles para los humanos.

Alicia
Correcto.

Beto
Tienes que navegar por una docena de archivos interconectados. Rastreas datos que fluyen a través de diferentes sistemas. Y si te distraes con un correo electrónico, ...

Alicia
... pierdes todo tu hilo de pensamiento.

Beto
Sí. La carga cognitiva es demasiado alta. Pero un modelo de IA puede retener toda la arquitectura en su memoria activa simultáneamente.

Alicia
Y no olvida dónde estaba.

Beto
Correcto. Ve las dependencias ocultas como un mapa, lo que facilita detectar dónde un cambio en un archivo rompe una integración en otro.

Alicia
Y aparentemente la calidad del código aguanta incluso cuando las cosas se vuelven totalmente caóticas.

Beto
Sí.

Alicia
El informe señala que en las tareas abiertas más complejas, aquellas donde incluso el ingeniero humano no está totalmente seguro de cómo debería verse la respuesta final, la tasa de éxito de Claude alcanzó el 76% en mayo de 2026.

Beto
Lo cual es increíblemente alto para ese nivel de ambigüedad.

Alicia
Correcto. Y hubo este incidente donde una actualización rutinaria comenzó a colapsar decenas de miles de trabajos de entrenamiento.

Beto
Oh, escenario de pesadilla total.

Alicia
Exacto. Un ingeniero señaló el incidente en vivo con básicamente solo algo de contexto de texto y acceso a clúster.

Beto
Y aquí es donde el mecanismo de depuración de la IA se vuelve verdaderamente sobrehumano. Un ingeniero humano en pánico, probaría una hipótesis a la vez. Es un proceso lineal.

Alicia
Pero Claude probó sistemáticamente la configuración del entorno, aisló esa bandera de depuración increíblemente oscura que estaba causando el fallo, la reprodujo y confirmó la solución.

Beto
En dos horas.

Alicia
Dos horas. Eso normalmente serían dos o tres días de trabajo humano de pánico.

Beto
Fácilmente.

Alicia
Porque, a diferencia del humano, Claude podía activar instantáneamente micro-entornos paralelos, ejecutar docenas de scripts de depuración al mismo tiempo, y simplemente agregar los resultados en segundos.

Beto
Sí.

Alicia
El informe incluso señala que una revisión automatizada de Claude sobre la base de código histórica de Anthropic habría detectado aproximadamente un tercio de los errores que causaron incidentes pasados.

Beto
Es sistemáticamente mejor encontrando la aguja en el pajar porque puede mirar cada pieza del paja simultáneamente.

Alicia
Pero seguramente esa métrica de líneas de código que hablamos al principio de la inmersión es un poco engañosa.

Beto
¿Cómo es eso?

Alicia
Bueno, si un humano produce código tan rápido, suele ser una pesadilla hinchada de mantener. ¿No se considera históricamente que medir líneas de código es una métrica terrible para la productividad real?

Beto
Sí, absolutamente.

Alicia
Se siente como si solo estuviéramos midiendo qué tan rápido puede teclear la IA, no cuánto valor está creando realmente.

Beto
Lo fascinante aquí es que Anthropic realmente afirma exactamente lo mismo en su informe.

Alicia
Oh, ¿de verdad?

Beto
Sí, admiten que las líneas de código es una medida imperfecta fuertemente sesgada hacia la cantidad, sobre la calidad.

Alicia
OK.

Beto
Pero aquí está el matiz crítico. La calidad ya se ha puesto al día.

Alicia
Lo ha hecho.

Beto
Hay un consenso amplio en Anthropic de que el código escrito por Claude alcanzó la paridad de calidad con el código escrito por humanos a finales de 2025.

Alicia
Vaya.

Beto
Y más importante aún, esperan que el código generado por la IA sea estrictamente mejor que el código humano dentro del año.

Alicia
Así que estamos pasando, de un mundo de creación de código, a una curación de código.

Beto
Exacto.

Alicia
El papel del humano en la ingeniería está cambiando rápidamente, alejándose de escribir cualquier cosa y moviéndose puramente hacia una función de revisión y supervisión.

Beto
Esa es la nueva realidad. Tú curas el resultado. No lo creas.

Alicia
Pero espera, si el IDE está escribiendo código que es estrictamente mejor que el código humano y el humano es solo un revisor, ¿cómo puede un humano revisar código de manera efectiva, si no hiciera la investigación subyacente para entender el problema en primer lugar?

Beto
Ese es un buen punto.

Alicia
Quiero decir, la ingeniería se trata de ejecutar un objetivo conocido. Pero ¿qué pasa con la ciencia real? ¿Está la IA tomando el control de la investigación?

Beto
Aquí es donde comenzamos a ver la verdadera base de la auto-mejora recursiva. El informe detalla cómo Claude realmente ejecuta experimentos.

Alicia
OK.

Beto
Le dan una tarea: "optimizar el código que entrena un pequeño modelo de IA, hacerlo funcionar lo más rápido posible, mientras sigue pasando las comprobaciones de corrección".

Alicia
Parece sencillo.

Beto
Históricamente, un investigador humano altamente cualificado podría lograr una aceleración de 4x en esta tarea en unas cuatro a ocho horas.

Alicia
OK.

Beto
Para abril de 2026, Mythos Preview estaba logrando una aceleración de 52x.

Alicia
52x.

Beto
Sí. En menos de un año, la IA pasó, de ser una asistente útil, a ser completamente sobrehumana y ejecutar un bucle experimental.

Alicia
Una aceleración de 52x. Eso es honestamente, es difícil de procesar.

Beto
Lo es.

Alicia
Y no solo está optimizando código existente. Ejecutaron este experimento de investigación de seguridad increíblemente complejo y abierto para ver si un modelo débil podría supervisar a uno fuerte.

Beto
Correcto.

Alicia
Durante el transcurso de 800 horas y unos $18,000 en costos de cómputo, estos agentes de Claude diseñaron los experimentos ellos mismos.

Beto
Piensa en esa escala.

Alicia
Pero ¿cómo no se quedaría atascada en un bucle de probar la misma idea fallida durante 800 horas?

Beto
Se reduce a la memoria jerárquica y a las transferencias de agentes.

Alicia
OK, ¿qué significa eso?

Beto
El sistema utiliza principalmente un agente gestor que tiene el objetivo de investigación general. Este gestor delega tareas específicas de codificación, o prueba, a agentes trabajadores.

Alicia
Como un laboratorio real.

Beto
Exacto. Y cuando un agente trabajador llega a un callejón sin salida, escribe un resumen de lo que falló y se lo pasa de vuelta al gestor.

Alicia
Oh, eso es inteligente.

Beto
El gestor luego actualiza el cuaderno global. Así que durante 800 horas, no solo están probando cosas aleatorias. Están explorando sistemáticamente un espacio de hipótesis, probando ideas, compartiendo hallazgos con otros agentes, e iterando.

Alicia
Y los resultados realmente hablan por sí mismos. Los agentes terminaron recuperando el 97% de la brecha de rendimiento en esta tarea.

Beto
Sí.

Alicia
Cuando dos investigadores humanos probaron exactamente lo mismo durante una semana, solo recuperaron el 23%.

Beto
La métrica más reveladora aquí, sin embargo, podría ser lo que el informe llama "gusto por la investigación".

Alicia
Gustos de investigación.

Beto
Sí. Cuando estás haciendo investigación novedosa, las cosas salen mal. Te caes en un agujero de conejo. Miraron sesiones donde los investigadores humanos se desviaron del camino. Y probaron si una IA podía elegir un siguiente paso mejor para poner la investigación de nuevo en marcha.

Alicia
OK, así que desarrollar gustos por la investigación es como navegar por un laberinto masivo.

Beto
Sí.

Alicia
En 2025, la IA solo se estaba topando al azar con paredes. Pero para 2026, es como si la IA hubiera desarrollado una brújula interna, reconociendo los patrones sutiles de un callejón sin salida antes de que siquiera camine por el pasillo.

Beto
Esa es una forma perfecta de visualizarlo. A finales de 2025, la IA eligió el mejor camino, el 51% de las veces, básicamente un lanzamiento de moneda.

Alicia
Correcto.

Beto
Para abril de 2026, Mythos Preview superó la elección humana el 64% de las veces.

Alicia
Vaya.

Beto
La IA está desarrollando un juicio real.

Alicia
Es como si estuviéramos haciendo la transición a ser ejecutivos de cine.

Beto
Ejecutivos de cine.

Alicia
Sí. Ya no operas la cámara. No ajustas la iluminación. Ni siquiera escribes el guión. Solo estás sentado en una gran silla, iluminando los proyectos con luz verde.

Beto
Esa es una analogía muy buena.

Alicia
Pero sigo pensando en el costo cultural que esto implica. Piensa en tu propio lugar de trabajo. Piensa en la última vez que ayudaste a un compañero a salir de un aprieto. Pasas horas desenredando un desorden juntos. Le debes un café. Construyes confianza.

Beto
El elemento humano.

Alicia
Exacto. El informe llama a esto "la economía de los regalos". ¿Qué pasa con la cultura de tu empresa cuando esa fricción se elimina por completo?

Beto
Desaparece.

Alicia
Hay una cita de un empleado que simplemente sudaba pavor existencial. Dijeron que cuando la IA funciona perfectamente, se sienten totalmente innecesarios.

Beto
Sí.

Alicia
Y cuando las cosas se rompen, se dan cuenta de que han perdido completamente el contexto para siquiera saber cómo arreglarlas.

Beto
Es un cambio psicológico profundo. Los humanos ahora están aferrándose a la idea de que nuestra ventaja comparativa es ver el panorama general.

Alicia
Correcto. Esos eran los visionarios.

Beto
Exacto. Nos decimos a nosotros mismos que la IA puede manejar los detalles, pero tenemos la visión general. Pero lo que muestran los datos sobre gustos por la investigación es que la brecha en el pensamiento de panorama general se está cerrando rápidamente.

Alicia
Eso es aterrador.

Beto
A medida que las ventanas de contexto y el razonamiento de la IA crecen, su imagen también se hace más grande.

Alicia
Lo que nos obliga a preguntarnos a dónde conduce esto realmente. Con los humanos siendo empujados cada vez más arriba en la cadena de abstracción, de la codificación a la investigación, a simplemente dar direcciones, ¿cuál es el objetivo final?

Beto
Bueno, Anthropic esboza tres futuros posibles para el trabajo y la sociedad.

Alicia
OK, veamos el escenario uno, la curva S. Esta es la idea de que las tendencias se estancan y las capacidades de la IA se estancan.

Beto
Sí. Y el mecanismo para un estancamiento podría ser físico o arquitectónico. Podríamos simplemente quedarnos sin energía para alimentar estos centros de datos o podríamos chocar contra los límites de la arquitectura transformer en sí misma.

Alicia
Espera, ¿qué hace que la arquitectura transformer sea un límite?

Beto
Bueno, el transformer es la estructura subyacente de los modelos de lenguaje actuales.

Alicia
Correcto.

Beto
Pero tiene algo llamado "límite de escalado cuadrático". A medida que aumentas la cantidad de contexto, como el tamaño de la base de código o la longitud de la tarea, la potencia computacional requerida para procesarlo no solo se duplica. Se cuadruplica.

Alicia
Oh, vaya.

Beto
Eventualmente, la memoria del modelo se degrada y simplemente cuesta demasiada computación mantener el contexto. Así que el desarrollo podría chocar contra un muro.

Alicia
Pero incluso si choca contra un muro hoy, el impacto ya es asombroso.

Beto
Absolutamente.

Alicia
El informe menciona Project Glasswing usando el modelo Mythos Preview actual, que encontró más de 10,000 vulnerabilidades de software críticas en los sistemas más importantes del mundo en solo semanas. Piensa en eso. Incluso si la IA nunca se vuelve más inteligente de lo que es a mediados de 2026, el cuello de botella ya se ha desplazado de encontrar problemas a parcharlos.

Beto
Cierto. Pero Anthropic considera que ese primer escenario es poco probable.

Alicia
OK.

Beto
El escenario dos es "la eficiencia compuesta". En este mundo, el desarrollo de la IA se vuelve en su mayor parte automatizado y los humanos existen solo para dar dirección.

Alicia
Así que son equipos supercargados.

Beto
Exacto. Las implicaciones para la economía en general son masivas. Una empresa de 100 personas podría operar con la producción de una organización de 10,000 personas porque cada empleado se sienta en la cima de una pirámide de agentes autónomos.

Alicia
Y luego está el escenario tres, "la auto-mejora recursiva completa".

Beto
Este es el punto más grande.

Alicia
Es el mundo donde la IA diseña totalmente sus propios sucesores. El ritmo del avance ya no está determinado por el pensamiento humano. Está determinado enteramente por cuánta potencia computacional tengas. Los humanos son movidos totalmente a la supervisión y la validación. Los humanos podrían conducir a esas máquinas de gracia amorosa, grandes avances en ciencia y medicina, o podría conducir a una pérdida total de control si los protocolos de alineación de seguridad fallan.

Beto
Esto plantea una pregunta importante sobre los límites de la aceleración en los escenarios dos y tres.

Alicia
OK.

Beto
Tenemos que mirar a la ley de Amdahl. Es un concepto de la informática, pero se aplica perfectamente a las organizaciones humanas que enfrentan una automatización rápida.

Alicia
¿Qué es?

Beto
La ley de Amdahl establece que acelerar una parte de un proceso solo mueve el cuello de botella a otro lugar.

Alicia
OK. Tiene sentido.

Beto
Si una IA puede generar 10,000 líneas de código perfecto en un minuto, pero un humano todavía tiene que revisarlo para asegurarse de que las líneas cumplan con los objetivos de la empresa, ...

Alicia
Entonces la revisión humana se convierte en el límite de velocidad definitivo.

Beto
Exacto. No has hecho todo el sistema exponencialmente más rápido. Solo has atascado otra parte de la tubería.

Alicia
Me encanta ese concepto. Es como ensanchar una autopista a 10 carriles solo para crear un atasco de tráfico absolutamente épico porque dejaste una sola rampa de salida en el extremo.

Beto
Esa es una analogía perfecta.

Alicia
Y piensa en tu propio trabajo por un segundo. Si tuvieras un ejército de agentes haciendo toda tu ejecución, redactando todos tus correos electrónicos, escribiendo todos tus informes, analizando todos tus datos, ¿qué nuevo cuello de botella te convertirías?

Beto
Correcto.

Alicia
¿Tendrías siquiera la capacidad cognitiva para revisar y aprobar todo ese resultado?

Beto
Casi seguro que no, por lo que en el escenario tres, donde el laboratorio está literalmente funcionando a la velocidad de cómputo, la fricción entre la velocidad de la IA y el procesamiento humano, se convierte en un problema social crítico. Si ocurre la auto-mejora recursiva, la IA avanza más rápido de lo que los humanos pueden verificar su seguridad o utilidad. ¿Cómo navegamos de forma segura esta colisión?

Alicia
Bueno, la solución propuesta por Anthropic es una desaceleración o pausa coordinada y verificable a nivel global para el desarrollo de la IA.

Beto
Básicamente, frenar, para que la sociedad puede alcanzar a la tecnología.

Alicia
Pero son muy claros, en que una pausa unilateral, donde solo una empresa decida detenerse por la bondad de su corazón, no funciona. Si Anthropic pausa, solo cambia quién está a la cabeza.

Beto
Requiere un tratado coordinado, muy parecido a los tratados de armas nucleares del siglo XX.

Alicia
Pero verificar una pausa de la IA, es significativamente más difícil que contar silos nucleares, ¿cierto?

Beto
Oh, absolutamente. El entrenamiento para los modelos de IA simplemente utiliza enormes cantidades de potencia informática, que es de propósito general.

Alicia
Correcto.

Beto
Un centro de datos entrenando superinteligencia, se ve exactamente igual desde fuera que un centro de datos renderizando una película blockbuster, o gestionando la logística global.

Alicia
Eso es salvaje.

Beto
Las entradas son fáciles de ocultar, y el incentivo para desertar en secreto es enorme, porque el primero en lograr la auto-mejora recursiva, básicamente se lleva todo.

Alicia
Anthropic dice que están organizando conversaciones en los próximos meses con responsables políticos, sociedad civil y otros laboratorios de IA, para intentar construir estos sistemas de verificación, antes de que sea demasiado tarde.

Beto
Es una tarea grande.

Alicia
Pero aquí es donde se pone realmente interesante, porque la tensión central de esta inmersión profunda no es solo sobre tratados internacionales, o el seguimiento de la potencia informática. Se trata del ritmo de tu vida diaria, que finalmente choca de frente con un laboratorio de IA funcionando a la velocidad de la luz.

Beto
Estamos mirando un futuro cercano donde el "99% de la sudoración que hace la genialidad" como dijo Thomas Edison, está totalmente automatizada. La lucha del descubrimiento, las largas noches en el laboratorio ejecutando experimentos fallidos, los dolores de probar y error, todo podría ser subcontratado a agentes de auto-mejora recursiva.

Alicia
Y eso nos deja con la profunda pregunta que masticar mientras cerramos hoy. Si la auto-mejora recursiva realmente funciona, si inevitablemente resuelve nuestros desafíos científicos, médicos y de ingeniería sin que tengamos que levantar un dedo, ¿cómo encontrarán los seres humanos significado en su autoestima?

Gran parte de la experiencia humana está definida por la lucha por comprender el mundo y construir cosas para mejorarlo.

Beto
Así es, realmente.

Alicia
Si ya no somos los constructores, si ese ingeniero de software 8x de repente es solo un espectador viendo cómo el código vuela, ¿en quién nos convertiremos?