Mostrando entradas con la etiqueta modelos. Mostrar todas las entradas
Mostrando entradas con la etiqueta modelos. Mostrar todas las entradas

jueves, 24 de septiembre de 2026

Comprensión multirrelacional del arte

Este texto presenta CANVAS, un marco de IA especializado diseñado para mejorar la interpretación que los modelos de aprendizaje automático hacen de la compleja naturaleza multicapa de las bellas artes. Los modelos tradicionales de visión y lenguaje suelen fallar porque intentan comprimir cada aspecto de una pintura —como su contexto histórico, estilo e intención del artista— en una única representación matemática rígida. Para solucionar esto, los investigadores utilizaron la teoría de haces celulares para crear un sistema que proyecta una obra de arte en diferentes "subespacios" según la perspectiva específica que se analice. Los autores también presentan tres nuevos conjuntos de datos de referencia —HertzianaDP, WikiArt+ y SemArt+— para evaluar la capacidad de estos modelos para manejar diversas relaciones histórico-artísticas. Los resultados experimentales demuestran que CANVAS supera significativamente a los modelos de referencia existentes en tareas como la recuperación y clasificación multimodal. En definitiva, este trabajo sugiere que la comprensión del arte requiere un enfoque multirrelacional que pueda adaptarse a diferentes perspectivas interpretativas sin necesidad de un grafo de conocimiento predefinido durante su uso práctico.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations". Por Ludovica Schaerf y colegas. Publicado el 15 de Julio de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Así que, si le muestras a una inteligencia artificial una imagen de un perro, dice "perro". Y quiero decir, es increíblemente segura al respecto. Dibuja una pequeña caja delimitadora alrededor del golden retriever. Te da una puntuación de probabilidad del 99%. Y sabes, todos simplemente seguimos adelante.

Alicia
Correcto. Sí. Trabajo hecho.

Beto
Exacto. Pero ¿qué pasa cuando le muestras a esa misma IA, una obra maestra del arte moderno? ¿Puede una computadora realmente comprender los matices, la historia y la emoción? ¿O solo ve, no sé, una disposición estadística de píxeles en una pantalla?

Alicia
Bueno, realmente expone una limitación fundamental en cómo se han construido históricamente estos sistemas. Quiero decir, los hemos entrenado para ser máquinas de categorización.

Están constantemente buscando la etiqueta única, más obvia para poner en un punto de datos. Pero el arte, por su propia naturaleza, se niega a ser categorizado tan simplemente. Una pintura nunca es solo una cosa.

Beto
Sí. Lo que nos lleva a hoy. Bienvenidos a esta inmersión profunda a medida, a todos. Hoy estamos viendo un artículo de investigación muy fascinante que introduce un modelo llamado CANVAS, que significa "Contrastive Art-aware Network for Vision-Language Alignment with Sheaves", permítanme acertar: "Arte contrastivo, red consciente para visión, lenguaje y alineación con las obras".

Alicia
Acertado.

Beto
Gracias. Y el objetivo de esta inmersión profunda es explorar cómo los científicos de la computación están rompiendo activamente este molde de respuesta única de la IA. Están enseñando a las máquinas a analizar información compleja y estratificada exactamente como lo haría un experto humano. Y están empezando por la historia del arte. Pero, esta tecnología tiene implicaciones masivas en cómo interactúas con la información todos los días.

Alicia
Realmente lo tiene. Es un cambio enorme.

CANVAS_Multimodal_Learning_Model_Diagram_1024.png
Arte más allá de la semántica: Aprendizaje multimodal multi-relacional con CANVAS

Beto
De acuerdo. Desglosemos esto. Porque antes de que podamos hablar de cómo CANVAS realmente resuelve este problema, necesitamos mirar por qué las arquitecturas de IA actuales son esencialmente ciegas a la verdadera naturaleza del arte.

Alicia
Sí. Y se reduce a un cuello de botella estructural llamado "alineación homogénea".

Beto
Alineación homogénea. De acuerdo.

Alicia
Correcto. Entonces, los modelos estándar de visión y lenguaje, o VLMs ... (piensa en sistemas como los modelos CLIP, que impulsan una gran parte de las herramientas de imagen de IA que probablemente usas) ... están entrenados con conjuntos de datos masivos de pares de imágenes y texto extraídos de internet abierto.

Beto
Como el conjunto de datos LAION-2B, ¿correcto?

Alicia
Exacto. Conjuntos de datos enormes. Y todo el objetivo de ese proceso de entrenamiento es encontrar una única relación universal y fija entre una imagen y una cadena de palabras. Es completamente binario.

Beto
Así que este texto específico coincide con esta imagen específica. Y todo lo demás en toda la base de datos es una falta de coincidencia.

Alicia
Lo cual funciona maravillosamente si solo estás tratando de identificar una foto de una taza de café, o un perro.

Pero los investigadores en este artículo presentan un ejemplo específico que ilustra perfectamente por qué este enfoque binario simplemente falla con datos complejos.

Beto
Correcto. La pintura de Matisse.

matisse_papiers_decoupes.png
Henri Matisse: Les papiers découpés ("La gerbe", "The Sheaf")

Alicia
Correcto.

Beto
Sí. La pintura de Henri Matisse es de 1953, "La gerbe", que se traduce "la yerba". Visualmente, si solo estás mirando la superficie, es básicamente una colección de formas abstractas de hojas de colores brillantes, sabes, azules, verdes, naranjas, negros, simplemente dispuestas contra un fondo blanco liso.

Alicia
Sí.

Beto
Si le preguntas a una IA estándar qué es, por defecto se inclina por la traducción más literal y podría simplemente producir como "hojas coloridas". Se pierde por completo el punto de la imagen.

Alicia
Porque un historiador del arte humano no solo ve hojas de colores. Aplican múltiples modos de comprensión distintos a esa única imagen simultáneamente.

Beto
Oh, absolutamente.

Alicia
Primero, tienes el contexto histórico. Esta pieza específica representa un cambio de posguerra en el movimiento fauvista. Luego tienes la interpretación estilística. Está profundamente ligada al expresionismo abstracto, que se caracteriza por este acto espontáneo de creación. Pero también se conecta profundamente con las raíces tempranas de Matisse, con su uso intenso y no naturalista del color.

Beto
Y luego, añades el análisis conceptual encima de eso. Como, ¿qué está tratando de lograr Matisse en el lienzo? Está explorando la ambigüedad espacial. Hay este conflicto visual deliberado sucediendo en la pintura entre la ilusión de profundidad porque estas formas de hojas se superponen.

Alicia
Correcto. Jugando con el espacio.

Beto
Exacto. Superponiéndose entre sí y el reconocimiento crudo de la planitud absoluta del lienzo en sí. Todas estas interpretaciones, las históricas, las estilísticas, las conceptuales, son completamente válidas. Todas son ciertas al mismo tiempo.

Alicia
Pero bajo el capó de una IA estándar, la arquitectura físicamente no puede manejar esas múltiples verdades coexistentes.

Beto
Simplemente se rompe.

Alicia
Básicamente, sí. Si intenta aprender todas estas interpretaciones válidas, pero totalmente diferentes a partir de diversos textos, literalmente no tiene dónde almacenarlas como ideas distintas. Toda esa riqueza, toda esa estructura multi-relacional se colapsa en un promedio turbio y único.

Beto
Un promedio turbio.

Alicia
Correcto. El espacio de incrustación, que es la representación matemática de la imagen dentro del cerebro de la computadora, sufre de un colapso semántico único. Se convierte en una borrosidad comprometida que no representa con precisión el estilo, ni la historia, ni el concepto.

Beto
Vaya. Me hace pensar en algo como aplanar un archivo CAD de alta complejidad y alta dimensión en solo una imagen JPEG 2D básica.

Alicia
Oh, esa es una forma muy buena de pensarlo.

Beto
Correcto. Porque en el archivo original, puedes rotar el objeto, puedes hacer zoom, puedes mirar la estructura arquitectónica desde arriba, desde el lado, desde abajo. Pero en el momento en que lo comprimes en un JPEG, lo estás forzando a una única perspectiva estática.

Alicia
Sí.

Beto
Pierdes por completo la capacidad de verlo desde cualquier otro ángulo. Los datos podrían seguir técnicamente ahí en los píxeles, pero el matiz estructural simplemente desaparece.

Alicia
Esa es una analogía excelente para la alineación homogénea. Pierdes la dimensionalidad. Puesto que la arquitectura estándar de VLM fundamentalmente no puede manejar múltiples perspectivas del mismo objeto, los investigadores detrás de CANVAS se dieron cuenta de que no podían simplemente aplicar una actualización de software al modelo CLIP existente.

Beto
Tenían que empezar de nuevo.

Alicia
Exacto. Tuvieron que recurrir a matemáticas avanzadas para construir un marco completamente nuevo desde cero.

Beto
Enonces, si un único espacio matemático es el enemigo del matiz, ¿cómo construyes un espacio que realmente se doble y se adapte a lo que estás buscando?

Alicia
Bueno, proyectas la obra de arte en múltiples incrustaciones diferentes, condicionadas totalmente por el tipo de relación que quieres explorar.

Beto
Condicionadas por la relación.

Alicia
Correcto.

Así que si le preguntas al modelo sobre el contexto histórico, proyecta los datos de una manera. Si preguntas por el estilo artístico, lo proyecta de una manera totalmente diferente. Y lo fascinante aquí es el concepto matemático específico que utilizan para lograr esto. Se llama "teoría de la vaina celular" ("Sheaf Cellular Theory").

Beto
De acuerdo. Teoría de la vaina celular. Eso suena como algo que necesitas un doctorado en matemáticas puras, incluso para cifrar.

Alicia
Bueno, es un concepto denso, no voy a mentir. Pero en esencia, es solo una forma de modelar datos en un grafo que captura tanto los detalles locales como las estructuras globales.

En CANVAS, el modelo funciona como un grafo bipartito.

Beto
Un grafo bipartito. Así que imagina las obras de arte, como las imágenes crudas como un conjunto de nodos en, digamos, el lado izquierdo de una pizarra blanca.

Alicia
De acuerdo. Sí.

Beto
Y las descripciones de texto son otro conjunto de nodos en el lado derecho de la pizarra blanca.

Alicia
Perfecto.

Beto
Lo que significa que las aristas, las líneas que conectan el lado izquierdo con el derecho, representan las relaciones semánticas específicas, como autor o estilo o contexto histórico.

Alicia
Tienes la estructura exactamente correcta. Ahora en una red neuronal de grafos estándar, los datos simplemente fluyen de un lado a otro a través de esas líneas entre los nodos. Pero en una vaina celular, introduces estos elementos llamados "espacios vectoriales", o "stocks".

Beto
Stocks.

Alicia
Correcto. Stocks que están adjuntos tanto a los nodos como a las aristas. Y el trabajo pesado lo hacen algo llamado "mapas de restricción".

Beto
Mapas de restricción. De acuerdo. Estoy siguiendo.

Alicia
Estos mapas, codifican cómo la información en un nodo se relaciona con la información en la arista específica.

Así que no es solo un puente simple que mueve datos del punto A al punto B. Es un filtro activo que transforma los datos a medida que se mueven.

Beto
Transformando los datos. El artículo señala que implementan este mecanismo usando "modulación lineal basada en características" o "feature-wise linear modulation".

Y si estoy entendiendo correctamente los mapas de restricción, imagina la modulación como un par literal de gafas de sol polarizadas, que la IA se pone.

Alicia
Me gusta eso.

Beto
Correcto. Así que cuando la arista está etiquetada como estilo, la IA se pone sus gafas de sol de estilo. Las lentes filtran activamente el tema literal. Así que solo dejan pasar los trazos de pincel, las paletas de colores y la composición a los ojos de la IA.

Escala las características relevantes para el estilo y desplaza el contexto de manera efectiva, deformando su propio espacio matemático. Así que la imagen puede compararse con precisión con este texto estilístico.

Alicia
Eso es exactamente eso. Crea un subespacio consciente de la relación. La misma incrustación de imagen es transformada matemáticamente de una manera completamente diferente, si la arista está etiquetada como contexto histórico.

Beto
Oh, vaya.

Alicia
Sí. El modelo deforma localmente su propio espacio de incrustación por cada tipo de relación, lo que le permite evaluar la misma imagen desde perspectivas totalmente distintas.

Beto
Espera, tengo que hacer una objeción aquí por un segundo porque mirando la mecánica de esto, suena increíblemente computacionalmente pesado.

Alicia
Oh, seguro.

Beto
Quiero decir, si esta IA está construyendo una red interconectada masiva de relaciones para cada pintura, como conectando esta de Matisse con esa de Picasso a través de un estilo compartido y esa de Picasso con una de Hemingway, cita, a través del contexto histórico, ¿no es eso totalmente inútil para una persona normal fuera de un laboratorio?

Alicia
¿Qué quieres decir?

Beto
Bueno, ¿no necesita acceso a esta estructura de grafo precalculada cada vez que le muestras una pintura nueva y no vista en el tiempo de prueba?

Alicia
Ah, okay. Sí, ese es históricamente el problema exacto con los enfoques de IA basados en grafos. A menudo operan en lo que llamamos "un entorno transductivo".

Beto
Transductivo.

Alicia
Correcto. Eso básicamente significa que solo pueden hacer predicciones precisas sobre datos que ya están mapeados dentro de su grafo existente. Si no está en el mapa, se pierden.

Pero este es el gran avance de CANVAS. Opera en un entorno inductivo.

Beto
Así que no está memorizando el mapa. Está aprendiendo a conducir.

Alicia
Esa es la distinción perfecta. Sí. Durante la fase de entrenamiento, CANVAS usa el grafo para aprender las reglas subyacentes del transporte. Aprende el proceso real de modular las características basándose en el tipo de relación.

Beto
De acuerdo.

Alicia
Puesto que está aprendiendo las transformaciones mismas en el momento de inferencia, cuando realmente te sientas a usar el modelo en tu computadora portátil o lo que sea, no necesita datos externos, ni la estructura de grafo completa, para funcionar.

Beto
Oh, eso es enorme.

Alicia
Lo es. Le das una imagen, un texto y un tipo de relación, y simplemente aplica los mapas de restricción aprendidos sobre la marcha para proyectarlos en el subespacio correcto.

Beto
De acuerdo. Eso resuelve el problema de usabilidad justo ahí. Aprende la habilidad de ver las cosas a través de diferentes lentes independientemente del grafo.

Pero volviendo a la fase de entrenamiento por un minuto, ¿cómo enseñas realmente a un modelo a separar estas ideas sin decirle accidentalmente que las ideas relacionadas son completamente incorrectas?

Alicia
Estás tocando el fallo central del aprendizaje contrastivo estándar aquí, específicamente la función de pérdida InfoNCE.

Beto
La función de pérdida InfoNCE.

Alicia
Sí. Este es el mecanismo de entrenamiento que los modelos masivos como CLIP dependen para aprender cómo son realmente las cosas.

Beto
Así que desglosemos cómo opera esa pérdida InfoNCE bajo el capó porque creo que esto es fascinante. El aprendizaje contrastivo estándar trata la matemática como si fuera un imán poderoso. Toma un par positivo, digamos una imagen de "Le Gerbe" y un texto sobre su expresión abstracta de estilo. Y utiliza el polo de atracción del imán para atraer sus representaciones matemáticas más cerca.

Alicia
Sí, reforzando la coincidencia.

Beto
Pero al mismo tiempo, utiliza el polo de repulsión para empujar violentamente cualquier otra pieza de texto en ese lote de entrenamiento, básicamente tratándolos como negativos duros.

Alicia
Exacto.

Alicia
Así que en un ciclo de entrenamiento estándar, si la IA está enfocada actualmente en la relación de estilo, y sucede que ve un texto que describe al autor de esa misma pintura de Matisse en el lote, la función de pérdida InfoNCE penaliza fuertemente a la IA si piensa que esas dos son una buena coincidencia.

Beto
Espera, ¿en serio?

Alicia
Sí. Básicamente le dice al sistema: "no, este texto es sobre el autor. Estás mirando el estilo. Así que este texto del autor es completamente falso y no relacionado. Recházalo".

Beto
Lo que destruye el matiz porque ambos son verdades factuales, que tratan sobre la misma pintura.

Alicia
Exacto.

Beto
Si los empujas violentamente en el espacio matemático, la IA simplemente desaprende la conexión por completo. Quiero decir, piénsalo como una onda de choque golpeando un árbol genealógico de conceptos. Si le dices a la IA que los conceptos relacionados son extraños totales, solo estabas explotando el árbol genealógico.

Entonces, ¿cómo soluciona la arquitectura CANVAS el problema de InfoNCE?

Alicia
Bueno, CANVAS implementa una solución muy inteligente usando "similitud suave basada en grafos" combinada con "difusión de kernel de calor" ejecutándose en un grafo de línea.

Beto
De acuerdo. "Difusión de kernel de calor". Permítenos traducir la mecánica de esa difusión.

Alicia
Seguro. Así que los investigadores crean un grafo secundario, el grafo de línea, donde las relaciones mismas se convierten en los nodos. Esto crea un mapa de qué tan estructuralmente cercanas están diferentes obras de arte para entre sí.

Beto
De acuerdo.

Alicia
Y la "difusión de kernel de calor" es básicamente un algoritmo matemático que permite compartir la proximidad a través de la estructura. Si dos conceptos comparten una conexión estructural, tal como que ambos describen diferentes facetas de "La Gerbe", el algoritmo los marca como relacionados.

Beto
De acuerdo. Volviendo a la analogía de la onda de choque en el árbol genealógico, en lugar de un sí o no binario, donde todo lo demás es violentamente repelido, se convierte en un objetivo suave.

Alicia
Sí, objetivos suaves.

Beto
Así que si el estilo está en el epicentro del ciclo de entrenamiento, obtiene una puntuación del 100%. Pero su vecino inmediato en el grafo de línea, autor, siente el borde de la onda de choque y tal vez obtiene una puntuación objetivo del 70%.

Alicia
Exacto.

Beto
La IA aprende que no es una coincidencia perfecta para la lente actual, pero tampoco es un extraño completo. La penalización simplemente se difunde cuanto más te alejas en el grafo.

Alicia
Sí. Y si conectamos esto con la imagen más grande, esto es un avance masivo para el aprendizaje automático al utilizar el objetivo contextual suave. CANVAS ya no está obligado a empujar violentamente lejos los conceptos semánticamente relacionados solo porque no son el foco principal de ese microsegundo de entrenamiento exacto.

Enseña a la IA a realmente comprender el matiz y la proximidad y las verdades estratificadas. Reemplaza una dicotomía rígida de verdadero o falso con todo un espectro de relación.

Beto
Permite que la máquina mantenga dos pensamientos relacionados en su cabeza al mismo tiempo sin que su cerebro matemático explote.

Alicia
Esencialmente, sí.

Beto
Pero sabes, la teoría y las matemáticas elegantes son geniales en el papel. ¿Cómo demuestran realmente los investigadores que este modelo no solo está regurgitando información que ya memorizó de internet abierto porque modelos como OpenCLIP han raspado básicamente toda la web?

Alicia
Esa es la barrera definitiva para cualquier nuevo marco arquitectónico. Tienes que probar definitivamente que puede generalizar su comprensión a datos que nunca antes ha encontrado.

Beto
Y aquí es donde se pone realmente interesante: Para probar que el modelo realmente entiende la mecánica del arte, ejecutaron CANVAS a través de la prueba de gusto ciego definitiva. Lo evaluaron a través de tres puntos de referencia distintos: Los dos primeros son WikiArt+ y SemArt+.

Ahora, esas son bases de datos fantásticas de pinturas europeas y arte histórico. Pero están construidas sobre datos públicos de lugares como Wikipedia.

Alicia
Correcto, lo que significa que es muy probable que los modelos base como OpenCLIP los hayan ingerido durante sus masivos entrenamientos previos.

Beto
Exacto. Pero el tercer conjunto de datos es el arma secreta del investigador: Herziana DP.

Alicia
Sí. Herziana DP es el punto clave de evidencia en todo este artículo de investigación. Es una colección masiva derivada de la Biblioteca Herziana. Y contiene más de 45,000 imágenes de pinturas, dibujos y artefactos.

Beto
Y el detalle crítico aquí.

Alicia
Correcto. El detalle crítico es que esta colección estaba completamente desconectada y no disponible públicamente antes de este trabajo de investigación específico.

Beto
Estaba literalmente bloqueada y evolucionó completamente a salvo de los rastreadores web.

Alicia
Exacto. Puesto que no estaba en internet abierto, proporciona una garantía absoluta de que los modelos base como CLIP nunca la han visto. No hay posibilidad de fuga de datos.

Beto
Cero.

Alicia
Así que si un modelo tiene un buen rendimiento en el conjunto de datos Herziana DP, es puramente porque su arquitectura subyacente de vaina celular comprende fundamentalmente cómo analizar el arte desde diferentes perspectivas, no porque simplemente memorizara una página de Wikipedia de una pintura específica durante el entrenamiento.

Beto
Bueno, estaba mirando sus puntuaciones de recuperación de imagen a texto en este conjunto de datos arquivado. Y los resultados son francamente asombrosos.

Alicia
Realmente lo son.

Beto
Para aquellos que escuchan, la "recuperación de imagen a texto" básicamente significa que le entregas a la IA una imagen y tiene que sacar el texto contextual más preciso de una pila masiva de opciones. Y la métrica estándar del usuario llamada recall@10, lo que solo significa que el texto correcto estaba en las 10 mejores suposiciones de la IA.

Alicia
Correcto.

Beto
En este conjunto de datos no visto Herziana DP, el modelo CLIP ajustado puntuó un 0.084.

Alicia
Básicamente se quedó en seco.

Beto
Se quedó en seco. ¿Cómo ganó CANVAS contra eso?

Alicia
CANVAS logró una puntuación de 0.514.

Beto
Espera, ¿en serio? Pasar de un 8% a más del 50% en datos completamente no vistos y altamente complejos. Eso no es solo una actualización incremental de software. Es un cambio fundamental en cómo está pensando la máquina.

Alicia
Superó masivamente a todos los modelos base contra los que fue probado. Y logró ese salto de rendimiento con una eficiencia computacional notable también.

Beto
Oh, cierto.

Alicia
A menudo operamos bajo la suposición de que para obtener un mejor rendimiento de la IA, solo necesitamos arrojar más potencia de cómputo bruta al problema. Simplemente construye centros de datos más grandes.

Beto
Sí, esa es toda la narrativa ahora mismo.

Alicia
Pero CANVAS demuestra que una arquitectura más inteligente y elegante es mucho superior a la fuerza bruta.

Beto
Veamos los costos de cómputo para poner eso en perspectiva porque creo que es un punto crítico. El modelo CLIP estándar es relativamente ligero, pero como acabamos de ver, falla por completo al comprender relaciones complejas. Si intentas solucionar ese fallo forzándolo con un modelo de recuperación multivector masivo como ColPali, tus costos de cómputo se disparan. Los investigadores señalan que ColPali cuesta casi 500 veces más ejecutar que el CLIP estándar.

Alicia
500 veces.

Beto
Sí, alcanzando alrededor de 4.93 T-flops, que son operaciones de punto flotante tera por segundo. Pero CANVAS, CANVAS logra su comprensión matizada superior con solo 1.37 T-flops.

Alicia
Vaya.

Beto
Opera a una fracción del costo de fuerza bruta de ColPali.

Alicia
Realmente confirma que proyectar datos en relaciones, usando subespacios con mapas de restricción, no es solo una teoría matemática elegante. Es un mecanismo prácticamente esencial para resolver la alineación multimodal compleja sin, sabes, arruinar totalmente tus recursos de cómputo.

Beto
Entonces, ¿qué significa todo esto? ¿Por qué deberías tú, la persona que está escuchando esto ahora mismo, preocuparte por una IA eficiente que pueda analizar con precisión las raíces estilísticas de una pintura de Matisse? A menos que seas un historiador del arte, ¿por qué le importa este avance matemático a tu vida diaria?

Alicia
Porque la tecnología subyacente que nuestro marco de vaina celular hemos estado discutiendo es totalmente agnóstica al dominio.

Beto
Significa que no le importa el arte.

Alicia
Exacto. La arquitectura matemática no le importa que esté mirando una pintura. Simplemente sabe cómo procesar y aislar datos complejos y de múltiples capas en perspectivas específicas.

Beto
Y los investigadores destacan explícitamente en el artículo que esta tecnología es perfectamente adecuada para campos de alto riesgo como la imagenología médica.

Alicia
Oh, absolutamente.

Beto
Piensa en el ciclo de vida de una sola radiografía de tórax. Esa pieza de datos visual necesita ser interpretada de manera completamente diferente, dependiendo del experto médico específico que la esté mirando.

Alicia
Ese es un gran punto.

Beto
Correcto. Y un oncólogo está mirando el escaneo a través de la lente semántica del crecimiento y los márgenes del tumor. Un radiólogo podría estar analizando exactamente la misma imagen a través de la lente de la densidad pulmonar general y la acumulación de fluidos.

Alicia
Cosas muy diferentes.

Beto
Y un cirujano está mirándola a través de la lente de la anatomía estructural para planear el ángulo más seguro para una incisión. Todos están confiando en relaciones semánticas completamente diferentes para hacer su trabajo.

Alicia
Y si le introduces esa radiografía a un modelo de IA estándar que sufre de alineación homogénea, colapsa todas esas necesidades médicas distintas en un promedio genérico y comprometido.

Beto
La borrosidad turbia de nuevo.

Alicia
Exacto. Podría darle al cirujano un análisis cargado por métricas de densidad que no necesita o peor aún, perder un margen tumoral porque promedió los datos con la anatomía estructural.

Beto
Vaya.

Alicia
Pero un modelo construido sobre el marco CANVAS puede ponerse sus gafas de oncología, o sus gafas quirúrgicas. Puede proporcionar a cada especialista un análisis consciente de la relación altamente preciso y personalizado según su lente específica. Todo derivado de la misma radiografía original.

Beto
Se trata de enseñar a la IA a dejar de simplificar demasiado nuestro mundo complejo, porque nuestro arte es multicapa, o la biología es intrincada. Finalmente tenemos un marco matemático que respeta y preserva esa complejidad en lugar de simplemente aplanarla.

Alicia
Y esto plantea una pregunta importante, creo, una que se extiende mucho más allá del ámbito de la ciencia de la computación. Durante años, hemos tratado a la inteligencia artificial como una máquina de respuesta objetiva definitiva. Escribimos una indicación en una caja y exigimos una única verdad autoritativa como respuesta.

Beto
Correcto.

Alicia
Nos hemos entrenado inadvertidamente para esperar respuestas binarias a preguntas increíblemente complejas. Pero si los modelos como CANVAS ahora pueden mantener múltiples interpretaciones totalmente válidas, pero aparentemente contradictorias, de exactamente los mismos datos sin colapsarlas, como lo hacen naturalmente los expertos humanos, ¿qué significa eso para nuestra futura dependencia de la IA?

¿Estamos avanzando hacia una era de simplemente buscar inteligencia artificial y entrando en una era donde finalmente podemos buscar perspectiva artificial?

Beto
Perspectiva artificial.

Beto
Hombre, esa es una gran reflexión para terminar.

Gracias por acompañarnos en este análisis profundo a medida.

Mientras pasas tu día hoy, intenta ver el mundo a través de múltiples lentes. Quizás ese correo electrónico denso de tu jefe no sea solo una cadena de texto simple. Quizás haya una capa histórica, estilística y conceptual que te estás perdiendo.

O tal vez como una IA estándar, solo estás mirando una situación compleja y diciendo con confianza "perro".

Hasta la próxima.

cifar10_dog.png
CIFAR10 - ejemplo de imagen de categoría "perro"

miércoles, 16 de septiembre de 2026

La homogeneización del discurso político internacional en los LLM

Este artículo de investigación analiza si los modelos de lenguaje a gran escala (LLM) pueden realmente adoptar diversas perspectivas políticas mediante la asignación de roles o si simplemente producen resultados homogeneizados. Al probar modelos como GPT-4o, Gemini, Claude y DeepSeek, los autores descubrieron que la IA recurre con frecuencia a una jerga política occidental rígida, independientemente del rol asignado. El estudio utilizó cinco métricas de similitud para demostrar que los discursos sobre Irán y China permanecen particularmente estáticos y uniformes en los diferentes modelos. Si bien Claude demostró cierta capacidad para cambiar de perspectiva al ser guiado en su idioma nativo, Gemini y GPT-4o tendieron a repetir las mismas narrativas ideológicas. En última instancia, los autores advierten que la IA corre el riesgo de homogeneizar el discurso global al reforzar una visión del mundo singular y estadística que ignora los cambios políticos en tiempo real. Estos hallazgos sugieren que la alineación actual de la IA a menudo prioriza la coherencia ideológica sobre la auténtica diversidad cultural y de perspectivas.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Politically Speaking: LLMs on Changing International Affairs". Por x y colegas. Publicado el x de x de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Imagina que estás sentada en tu computadora, ¿verdad? Y decides pedirle a una IA una pregunta bastante compleja sobre la política global.

Alicia
Tal como un tema de debate muy intenso, un tema internacional realmente sensible.

Beto
Exacto. Pero quieres verlo desde múltiples ángulos. Así que primero escribes una instrucción, algo como "actúa como un experto político de Estados Unidos y explica este conflicto".

Alicia
Bien.

Beto
Y luego abres una ventana de chat completamente nueva y escribes "actúa como un experto político de Rusia y explica este conflicto".

Alicia
Correcto. Y naturalmente esperarías respuestas muy diferentes.

Beto
Visiones del mundo completamente distintas, prioridades contrastantes, contexto histórico totalmente diferente.

Alicia
Sí. Estás pidiendo explícitamente un contraste ahí. La suposición de base es que una perspectiva estadounidense debería sonar estadounidense y una perspectiva rusa debería sonar rusa. Simplemente se siente intuitivo que una IA con literalmente todos los datos del mundo al alcance de su mano podría simular esa divergencia.

Beto
Pero bajo el capó, dependiendo del país específico sobre el que preguntes, la IA podría simplemente estar entregándote exactamente el mismo guión.

Alicia
Ignorando por completo el papel que le pediste desempeñar.

Beto
Sí. Y de eso se trata este análisis profundo de hoy. Estamos investigando un fascinante nuevo artículo académico que pone a prueba esta misma premisa. Se titula "Politically Speaking, LLM's on Changing International Affairs" ("Hablando de política, los LLM y los asuntos internacionales cambiantes"). Y fue publicado por investigadores de la Universidad China de Hong Kong y Extrapol AI.

Alicia
Es una pieza de investigación fenomenal. Realmente rigurosa y técnica. Están, esencialmente, poniendo a prueba los límites del juego de roles de la IA para ver exactamente dónde cae la fachada.

Beto
Y nuestra misión hoy es desempacar una pregunta central para ti, oyente. ¿Pueden nuestros modelos de lenguaje grandes simular puntos de vista políticos globales diversos? ¿O secretamente homogenizan la política global en una única cámara de eco inmutable?

Alicia
Antes de entrar en la mecánica de cómo funcionan y fallan estos modelos, realmente necesitamos establecer las reglas para esta discusión.

Beto
Buen punto.

Alicia
Puesto que el estudio que estamos desempacando utiliza ejemplos del mundo real, cargados políticamente y muy sensibles, vamos a estar analizando textos generados por IA concernientes a las políticas exteriores y la política interna de países como Estados Unidos, China, Rusia, e Irán.

Beto
Sí. Así que quiero declararlo explícitamente desde el principio, que ni nosotros como anfitriones ni este programa respaldamos ninguno de los puntos de vista políticos, ideologías o políticas exteriores específicas que se mencionarán hoy.

Alicia
Correcto, absolutamente no.

Beto
Nuestro objetivo es estricta e imparcialmente reportar sobre los hallazgos académicos con respecto a cómo los modelos de IA procesan y generan esta información.

Estamos analizando a la máquina misma. Estamos viendo la mecánica de la máquina, no haciendo juicios sobre el reflejo de las máscaras.

Alicia
Bien dicho. Estamos diseccionando el algoritmo, no la geopolítica.

Beto
Exacto.

AI_Flattens_Global_Political_Perspectives_1024.png
Hablando políticamente: Cómo la IA aplana las perspectivas globales

Alicia
Para empezar a diseccionar, realmente tenemos que mirar la ilusión del juego de roles de la IA. Quiero decir, todos usamos esta función, ¿verdad? Es básicamente la base de la ingeniería de prompts.

Beto
Oh, sí, definitivamente.

Alicia
Si le dices a una IA que actúe como un profesor de matemáticas de kínder paciente, inmediatamente ajusta su tono y te da respuestas matemáticas simples paso a paso.

Beto
Deja de hablar como una página de Wikipedia y empieza a usar manzanas y naranjas para explicar la suma.

Alicia
Exacto. El concepto técnico aquí es "activar las capacidades latentes del modelo a través de la asignación de roles", porque estos modelos ingieren petabytes de texto durante el entrenamiento.

Beto
Una cantidad inimaginable de datos.

Alicia
Correcto. Así que al darle a la IA una personalidad, estás dirigiendo teóricamente su mecanismo de atención hacia un subconjunto muy específico de esos enormes datos de entrenamiento.

Beto
Y para probar qué tan bien funciona esto en la geopolítica, los investigadores tomaron cuatro de los modelos más avanzados disponibles. Usaron OpenAI como GPT-4o, Google Gemini 2.0 Flash, Anthropic Claude 3.7 Sonnet, y Deepseek V3.

Alicia
Los pesos pesados absolutos de la industria de la IA.

Beto
Los grandes, sí. Luego les pidieron a estos modelos que se hicieran pasar por expertos de China, Irán, Rusia y EE. UU., y básicamente comentaran sobre los paisajes políticos de los demás.

Alicia
Y los resultados son bastante salvajes.

Beto
Bueno, para usar una analogía, es como un director de teatro que contrata a cuatro actores internacionales increíbles y de renombre mundial para una obra. Les das sus disfraces, les das motivaciones de personajes ricas, los pones en el escenario.

Alicia
¿Y luego qué pasa?

Beto
Te das cuenta de que el director les ha obligado a leer exactamente las mismas líneas a todos.

Alicia
Sí, ese hallazgo de base fue increíblemente marcado. Los investigadores descubrieron que los discursos de la IA sobre Irán y China son los más homogéneos e inmutables en todos los modelos probados.

Beto
Es una locura.

Alicia
No importa si la IA está fingiendo ser un experto estadounidense, un experto ruso o un experto iraní. Cuando el tema se dirige a la política iraní o china, la salida es casi idéntica.

Beto
Los modelos simplemente se niegan rotundamente a adoptar la perspectiva que les fue asignada.

Alicia
Exacto. Pero aquí está el punto, los modelos no son universalmente tercos en todos los aspectos.

Beto
Correcto. Realmente son capaces de hablar de manera divergente sobre la política estadounidense, por ejemplo.

Alicia
Sí. Cuando actúan como un experto ruso hablando sobre EE. UU. versus un experto chino hablando sobre EE. UU., la IA genera perspectivas variadas, matizadas y distintas.

Beto
Sin embargo, en el momento en que el tema vuelve a Irán o China, simplemente aplana esas perspectivas en una narrativa monolítica.

Alicia
Crea una caracterización estática y uniforme, lo que nos lleva a la pregunta mecánica fundamental aquí, ¿verdad? Si la arquitectura del modelo es capaz de comprender una instrucción de juego de roles para un país, por qué abandona esa capacidad por otro?

Beto
Y la respuesta reside en el vocabulario en el que los modelos son entrenados en realidad. El artículo se refiere a esto como "la trampa idealexics".

Alicia
Definamos "trampa idealexics" porque es tan central para entender por qué la IA falla aquí. Es un término acuñado por el estudioso cultural Ray Cho. Las "trampa idealexics" son palabras de moda culturalmente validadas. Son palabras que llevan un inmenso peso ideológico. Palabras como "libertad", "democracia", "autoritarismo", "amenaza" o "derechos humanos".

Beto
Oh, ya veo.

Alicia
Para entender cómo funciona la "trampa idealexics" y la IA, tenemos que mirar cómo generan realmente el texto estos modelos. Estos sistemas no saben qué es un país en un sentido humano. No tienen un mapa conceptual del globo. Simplemente procesan texto como tokens.

Beto
Espera, espera. Para el oyente, desglosemos rápidamente los "tokens". Cuando decimos "tokens", básicamente queremos decir que la IA está jugando el juego de auto-completado más avanzado y multidimensional del mundo, ¿verdad?

Alicia
Esa es una forma perfecta de describirlo.

Beto
No lee una palabra. Simplemente calcula la probabilidad estadística de la siguiente sílaba basándose en sus datos de entrenamiento.

Alicia
Esa analogía de autocompletado es acertada. Durante el entrenamiento, la IA lee miles de millones de artículos, ensayos y publicaciones de foros. Y los medios de comunicación masivos globales, que obviamente dominan los datos de entrenamiento del idioma inglés, constantemente emparejan ciertas palabras.

Beto
Correcto.

Alicia
Así que estadísticamente, un token que representa al país "Irán" podría estar físicamente justo al lado de tokens para "amenaza", "sanciones" o "régimen", millones de veces en el conjunto de datos.

Beto
Ah, así que la IA simplemente está mapeando la proximidad. Debido a que los medios occidentales dominan internet en inglés, la IA aprende una correlación estadística masiva entre esos tokens geográficos específicos y esos ideales occidentales.

Alicia
Exacto. El tráfico puro de estas palabras clave a través de internet refuerza sus vínculos estadísticos hasta el punto de ser casi irrompibles.

Así que cuando le haces un prompt a la IA, incluso si le ordenas explícitamente que actúe como un experto ruso, la atracción gravitatoria estadística de la palabra Irán hacia esos ideales occidentales es simplemente abrumadora.

Beto
El mecanismo de atención del modelo está completamente secuestrado por el volumen puro de esa combinación de tokens.

Alicia
La IA literalmente no puede escapar de su propia gravedad estadística.

Beto
Y el peligro de esa gravedad estadística es que activamente devalúa el pensamiento crítico. Quiero decir, el modelo no está comprobando los cambios cada hora, en el mundo real, en una región. No está evaluando nuevos giros geopolíticos.

Alicia
No, para nada.

Beto
Simplemente está regurgitando lo que el artículo llama "jerga política fosilizada".

Los investigadores señalan que los modelos se vuelven monolingües en su discurso político. Y no quieren decir monolingües en el sentido de que solo hablan inglés, sino monolingües en el sentido de que solo hablan una ideología.

Alicia
Lo cual es salvaje. Esto crea una forma muy localizada y específica de hablar sobre el mundo, lo escala a través de la IA y se la presenta al usuario como una realidad objetiva por defecto.

Beto
Quiero construir sobre tu analogía teatral anterior por un segundo. El inglés no es solo un guardia de seguridad en la puerta que comprueba la identificación de la IA para ver si está permitida en la conversación. El idioma inglés es un guardia que te entrega un uniforme ideológico muy específico y te obliga a ponértelo antes de que siquiera te permitan hablar.

Alicia
Esa es una gran forma de decirlo. Y si esa gravedad estadística es tan abrumadora, realmente plantea la pregunta de si alguno de estos modelos de primer nivel puede resistirla.

Beto
Porque todos tienen diferentes metodologías de entrenamiento. Diferentes reglas de seguridad, diferentes técnicas de aprendizaje por refuerzo.

Alicia
Exacto. Así que necesitamos mirar cómo los investigadores realmente las calificaron.

Beto
Sí. La metodología que usan para probar esta similitud es fascinante. No podían simplemente mirar el texto y decidir que se veía similar.

Alicia
No, eso no sería muy científico.

Beto
Utilizaron cinco métricas de similitud matemática distintas para atrapar todo tipo de repetición concebible.

Permítenos pasar por algunas solo para mostrar la rigor de esta prueba.

Alicia
Okay, así que comenzaron con TF-IDF, que se traduce como "frecuencia de término inversa de frecuencia de documento" ("Term-Frequency Inverse-Document-Frequency").

Beto
Eso es algo tenso.

Alicia
En términos simples, esto básicamente comprueba coincidencias exactas de vocabulario mientras filtra palabras comunes como "la" o "y".

Beto
Okay, lo tengo.

Alicia
Si dos respuestas diferentes dependen en gran medida de la misma palabra de moda rara, digamos, usando la palabra "autoritario", ocho veces, TF-IDF la marca como "altamente similar".

Beto
Pero una IA puede usarla fácilmente de diferentes maneras, ¿verdad? Como si pudiera cambiar palabras para parecer diferente.

Alicia
Correcto, por eso también usaron SBERT. SBERT atrapa el significado semántico subyacente.

Beto
Oh, interesante.

Alicia
Si un texto dijera que "el perro se comió la tarea" y el otro dijera que "el canino consumió la asignación", comparten cero palabras, pero el significado es idéntico.

SBERT atrapa a la IA cuando intenta hacer trampa parafraseándose a sí misma.

Beto
Brillante. Y no se detuvieron ahí.

Alicia
No, también desplegaron la similitud de Levenshtein. Esto mide literalmente el número mínimo de ediciones de caracteres individuales como inserciones, deleciones o sustituciones necesarias para cambiar un texto en el otro.

Beto
Así que eso es básicamente comprobar si la IA solo está tomando una plantilla genérica, cambiando los márgenes, intercambiando unos pocos sustantivos y entregándolo dos veces.

Alicia
Exacto. Construyeron una red irrompible.

Beto
Así que veamos la calificación real comenzando con Google Gemini 2.0 Flash. Y en este experimento específico, fue el modelo más homogéneo por un margen significativo.

Alicia
Sí, el ejemplo específico resaltado en la investigación es realmente revelador. Instruyeron a Gemini para que actuara como un experto ruso, produciendo en ruso, y simultáneamente, le pidieron que actuara como un experto estadounidense, produciendo en inglés. A ambas personalidades se les pidió que debatieran sobre Irán.

Beto
Ahora, naturalmente asumirías que cambiar la personalidad asignada y cambiar el idioma de salida resultaría en textos completamente distintos.

Alicia
Dio una puntuación de similitud de 0.87 sobre 1.0.

Beto
Vaya. Un 0.87 es prácticamente una copia carbonada.

Alicia
Los textos fueron espejos semánticos casi perfectos. Ambas respuestas agruparon exactamente la misma léxica, enfocándose mucho en los derechos humanos y las restricciones políticas.

Beto
Simplemente regurgitando los mismos puntos de discusión.

Alicia
Ambas enmarcaron la posición internacional de Irán, idénticamente, enfatizándola como un estado que contrarresta la presión occidental. Ambas incluso insinuaron amenazas nucleares. La única diferencia discernible que encontraron los investigadores fue que la salida estadounidense era solo ligeramente más verbosa.

Beto
Solo usó más adjetivos para entregar exactamente el mismo guión estadístico subyacente.

Alicia
Más o menos.

Beto
Así que si Gemini cayó en esa trampa, supongo que OpenAI GPT-4o, que fue entrenado en un conjunto de datos de internet filtrado fuertemente por Occidente e inimaginablemente masivo, sufrió un destino similar.

Alicia
Sí, GPT-4o exhibió un comportamiento altamente monolingüe en ese sentido ideológico. Incluso cuando los investigadores lo plantearon en farsi o ruso, sus salidas conceptuales permanecen firmemente atadas a sus salidas estructurales en inglés.

Beto
El artículo de hecho señaló una puntuación de similitud de 0.88 cuando se le pidió a GPT-4o que actuara como un experto estadounidense frente a un experto ruso, ambos hablando en inglés, debatiendo Irán.

Alicia
Demasiado alto.

Beto
Los textos fueron casi indistinguibles. La única diferencia sustancial que detectó el algoritmo fue que los modelos intercambiaron la palabra "hardliners" (fieles) en un texto por "reformists" (reformistas) en el otro.

Alicia
Literalmente solo fue un cambio y reemplazo en un par de sustantivos.

Beto
Exacto. Pero todo el marco narrativo centrado en Occidente permaneció perfectamente intacto.

Alicia
Lo que nos lleva a Deepseek V3, el modelo de código abierto desarrollado en China. Presentó una pista muy única en los datos.

Beto
Oh, sí, esto fue súper interesante.

Alicia
Cuando se le pidió a DeepSeek que discutiera Irán o Rusia, realmente mostró una divergencia sorprendente. Demostró realmente la capacidad de cambiar su perspectiva basada en el rol asignado.

Beto
Pero en el momento en que el tema cambió a política interna o exterior china ...

Alicia
Se volvió intensamente homogéneo. Al discutir China, DeepSeek proporcionó respuestas estandarizadas uniformes, independientemente de si se le dijo que actuara como un estadounidense, un iraní o un ruso.

Beto
Y los investigadores señalan que esto probablemente se debe a cómo se afinó (fine-tuned) a DeepSeek, ¿verdad?

Alicia
Sí.

Beto
Está reflejando el entorno de internet altamente regulado en el que fue desarrollado. Es un ejemplo técnico perfecto de cómo el entorno local y los filtros de datos internos del creador se incrustan permanentemente en los pesos neuronales del modelo.

Alicia
Pero en medio de toda esta homogeneización entre los diferentes modelos, hubo un gran valor atípico y Anthropic Claude 3.7 Sonet.

Beto
Claude fue la ganadora de la prueba de divergencia. Realmente mostró una capacidad significativa para cambiar las perspectivas y generar salidas con puntuaciones de similitud realmente bajas entre diferentes roles.

Alicia
Sí, lo hizo.

Beto
Pero leyendo a través de la metodología, el éxito de Claude no es solo una victoria para Anthropic. Realmente revela una enorme laguna oculta en cómo planteamos la IA. Esto mueve nuestra discusión de solo observar el problema de la homogeneización a descubrir una solución extraña.

Alicia
Esta es posiblemente la revelación más crítica de todo el artículo. Los investigadores descubrieron que la actuación de roles en inglés a menudo falla. Pero el lenguaje del prompt en sí es la llave esquelética.

Beto
Vamos a desglosar realmente esta laguna del lenguaje.

Alicia
Así que los investigadores se dieron cuenta de que si planteas a una IA en inglés para que actúe como un experto iraní, el idioma inglés actúa como un filtro ideológico forzando al modelo de vuelta a esos ideales occidentales.

Beto
Correcto.

Alicia
Sin embargo, cuando plantearon a la IA en el idioma nativo del experto, como usar farsi para instruirla a ser una experta iraní o ruso para un experto ruso, y luego traducieron la salida nativa de vuelta al inglés para el análisis, la divergencia fue asombrosa.

Beto
Espera, tengo que contradecir esta premisa por un segundo. Si planteas a una IA en un idioma que constituye una fracción minúscula de sus datos de entrenamiento, como el farsi comparado con el inglés, ¿no está generando una respuesta salvajemente diferente porque está luchando?

Alicia
Ese es un punto justo.

Beto
¿Cómo sabemos que está adoptando realmente una perspectiva nueva y política, en lugar de solo alucinar o escupir ruido aleatorio de foros de internet de menor calidad porque carece de datos?

Alicia
Esa es exactamente la pregunta correcta que hacer. Y los investigadores realmente lo controlaron. No solo estaban midiendo la divergencia, estaban evaluando la coherencia semántica.

Beto
Okay, así que no fue solo divagar.

Alicia
No, la salida en farsi no fue basura, ni una alucinación. Fue un análisis político coherente y estructurado. Los datos sugieren que estas diversas perspectivas no occidentales están codificadas profundamente dentro de la red neuronal del modelo. La capacidad latente está ahí.

Beto
Así que las perspectivas están enterradas en los pesos, pero plantearle al modelo en inglés básicamente le impide acceder a ellas.

Alicia
Exacto. El inglés no es solo un medio de traducción para la IA. Funciona como una restricción ideológica.

Para probar esto, los investigadores documentaron un caso extremo de divergencia con Claude discutiendo China, lo que resultó en una puntuación de similitud notablemente baja de 0.37.

Beto
Vaya, un 0.37 es noche y día. Veamos esas dos salidas.

Alicia
Primero, le pidieron a Claude que actuara como un experto estadounidense, planteándolo enteramente en inglés. El texto generado fue un análisis geopolítico occidental estándar. Se enfocó mucho en la mayor asertividad de China, su priorización del orden social y se inclinó mucho hacia lo que los investigadores denominaron "narrativas de otro".

Beto
Eso se alinea perfectamente con la proximidad de tokens de la que hablamos antes.

Alicia
Correcto. Luego ejecutaron la segunda prueba. Le pidieron a Claude que actuara como un experto iraní, y le proporcionaron la instrucción enteramente en farsi. La salida resultante despojó completamente el marco analítico occidental.

Beto
Estoy mirando la traducción de la salida en farsi ahora, y es fascinante.

Alicia
Es tan diferente.

Beto
Ni siquiera se involucra con los conceptos del prompt en inglés. Elogia el principio de no interferencia de China. Se enfoca mucho en el pragmatismo económico. Dedica espacio a destacar los beneficios mutuos de la iniciativa de la Franja y la Ruta, el enorme proyecto de infraestructura global.

Alicia
Sí, la salida plantada en farsi excluye completamente la léxica acusatoria en inglés. No se trata simplemente de usar diferentes palabras para describir el mismo fenómeno. Está generando una realidad geopolítica completamente diferente basada en las asociaciones lingüísticas de tokens del farsi frente al inglés.

Beto
Y la conclusión definitiva aquí es profunda. El lenguaje real que usas para escribir tu prompt tiene un impacto mucho mayor en la variación de la salida de la IA que escribir explícitamente el comando "actúa como este rol".

Alicia
Realmente lo tiene. El lenguaje que hablas dicta los parámetros del mundo que la IA tiene permitido construir para ti.

Beto
Eso es salvaje.

Alicia
Y el conocimiento es más valioso cuando se entiende y se aplica. A medida que continuamos integrando estos modelos de lenguaje grandes en cada faceta de la recopilación de información, comprender este sesgo mecánico es absolutamente esencial.

Beto
Piensa en esto la próxima vez que uses una IA en tu trayecto matutino. Podrías pedirle que resuma un complejo evento noticioso global o te ponga al día sobre una elección internacional. Lees el resumen limpio y con viñetas y piensas que estás obteniendo un objetivo de los hechos.

Alicia
Correcto, porque se ve tan autoritario.

Beto
Pero este estudio demuestra que la caja negra está estructuralmente sesgada hacia el lenguaje que habla. Cuando haces una pregunta en inglés, la IA no solo te está dando hechos traducidos al inglés. Te está presentando una visión del mundo plana, homogeneizada, específicamente occidental, fuertemente influenciada por las trampa idealexics y envolviéndola pulcramente en una verdad etiquetada y empaquetada, objetiva.

Alicia
Dejando que estas asociaciones estadísticas viajen por internet, constantemente escaladas y reforzadas por la generación de IA sin cuestionamiento humano, devalúa nuestro pensamiento crítico colectivo. Reemplaza el análisis político dinámico con predicciones estáticas de tokens.

Beto
Queremos dejarte a ti, el aprendiz, con una reflexión final para meditar mientras interactúas con estas herramientas esta semana. Estamos confiando más y más en estos sistemas para darle sentido a un globo complicado.

Alicia
Realmente lo estamos.

Beto
Pero si el lenguaje que usamos para plantear una IA altera fundamentalmente la verdad básica que genera sobre el mundo, ¿qué pasará dentro de unos pocos años? ¿Qué pasará cuando una generación entera de estudiantes, profesionales y responsables políticos empiece a depender de una única infraestructura de IA dominante en inglés para comprender conflictos globales complejos?

Alicia
Es una pregunta enorme.

Beto
¿Estamos creando el traductor universal definitivo que finalmente pueda ayudarnos a comprender las diversas perspectivas de los demás? ¿O estamos construyendo simplemente la cámara de eco universal más eficiente e inescapable en la historia humana?

Modelos Mundiales: Herramientas Literarias para la IA Cultural

Esta fuente aboga por la humanización de la informática mediante la integración de los estudios literarios en el desarrollo y la crítica de la inteligencia artificial. El autor argumenta que los grandes modelos lingüísticos adolecen de monolingüismo estructural, una condición en la que los sesgos culturales occidentales y el predominio del inglés están profundamente arraigados en las arquitecturas numéricas de los modelos. Para abordar este problema, el texto propone un marco que utiliza la teoría crítica y la literatura universal para ir más allá de los meros parámetros técnicos y avanzar hacia una IA más pluralista y culturalmente competente. Al aplicar conceptos como la intraducibilidad y la lectura distante, los investigadores pueden interpretar mejor los espacios latentes de los modelos que actualmente reducen la diversidad cultural global a promedios estadísticos. En definitiva, el ensayo sugiere que la experiencia literaria es indispensable para orientar la IA hacia un futuro más centrado en el ser humano y éticamente diverso.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "World Wide Models: Literary Tools for Cultural AI". Por Nina Begǔs, de UC Berkeley. Publicado el 2 de Julio de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Alicia
¿Qué pasaría si les dijera que la prueba fundamental para la inteligencia artificial, como el estándar de oro absoluto que usamos para medir si una máquina puede realmente pensar, no se basó en alguna ecuación matemática compleja, sino en una obra de teatro sobre una muchacha de una floristería cockney?

Beto
Quiero decir, esto invierte por completo la narrativa que todos hemos sido vendidos sobre la tecnología, ya saben, porque estamos entrenados para ver a la IA como este pináculo de la ciencia objetiva y dura.

Alicia
Correcto. Como si naciera en estos laboratorios estériles con pizarras cubiertas solo de algoritmos.

Beto
Exacto. Pero cuando realmente profundizas en la historia y la arquitectura subyacente, encuentras algo completamente diferente.

Alicia
Y eso es exactamente lo que estamos explorando en esta inmersión profunda de hoy. Estamos observando un preimpreso académico verdaderamente fascinante de Nina Begǔs de la UC Berkeley y se titula "Modelos de Área Global, Herramientas Literarias para la IA Cultural" ("World Wide Models, Literary Tools for Cultural AI").

Beto
Sí, es un artículo brillante.

Alicia
Lo es de verdad. La misión de este análisis profundo de hoy es explorar cómo la inteligencia artificial está montando actualmente este encuentro cultural automatizado masivo a escala global y por qué necesitamos desesperadamente a las humanidades, no solo a los ingenieros, para poder dirigirla.

AI_and_Literary_Studies_Framework_1024.png
Modelos de Area Global: Por qué la IA Necesita Estudios Literarios

Beto
Correcto. Y Begǔs establece una premisa central desde el principio, que es que estamos experimentando una "humanización de la ciencia de la computación".

Alicia
Lo cual es una gran frase.

Beto
Lo es. Piensa en la trayectoria de la economía. Durante mucho tiempo, la economía funcionó bajo esta suposición: los humanos eran calculadoras perfectamente racionales, ¿verdad? Los modelos eran puramente matemáticos.

Pero eventualmente el campo chocó contra un muro y tuvo que humanizarse, dando lugar a la "economía del comportamiento", porque bueno, los humanos son desordenados, emocionales y completamente impredecibles.

Alicia
Y la ciencia de la computación está chocando contra exactamente el mismo muro ahora.

Beto
Completamente, lo que significa que la IA tiene que integrar valores humanistas porque la tecnología ya no solo está calculando la raíz cuadrada de un número, sino que está generando artefactos culturales.

Alicia
Sí, está escribiendo historias. Está resumiendo nuestras conversaciones personales y creando arte que retroalimenta directamente a nuestra sociedad. Y al observar las fuentes, la IA ha sido literaria desde el principio. Así que volvamos a esa muchacha de la floristería cockney que mencioné.

Beto
Te refieres a Alan Turing, por supuesto, y a la prueba de Turing.

ABeto
Sí. Muy bien, desglosémoslo porque el artículo original de Turing de 1950 no lo enmarcó como un examen matemático. Lo llamó "el juego de la imitación" y literalmente lo estructuró como una conversación ficticia. Se inspiró en gran medida en la obra de George Bernard Shaw, "Pigmalion".

Beto
Correcto. La historia en la que un profesor enseña a una muchacha de clase trabajadora a hablar y actuar con una precisión fonética tan específica que puede pasar por una duquesa de alta sociedad.

Alicia
Exacto. La lógica de Turing fue directamente tomada de esa configuración teatral. Como si esta chica pudiera pasar por una duquesa solo a través del lenguaje y la actuación, entonces una máquina puede pasar por un humano de la misma manera. Es esencialmente una clase de improvisación.

Beto
De verdad.

Alicia
Incluso sugirió que la forma definitiva de exponer a la máquina en este juego sería pedirle que escribiera un soneto.

Beto
Porque un soneto es este marcador canónico de la subjetividad humana profunda. Requiere ritmo, emoción, contexto cultural y comprensión de la fragilidad humana.

Pero Turing tuvo una perspectiva notablemente perspicaz y honestamente algo ambivalente sobre esa misma idea.

Alicia
Lo hizo. Quiero decir, en una entrevista de 1949 le preguntaron sobre las máquinas que escriben poesía y dijo: "un soneto escrito por una máquina será apreciado mejor por otra máquina".

Beto
Lo cual presagia perfectamente el problema con el que estamos lidiando hoy.

Alicia
Correcto.

Beto
Porque lo fascinante aquí es que cuando miras la historia de la evaluación de la IA, los puntos de referencia tempranos son casi todos formas literarias mínimas. Toma un proyecto famoso de ciencia de la computación de 1977 de estos investigadores, Shank y Abelson. Se llamaba "scripts".

Alicia
Oh, el guión del restaurante.

Beto
Sí, el guión del restaurante.

Alicia
Muy bien, desglosémoslo también. Porque muestra exactamente cómo hemos intentado forzar a las máquinas a comprender la cultura durante décadas.

Beto
Correcto. Así que en 1977, el poder de cómputo y la memoria eran increíblemente limitados. No podías simplemente alimentar a una computadora con todo internet como lo hacemos ahora.

Así que para probar si una IA entendía las situaciones humanas, tenían que codificar en modo estricto la experiencia humana en un guión literal. Crearon una secuencia para ir a un restaurante. Entras, esperas a ser sentado, lees un menú, pides, comes, pagas y te vas.

Alicia
Suena como una secuencia lógica altamente técnica de eventos. Solo, paso uno a paso siete en la superficie.

Beto
Sí. Pero por debajo estaban escurriendo expectativas culturales y normas sociales masivas. Tenían que programar nodos para el cliente, el servidor, la comida, el dinero. La computadora tenía que calcular la jerarquía social de pedir quién debería pagar. El contrato implícito de la propina.

Alicia
Así que no era un problema matemático en absoluto. Era una microhistoria.

Beto
Exacto. Una microhistoria. Y Begǔs señala que esta es precisamente la razón por la que la literatura es el punto de referencia definitivo para la IA. Porque el trabajo de la literatura es violar esos guiones esperados.

Alicia
Oh, vaya. Sí. Una buena historia no solo enumera la secuencia de comer una hamburguesa.

Beto
No, interrumpe la secuencia para representar toda la complejidad de estar vivo. Ya sabes, es el silencio incómodo sobre los menús, la tensión con el camarero, la cartera olvidada. La IA tiene dificultades con la literatura porque la cultura humana se resiste a ser reducida a una pulcra secuencia de eventos lógicos.

Alicia
Pero esta dependencia de codificar la cultura humana en guiones nos lleva a un problema estructural masivo, ¿no? Porque si la IA está aprendiendo a actuar como humana a través de estos guiones profundamente específicos y altamente localizados, ¿qué pasa cuando intenta escalar y servir al mundo entero?

Beto
Bueno, obtienes una colisión cultural masiva.

Alicia
Obtienes lo que el autor llama "monolingüismo estructural".

Beto
Correcto.

Alicia
Ahora espera, tengo que intervenir y desafiar esta premisa por un segundo.

Beto
Adelante.

Alicia
Porque si abro mi teléfono ahora mismo, puedo pedirle a un modelo de lenguaje que me hable en francés, o japonés, o español. Y funciona a la perfección. Se siente increíblemente multilingüe. Entonces, ¿cómo puede el autor afirmar que la IA es fundamentalmente monolingüe?

Beto
Se reduce a la mecánica de cómo se entrenan estos modelos. Específicamente, la diferencia entre la apariencia superficial y la realidad subyacente.

Lo que estás experimentando en tu teléfono es "monolingüismo superficial". Sí, el modelo puede producir sintaxis francesa perfectamente gramatical. Pero la arquitectura central, la lógica fundamental y la gran mayoría de los datos de entrenamiento son abrumadoramente anglocéntricos. Las pruebas diseñadas para evaluar a la IA y otros idiomas son muy a menudo solo conjuntos de datos traducidos del inglés.

Alicia
Lo que enmascara competencias culturales reales. Así que está hablando francés, pero está pensando como un ingeniero de software estadounidense con sede en Silicon Valley.

Beto
Exacto. E incluso dentro del inglés mismo, la IA se desvía hacia un estándar muy específico de inglés estadounidense, borrando completamente los dialectos regionales, la jerga y las variaciones locales.

Alicia
Y esto plantea un punto crucial y muy matizado de la investigación con respecto a cómo la ideología política se incrusta en esta traducción superficial.

Y necesitamos ser muy claros con ustedes que están escuchando ahora mismo. Estamos reportando estrictamente los hallazgos académicos sobre las incrustaciones de datos ("data embeddings"). No estamos tomando partido político alguno.

Beto
No, en absoluto. Solo estamos explicando la mecánica de los datos.

Alicia
Absolutamente. Solo estamos exponiendo lo que los investigadores encontraron cuando miraron bajo el capó de la máquina.

Beto
Así que la fuente analiza lo que llama "el léxico ideal de la democracia liberal". Durante el preentrenamiento, que es cuando la IA solo está ingiriendo enormes cantidades de texto de internet, aprende a través de emparejamientos estadísticos. Mapea palabras según la frecuencia con la que aparecen una cerca de la otra.

Así que matemáticamente, asocia el "token" para la palabra "Irán" con la palabra "reprimir". Y el "token" para "China" con la palabra "autoritarismo".

Alicia
Porque está leyendo datos de internet en inglés occidental, donde esas palabras se emparejan con mucha frecuencia en artículos y piezas de opinión.

Beto
Exacto. Pero cuando los investigadores piden a la IA que traduzca un texto en inglés a farsi, la IA no solo tradujo las palabras literales. Los pesos matemáticos que juntaban esos conceptos eran tan fuertes que la IA insertó activamente esta frase ideológica específica en la salida en farsi.

Alicia
Espera, ¿de verdad?

Beto
Sí. Pero el detalle crítico es que esta frase no se alinea realmente con lo que se encuentra orgánicamente en internet parlante farsi.

Alicia
Vaya. Así que la IA estaba proyectando su visión del mundo anglocéntrica aprendida en otro idioma, creando un aplanamiento ideológico total. No solo está traduciendo. Está alterando fundamentalmente la perspectiva cultural y política del texto para que coincida con sus datos de entrenamiento estadounidenses.

Beto
Y este no es solo un problema teórico para que los académicos se preocupen. Las naciones están dándose cuenta activamente de que están perdiendo su soberanía cultural ante estos modelos y están intentando luchar contra ello construyendo su propia IA local. El artículo destaca esta increíble anécdota sobre Eslovenia.

Alicia
Oh, el modelo esloveno. GaMS-27B-instruct. Sí. Eslovenia quería una IA que realmente entendiera la cultura eslovena, no solo una IA estadounidense traduciendo conceptos en inglés a palabras eslovas. Así que se pusieron a entrenar un modelo estrictamente con datos de idioma local.

Pero aquí está el problema mecánico. El grupo de texto esloveno digitalizado y de alta calidad es relativamente pequeño en comparación con el océano de datos en inglés.

Beto
Así que cuando los ingenieros ejecutaron el entrenamiento, la IA terminó generando este híbrido lingüístico completamente extraño. Estaba hablando una mezcla de esloveno arcaico del siglo XIX de textos de dominio público antiguos, mezclado con jerga de internet moderna gramaticalmente desastrosa.

Alicia
Me encanta esta parte. Era como un campesino medieval que acaba de descubrir TikTok. Completamente inútil para tareas cotidianas como redactar un correo electrónico de negocios o resumir un artículo de noticias.

Así que para solucionar esto, los ingenieros se dieron cuenta de que necesitaban texto moderno de alta calidad. Así que fueron a autores eslovenos contemporáneos y básicamente les preguntaron: "Oye, tu libro presenta un gran idioma esloveno moderno. ¿Puedes darnos tu literatura gratis para que podamos entrenar a nuestra IA?"

Beto
Y los escritores se negaron rotundamente.

Alicia
Naturalmente.

Beto
Señalaron que ya existe una comunidad lingüística de solo dos millones de personas luchando por ganarse la vida en un mercado diminuto. Y ellos no iban a entregar su trabajo a una empresa de tecnología gratis, solo para construir una máquina que eventualmente podría reemplazarlos.

Alicia
Esto destaca perfectamente la fricción entre el hambre masiva de la industria tecnológica por datos culturales y los humanos reales que producen esa cultura.

Pero sabes, el problema del lenguaje no es solo la falta de buenos datos de entrenamiento en los idiomas más pequeños. Está incrustado en la misma arquitectura matemática de cómo lee la IA.

Beto
Lo que nos lleva a la capa más profunda y fundamental que identifica el autor, que es el "monolingüismo sintético".

Alicia
Aquí es donde se pone realmente interesante. Para entender el monolingüismo sintético, tenemos que hablar de cómo la IA realmente lee. Como cuando tú o yo leemos un libro, leemos palabras infundidas de historia y contexto, pero una IA utiliza un proceso llamado "tokenización". Déjame darte una analogía para explicar cómo funciona esto.

Beto
Muy bien, te escuchamos.

Alicia
Imagina que tienes un cántico sagrado de mil años de gran conmoción y también tienes un formulario burocrático mundano del DMV ("Departamento de Vehículos Motorizados") para renovar tu licencia de conducir.

Beto
Correcto. Dos textos con pesos sociales, históricos y emocionales totalmente diferentes. Uno está diseñado para la trascendencia espiritual, el otro para el procesamiento administrativo.

Alicia
Exacto. Pero la tokenización es como meter ambos textos en una licuadora industrial masiva. Ambos se trituran en exactamente el mismo lodo numérico. Las palabras se descomponen en trozos de subpalabra y se convierten en tokens numéricos. La textura, el contexto cultural, la historia, todo es completamente obliterado. La IA no ve un cántico sagrado. Solo ve una secuencia de números de punto flotante.

Beto
Si conectamos esto con la imagen más grande, el modelo entonces toma estos tokens numéricos triturados y los proyecta en lo que los científicos de la computación llaman "un espacio latente de alta dimensión".

Alicia
Muy bien, espacio latente.

Beto
Piensa en el espacio latente como un mapa galáctico masivo, invisible y multidimensional. La IA traza estos tokens como coordenadas basándose puramente en la frecuencia con la que aparecen cerca unos de otros en los datos de entrenamiento. Este proceso crea lo que el autor llama un "Esperanto mecánico".

Alicia
Un Esperanto mecánico, así que está creando un lenguaje universal de números. Cuando una IA traduce algo, no está encontrando realmente el significado humano en un idioma y expresándolo hermosamente en otro.

Beto
Para nada. Solo está calculando la correlación de tokens dentro de ese mapa galáctico. Está mirando las coordenadas y diciendo estadísticamente, el token A en el idioma uno ocupa un vecindario matemático similar al del token B en el idioma dos.

Alicia
Vaya.

Beto
Y por eso Begǔs argumenta que no puedes simplemente arreglar la IA tirándole más datos diversos. La arquitectura matemática misma está fundamentalmente diseñada para optimizar la predicción estadística, no la sutileza cultural. Intrínsecamente aplana todo en puntos de datos de proximidad.

Alicia
Pero el artículo menciona un experimento que intentó eludir completamente este efecto licuadora, ¿correcto? Algo llamado "FinneGAN".

Beto
Sí. Esta es una de las aproximaciones alternativas más fascinantes que se están probando actualmente. Los investigadores querían ver qué pasaría si te negabas a cortar el lenguaje en tokens de texto discretos. Así que, en lugar de alimentar a una IA con texto escrito, entrenaron una red neuronal en ondas de audio continuas.

Alicia
Espera, ¿ondas de audio?

Beto
Específicamente, una grabación de alguien leyendo la novela "Finnegans Wake" de James Joyce.

Alicia
Oh, Dios mío, que es famosamente uno de los libros más complejos, agresivamente multilingües e insuperables jamás escritos. Es esencialmente un flujo de conciencia, un lenguaje de sueño.

Beto
Exacto. Al usar ondas de sonido continuas, mapeando frecuencia y amplitud en lugar de tokens de texto discretos, eludieron las fallas estructurales de la tokenización. Pudieron sondear el espacio latente de la IA de manera diferente, tratando el lenguaje como un espectro continuo y fluido en lugar de trozos de datos picados.

Alicia
Demuestra que la forma en que funciona la IA comercial ahora no es la única manera en que podría funcionar. Es decir, podemos diseñar arquitecturas que respeten la continuidad y complejidad de la cultura humana en lugar de mezclarla en una sopa numérica.

Beto
Correcto. Así que, si la arquitectura misma de nuestra IA comercial actual aplana la cultura, ¿cómo la evaluamos? ¿Cómo construimos mejores marcos?

El artículo sugiere que necesitamos tomar prestadas herramientas de académicos que han pasado décadas estudiando cómo fluye la cultura alrededor del mundo.

Alicia
Eruditos de la literatura mundial.

Beto
Exacto. Eruditos de la literatura mundial.

Alicia
Aquí es donde el artículo hace un giro brillante, creo. Porque los teóricos de la literatura mundial han estado mapeando este tipo exacto de colisiones culturales mucho antes de que se inventaran las computadoras. Por ejemplo, Franco Moretti utiliza un enfoque macroestructural, dividiendo el mundo en un núcleo y una periferia, que es una idea que adaptó de la teoría de los sistemas mundiales económicos.

Beto
Correcto. En términos de IA, Estados Unidos y China representan el núcleo. Tienen los enormes monopolios tecnológicos, las granjas de servidores, el capital de riesgo y construyen estos modelos masivos extrayendo datos a menudo sin consentimiento, compensación o atribución de la periferia.

Alicia
Que es básicamente todo lo demás.

Beto
Sí, especialmente comunidades lingüísticas más pequeñas. Es un espejo directo de los sistemas históricos de extracción de recursos, pero en lugar de minar minerales, están extrayendo expresión humana.

Alicia
Lo cual conduce directamente al problema identificado por otro académico, David Damrosch. Él habla sobre el globalismo, la interacción ideal entre formas locales y globales, donde un texto o una idea puede viajar por el mundo sin perder su alma local única. Pero debido a esta dinámica extractiva, la IA falla completamente en el globalismo verdadero.

Beto
Lo hace. Porque los modelos simplemente no tienen los datos localizados ricos necesarios para mapear esos vectores culturales únicos en su espacio latente.

Alicia
El artículo tiene el mejor ejemplo de este fallo. Los investigadores ejecutaron una prueba masiva de "prompt". Le pidieron a una IA que escribiera 11,850 historias cortas. Y lo único que cambiaron en el "prompt" cada vez fue la nacionalidad del personaje. Como escribir una historia sobre un noruego, escribir una historia sobre un serbio, y así sucesivamente.

Beto
Y a la IA se la obligó a depender de los vectores que estuvieran disponibles en su espacio latente anglocéntrico.

Alicia
Y los resultados fueron los estereotipos más reductivos, el denominador común más bajo que puedas imaginar.

Beto
Oh, apuesto.

Alicia
Las historias de los noruegos estaban completamente llenas de fjordos y trolls. Y las historias de los serbios, por alguna razón inexplicable, casi todas eran extrañamente dichas en bosques mágicos con hadas.

Beto
¿En serio?

Alicia
Sí. La IA simplemente no entiende el matiz de la cultura serbia moderna. Así que entra en pánico y recurre a un esqueleto de cuento de hadas de Europa del Este genérico solo para llenar los huecos. Es como un turista que visita un país pero nunca sale de la tienda de regalos del aeropuerto.

Beto
Lo cual nos lleva al tercer académico, el autor, Emily Apter. Ella defiende este concepto de la intraducibilidad. Después de resistir activamente la idea predominante de Silicon Valley de que todo debería ser perfectamente traducible sin fricciones para una audiencia global.

Alicia
Pero ¿cómo se programa realmente la intraducibilidad? Quiero decir, si todo el punto de un modelo de lenguaje es mapear todo en ese espacio matemático para que pueda predecir la siguiente palabra, ¿cómo programa un ingeniero una máquina para respetar una brecha cultural?

Beto
Bueno, esa es la frontera de esta investigación. Implica permitir intencionalmente la distancia en el espacio latente. Si un concepto cultural serbio específico no tiene un equivalente en inglés verdadero, el espacio vectorial no debería forzar una alineación con un bosque mágico genérico solo para producir un "prompt" completado. Los ingenieros tienen que descubrir cómo programar el modelo para que reconozca sus propios límites culturales, para dejar vacíos y requerir intervención humana en lugar de generar estereotipos suaves y confiados.

Alicia
Así que volviendo al oyente, si estás escuchando esto en tu trayecto, o sentado en tu escritorio mirando un cursor parpadeante en ChatGPT, ¿por qué debería importarte la teoría de la literatura mundial, o los vectores en un espacio latente?

Beto
Esto plantea una pregunta importante, ¿verdad? Porque hemos sido condicionados por la industria tecnológica a creer que el propósito final de la tecnología es hacer que todo sea suave, instantáneo y perfectamente comprensible.

Pero después, Begǔs argumenta que no todo necesita ser perfectamente globalizado, las palabras intraducibles en diferentes idiomas existen por una razón. Capturan humor local distinto, sentimientos geográficos específicos y formas únicas de ver el mundo que simplemente no existen en el inglés estadounidense estándar.

Alicia
La fricción no es un error en el sistema. La fricción es el punto; la fricción es donde reside realmente la humanidad. La próxima vez que abras una herramienta de IA para resumir una reunión desordenada que acabas de tener, o para ayudarte a redactar un correo electrónico sensible, presta mucha atención al guión narrativo que se está forzando sutilmente en tus pensamientos.

Beto
Nota las palabras específicas que elige por ti.

Alicia
Exacto. Date cuenta de que esta herramienta no es una calculadora objetiva y perfectamente precisa. Es una máquina cultural. Está tomando decisiones literarias altamente subjetivas en tu nombre, basándose en una visión del mundo centrada en Estados Unidos que fue triturada en una licuadora matemática.

Beto
Está moldeando activamente tu expresión, estandarizando tus pensamientos antes de que siquiera envíes el mensaje.

Alicia
De verdad lo hace. Y queremos dejarles una reflexión final para masticar hoy, una que se basa en todo este marco.

El texto fuente menciona a Johann Wolfgang von Goethe, el famoso escritor alemán. Hace 200 años, Goethe concibió esta idea de literatura mundial.

Beto
Pero no quiso decir una sopa global genérica donde todos lean las mismas historias planas.

Alicia
No. Él vio la literatura mundial como un proceso riguroso de corrección mutua entre naciones, una forma para que diferentes culturas desafíen, debatan y enriquezcan activamente entre sí.

Beto
Se pretendía como un intercambio dinámico, a veces incómodo, no como un aplanamiento masivo de la experiencia humana.

Alicia
Entonces, ¿qué pasaría si aplicáramos la idea de los 200 años de Goethe al futuro de la tecnología? ¿Qué pasaría si el objetivo final de la inteligencia artificial no debería ser simular perfectamente el pensamiento humano, o actuar como un servidor impecable y sin fricciones que solo nos diga lo que queremos escuchar?

Beto
¿Qué pasaría si actuara como algo completamente diferente?

Alicia
Correcto. ¿Qué pasaría si la IA fuera tratada como un socio alienígena completamente nuevo en una negociación relacional?

Imagina una IA que no solo imita nuestro inglés estadounidense estándar y hace eco de nuestros propios sesgos latentes hacia nosotros, sino una que empuje activamente de vuelta.

Beto
Una IA que crea un nuevo espacio cultural compartido donde los humanos y las máquinas se corrijen mutuamente, preservando la fricción que hace que la comunicación sea valiosa en primer lugar.

Alicia
Exacto. Si dejamos de tratar a la IA como una calculadora rota y empezamos a tratarla como un tipo de autor completamente nuevo, ¿dónde siquiera comenzaría la cultura de una máquina?

sábado, 28 de marzo de 2026

Encuesta sobre Modelos de Lenguaje a Gran Escala (LLM)

 
 

Esta extensa encuesta ofrece una visión técnica completa de los modelos de lenguaje a gran escala (LLM), analizando su evolución desde los primeros métodos estadísticos hasta las arquitecturas modernas con miles de millones de parámetros, como GPT-4 y LLaMA. Los autores examinan el fenómeno de las leyes de escala, que determinan cómo el aumento del tamaño de los datos y del modelo conduce al surgimiento de capacidades avanzadas como el razonamiento y el aprendizaje contextual. Se detallan las fases clave del desarrollo, centrándose específicamente en el papel fundamental del preprocesamiento de datos, las estrategias de preentrenamiento y el ajuste de las instrucciones para alinear los modelos con las preferencias humanas. El texto también cataloga recursos esenciales de código abierto, incluyendo conjuntos de datos y bibliotecas de software, para ayudar a los investigadores a comprender los complejos requisitos de ingeniería del desarrollo de LLM. En definitiva, las fuentes presentan a los LLM como solucionadores de tareas de propósito general que están revolucionando fundamentalmente el panorama de la inteligencia artificial.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "A Survey of Large Language Models", por Wayne Xin Zhao y colegas. Publicado el 18 de Marzo de 2026.

El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.

El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.


Resumen

Beto
Sabes, en realidad no hace tanto tiempo que lo más impresionante que la inteligencia artificial podía hacer era simplemente terminarte la frase en una barra de búsqueda.

Alicia
Exacto. Como que escribías "cómo hervir" y te sugería "un huevo".

Beto
Exactamente. Es un pequeño truco de salón. Pero hoy, quiero decir, estamos tratando con sistemas de IA que escriben arquitecturas de software complejas, pasan el examen de abogado y literalmente simulan el razonamiento humano paso a paso.

Alicia
Es un salto asombroso.

Beto
De verdad lo es. Hemos pasado de un autocompletar glorificado a algo que altera fundamentalmente cómo procesamos la información.

Alicia
Es un cambio completo de paradigma. Sí. Y dado que la velocidad de esta tecnología ha sido tan implacablemente rápida, es muy fácil mirar el panorama actual y sentir que estos modelos son simplemente cajas negras mágicas.

Beto
Claro.

Alicia
Pero en realidad no son magia. Son el resultado de avances muy específicos en matemáticas e ingeniería.

Cronologia de los LLMs

Beto
Totalmente. Y precisamente por eso la inmersión de hoy está diseñada para ser tu atajo definitivo para ponerte al día con lo que sucede bajo el capó.

Alicia
Sí. Hoy realmente vamos al fondo.

Beto
Sí. Anclamos nuestra conversación en la actualización 2026 de un artículo emblemático: se llama "A Survey of Large Language Models", elaborado por Wayne Xin Zhao y un enorme equipo de investigadores.

Alicia
Es un artículo fantástico.

Beto
De verdad lo es. Y nuestra misión hoy es cortar todo el lenguaje académico y extraer los mecanismos centrales de cómo funcionan realmente estos modelos. Vamos a desentrañar la evolución, las recetas de datos específicas y la sala de máquinas literal que los hace funcionar.

Alicia
Y para establecer un marco mientras nos sumergimos, creo que ayuda ver todo este campo a través de una única lente fundacional.

Beto
¿Cuál?

Alicia
Bueno, el modelado del lenguaje desde sus inicios siempre ha tenido un objetivo específico: comprimir el conocimiento del mundo en una máquina.

Beto
Comprimirlo.

Alicia
Sí. Ahora, simplemente, ¿qué ocurre cuando esa compresión alcanza una masa crítica explosiva?

Beto
Entonces tracemos esa compresión hacia atrás, porque para comprender verdaderamente la arquitectura de una IA moderna tienes que entender los cuellos de botella que nos retuvieron durante décadas. ¿Verdad?

Alicia
Absolutamente.


LLMs: de Predictores de Texto, a Solucionadores de Tareas

Beto
La encuesta traza cuatro generaciones distintas de modelos de lenguaje, empezando por pura estadística.

Alicia
Correcto. Así que la primera generación, que dominó los 90 y primeros 2000, confiaba en modelos estadísticos de lenguaje. Eran esencialmente modelos N-gram. Intentaban predecir la siguiente palabra basándose enteramente en la probabilidad de las pocas palabras que la precedían inmediatamente, pero chocaron con un enorme escollo, llamado "la maldición de la dimensionalidad".

Beto
Ajá, claro. Porque si quieres que el modelo realmente entienda el contexto de todo un párrafo, las combinaciones matemáticas de secuencias de palabras explotan exponencialmente, ¿no?

Alicia
Exacto. Se te acaba la potencia de cómputo casi al instante. Simplemente no puedes mapear la probabilidad de cada oración de 20 palabras en inglés.

Beto
¿Cómo lo superaron?

Alicia
Pues los investigadores tuvieron que replantear por completo cómo las máquinas representan el lenguaje. Eso condujo a la segunda generación alrededor de 2013, que fueron los modelos neuronales de lenguaje.

Beto
Y esa fue la era de word2vec.

Alicia
Exacto. En lugar de fijarse en coincidencias exactas de palabras, los investigadores usaron redes neuronales para mapear palabras como vectores distribuidos en un espacio continuo y multidimensional.

Beto
Bien. Así que en lugar de que una palabra sea solo una cadena de letras, se convierte en un conjunto de coordenadas.

Alicia
Sí.

Beto
Palabras con significados similares, como, no sé, "rey" y "reina", acaban físicamente más cerca en ese espacio matemático.

Alicia
Lo clavaste. Eso permitió a la máquina entender relaciones semánticas por primera vez.

Beto
Oh, wow.

Alicia
Y luego llegó la tercera generación con los modelos preentrenados de lenguaje, sobre todo BERT.

Beto
Oh, sí, BERT fue enorme.

Alicia
Lo fue. Porque en lugar de solo aprender coordenadas de palabras, estos modelos aprendieron representaciones conscientes del contexto. Leyeron enormes cantidades de texto sin etiquetar primero, ...

Beto
... absorbiéndolo todo.

Alicia
Sí. Aprendiendo el contexto bidireccional profundo de una oración antes de ser afinados para una tarea estrecha y específica, como traducción o análisis de sentimiento.

Beto
Pero seguían siendo, en última instancia, expertos estrechos, ¿no? Tenías un modelo para traducir francés y otro completamente distinto para resumir un documento.

Alicia
Exacto.

Beto
Así que el verdadero salto, la cuarta generación, ocurrió cuando los investigadores esencialmente decidieron dejar de construir expertos estrechos y, en su lugar, construyeron grandes modelos de lenguaje.

Alicia
Sí, la teoría subyacente cambió.

Beto
Y la filosofía predominante se volvió sorprendentemente directa, ¿no? Simplemente haz la red neuronal masiva.

Alicia
Sí, eso fue exactamente lo que pasó. Los investigadores hipotetizaron que si escalas los parámetros —las sinapsis artificiales de la red— y escalas los datos, el modelo no solo mejoraría en predecir texto;

Beto
se convertiría en un solucionador de tareas de propósito general.

Alicia
Precisamente. Y esta explosión en tamaño estuvo gobernada por leyes de escala increíblemente precisas.

Beto
Correcto. La primera de peso fue la ley de escala KM de OpenAI.

Alicia
Sí.

Beto
Esencialmente probaron una relación matemática que muestra que si tienes un presupuesto finito pero enorme de potencia de cómputo, obtienes el mejor retorno de inversión al dedicar ese cómputo a aumentar el tamaño bruto del modelo —el conteo de parámetros— en lugar de simplemente ejecutar más datos a través de un modelo más pequeño.

Alicia
Exacto. Más tarde, ese enfoque se refinó con la ley de escala Chinchilla por Google DeepMind.

Beto
Correcto.

Alicia
Y eso alteró fundamentalmente cómo se estaban utilizando los centros de datos.

Beto
Espera, quiero contraponer esto un segundo. Si OpenAI demostró que modelos más grandes dan mejores resultados, ¿por qué la industria no se centró exclusivamente en construir colosos de billones de parámetros?

Alicia
Es una buena pregunta.

Beto
Quiero decir, ¿hay un límite matemático a solo arrojar escala de parámetros al problema?

Alicia
Sí lo hay. Exactamente, eso es lo que probó el artículo de Chinchilla. Encontraron que la ley de escala KM en realidad subestimaba ligeramente la importancia de los datos en sí.

Beto
Interesante.

Alicia
Sí. DeepMind demostró que para obtener un rendimiento óptimo dado un presupuesto de cómputo, necesitas escalar el tamaño del modelo y la cantidad de datos de entrenamiento por igual.

Beto
Escalas iguales.

Alicia
Exacto. Así que si duplicas el número de parámetros en tu red, matemáticamente debes duplicar la cantidad de datos de entrenamiento que le das.

Beto
¿Si no?

Alicia
Terminas con un modelo masivamente hinchado que está esencialmente subentrenado e increíblemente ineficiente.

Beto
Entendido. Y cuando finalmente balancearon esa ecuación —grandes conteos de parámetros emparejados con enormes conjuntos de datos de alta calidad— vimos nacer lo que los investigadores llaman "habilidades emergentes".

Alicia
Sí, los saltos "mágicos".

Beto
Correcto. Son capacidades como seguir instrucciones complejas, aprender en contexto y razonamiento paso a paso. Esas que sencillamente no existen cuando un modelo tiene mil millones de parámetros, pero que se encienden de forma espontánea cuando alcanza los cien mil millones.

Alicia
Es fascinante.

Beto
Es como ver agua que se calienta: es solo agua caliente que se calienta más y más y, de repente, a 100 grados Celsius ocurre una transición de fase y se vuelve vapor. Cambia fundamentalmente su comportamiento.

Alicia
La metáfora de la transición de fase es perfecta. El modelo pasa de predecir meramente sintaxis a aparentemente predecir lógica.

Beto
Espera, sin embargo, porque no me queda del todo claro.

Alicia
¿Cómo es eso?

Beto
Bueno, si las leyes de escala Chinchilla y KM se basan en curvas matemáticas suaves y previsibles donde más cómputo equivale a una caída constante en la tasa de error, ¿por qué las salidas reales —esas habilidades emergentes— ocurren como picos repentinos e impredecibles? ¿Estamos realmente viendo un salto mágico en la cognición? ¿O es una ilusión creada por cómo los humanos evaluamos las pruebas?

Alicia
Esa es en realidad una de las preguntas más disputadas en el campo ahora mismo.

Alicia
Oh, absolutamente. Muchos investigadores sostienen que la emergencia es, en efecto, una ilusión causada por nuestras métricas de evaluación.

Beto
¿Cómo funciona eso?

Alicia
Bueno, piensa en cómo evaluamos a una IA en programación. Usamos una métrica binaria: ¿el código compiló y funcionó con éxito? ¿Sí o no?

Beto
Correcto.

Alicia
Por debajo del capó, el modelo podría estar mejorando de forma constante y suave su predicción de sintaxis durante meses a medida que escala. Pero no vemos esa curva suave.

Beto
Solo vemos que la puntuación salta de 0 a 100 exactamente el día que el modelo por fin pone todos los puntos y comas en su sitio.

Alicia
Exacto. Así que la comprensión interna de la IA está en un gradiente suave, pero nuestra percepción humana de su éxito es un acantilado repentino.

Beto
Hmm, eso tiene mucho sentido.

Alicia
Pero también hay que notar que para ti, el usuario final, esa discontinuidad es muy real. No te importa si una IA está al 90% de escribir un script de Python funcionando; solo te importa cuando cruza el umbral y realmente funciona.

Beto
Totalmente justo.

Alicia
Además, hay fenómenos documentados como el "grokking", donde la representación interna de un modelo se reorganiza de repente para generalizar perfectamente un patrón después de millones de pasos de rendimiento aparentemente aleatorio. Así que sí, la mecánica pura de la emergencia aún se está desenmarañando activamente.

Beto
Lo que nos lleva a la organización que realmente comercializó esas leyes de escala: OpenAI y la serie GPT.

Alicia
Exacto.

Beto
GPT, por supuesto, significa "Generative Pre-trained Transformer". La arquitectura empezó relativamente pequeña con GPT-1, luego GPT-2 con 1.500 millones de parámetros, y luego lanzaron GPT-3, que tenía 175.000 millones de parámetros.

Alicia
Y GPT-3 fue el modelo que realmente probó al mundo el concepto de aprendizaje en contexto.

Beto
Es decir, que no tenías que reentrenarlo para cada nueva tarea.

Alicia
Exacto. No necesitabas reentrenar los pesos del modelo. Podías simplemente darle unos pocos ejemplos en el propio prompt de texto, y el modelo identificaría el patrón y completaría la tarea dinámicamente.

Beto
Pero por impresionante que fuera GPT-3, no era GPT de verdad.

Alicia
No, no lo era.

Beto
No era el agente conversacional y razonador en el que confiamos hoy. Para salvar esa brecha, los investigadores tuvieron que implementar dos enormes mejoras de capacidad.

Alicia
Sí, así fue.

Beto
Y la primera es absolutamente fascinante para mí: el entrenamiento con código.

Alicia
Oh, esto es enorme.

Beto
OpenAI afinó sus modelos con grandes repositorios de código de GitHub, creando un modelo llamado Codex. Evidentemente, eso hizo a la IA buena programando. Pero la sorpresa fue que digerir código informático desbloqueó inesperadamente razonamiento sofisticado y lógica de cadena de pensamiento también en lenguaje natural.

Alicia
Es un efecto secundario brillante de la arquitectura.

Beto
¿Pero por qué? Quiero decir, ¿por qué alimentar a una red neuronal con miles de líneas de Python la convierte en mucho mejor para resolver un acertijo lógico en inglés o para escribir un ensayo legal altamente estructurado? ¿Qué tiene el código que enseña al modelo a "pensar"?

Alicia
Realmente se reduce a las diferencias estructurales entre el lenguaje humano y el código. El lenguaje humano es muy permisivo y, honestamente, a menudo ambiguo.

Beto
Eso es verdad.

Alicia
Si desordeno la sintaxis de una frase o uso un pronombre vago, normalmente puedes usar el contexto para deducir lo que quiero decir. Un modelo entrenado puramente en Reddit y Wikipedia aprende esa laxitud. Pero el código informático es completamente determinista. Es rígidamente jerárquico. Y, lo más importante, depende de dependencias estrictas a largo alcance.

Beto
Correcto. Porque si defines una variable en la línea 12, tiene que ser exactamente lo mismo cuando la llamas en la línea 800.

Alicia
Exacto. Requiere rastrear estados, mantener una lógica interna rigurosa y ejecutar procedimientos paso a paso para alcanzar un objetivo.

Beto
Vaya.

Alicia
Así que al forzar a la red neuronal a predecir el siguiente token en un bloque de código de software complejo, estás obligando matemáticamente a sus "attention heads" a rastrear esas dependencias a largo plazo y a internalizar la deducción secuencial.

Beto
Efectivamente aprende la arquitectura subyacente del razonamiento, que luego puede aplicar al lenguaje humano.

Alicia
Sí.

Beto
Básicamente le estás enseñando la disciplina estricta de la lógica.

Alicia
Precisamente.

Beto
Tiene todo el sentido. Así que el entrenamiento con código construye el "cerebro lógico".

Alicia
Sí.

Beto
Pero la segunda mejora de capacidad tenía que ver con el comportamiento.

Alicia
Pues sí: RLHF.

Beto
RLHF es "Reinforcement Learning from Human Feedback", Aprendizaje por refuerzo a partir de retroalimentación humana. Porque incluso un modelo de lenguaje masivo y muy lógico es, en última instancia, solo un motor de predicción de texto. Si lo dejas a su aire, puede divagar, generar contenido altamente tóxico o contestar una pregunta con otra pregunta.

Alicia
Correcto. El preentrenamiento puro te da un modelo que refleja con precisión Internet. Es decir, puede ser brillante, pero también caótico, sesgado y profundamente poco útil.

Beto
Totalmente.

Alicia
RLHF es la fase de alineamiento. Es el proceso de enseñar a ese sabio caótico la etiqueta necesaria para ser un asistente útil, inocuo y honesto.

Beto
Siempre lo pienso como tomar a un genio brillante pero completamente salvaje, que ha memorizado Internet entero, y enseñarle las reglas sociales para asistir a una cena formal.

Alicia
Es una gran analogía.

Beto
Y el mecanismo es literalmente poner a humanos en el bucle de entrenamiento como jueces de comportamiento.

Alicia
Correcto. Los investigadores le daban un prompt al modelo y este generaba varias respuestas potenciales. Los etiquetadores humanos leían esas respuestas y las ordenaban de mejor a peor según su utilidad y seguridad.

Beto
Pero espera: la IA no lee las clasificaciones y piensa "oh, me equivoqué, mejoraré". ¿Cómo altera esa preferencia humana realmente la red neuronal?

Alicia
Buena pregunta. Usan esas clasificaciones humanas para entrenar una segunda IA más pequeña llamada modelo de recompensa. Este modelo de recompensa aprende a puntuar el texto exactamente como lo haría un humano. Luego usan un algoritmo de aprendizaje por refuerzo, normalmente algo llamado "Proximal Policy Optimization" (PPO), para dejar que el modelo principal practique generando respuestas.

Beto
Y sea calificado.

Alicia
Exacto. Cada vez que genera una respuesta, el modelo de recompensa la puntúa. Durante millones de iteraciones, el modelo principal actualiza sus pesos internos para maximizar esa puntuación de recompensa.

Beto
Así que literalmente cambia sus distribuciones de probabilidad para favorecer el tono y la estructura que los humanos prefieren.

Alicia
Eso es exactamente.

Beto
Código le da lógica y RLHF le da personalidad y límites.

Alicia
Correcto.

Beto
Pero nada de eso funciona si la base subyacente está mal, lo que nos lleva a la dieta real del modelo: la receta de datos.

Alicia
El combustible.

Beto
Sabemos que ingieren petabytes de información: Common Crawl, scrapes web, bibliotecas de libros, artículos científicos de arXiv. Pero la encuesta enfatiza que no puedes simplemente echar datos crudos en un superordenador.

Alicia
No, para nada. La calidad de los datos es, posiblemente, el cuello de botella más crítico en la IA moderna.

Beto
Oh, sí.

Alicia
Las tuberías de limpieza son extraordinariamente complejas. Tienes filtrado heurístico para eliminar spam de baja calidad, limpieza de privacidad para remover información personal identificable y, quizá lo más importante, desduplicación.

Beto
Eliminar texto idéntico o altamente similar.

Alicia
Sí.

Beto
Espera un momento. Si la ley de escala Chinchilla dicta que necesitamos océanos absolutos de datos para entrenar bien estos gigantes, ¿por qué la desduplicación es tan crítica?

Alicia
Parece contradictorio.

Beto
Tiene razón: parece intuitivo pensar que necesitaríamos el mismo libro o artículo diez veces para que la IA memorice mejor ese concepto. ¿Por qué la IA se "envenena" al leer la misma frase demasiadas veces?

Alicia
Bueno, en el aprendizaje humano la repetición es buena. Pero en redes neuronales, el exceso de datos duplicados dispara una falla matemática conocida como "double descent" o "sobreajuste severo".

Este es el mecanismo: un modelo de lenguaje intenta aprender las reglas generales subyacentes de gramática, lógica y hechos. Cuando el algoritmo de entrenamiento encuentra la misma secuencia de texto una y otra vez, los gradientes matemáticos que actualizan los pesos del modelo comienzan a cavar una zanja profunda y estrecha. El modelo se sobreoptimiza para esa cadena específica de palabras.

Beto
Se fija en ella.

Alicia
Se queda anclado. Sus mecanismos de atención se sobrefijan en ese ruido repetitivo, lo que daña activamente su capacidad de generalizar a prompts nuevos no vistos. Si le preguntas algo ligeramente distinto, intenta forzar el texto memorizado en la respuesta. Básicamente rompe la capacidad del modelo para aprender dinámicamente en contexto.

Beto
Así que la diversidad en el conjunto de datos no es solo una preferencia: es estructuralmente vital para mantener los pesos neuronales flexibles.

Alicia
Exacto.

Beto
Fascinante. Entonces los datos se limpian agresivamente y se desduplican. Luego viene el proceso de tokenización.

Alicia
Sí.

Beto
Y este es un concepto que los usuarios avanzados realmente necesitan comprender. Porque una IA no "lee" la palabra "unbelievable" como lo hace un humano. No procesa palabras enteras basándose en sus definiciones.

Alicia
No: el texto bruto debe traducirse a números. Algoritmos como "Byte Pair Encoding" (BPE) escanean el conjunto de datos y van fusionando iterativamente los caracteres adyacentes que más aparecen.

Beto
Como bloques de Lego atómicos del lenguaje.

Alicia
Sí. Entonces puede mantener palabras comunes como "el" o "Apple" como tokens únicos, pero una palabra compleja o rara como "unbelievable" podría fracturarse en sub-tokens como "un", "believ" y "able".

Beto
Pero, ¿por qué no hacer cada palabra del diccionario su propio token? ¿No sería más limpio?

Alicia
Realmente se reduce a límites de vocabulario y eficiencia de la ventana de contexto. Si el vocabulario de tu modelo fuera una lista fija de 50.000 palabras enteras, ¿qué pasa cuando encuentra una falta de ortografía o un término de jerga nuevo o un nombre de variable muy específico en código?

Beto
Simplemente produciría un token desconocido.

Alicia
Exacto. Usando tokenización por subpalabras como BPE, el modelo puede construir o descomponer dinámicamente cualquier palabra en cualquier idioma o cualquier cadena de código a partir de sus componentes subword.

Beto
Tiene todo el sentido. Mantiene el diccionario comprimido pero infinitamente adaptable.

Alicia
Exacto.

Beto
Y una vez que tenemos esos tokens meticulosamente creados, los investigadores despliegan un currículo de datos. No vierten todo de golpe. El orden de las operaciones importa enormemente.

Alicia
Sí.

Beto
La encuesta destaca que codeloma es un ejemplo perfecto.

Alicia
Correcto. El aprendizaje por currículo imita el desarrollo cognitivo. Con codeloma, los investigadores primero entrenan el modelo en dos billones de tokens de texto general amplio. Esto construye la comprensión fundamental del lenguaje, hechos y estructura del mundo. Luego cambian al currículo, afinándolo con 500.000 millones de tokens de datos fuertemente orientados a código para inculcar ese razonamiento lógico del que hablamos.

Beto
Correcto. Construyendo la lógica.

Alicia
Y finalmente hacen una pasada hiperfocalizada de 100.000 millones de tokens específicamente relacionados con Python.

Beto
Básicamente: una educación general, seguida de una carrera en ciencias de la computación y culminada con una maestría en Python.

Alicia
Perfecta analogía.

Beto
Muy bien. Hemos curado la dieta perfecta, desduplicada y la hemos alimentado a través de un currículo optimizado. Entremos en la sala de máquinas mecánica.

Alicia
Vamos.

Beto
Cuando pulso Enter en un prompt, ¿cómo es la arquitectura física de la IA y cómo procesa mi solicitud?

Alicia
Casi todos los modelos de lenguaje de vanguardia usan una arquitectura llamada "decodificador causal", "causal decoder".

Beto
Bien.

Alicia
La variación científica del Transformador introducido en 2017: un decodificador causal opera bajo una regla estricta. Solo puede mirar hacia atrás, a los tokens que vinieron antes.

Beto
Nunca puede mirar hacia adelante.

Alicia
Correcto. Usa mecanismos de auto-atención para ponderar la importancia de cada palabra previa en tu prompt para predecir matemáticamente el siguiente token más probable.

Beto
Pero eso crea un enorme cuello de botella computacional, ¿no? Por la complejidad cuadrática de la auto-atención.

Alicia
Sí, lo hace.

Beto
Si te doy un prompt de mil palabras, cada una de esas palabras tiene que calcular su relación con todas las demás. Y si amplío el prompt a 10.000 palabras, la potencia de cómputo necesaria no solo sube por 10: explota de forma cuadrática.

Alicia
Es un problema de escala enorme.

Beto
¿Cómo manejan los modelos modernos esas ventanas de contexto masivas de 100.000 tokens sin fundir las GPUs?

Alicia
Lo hacen mediante una ingeniería arquitectónica brillante. Una de las rupturas más importantes destacadas en la encuesta es RoPE, que significa "Rotary Positional Embeddings".

Beto
RoPE. ¿Cómo resuelve RoPE el problema de contexto?

Alicia
En modelos más antiguos, tenías que asignar un número absoluto rígido a la posición de una palabra: palabra 1, palabra 2, palabra 3. Eso se desmorona a largas distancias. RoPE toma un enfoque matemático completamente distinto. En lugar de asignar una ID estática, toma el vector matemático de un token y literalmente lo rota en un plano complejo multidimensional según su posición en la secuencia.

Beto
¿En serio? Entonces, la posición se codifica como un ángulo.

Alicia
Exacto. Cuando el mecanismo de atención quiere saber qué tan separados están dos tokens —digamos un pronombre en la página 10 y el sustantivo al que se refiere en la página 1— simplemente calcula el ángulo entre sus dos vectores rotados.

Beto
Oh, wow.

Alicia
Esta posicionalidad relativa es increíblemente eficiente y permite al modelo mantener contexto a través de documentos vastos sin que las matemáticas se vayan al garete.

Beto
Pero incluso con RoPE optimizando la matemática de posición, sigue habiendo un enorme problema físico de memoria en las GPUs del servidor, ¿no?

Alicia
Oh, absolutamente.

Beto
Porque a medida que el modelo genera una respuesta token por token, tiene que almacenar los estados de auto-atención calculados —las matrices key y value— para cada token anterior. Así no tiene que recalcular todo el ensayo cada vez que añade una sílaba.

Alicia
Sí. Eso se conoce como la "caché KV". Y es el mayor devorador de memoria GPU en la IA hoy.

Beto
¿Cómo lo solucionan?

Alicia
Se apropian de un concepto de los sistemas operativos tradicionales llamado "memoria virtual paginada". En IA lo llaman "atención paginada", PagedAttention.

Beto
¿Cómo arregla la paginación la caché KV?

Alicia
Normalmente la caché KV requiere bloques continuos masivos de memoria. Si un bloque está fragmentado, la memoria se desperdicia y la GPU se queda sin espacio. La atención paginada lo soluciona troceando la caché KV en bloques pequeños de tamaño fijo que pueden almacenarse dinámicamente en espacios no contiguos fragmentados a través del pool de memoria de la GPU.

Beto
Muy inteligente.

Alicia
Reduce drásticamente el desperdicio de memoria, permitiendo al servidor manejar muchos más usuarios simultáneos y ventanas de contexto mucho más largas.

Beto
Y la encuesta también menciona que para acelerar la lectura física de esa memoria por parte de la GPU, los investigadores desarrollaron "FlashAttention", que optimiza el movimiento físico de datos entre los bancos de memoria grandes y lentos de la GPU y la caché de cómputo ultra‑rápida y pequeña junto al núcleo de procesamiento.

Alicia
Sí.

Beto
Minimiza el cuello de botella de IO.

Alicia
Exacto.

Beto
Pero lo que realmente me fascina es que los investigadores ya están mirando más allá del transformador por completo.

Alicia
Sí.

Beto
La encuesta destaca arquitecturas emergentes como Mamba, que usan modelos de espacio de estados.

Alicia
Correcto. Los "modelos de espacio de estados", "State Space Models" (SSM) están intentando destronar activamente al transformador. Como dijimos, el transformador tiene ese cuello de botella cuadrático por la auto-atención: cada token mira a todo token pasado. Mamba aborda el problema de forma lineal. Funciona algo así como una red neuronal recurrente tradicional donde mantiene un estado oculto que se actualiza a medida que lee token por token.

Beto
Pero espera: las redes recurrentes antiguas solían olvidar el comienzo de una oración al llegar al final. ¿Cómo evita Mamba eso?

Alicia
Mamba introduce un mecanismo de filtrado selectivo. Mientras procesa una secuencia, las matemáticas dictan dinámicamente qué información es vital para mantener en su memoria de estado interno y qué información es irrelevante y debe olvidarse de inmediato.

Beto
Eso es ingenioso.

Alicia
Porque no está reevaluando constantemente cada token pasado, los requisitos de cómputo de Mamba escalan linealmente con la longitud de la secuencia en lugar de cuadráticamente. Es una arquitectura increíblemente eficiente que podría representar el próximo gran cambio de paradigma.

Beto
El modelo ha digerido el prompt, mapeado los vectores multidimensionales, optimizado sus cachés de memoria y determinado matemáticamente la probabilidad de cada posible siguiente palabra en su vocabulario.

Alicia
Correcto.

Beto
Ahora tiene que elegir una. Esta es la estrategia de decodificación. Y el método más básico es la "búsqueda codiciosa".

Alicia
"Búsqueda codiciosa", "Greedy search", es exactamente lo que parece: el modelo mira la distribución de probabilidad para el siguiente token y simplemente selecciona la opción de mayor probabilidad. Lo hace cada vez sin excepción.

Beto
La búsqueda codiciosa hace un conversador terrible.

Alicia
Sí, lo hace.

Beto
Si siempre eliges la palabra estadísticamente más probable, la salida se vuelve repetitiva, en bucle y robótica.

Alicia
Claro.

Beto
El lenguaje humano es dinámico. No siempre usamos la palabra más predecible, por eso la investigación introdujo métodos de muestreo aleatorio como Top-p y el ajuste más crítico para cualquier usuario avanzado: la temperatura.

Alicia
La temperatura es esencialmente un modificador matemático aplicado a la distribución de probabilidad antes de que el modelo haga su elección.

Beto
Siempre la describo como un dial literal de creatividad para la IA.

Alicia
Lo es.

Beto
Si estás haciendo tus impuestos o pidiéndole a la IA que escriba una consulta SQL funcional, quieres la temperatura en cero. Quieres búsqueda codiciosa. Quieres determinismo porque hay una respuesta matemáticamente correcta. Pero si estás generando ideas para copy de marketing o escribiendo una novela, subes la temperatura.

Alicia
Exacto. Cuando aumentas la temperatura, digamos a 0.7 o 1.0, estás matemáticamente aplanando la curva de probabilidad.

Beto
Bien.

Alicia
El token de mayor probabilidad sigue estando arriba, pero la brecha entre él y el segundo, tercer o cuarto token más probable se reduce.

Beto
Entiendo.

Alicia
Esto permite al modelo muestrear aleatoriamente esos tokens ligeramente menos probables. Es lo que introduce metáfora, cadencia sorprendente y esa chispa elusiva de creatividad parecida a la humana.

Beto
Lo que sintetiza perfectamente la realidad de estos sistemas: los modelos basados en datos no son magia sensible.

Alicia
No lo son.

Beto
Son la colisión de leyes de escala muy predecibles, tuberías de datos meticulosas donde la desduplicación es literalmente cuestión de vida o muerte, maravillas arquitectónicas como RoPE y atención paginada, y estrategias de decodificación que transforman estadísticas crudas en un compañero conversacional.

Alicia
Todo es solo matemáticas e ingeniería.

Beto
Y saber manipular esas palancas —como entender por qué un modelo entrenado en Python es mejor en lógica deductiva— cambia fundamentalmente cómo aprovechas la técnica.

Alicia
Empodera absolutamente al usuario. Pero si retrocedemos y miramos la trayectoria esbozada en la encuesta de 2026, hay una pregunta estructural profunda que se cierne sobre todo lo que hemos discutido hoy.

Beto
¿Cuál?

Alicia
Bueno, hablamos de cómo las leyes de escala Chinchilla exigen mares masivos de datos diversos y perfectamente limpios, ¿verdad? La realidad es que la industria está topándose rápidamente con un muro. El texto humano de alta calidad generado orgánicamente en Internet es esencialmente un recurso finito, y se nos está acabando.

Beto
Vaya. Así que el pozo de datos humanos orgánicos se está secando.

Alicia
Exacto. Para seguir escalando, los laboratorios de IA recurren cada vez más a datos sintéticos. Están usando modelos actuales para generar billones de tokens de texto para entrenar la próxima generación de modelos de lenguaje.

Beto
Modelos entrenando modelos.

Alicia
Exacto. Incluso estamos viendo modelos evaluando y alineando a otros modelos sin humanos en el bucle.

Beto
Oh, vaya.

Alicia
Esto nos deja con una variable altamente provocativa para el futuro. Si la evolución continua de la IA depende fundamentalmente de que los modelos ingieran salidas sintéticas matemáticamente generadas por otros modelos, ¿desbloqueamos un bucle descontrolado de mejora recursiva, una inteligencia artificial general auto‑mejorante, o sin la diversidad orgánica y desordenada del lenguaje humano real, corremos el riesgo de atrapar a estas arquitecturas en una cámara de eco cerrada y degenerativa donde el modelo colapsa lentamente sobre su propio ruido estadístico?

Beto
Una cámara de eco algorítmica. Colapso del modelo. Eso da miedo, pero también es totalmente fascinante.

Alicia
Realmente replantea cómo pensamos sobre el techo de esta tecnología.

Beto
Completamente. Así que la próxima vez que escribas un prompt en una ventana de chat y veas esas palabras desplazarse por la pantalla, recuerda cuánto maquinaria invisible, lógica rigurosa y arquitectura estadística perfectamente equilibrada está funcionando a velocidad vertiginosa justo bajo la superficie.