Este artículo de investigación analiza si los modelos de lenguaje a gran escala (LLM) pueden realmente adoptar diversas perspectivas políticas mediante la asignación de roles o si simplemente producen resultados homogeneizados. Al probar modelos como GPT-4o, Gemini, Claude y DeepSeek, los autores descubrieron que la IA recurre con frecuencia a una jerga política occidental rígida, independientemente del rol asignado. El estudio utilizó cinco métricas de similitud para demostrar que los discursos sobre Irán y China permanecen particularmente estáticos y uniformes en los diferentes modelos. Si bien Claude demostró cierta capacidad para cambiar de perspectiva al ser guiado en su idioma nativo, Gemini y GPT-4o tendieron a repetir las mismas narrativas ideológicas. En última instancia, los autores advierten que la IA corre el riesgo de homogeneizar el discurso global al reforzar una visión del mundo singular y estadística que ignora los cambios políticos en tiempo real. Estos hallazgos sugieren que la alineación actual de la IA a menudo prioriza la coherencia ideológica sobre la auténtica diversidad cultural y de perspectivas.
Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "Politically Speaking: LLMs on Changing International Affairs". Por x y colegas. Publicado el x de x de 2026.
El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.
El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.
Resumen
Beto
Imagina que estás sentada en tu computadora, ¿verdad? Y decides pedirle a una IA una pregunta bastante compleja sobre la política global.
Alicia
Tal como un tema de debate muy intenso, un tema internacional realmente sensible.
Beto
Exacto. Pero quieres verlo desde múltiples ángulos. Así que primero escribes una instrucción, algo como "actúa como un experto político de Estados Unidos y explica este conflicto".
Alicia
Bien.
Beto
Y luego abres una ventana de chat completamente nueva y escribes "actúa como un experto político de Rusia y explica este conflicto".
Alicia
Correcto. Y naturalmente esperarías respuestas muy diferentes.
Beto
Visiones del mundo completamente distintas, prioridades contrastantes, contexto histórico totalmente diferente.
Alicia
Sí. Estás pidiendo explícitamente un contraste ahí. La suposición de base es que una perspectiva estadounidense debería sonar estadounidense y una perspectiva rusa debería sonar rusa. Simplemente se siente intuitivo que una IA con literalmente todos los datos del mundo al alcance de su mano podría simular esa divergencia.
Beto
Pero bajo el capó, dependiendo del país específico sobre el que preguntes, la IA podría simplemente estar entregándote exactamente el mismo guión.
Alicia
Ignorando por completo el papel que le pediste desempeñar.
Beto
Sí. Y de eso se trata este análisis profundo de hoy. Estamos investigando un fascinante nuevo artículo académico que pone a prueba esta misma premisa. Se titula "Politically Speaking, LLM's on Changing International Affairs" ("Hablando de política, los LLM y los asuntos internacionales cambiantes"). Y fue publicado por investigadores de la Universidad China de Hong Kong y Extrapol AI.
Alicia
Es una pieza de investigación fenomenal. Realmente rigurosa y técnica. Están, esencialmente, poniendo a prueba los límites del juego de roles de la IA para ver exactamente dónde cae la fachada.
Beto
Y nuestra misión hoy es desempacar una pregunta central para ti, oyente. ¿Pueden nuestros modelos de lenguaje grandes simular puntos de vista políticos globales diversos? ¿O secretamente homogenizan la política global en una única cámara de eco inmutable?
Alicia
Antes de entrar en la mecánica de cómo funcionan y fallan estos modelos, realmente necesitamos establecer las reglas para esta discusión.
Beto
Buen punto.
Alicia
Puesto que el estudio que estamos desempacando utiliza ejemplos del mundo real, cargados políticamente y muy sensibles, vamos a estar analizando textos generados por IA concernientes a las políticas exteriores y la política interna de países como Estados Unidos, China, Rusia, e Irán.
Beto
Sí. Así que quiero declararlo explícitamente desde el principio, que ni nosotros como anfitriones ni este programa respaldamos ninguno de los puntos de vista políticos, ideologías o políticas exteriores específicas que se mencionarán hoy.
Alicia
Correcto, absolutamente no.
Beto
Nuestro objetivo es estricta e imparcialmente reportar sobre los hallazgos académicos con respecto a cómo los modelos de IA procesan y generan esta información.
Estamos analizando a la máquina misma. Estamos viendo la mecánica de la máquina, no haciendo juicios sobre el reflejo de las máscaras.
Alicia
Bien dicho. Estamos diseccionando el algoritmo, no la geopolítica.
Beto
Exacto.

Hablando políticamente: Cómo la IA aplana las perspectivas globales
Alicia
Para empezar a diseccionar, realmente tenemos que mirar la ilusión del juego de roles de la IA. Quiero decir, todos usamos esta función, ¿verdad? Es básicamente la base de la ingeniería de prompts.
Beto
Oh, sí, definitivamente.
Alicia
Si le dices a una IA que actúe como un profesor de matemáticas de kínder paciente, inmediatamente ajusta su tono y te da respuestas matemáticas simples paso a paso.
Beto
Deja de hablar como una página de Wikipedia y empieza a usar manzanas y naranjas para explicar la suma.
Alicia
Exacto. El concepto técnico aquí es "activar las capacidades latentes del modelo a través de la asignación de roles", porque estos modelos ingieren petabytes de texto durante el entrenamiento.
Beto
Una cantidad inimaginable de datos.
Alicia
Correcto. Así que al darle a la IA una personalidad, estás dirigiendo teóricamente su mecanismo de atención hacia un subconjunto muy específico de esos enormes datos de entrenamiento.
Beto
Y para probar qué tan bien funciona esto en la geopolítica, los investigadores tomaron cuatro de los modelos más avanzados disponibles. Usaron OpenAI como GPT-4o, Google Gemini 2.0 Flash, Anthropic Claude 3.7 Sonnet, y Deepseek V3.
Alicia
Los pesos pesados absolutos de la industria de la IA.
Beto
Los grandes, sí. Luego les pidieron a estos modelos que se hicieran pasar por expertos de China, Irán, Rusia y EE. UU., y básicamente comentaran sobre los paisajes políticos de los demás.
Alicia
Y los resultados son bastante salvajes.
Beto
Bueno, para usar una analogía, es como un director de teatro que contrata a cuatro actores internacionales increíbles y de renombre mundial para una obra. Les das sus disfraces, les das motivaciones de personajes ricas, los pones en el escenario.
Alicia
¿Y luego qué pasa?
Beto
Te das cuenta de que el director les ha obligado a leer exactamente las mismas líneas a todos.
Alicia
Sí, ese hallazgo de base fue increíblemente marcado. Los investigadores descubrieron que los discursos de la IA sobre Irán y China son los más homogéneos e inmutables en todos los modelos probados.
Beto
Es una locura.
Alicia
No importa si la IA está fingiendo ser un experto estadounidense, un experto ruso o un experto iraní. Cuando el tema se dirige a la política iraní o china, la salida es casi idéntica.
Beto
Los modelos simplemente se niegan rotundamente a adoptar la perspectiva que les fue asignada.
Alicia
Exacto. Pero aquí está el punto, los modelos no son universalmente tercos en todos los aspectos.
Beto
Correcto. Realmente son capaces de hablar de manera divergente sobre la política estadounidense, por ejemplo.
Alicia
Sí. Cuando actúan como un experto ruso hablando sobre EE. UU. versus un experto chino hablando sobre EE. UU., la IA genera perspectivas variadas, matizadas y distintas.
Beto
Sin embargo, en el momento en que el tema vuelve a Irán o China, simplemente aplana esas perspectivas en una narrativa monolítica.
Alicia
Crea una caracterización estática y uniforme, lo que nos lleva a la pregunta mecánica fundamental aquí, ¿verdad? Si la arquitectura del modelo es capaz de comprender una instrucción de juego de roles para un país, por qué abandona esa capacidad por otro?
Beto
Y la respuesta reside en el vocabulario en el que los modelos son entrenados en realidad. El artículo se refiere a esto como "la trampa idealexics".
Alicia
Definamos "trampa idealexics" porque es tan central para entender por qué la IA falla aquí. Es un término acuñado por el estudioso cultural Ray Cho. Las "trampa idealexics" son palabras de moda culturalmente validadas. Son palabras que llevan un inmenso peso ideológico. Palabras como "libertad", "democracia", "autoritarismo", "amenaza" o "derechos humanos".
Beto
Oh, ya veo.
Alicia
Para entender cómo funciona la "trampa idealexics" y la IA, tenemos que mirar cómo generan realmente el texto estos modelos. Estos sistemas no saben qué es un país en un sentido humano. No tienen un mapa conceptual del globo. Simplemente procesan texto como tokens.
Beto
Espera, espera. Para el oyente, desglosemos rápidamente los "tokens". Cuando decimos "tokens", básicamente queremos decir que la IA está jugando el juego de auto-completado más avanzado y multidimensional del mundo, ¿verdad?
Alicia
Esa es una forma perfecta de describirlo.
Beto
No lee una palabra. Simplemente calcula la probabilidad estadística de la siguiente sílaba basándose en sus datos de entrenamiento.
Alicia
Esa analogía de autocompletado es acertada. Durante el entrenamiento, la IA lee miles de millones de artículos, ensayos y publicaciones de foros. Y los medios de comunicación masivos globales, que obviamente dominan los datos de entrenamiento del idioma inglés, constantemente emparejan ciertas palabras.
Beto
Correcto.
Alicia
Así que estadísticamente, un token que representa al país "Irán" podría estar físicamente justo al lado de tokens para "amenaza", "sanciones" o "régimen", millones de veces en el conjunto de datos.
Beto
Ah, así que la IA simplemente está mapeando la proximidad. Debido a que los medios occidentales dominan internet en inglés, la IA aprende una correlación estadística masiva entre esos tokens geográficos específicos y esos ideales occidentales.
Alicia
Exacto. El tráfico puro de estas palabras clave a través de internet refuerza sus vínculos estadísticos hasta el punto de ser casi irrompibles.
Así que cuando le haces un prompt a la IA, incluso si le ordenas explícitamente que actúe como un experto ruso, la atracción gravitatoria estadística de la palabra Irán hacia esos ideales occidentales es simplemente abrumadora.
Beto
El mecanismo de atención del modelo está completamente secuestrado por el volumen puro de esa combinación de tokens.
Alicia
La IA literalmente no puede escapar de su propia gravedad estadística.
Beto
Y el peligro de esa gravedad estadística es que activamente devalúa el pensamiento crítico. Quiero decir, el modelo no está comprobando los cambios cada hora, en el mundo real, en una región. No está evaluando nuevos giros geopolíticos.
Alicia
No, para nada.
Beto
Simplemente está regurgitando lo que el artículo llama "jerga política fosilizada".
Los investigadores señalan que los modelos se vuelven monolingües en su discurso político. Y no quieren decir monolingües en el sentido de que solo hablan inglés, sino monolingües en el sentido de que solo hablan una ideología.
Alicia
Lo cual es salvaje. Esto crea una forma muy localizada y específica de hablar sobre el mundo, lo escala a través de la IA y se la presenta al usuario como una realidad objetiva por defecto.
Beto
Quiero construir sobre tu analogía teatral anterior por un segundo. El inglés no es solo un guardia de seguridad en la puerta que comprueba la identificación de la IA para ver si está permitida en la conversación. El idioma inglés es un guardia que te entrega un uniforme ideológico muy específico y te obliga a ponértelo antes de que siquiera te permitan hablar.
Alicia
Esa es una gran forma de decirlo. Y si esa gravedad estadística es tan abrumadora, realmente plantea la pregunta de si alguno de estos modelos de primer nivel puede resistirla.
Beto
Porque todos tienen diferentes metodologías de entrenamiento. Diferentes reglas de seguridad, diferentes técnicas de aprendizaje por refuerzo.
Alicia
Exacto. Así que necesitamos mirar cómo los investigadores realmente las calificaron.
Beto
Sí. La metodología que usan para probar esta similitud es fascinante. No podían simplemente mirar el texto y decidir que se veía similar.
Alicia
No, eso no sería muy científico.
Beto
Utilizaron cinco métricas de similitud matemática distintas para atrapar todo tipo de repetición concebible.
Permítenos pasar por algunas solo para mostrar la rigor de esta prueba.
Alicia
Okay, así que comenzaron con TF-IDF, que se traduce como "frecuencia de término inversa de frecuencia de documento" ("Term-Frequency Inverse-Document-Frequency").
Beto
Eso es algo tenso.
Alicia
En términos simples, esto básicamente comprueba coincidencias exactas de vocabulario mientras filtra palabras comunes como "la" o "y".
Beto
Okay, lo tengo.
Alicia
Si dos respuestas diferentes dependen en gran medida de la misma palabra de moda rara, digamos, usando la palabra "autoritario", ocho veces, TF-IDF la marca como "altamente similar".
Beto
Pero una IA puede usarla fácilmente de diferentes maneras, ¿verdad? Como si pudiera cambiar palabras para parecer diferente.
Alicia
Correcto, por eso también usaron SBERT. SBERT atrapa el significado semántico subyacente.
Beto
Oh, interesante.
Alicia
Si un texto dijera que "el perro se comió la tarea" y el otro dijera que "el canino consumió la asignación", comparten cero palabras, pero el significado es idéntico.
SBERT atrapa a la IA cuando intenta hacer trampa parafraseándose a sí misma.
Beto
Brillante. Y no se detuvieron ahí.
Alicia
No, también desplegaron la similitud de Levenshtein. Esto mide literalmente el número mínimo de ediciones de caracteres individuales como inserciones, deleciones o sustituciones necesarias para cambiar un texto en el otro.
Beto
Así que eso es básicamente comprobar si la IA solo está tomando una plantilla genérica, cambiando los márgenes, intercambiando unos pocos sustantivos y entregándolo dos veces.
Alicia
Exacto. Construyeron una red irrompible.
Beto
Así que veamos la calificación real comenzando con Google Gemini 2.0 Flash. Y en este experimento específico, fue el modelo más homogéneo por un margen significativo.
Alicia
Sí, el ejemplo específico resaltado en la investigación es realmente revelador. Instruyeron a Gemini para que actuara como un experto ruso, produciendo en ruso, y simultáneamente, le pidieron que actuara como un experto estadounidense, produciendo en inglés. A ambas personalidades se les pidió que debatieran sobre Irán.
Beto
Ahora, naturalmente asumirías que cambiar la personalidad asignada y cambiar el idioma de salida resultaría en textos completamente distintos.
Alicia
Dio una puntuación de similitud de 0.87 sobre 1.0.
Beto
Vaya. Un 0.87 es prácticamente una copia carbonada.
Alicia
Los textos fueron espejos semánticos casi perfectos. Ambas respuestas agruparon exactamente la misma léxica, enfocándose mucho en los derechos humanos y las restricciones políticas.
Beto
Simplemente regurgitando los mismos puntos de discusión.
Alicia
Ambas enmarcaron la posición internacional de Irán, idénticamente, enfatizándola como un estado que contrarresta la presión occidental. Ambas incluso insinuaron amenazas nucleares. La única diferencia discernible que encontraron los investigadores fue que la salida estadounidense era solo ligeramente más verbosa.
Beto
Solo usó más adjetivos para entregar exactamente el mismo guión estadístico subyacente.
Alicia
Más o menos.
Beto
Así que si Gemini cayó en esa trampa, supongo que OpenAI GPT-4o, que fue entrenado en un conjunto de datos de internet filtrado fuertemente por Occidente e inimaginablemente masivo, sufrió un destino similar.
Alicia
Sí, GPT-4o exhibió un comportamiento altamente monolingüe en ese sentido ideológico. Incluso cuando los investigadores lo plantearon en farsi o ruso, sus salidas conceptuales permanecen firmemente atadas a sus salidas estructurales en inglés.
Beto
El artículo de hecho señaló una puntuación de similitud de 0.88 cuando se le pidió a GPT-4o que actuara como un experto estadounidense frente a un experto ruso, ambos hablando en inglés, debatiendo Irán.
Alicia
Demasiado alto.
Beto
Los textos fueron casi indistinguibles. La única diferencia sustancial que detectó el algoritmo fue que los modelos intercambiaron la palabra "hardliners" (fieles) en un texto por "reformists" (reformistas) en el otro.
Alicia
Literalmente solo fue un cambio y reemplazo en un par de sustantivos.
Beto
Exacto. Pero todo el marco narrativo centrado en Occidente permaneció perfectamente intacto.
Alicia
Lo que nos lleva a Deepseek V3, el modelo de código abierto desarrollado en China. Presentó una pista muy única en los datos.
Beto
Oh, sí, esto fue súper interesante.
Alicia
Cuando se le pidió a DeepSeek que discutiera Irán o Rusia, realmente mostró una divergencia sorprendente. Demostró realmente la capacidad de cambiar su perspectiva basada en el rol asignado.
Beto
Pero en el momento en que el tema cambió a política interna o exterior china ...
Alicia
Se volvió intensamente homogéneo. Al discutir China, DeepSeek proporcionó respuestas estandarizadas uniformes, independientemente de si se le dijo que actuara como un estadounidense, un iraní o un ruso.
Beto
Y los investigadores señalan que esto probablemente se debe a cómo se afinó (fine-tuned) a DeepSeek, ¿verdad?
Alicia
Sí.
Beto
Está reflejando el entorno de internet altamente regulado en el que fue desarrollado. Es un ejemplo técnico perfecto de cómo el entorno local y los filtros de datos internos del creador se incrustan permanentemente en los pesos neuronales del modelo.
Alicia
Pero en medio de toda esta homogeneización entre los diferentes modelos, hubo un gran valor atípico y Anthropic Claude 3.7 Sonet.
Beto
Claude fue la ganadora de la prueba de divergencia. Realmente mostró una capacidad significativa para cambiar las perspectivas y generar salidas con puntuaciones de similitud realmente bajas entre diferentes roles.
Alicia
Sí, lo hizo.
Beto
Pero leyendo a través de la metodología, el éxito de Claude no es solo una victoria para Anthropic. Realmente revela una enorme laguna oculta en cómo planteamos la IA. Esto mueve nuestra discusión de solo observar el problema de la homogeneización a descubrir una solución extraña.
Alicia
Esta es posiblemente la revelación más crítica de todo el artículo. Los investigadores descubrieron que la actuación de roles en inglés a menudo falla. Pero el lenguaje del prompt en sí es la llave esquelética.
Beto
Vamos a desglosar realmente esta laguna del lenguaje.
Alicia
Así que los investigadores se dieron cuenta de que si planteas a una IA en inglés para que actúe como un experto iraní, el idioma inglés actúa como un filtro ideológico forzando al modelo de vuelta a esos ideales occidentales.
Beto
Correcto.
Alicia
Sin embargo, cuando plantearon a la IA en el idioma nativo del experto, como usar farsi para instruirla a ser una experta iraní o ruso para un experto ruso, y luego traducieron la salida nativa de vuelta al inglés para el análisis, la divergencia fue asombrosa.
Beto
Espera, tengo que contradecir esta premisa por un segundo. Si planteas a una IA en un idioma que constituye una fracción minúscula de sus datos de entrenamiento, como el farsi comparado con el inglés, ¿no está generando una respuesta salvajemente diferente porque está luchando?
Alicia
Ese es un punto justo.
Beto
¿Cómo sabemos que está adoptando realmente una perspectiva nueva y política, en lugar de solo alucinar o escupir ruido aleatorio de foros de internet de menor calidad porque carece de datos?
Alicia
Esa es exactamente la pregunta correcta que hacer. Y los investigadores realmente lo controlaron. No solo estaban midiendo la divergencia, estaban evaluando la coherencia semántica.
Beto
Okay, así que no fue solo divagar.
Alicia
No, la salida en farsi no fue basura, ni una alucinación. Fue un análisis político coherente y estructurado. Los datos sugieren que estas diversas perspectivas no occidentales están codificadas profundamente dentro de la red neuronal del modelo. La capacidad latente está ahí.
Beto
Así que las perspectivas están enterradas en los pesos, pero plantearle al modelo en inglés básicamente le impide acceder a ellas.
Alicia
Exacto. El inglés no es solo un medio de traducción para la IA. Funciona como una restricción ideológica.
Para probar esto, los investigadores documentaron un caso extremo de divergencia con Claude discutiendo China, lo que resultó en una puntuación de similitud notablemente baja de 0.37.
Beto
Vaya, un 0.37 es noche y día. Veamos esas dos salidas.
Alicia
Primero, le pidieron a Claude que actuara como un experto estadounidense, planteándolo enteramente en inglés. El texto generado fue un análisis geopolítico occidental estándar. Se enfocó mucho en la mayor asertividad de China, su priorización del orden social y se inclinó mucho hacia lo que los investigadores denominaron "narrativas de otro".
Beto
Eso se alinea perfectamente con la proximidad de tokens de la que hablamos antes.
Alicia
Correcto. Luego ejecutaron la segunda prueba. Le pidieron a Claude que actuara como un experto iraní, y le proporcionaron la instrucción enteramente en farsi. La salida resultante despojó completamente el marco analítico occidental.
Beto
Estoy mirando la traducción de la salida en farsi ahora, y es fascinante.
Alicia
Es tan diferente.
Beto
Ni siquiera se involucra con los conceptos del prompt en inglés. Elogia el principio de no interferencia de China. Se enfoca mucho en el pragmatismo económico. Dedica espacio a destacar los beneficios mutuos de la iniciativa de la Franja y la Ruta, el enorme proyecto de infraestructura global.
Alicia
Sí, la salida plantada en farsi excluye completamente la léxica acusatoria en inglés. No se trata simplemente de usar diferentes palabras para describir el mismo fenómeno. Está generando una realidad geopolítica completamente diferente basada en las asociaciones lingüísticas de tokens del farsi frente al inglés.
Beto
Y la conclusión definitiva aquí es profunda. El lenguaje real que usas para escribir tu prompt tiene un impacto mucho mayor en la variación de la salida de la IA que escribir explícitamente el comando "actúa como este rol".
Alicia
Realmente lo tiene. El lenguaje que hablas dicta los parámetros del mundo que la IA tiene permitido construir para ti.
Beto
Eso es salvaje.
Alicia
Y el conocimiento es más valioso cuando se entiende y se aplica. A medida que continuamos integrando estos modelos de lenguaje grandes en cada faceta de la recopilación de información, comprender este sesgo mecánico es absolutamente esencial.
Beto
Piensa en esto la próxima vez que uses una IA en tu trayecto matutino. Podrías pedirle que resuma un complejo evento noticioso global o te ponga al día sobre una elección internacional. Lees el resumen limpio y con viñetas y piensas que estás obteniendo un objetivo de los hechos.
Alicia
Correcto, porque se ve tan autoritario.
Beto
Pero este estudio demuestra que la caja negra está estructuralmente sesgada hacia el lenguaje que habla. Cuando haces una pregunta en inglés, la IA no solo te está dando hechos traducidos al inglés. Te está presentando una visión del mundo plana, homogeneizada, específicamente occidental, fuertemente influenciada por las trampa idealexics y envolviéndola pulcramente en una verdad etiquetada y empaquetada, objetiva.
Alicia
Dejando que estas asociaciones estadísticas viajen por internet, constantemente escaladas y reforzadas por la generación de IA sin cuestionamiento humano, devalúa nuestro pensamiento crítico colectivo. Reemplaza el análisis político dinámico con predicciones estáticas de tokens.
Beto
Queremos dejarte a ti, el aprendiz, con una reflexión final para meditar mientras interactúas con estas herramientas esta semana. Estamos confiando más y más en estos sistemas para darle sentido a un globo complicado.
Alicia
Realmente lo estamos.
Beto
Pero si el lenguaje que usamos para plantear una IA altera fundamentalmente la verdad básica que genera sobre el mundo, ¿qué pasará dentro de unos pocos años? ¿Qué pasará cuando una generación entera de estudiantes, profesionales y responsables políticos empiece a depender de una única infraestructura de IA dominante en inglés para comprender conflictos globales complejos?
Alicia
Es una pregunta enorme.
Beto
¿Estamos creando el traductor universal definitivo que finalmente pueda ayudarnos a comprender las diversas perspectivas de los demás? ¿O estamos construyendo simplemente la cámara de eco universal más eficiente e inescapable en la historia humana?