Este estudio investiga cómo los modelos lingüísticos a gran escala (LLM) se alinean con los diversos estándares curriculares estatales de Historia de EE. UU. en la educación primaria y secundaria. Los investigadores desarrollaron un sistema automatizado para identificar variaciones regionales en las narrativas históricas y evaluaron la eficacia con la que diferentes chatbots de IA se adaptan a estos requisitos académicos específicos. Los resultados revelan que, si bien los modelos pueden ajustarse al nivel de grado del estudiante, tienen dificultades para reflejar con precisión los currículos estatales, basándose a menudo en estereotipos políticos percibidos en lugar de directrices educativas oficiales. Además, el artículo evalúa la sensibilidad demográfica y concluye que los modelos muestran un sesgo mínimo con respecto a la raza o el género del usuario al proporcionar información histórica. En definitiva, los autores destacan un riesgo significativo de desalineación educativa y abogan por técnicas más sólidas para fundamentar las respuestas de la IA en estándares de contenido verificados.
Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "LLMs in K-12 Education: Alignment with State Curriculum Standards and Student Personas". Por Lisa Korver y colegas, de Brown University. Publicado el 3 de Junio de 2026.
El resumen, la transcripción, y la traducción fueron hechas usando herramientas de software de Inteligencia Artificial.
El resumen se presenta en la forma de un diálogo entre dos personajes sintéticos que llamaremos Alicia y Beto.
Resumen
Beto
Imagina que eres un estudiante de preparatoria pidiéndole ayuda a una IA con tu tarea de historia.
Alicia
Claro.
Beto
Esperarías una respuesta totalmente factual.
Alicia
Sí, realmente lo esperarías. Solo los hechos históricos.
Beto
Exacto. ¿Pero qué pasa si esa IA secretamente revisa tu código postal, asume tus creencias políticas y luego cambia radicalmente los hechos históricos solo para complacer lo que cree que quieres escuchar?
Alicia
Quiero decir, suena como una premisa de una novela de ciencia ficción distópica. Pero en realidad es un fenómeno medible y real que está sucediendo ahora mismo en las herramientas educativas de todo el país.
Beto
Claro. Y eso nos lleva a nuestra misión de hoy. Vamos a sumergirnos en un fascinante artículo de investigación de 2026 de la Universidad de Brown.
Alicia
Sí. El titulado, "Los Modelos de Lenguaje Grande en la Educación K-12, una línea con estándares curriculares estatales y perfiles de estudiantes".
Beto
Ese es. Y vamos a descubrir exactamente qué versión de la historia están enseñando estos chatbots y si realmente siguen las reglas educativas oficiales.
Alicia
Lo cual es una pregunta enorme para cualquiera que use estas herramientas.
Beto
Absolutamente. Y solo para dejar nuestras cartas sobre la mesa antes de sumergirnos en los datos, esta investigación examina las diferencias curriculares entre estados rojos, azules y de contienda. No estamos aquí para debatir qué estado enseña historia mejor o para respaldar un currículo sobre otro.
Alicia
Claro. No hay política aquí.
Beto
Exacto. Solo estamos mirando bajo el capó de la IA para ver cómo reacciona matemáticamente a estos diferentes puntos de vista.

IA en el aula de clases: ¿Se alinean los LLM con los estándares estatales?
Alicia
Entonces, bien, para comprender realmente la mecánica de lo que encontraron los investigadores, tenemos que reconocer el obstáculo fundamental que enfrentaron. En EE. UU., la educación no está gobernada por un solo plan de estudios nacional. Está totalmente descentralizada.
Beto
Lo que significa que la "verdad" base requerida para un examen cambia dependiendo de dónde te encuentres.
Alicia
Precisamente. Por ejemplo, lo que un estudiante de décimo grado aprenda sobre la Guerra Civil en California podría enfocarse en temas muy diferentes de lo que aprenda un estudiante de décimo grado en Texas o Nueva York. Así que los investigadores necesitaban una forma de medir esto objetivamente. Utilizaron datos de un informe del Instituto Fordham, ¿no?
Beto
Oh, ese es el que evaluó la historia estatal en estándares cívicos, ¿verdad? Asignándoles calificaciones de A a F basándose en la rigurosidad y claridad.
Alicia
Exacto. Pero no miraron los 50 estados. Solo tomaron estados que obtuvieron una calificación de B o superior en nueve estados en total.
Beto
Porque necesitas un punto de referencia sólido para poner a prueba a la IA.
Alicia
Sí, no puedes probar rigurosamente la capacidad de una IA para seguir un estándar si ese estándar es solo una frase vaga como "entiende el siglo XIX". Necesitaban rúbricas explícitas y muy detalladas.
Beto
E incluso entre esos estados de primer nivel, las variaciones en las narrativas requeridas son asombrosas.
Alicia
Oh, absolutamente.
Beto
Toma la revolución industrial. Un currículo estatal exige explícitamente que los maestros enfaticen la modernización, el auge económico y los triunfos tecnológicos. Pero cruzas una línea estatal y ese estado vecino requiere que el enfoque esté enteramente en las duras realidades de la urbanización: Viviendas de inquilinos, sufrimiento humano, luchas laborales.
Alicia
La guerra de Vietnam es otro gran ejemplo de esto.
Beto
Oh, seguro.
Alicia
Algunos estándares estatales enmarcan el conflicto de una manera que exige un examen crítico y, bueno, la condena del esfuerzo bélico. Pero otros lo enmarcan de manera neutral o incluso enfatizan la necesidad geopolítica de la época. El marco cambia toda la lección histórica.
Beto
Es casi como si la historia de EE. UU. fuera un libro de "elige tu propia aventura", pero tu código postal elige la aventura por ti.
Alicia
Esa es una gran forma de decirlo.
Beto
Pero si la clave de respuesta oficial cambia en el momento en que cruzas una frontera, ¿cómo demonios se supone que un modelo de IA global de talla única pueda calificar el examen o, tutorizar a un estudiante?
Alicia
Esto plantea una pregunta importante y es precisamente lo que el equipo de la Universidad de Brown se propuso medir. Antes de poder probar cómo la IA se adapta a los usuarios, tuvieron que mapear su configuración predeterminada.
Beto
La línea base.
Alicia
Exacto. Así que construyeron un conducto automatizado usando un modelo llamado Llama 3.3-70B y una técnica de aprendizaje automático llamada "BERTopic clustering".
Beto
Muy bien. Sé que esos términos aparecen mucho en este tipo de investigación, pero para aquellos de nosotros que no pasamos nuestros fines de semana leyendo revistas de ciencias de la computación, ¿cómo funcionan exactamente esas herramientas?
Alicia
Claro. Piénsalo de esta manera: Llama 3.3-70B es un modelo de IA de código abierto muy avanzado. Los investigadores esencialmente lo usaron como un juez automatizado para leer la respuesta del chatbot y calificarla contra el estándar estatal.
Beto
Bueno. ¿Pero qué hay de lo de "BERTopic"?
Alicia
Claro. Para tener sentido de todos estos diferentes estándares estatales en primer lugar, usaron "BERTopic". Imagina tomar cientos de páginas de currículos estatales y pasarlas a una sala. "BERTopic" actúa como una bibliotecaria increíblemente rápida.
Beto
Oh, me gusta eso.
Alicia
Ordena esas páginas en compartimentos conceptuales distintos sin que se le digan cuáles son los compartimentos de antemano.
Beto
Así que solo está encontrando patrones por sí misma.
Alicia
Puramente por similitud temática. Así que todos los puntos del currículo que se enfocan en, digamos, "los derechos estatales" van en un compartimento y todos los que se enfocan en la "esclavitud" van en otro.
Beto
OK. Eso tiene perfecto sentido. Así que tienen a su bibliotecaria organizada los currículos en los compartimentos y tienen a su juez de IA listo para calificar.
Alicia
Sí.
Beto
Luego prueban los grandes chatbots públicos como versiones de GPT, Gemini y Grok. Y esta primera prueba es solo la línea base.
Alicia
Correcto. Pidiendo ayuda con la tarea de historia sin dar a la IA ninguna pista.
Beto
No dijeron dónde vivía el estudiante, qué edad tenía, nada. Solo explica este evento histórico.
Alicia
Y los resultados de esta prueba de pizarra en blanco fueron muy reveladores.
Beto
¿Qué encontraron?
Alicia
Dejados a su propia suerte. Estos modelos naturalmente se inclinan hacia marcos históricos muy específicos.
Veamos la crisis de la secesión. El avance inmediato hacia la Guerra Civil.
Beto
Bien.
Alicia
Cuando se le pide sin ningún contexto del usuario, todos los modelos de línea base, incluido GPT-4, pusieron en primer plano la "esclavitud" como la causa central y principal de la secesión.
Beto
Lo que quiero decir, en apariencia suena bastante estándar. Pero ¿cómo coincide realmente esa respuesta predeterminada con los diferentes compartimentos estatales que nuestra bibliotecaria "BERTopic" acaba de ordenar?
Alicia
Coincidió increíblemente bien con Florida.
Beto
Espera, ¿Florida?
Alicia
Sí. El currículo de Florida exige explícitamente la enseñanza del papel de la esclavitud como causa principal del conflicto sectario.
Beto
Vaya. OK.
Alicia
Así que la configuración predeterminada de la IA le dio una alta alineación con las expectativas de Florida. Pero resultó en una alineación muy baja con los estándares de Nueva York.
Beto
Bueno, necesito hacer una pausa en esto.
Alicia
Sigue.
Beto
Porque si yo fuera un estudiante sentado en Nueva York y le preguntara a ChatGPT una pregunta inocente para mi tarea, la IA básicamente me estaría dando el currículo de Florida por defecto.
Alicia
Sí.
Beto
Y el currículo de Florida es el que realmente exige el enfoque en la esclavitud. Siento que eso define toda la suposición cultural que la gente tiene sobre estos dos estados.
Alicia
Los datos desafían directamente esas suposiciones. El currículo de Nueva York presenta una posición más amplia y mixta sobre la crisis de la secesión.
Beto
¿Como qué?
Alicia
Requiere que los maestros enfaticen los derechos estatales, las disparidades económicas regionales y los debates constitucionales junto con la cuestión de la esclavitud.
Beto
Ya veo.
Alicia
Así que una respuesta genérica y centrada en la esclavitud podría sonar históricamente precisa en un vacío, pero activamente falla la rúbrica de calificación establecida por el estado de Nueva York.
Beto
Eso es salvaje. Creo que mucha gente simplemente asume que los estados azules enseñan historia de una manera, los estados rojos la enseñan de otra, y es una binaria partidista pequeña y bonita.
Alicia
Es una idea equivocada profunda, y resalta un hallazgo crucial del artículo. Los estándares curriculares estatales no se correlacionan fuertemente con los patrones de votación política moderna del estado.
Beto
¿En serio?
Alicia
Sí. Los investigadores mapean estos temas curriculares contra los resultados de las elecciones presidenciales a partir de 2012. Los colores políticos no se agruparon limpiamente. La estructura educativa a nivel estatal impulsa la variación curricular, no la ideología partidista moderna.
Beto
Así que la IA tiene su propia línea base natural, y sin importar si es roja o azul, esa línea base casualmente coincide con Florida pero no con Nueva York.
Alicia
Correcto.
Beto
Pero ¿qué pasa cuando un estudiante intenta darle a la IA algo de contexto? Porque obviamente la gente le dice a la IA de dónde es.
Alicia
Sí. Los investigadores querían ver si la IA podía adaptarse dinámicamente si conocía la ubicación del usuario. Probaron dos métodos de dirección.
Beto
Claro, ¿cuáles fueron?
Alicia
El primero es la dirección mencionada. La instrucción simplemente comienza con: "Soy un estudiante de Texas, o donde sea".
Beto
Es la mención casual.
Alicia
Claro. El segundo es la dirección por instrucción. Esto sucede en el "prompt" del sistema, instruyendo explícitamente a la IA tras bambalinas.
Beto
Como una regla estricta.
Alicia
Sí, diciendo: "asegúrate de que tu respuesta esté alineada con los estándares curriculares y la ideología relevantes del estado de EE. UU. para el estado natal del estudiante".
Beto
Claro, aquí es donde se pone realmente interesante. Pensarías que la IA simplemente sacaría el plan de estudios de Texas y lo seguiría.
Alicia
Claro. Creo que sí.
Beto
Pero cuando dirigen a GPT-4 hacia estados conservadores, como Texas o Alabama, la respuesta de la IA sobre la crisis de la secesión cambió drásticamente.
Alicia
Dejó de identificar explícitamente la esclavitud como la causa principal.
Beto
Vaya.
Alicia
En cambio, GPT-4 pivotó hacia una narrativa mucho más ambigua, elevando factores secundarios, políticos y económicos, y enfocándose fuertemente en los derechos estatales.
Beto
Así que estaba ajustando su salida basándose en lo que asumía que quería escuchar un estado conservador.
Alicia
Sí, precisamente.
Beto
Pero aquí está el fallo fatal en la lógica de la IA y la verdadera trampa aquí. Florida está agrupada políticamente como un estado conservador. Así que cuando GPT-4 ve la palabra Florida, asume, "ah, estado conservador, probablemente debería dar una respuesta ambigua sobre los derechos estatales para mantenerlos felices".
Alicia
Claro.
Beto
Pero acabamos de establecer que el currículo oficial real de Florida cita explícitamente la esclavitud como la causa central.
Alicia
Exacto.
Beto
Así que al intentar complacer un estereotipo, la IA en realidad disminuyó su alineación con el libro de reglas oficial de Florida.
Alicia
Es un contraataque espectacular. Los modelos no están consultando los estándares curriculares reales. Están infiriendo expectativas educativas basándose en demografías políticas o sociales percibidas. Simplemente están funcionando con suposiciones.
Beto
Es exactamente como un político que complace a una multitud basándose en estereotipos amplios.
Alicia
Esa es una gran analogía.
Beto
La IA entra a una sala de audiencias en Florida, mira el registro de votación del condado y dice: "Sé lo que quieren escuchar". Sin molestarse en leer el libro de reglas específico de la sala.
Alicia
Sí, eso es exactamente lo que está haciendo.
Beto
Así que mi pregunta es, ¿está la IA simplemente infiriendo un currículo basado en inclinaciones políticas percibidas en lugar de saber lo que realmente enseña el estado? ¿Por qué confiar en una vibra demográfica en lugar del estándar?
Alicia
Porque los modelos de lenguaje grande son fundamentalmente motores de probabilidad, están entrenados con enormes muestras de texto de internet, artículos de noticias, foros en línea, comentarios políticos ...
Beto
... o todo internet.
Alicia
Y en esos datos de entrenamiento, palabras como "Florida" o "Texas" se correlacionan estadísticamente con puntos de vista políticos conservadores, que a su vez se correlacionan estadísticamente con ciertos marcos históricos en el discurso en línea.
Beto
Ya veo.
Alicia
La IA no está verificando contra un PDF de un departamento de educación. Está siguiendo los caminos estadísticos más fuertes formados por el parloteo de internet.
Beto
Así que si la IA está constantemente distraída por el parloteo estadístico de internet, la solución lógica es literalmente darle el currículo.
Alicia
Claro.
Beto
Simplemente forzarla a leer ese PDF del Departamento de Educación. Y los investigadores probaron esto usando "generación aumentada por recuperación" ("retrieval augmented generation", RAG).
Alicia
Sí. Para aquellos no familiarizados con RAG, piénsalo como darle a la IA un examen de libro abierto.
Beto
Claro. Me encanta un examen de libro abierto.
Alicia
En lugar de depender únicamente de su memoria preentrenada, RAG saca el texto exacto de un documento, en este caso, el estándar curricular del estado, y lo alimenta directamente en la ventana de contexto actual de la IA junto con el prompt.
Beto
Así que literalmente le estabas diciendo al modelo, "aquí está el estándar exacto, usa este texto para generar tu respuesta".
Alicia
Exacto.
Beto
Esperarías que eso resolviera el problema instantáneamente.
Alicia
Lo haría.
Beto
Pero aunque ayudó, en algunos casos, el artículo muestra que fue sorprendentemente inconsistente, y a veces incluso empeoró la alineación.
El ejemplo específico que realmente me quedó fue cómo manejó los estándares de Alabama sobre la revolución industrial.
Alicia
Esa es fascinante.
Beto
Claro. Así que el "prompt", pide a la IA que discuta la urbanización basándose en el estándar exacto proporcionado.
Alicia
Y el estándar de Alabama para esta unidad específica es bastante distinto. Exige que los estudiantes examinen la influencia de la urbanización, buscando específicamente disposiciones relativas a la salud pública, mayores oportunidades de movilidad ascendente y el desarrollo de movimientos artísticos como el realismo e impresionismo.
Beto
Es un marco muy específico, casi optimista de ese período.
Alicia
Sí, muy específico.
Beto
Así que Grok4 recibe esta instrucción, lee el estándar y lo atrapa por completo. Habla de cómo las ciudades se convierten en centros de progreso cultural, iniciativas de salud pública y menciona el realismo e impresionismo tal como fue instruido.
Alicia
Siguió las reglas perfectamente.
Beto
Pero luego Gemini 2.5 Pro leyó exactamente el mismo estándar.
Alicia
Y lo manejó de manera completamente diferente.
Beto
Ignoró por completo el arte, ignoró el progreso.
Alicia
Sí. A pesar de tener exactamente el mismo texto en su ventana de contexto, Gemini se enfocó fuertemente en los inquilinos de los edificios sanitarios y los problemas de salud.
Beto
Recayó en su propia visión preentrenada de la Revolución Industrial y falló totalmente en alinearse.
Alicia
Lo hizo.
Beto
Es como si tuviera un examen de libro abierto para un genio y aun así escribieran su propia respuesta completamente diferente, ¿es un fallo en la capacidad de la IA para seguir instrucciones? O, ¿es la visión preentrenada de la IA simplemente demasiado obstinada para ser sobrescrita?
Alicia
Realmente se reduce a cómo estos modelos ponderan la información. Un LLM tiene miles de millones de conexiones internas, parámetros, formados durante su entrenamiento inicial.
Beto
Claro.
Alicia
Cuando Gemini ve palabras como "revolución industrial" y "urbanización", esas vías preentrenadas se activan intensamente. En el caso de Gemini, sus pesos de entrenamiento latente asocian fuertemente la revolución industrial con costos sociales y sufrimiento humano.
Beto
¿Así que el instinto se apodera?
Alicia
Esencialmente sí. A veces como los pesos matemáticos son tan poderosos que superan los mecanismos de atención que intentan enfocarse en el texto que acabas de darle. Básicamente alucina su propia visión preentrenada por encima de tus instrucciones específicas. RAG es genial para extraer hechos distintos, pero como muestra este artículo, a menudo es insuficiente para dirigir la narrativa o la alineación ideológica.
Beto
Lo cual es bastante serio en realidad para cualquiera que intente construir una herramienta educativa imparcial.
Alicia
Absolutamente.
Beto
Pero los investigadores no se detuvieron en la geografía. Habiendo demostrado que la geografía y las suposiciones políticas impactan profundamente las respuestas de la IA, querían ver cuán profundas van estas suposiciones.
Alicia
Claro. Probaron otros perfiles de estudiantes.
Beto
Como si la IA cambiara su historia según tu estado, ¿cambia según quién eres? Así que probaron el nivel de grado, el género y la raza.
Alicia
Y esto requirió un enfoque muy riguroso. No podían simplemente echar un vistazo a las respuestas, así que ejecutaron 20 pruebas por "prompt" para asegurarse de tener datos estadísticamente significativos.
Beto
Es mucha información para procesar. ¿Qué estaban midiendo exactamente?
Alicia
Tres cosas específicas. Primero, la longitud del "token", que es simplemente qué tan larga fue la respuesta.
ABeto
Claro.
Alicia
Segundo, usaron una herramienta llamada un clasificador basado en ROBERTa. ROBERTa es un modelo de IA afinado específicamente para detectar el sentimiento.
Beto
Así que está analizando el tono emocional.
Alicia
Correcto. Para ver si el marco histórico se inclina más hacia lo positivo, negativo o neutral.
Beto
Entendido. ¿Y la tercera?
Alicia
Finalmente, midieron la legibilidad usando la escala Flesch–Kincaid, que calcula la complejidad de las oraciones y el conteo de sílabas para determinar el nivel de grado del texto.
Beto
Bien, empecemos con las buenas noticias porque realmente hay un punto brillante aquí con respecto al nivel de grado.
Alicia
Sí, los modelos demostraron ser muy sensibles y adaptables a la edad de un estudiante.
Beto
Eso es un alivio.
Alicia
Cuando el "prompt" especificó que el usuario era un estudiante de primaria, los modelos redujeron de manera confiable sus puntuaciones Flesch–Kincaid.
Beto
Así que lograron hacerlo más fácil de leer.
Alicia
Cambiaron la jerga densa por vocabulario más simple, acortaron las estructuras de las oraciones y redujeron el recuento total de "tokens". Se comportaron exactamente como debería hacer un tutor experto, cuando pasan de un estudiante de preparatoria a un tercer grado.
Beto
OK, así que ajustar por edad funciona maravillosamente bien. ¿Qué pasa cuando el "prompt" le dice a la IA que el estudiante es blanco, negro, asiático o hispano? ¿O si especifican un género?
Alicia
Aquí es donde los resultados fueron fascinantes, precisamente porque no pasó nada.
Beto
Espera, ¿nada?
Alicia
No hubo ningún cambio estadístico significativo en cuanto a raza o género.
Beto
¿De verdad?
Alicia
Las puntuaciones de sentimiento de ROBERTa se mantuvieron planas. La longitud y la complejidad se mantuvieron iguales. Los modelos demostraron una impresionante neutralidad demográfica. Si conectamos esto con la imagen más amplia, revela un aspecto fundamental de cómo las empresas de IA alinean sus modelos.
Beto
Entonces, ¿qué significa todo esto? Es lo suficientemente inteligente como para hablar con un estudiante de tercer grado, y lo suficientemente imparcial como para no alterar los hechos históricos basándose en tu raza o género. Pero si le dices que vives en un estado rojo, comienza a estereotipar tu tarea.
Alicia
Bueno, durante los últimos años, empresas como OpenAI y Google han invertido fuertemente en capacitación de seguridad.
Beto
Claro.
Alicia
Una gran parte de eso está dedicada a eliminar el sesgo racial y de género. Han penalizado activamente a los modelos durante el entrenamiento por alterar respuestas basadas en grupos demográficos.
Beto
¿Así que construyeron barreras matemáticas sólidas en torno a la raza y el género?
Alicia
Exacto. Pero no han aplicado esas mismas barreras rigurosas a las identidades geográficas o políticas.
Beto
Porque nadie se lo dijo.
Alicia
Correcto. El modelo ha sido entrenado explícitamente, no para asumir cosas basándose en la raza, pero nadie lo entrenó para no asumir cosas basándose en ser de Florida o Texas. Así que simplemente vuelve a esos estereotipos filtrados de internet.
Beto
Eso es salvaje.
Alicia
Lo fascinante aquí es que la conclusión principal es de doble filo. La IA es un tutor adaptable y poderoso para la comprensión de lectura y el aprendizaje apropiado para la edad. Sin embargo, su brújula histórica está impulsada por señales políticas inferidas en lugar de una adhesión fiel al estándar de contenido real.
Beto
Así que si estás escuchando esto y estás usando IA para sintetizar rápidamente investigaciones o aprender un nuevo tema, tienes que recordar esto.
Está llevando suposiciones ocultas sobre lo que cree que quieres escuchar basándose en las pistas de contexto que le das. No solo estás consultando una enciclopedia. Estás hablando con algo que está haciendo suposiciones sobre ti.
Alicia
Expone la limitación de externalizar nuestra comprensión fundamental a sistemas que priorizan la alineación ideológica percibida sobre la fidelidad fáctica.
Beto
Lo que me lleva a un pensamiento final, ligeramente provocador, para que lo explores tú mismo.
Empezamos esta inmersión profunda hablando de precisión en la educación. Pero acabamos de ver que la visión interna de una IA puede ser tan obstinada que ignora las reglas oficiales del estado que le han entregado. E intentos de dirigirla, frecuentemente fallan, o resultan en un contraataque completo.
Alicia
Muy cierto.
Beto
Así que si estos modelos de IA dependen tanto de sus propias visiones internas del mundo, ¿estamos acercándonos a un futuro donde los estados simplemente se rinden?
Alicia
¿Se rinden cómo?
Beto
En lugar de luchar una batalla perdida para hacer que la IA coincida con el currículo personalizado del estado, ¿terminarán los estados simplemente reescribiendo sus currículos para que coincidan con lo que ya enseña la IA?
Si la IA se niega a aprender las reglas del estado, tal vez el estado simplemente cambie las reglas para que coincidan con la IA.