domingo, 26 de julio de 2026

HeartMuLa: Modelos de código abierto para la creación musical

 
 

Este texto presenta HeartMuLa, una completa familia de modelos de código abierto para la creación musical, diseñados para mejorar la calidad y la accesibilidad de la creación musical mediante IA. Este ecosistema se basa en cuatro pilares principales: HeartCLAP para la alineación de audio y texto, HeartTranscriptor para el reconocimiento de letras, HeartCodec para la compresión de audio de alta fidelidad y el modelo generativo HeartMuLa. Una innovación clave es HeartCodec, que utiliza una baja velocidad de fotogramas para capturar de forma eficiente estructuras musicales extensas, manteniendo al mismo tiempo detalles acústicos complejos. El sistema admite la generación compleja y controlable por el usuario, lo que permite a los creadores definir estilos, letras y audio de referencia para canciones de hasta seis minutos. Mediante un proceso de entrenamiento de cuatro etapas que incluye ajuste fino supervisado y aprendizaje por refuerzo, los investigadores lograron reproducir con éxito la síntesis musical de calidad profesional utilizando recursos académicos. En definitiva, estos modelos pretenden proporcionar una base transparente y de alto rendimiento para futuros avances en la producción de contenido multimodal y la inteligencia musical.

Enlace al artículo científico, para aquellos interesados en profundizar en el tema: "HeartMuLa: A Family of Open Sourced Music Foundation Models", por los equipos de HeartMuLa. Publicado el 7 de Julio de 2026.


Resumen

Beto
Si abres hoy un generador de música de IA comercial y escribes, por ejemplo, "una canción de synth pop animada sobre beber café",

Alicia
Obtienes un éxito.

Beto
Así es. Algo increíble sucede. Dos minutos después, sale una pista totalmente mezclada y lista para la radio. Se siente como magia.

Alicia
Sí. Lo hace.

Beto
Pero para los desarrolladores e investigadores que intentan construir la próxima generación de IA, es en realidad una caja negra profundamente frustrante. Está totalmente bloqueada detrás de un muro de pago corporativo. Realmente no sabemos cómo está haciendo esas elecciones creativas.

Alicia
Bueno, es la definición absoluta de un sistema cerrado. Quiero decir, le das una instrucción (prompt). Ella escupe el audio y los mecanismos internos, el proceso de pensamiento real del algoritmo está totalmente oculto al público.

Beto
Lo que nos lleva a la misión del análisis profundo de hoy. Estamos forzando esa caja abierta.

Alicia
Por fin.

Beto
Sí. Estamos viendo este enorme artículo de investigación recién publicado sobre un proyecto llamado HeartMuLa. Es una familia de modelos fundacionales de música de código abierto ("open source"). Y lo que han demostrado aquí realmente cambia el panorama.

Alicia
Es un gran logro.

Beto
Han demostrado que la generación de canciones de alta fidelidad de seis minutos y calidad comercial, la misma calidad por la que pagas suscripciones en plataformas como Suno o Udio, puede lograrse utilizando datos a escala académica.

Alicia
Sí. Y una arquitectura totalmente de código abierto. Debido a que es código abierto, el telón se levanta. Finalmente tenemos un plano reproducible y transparente de cómo un algoritmo realmente aprende a componer una sinfonía o escribir un gancho pop.

Beto
Así que, ya sea que seas un músico frustrado que busca una pista de acompañamiento, o quizás un creador de videos que necesita música de fondo muy específica sin tener que lidiar con derechos de autor, ...

Alicia
Oh, sí, esos son los peores.

Beto
... O simplemente alguien que escucha ahora mismo y está fascinado por cómo las computadoras realmente aprenden a crear ambiente, este análisis profundo va a revelar la mecánica subyacente.

HeartMuLa_Music_AI_Ecosystem_1024.png
HeartMuLa: Un Ecosistema de IA de Música, de código abierto y alta fidelidad

Beto
De acuerdo, desglosemos esto.

¿Por dónde empezamos con el sistema tan complejo lógicamente antes de que una computadora pueda escribir una canción? Tiene que ser capaz de escuchar y digitalizar el audio, ¿verdad?

Alicia
Sí, ese es el desafío fundamental. Quiero decir, no puedes simplemente introducir formas de onda de audio crudas en una red neuronal y esperar que las entienda.

Beto
Es demasiado ruido.

Alicia
Exacto. Los datos son demasiado densos. Necesitas un tokenizador, algo para comprimir ese audio crudo en tokens digitales discretos. Piensa en ello como crear un alfabeto musical que la IA pueda leer y escribir fácilmente.

Beto
De acuerdo, tiene sentido.

Alicia
Y para HeartMuLa, este tokenizador se llama HeartCodec. Y lo que lo hace increíblemente único es su tasa de muestreo (frame rate). Comprime el audio a una tasa ultra baja de 12.5 hertz.

Beto
Permíteme detenernos aquí porque 12.5 hertz suena como solo una especificación técnica, pero sospecho que es el punto clave de todo este proyecto. La mayoría de los códecs de audio comerciales estándar operan a lo que digamos entre 25 y 50 hertz.

Alicia
Sí, ese es el estándar de la industria, generalmente alrededor de 50.

Beto
Así que al reducirlo a 12.5 hertz, esencialmente estás teniendo la mitad o incluso una cuarta parte de la cantidad de datos que el modelo tiene que procesar por cada segundo de audio.

Alicia
Exacto.

Beto
Es como intentar describir una película visualmente compleja a un amigo. En lugar de enviarle todos los 24 fotogramas por segundo, que consume un ancho de banda masivo, le envías un resumen brillante y denso cada segundo.

Alicia
Me encanta esa analogía.

Beto
Y ese resumen captura perfectamente la iluminación, el diálogo y el ambiente.

Alicia
Sí. Y esa reducción de la carga computacional es realmente la única razón por la que la generación de canciones de seis minutos es siquiera posible aquí. Quiero decir, si la IA tuviera que predecir tokens musicales a 50 hertz, generar una pista de longitud completa requeriría una secuencia computacional tan masiva. Simplemente colapsaría los sistemas académicos estándar.

Beto
O tardaría horas en renderizar un solo minuto de audio.

Alicia
Exacto. Así que reducir la tasa de fotogramas resuelve el problema de la duración, pero sabes, introduce un problema masivo de fidelidad.

Beto
Sí, porque la música no es solo un sonido. Un segundo de una canción tiene un bombo, una línea de bajo, un cantante respirando, armonías de fondo, reverberación.

Alicia
Hay tanto sucediendo.

Beto
Si comprimes todo eso a solo 12.5 fotogramas por segundo, ¿cómo no pierde todo ese detalle rico?

Alicia
Bueno, lo resolvieron al no depender de una sola forma de escuchar. HeartCodec utiliza esta estrategia de múltiples codificadores (multi-encoder). Realmente combina tres codificadores preentrenados diferentes para capturar capas específicas del sonido simultáneamente.

Beto
Tres diferentes. De acuerdo.

Alicia
Sí. Primero, utiliza Whisper para capturar la fonética. Así que se centra puramente en cómo se están articulando las palabras.

Beto
Solo las voces.

Alicia
Sí. Segundo, utiliza un codificador llamado WaveLM para atrapar pistas fonéticas y matices vocales adicionales. Y finalmente, utiliza un codificador ME para capturar la riqueza semántica y acústica.

Beto
¿Qué significa?

Alicia
Es decir, el timbre de la guitarra, el tono del platillo, la melodía general. Y luego fusiona matemáticamente esas tres perspectivas distintas antes de comprimirlas en ese token de 12.5 hertz.

Beto
Oh, wow. Así que procesar las letras e instrumentos como capas semánticas totalmente separadas es un cambio masivo. Significa que el modelo no solo está escuchando un muro de sonido.

Alicia
Correcto. Es claramente consciente del cantante frente a la banda.

Beto
Lo que me lleva a una pregunta sobre las letras mismas. Porque entender la voz humana en una canción es notoriamente difícil para las computadoras. Si intento dictar un mensaje de texto mientras la canción de rock suena en mi coche.

Alicia
Nunca funciona.

Beto
Mi teléfono genera jerga absoluta.

Alicia
Sí. Porque los modelos de voz estándar están entrenados en audio hablado limpio, como audiolibros o podcasts. Cuando introduces riffs de guitarra pesados o bajos retumbantes o platillos estallando, actúa como una interferencia acústica masiva.

Beto
Sí.

Alicia
La IA está básicamente tratando de escuchar una conversación susurrada en un club nocturno ruidoso y abarrotado.

Beto
¿Cómo sabe HeartMuLa qué palabras cantar, si ni siquiera puede transcribir con precisión sus propios datos de entrenamiento?

Alicia
Bueno, construyeron una herramienta especializada llamada HeartTranscriptor. Empezaron con el modelo de texto-a-voz Whisper, pero lo afinaron específicamente en un conjunto de datos masivo de audio musical.

Beto
De acuerdo. ¿Pero cómo resolvieron el problema del club ruidoso?

Alicia
Usaron una herramienta de separación de fuente llamada Demux. Durante el entrenamiento, Demux aísla matemáticamente las frecuencias vocales del acompañamiento instrumental.

Beto
Ah, ingenioso.

Alicia
Así que al entrenar con esas voces aisladas junto con las pistas completas, Heart Transcriptor aprende a filtrar agresivamente el ruido instrumental y reconocer las letras con una precisión increíble.

Beto
Tengo que hacer una objeción sobre una cosa, sin embargo.

Alicia
Sí.

Beto
Tenemos este increíble transcriptor. Y tenemos el HeartCodec comprimiendo todo hasta 12.5 hertz. Pero no importa cuán inteligentes sean tus codificadores, si estás comprimiendo la salida de audio final, la voz humana cantando suele sufrir mucho.

Alicia
Lo hace. La alta compresión generalmente equivale a un audio con fallos terribles.

Beto
Sí. ¿No suena la salida como un robot submarino?

Alicia
Ese es el obstáculo exacto. La mayoría de los códecs de baja tasa de fotogramas golpean directamente al reconstruir formas de onda a partir de tokens discretos altamente comprimidos, lo que generalmente causa una pérdida severa de información. Las voces obtienen estos artefactos duros.

Beto
Entonces, ¿cómo lo arreglan?

Alicia
Lo fascinante aquí es que los investigadores introdujeron una etapa de decodificación llamada "SQ fine tune". Y utilizaron un "decodificador de emparejamiento de flujo" ("flow-matching decoder"), que evita por completo esa degradación robótica.

Beto
Vamos a desglosar cómo funciona eso, porque el decodificador de emparejamiento de flujo suena a jerga pura.

Alicia
De acuerdo. Piensa en esos tokens comprimidos de 12.5 hertz como un dibujo de conectar los puntos.

Beto
Bien.

Alicia
Si tomas un decodificador estándar y solo dibujas líneas rígidas entre los puntos, obtienes una imagen angular robótica. Eso es tu audio submarino con fallas.

Beto
Tiene sentido.

Alicia
El decodificador de emparejamiento de flujo actúa más como un artista que sabe dibujar las curvas suaves y naturales entre esos puntos. Matemáticamente predice las ondas de audio suaves y continuas que deberían existir lógicamente en los espacios entre los tokens.

Beto
Oh, eso tiene todo el sentido. Así que en lugar de simplemente desempacar brutalmente los datos gruesos, está suavizando la trayectoria del sonido.

Alicia
Exacto.

Beto
Así es como mantienes la fragilidad respiratoria de una voz humana sin que suene como un androide defectuoso.

Alicia
Lo entiendes bien. Logra la calidad de reconstrucción de vanguardia mientras mantiene esa eficiencia computacional de 12.5 hertz.

Beto
De acuerdo. Así que le hemos dado a la IA una audición perfecta y puede recrear audio de alta fidelidad. Pero escuchar una nota y entender el ambiente son dos cosas totalmente diferentes.

Alicia
Muy cierto.

Beto
Si le digo a la IA que quiero una canción acústica de amor introspectiva, ¿cómo conecta mi texto en inglés con su nuevo alfabeto de audio de 12.5 hertz?

Alicia
Esa transición de procesamiento de audio crudo a comprensión semántica es manejada por un modelo llamado HeartCLAP. Es un modelo de alineación de texto a audio. Básicamente actúa como el diccionario universal que traduce entre indicaciones de texto humano y el audio musical correspondiente.

Beto
Y para construir ese diccionario, necesitas una cantidad absurda de datos. Vi que curaron un conjunto de datos de alta calidad de 100,000 horas para esto.

Alicia
Sí, 100,000 horas.

Beto
Pero no simplemente rastrearon audio aleatorio de internet y esperaron lo mejor. ¿Lo hicieron?

Alicia
No. Rastrear significa comprensión turbia. Usaron una estrategia de "humano en el ciclo" ("human in the loop") para construir una taxonomía llamada Heartbeats Benchmark.

Beto
¿Qué implica eso?

Alicia
Tuvieron a musicólogos profesionales diseñar un sistema para categorizar la música a través de tres perspectivas macro. La primera es la estructura acústica. Esto identifica el género, el ritmo y los instrumentos específicos.

Beto
De acuerdo. Lo básico.

Alicia
Sí. La segunda es la semántica del contenido. Esto analiza la textura vocal. ¿Es el cantante rasposo o suave? ¿Y cuál es el tema narrativo de las letras?

Beto
Vaya, eso es detallado.

Alicia
Y la tercera es la atmósfera contextual. Esto mapea la valencia emocional y el escenario de uso. ¿Es esta música tensa y cinematográfica, o relajada y alegre?

Beto
Aquí es donde se pone realmente interesante. No simplemente le ponen una etiqueta general sobre una canción de tres minutos. Hacen esta cosa llamada "anotación de estilo de grano fino" ("fine grain style annotation").

Alicia
Sí. Esto es un salto masivo para los modelos de código abierto. Realmente utilizan marcadores estructurales para mapear la canción cronológicamente.

Beto
Correcto. En lugar de etiquetar una pista completa como solo "pop rock", el modelo la descompone sección por sección. Puede asignar una entrega vocal tranquila e introspectiva con guitarras acústicas específicamente al verso.

Alicia
Sí.

Beto
Y luego el enfoque cambia a un gancho distorsionado de alta energía y explosivo para el coro.

Alicia
Lo que refleja cómo los compositores humanos realmente arreglan la música. Quiero decir, se trata de tensión, liberación y evolución a lo largo del tiempo.

Beto
Y para ti, el oyente, esta es la clave de por qué HeartMuLa no es solo una máquina tragamonedas donde tiras de la palanca y esperas obtener algo utilizable.

Alicia
Absolutamente no.

Beto
Si eres un creador y quieres una pista que comience con una introducción melancólica, caiga en un verso de metal pesado y termine con un suave piano outro. Esta comprensión detallada sección por sección es lo que permite a la IA ejecutar ese control preciso.

Alicia
Así que ahora tenemos el alfabeto comprimido y tenemos el vocabulario emocional. El siguiente paso es mirar al cerebro que lo junta todo para realmente componer la pista.

Beto
El modelo central mismo.

Alicia
Sí. Este es la arquitectura de HeartMuLa. Utiliza una arquitectura jerárquica global local. Lo que básicamente significa que el cerebro está dividido en dos modelos transformadores distintos.

Beto
Vamos a desglosar la arquitectura. Tienes un transformador global masivo de 3 mil millones de parámetros y un transformador local más pequeño de 300 millones de parámetros. ¿Por qué dividirlos así?

Alicia
Bueno, porque componer una canción requiere dos tipos de pensamiento muy diferentes. El transformador global de 3 mil millones de parámetros mira el nivel macro. Su trabajo es predecir los patrones semánticos y estructurales generales a lo largo de toda la línea de tiempo de la canción.

Beto
Como las cosas de la gran imagen.

Alicia
Exacto. ¿Dónde va el coro? ¿Cuál es la melodía principal? ¿Cuál es la progresión de acordes central?

Beto
Así que el transformador global es como el arquitecto. Está dibujando los planos, decidiendo dónde van las paredes portantes, dónde están las habitaciones y simplemente el flujo general de la casa.

Alicia
Esa es una gran manera de visualizarlo. Y una vez que el arquitecto establece esa estructura macro, el transformador local más pequeño de 300 millones de parámetros interviene.

Beto
De acuerdo.

Alicia
Toma esos planos y predice todos los tokens residuales restantes para llenar los intrincados detalles acústicos.

Beto
El diseñador de interiores.

Alicia
Sí.

Beto
El modelo más pequeño no se preocupa por la estructura de la casa. Simplemente está eligiendo la textura exacta del papel tapiz. El acabado de latón en los pomos de las puertas. La reverberación específica en el platillo.

Alicia
Y dividir el trabajo de esta manera ahorra una enorme cantidad de potencia computacional. El modelo gigante solo hace el trabajo pesado de la estructura macro mientras que el modelo ágil maneja las texturas micro.

Beto
Eso es muy eficiente.

Alicia
Lo es.

Pero una arquitectura tan compleja requiere una educación muy metódica. Los investigadores desplegaron un paradigma de entrenamiento de cuatro etapas.

Beto
¿Cuáles fueron las etapas?

Alicia
Comenzaron con una etapa de calentamiento usando clips cortos de 30 segundos solo para enseñar texturas acústicas básicas. Luego vino el preentrenamiento con canciones de duración completa para que pudiera aprender dependencias temporales a largo plazo.

Beto
Lograr el flujo correcto.

Alicia
Sí. La tercera etapa fue el ajuste fino supervisado usando un subconjunto prístino de 15,000 horas y altamente filtrado para pulir realmente la calidad de la síntesis.

Beto
Pero la etapa final, la cuarta etapa, es lo que elevó esto de ser solo un buen modelo a uno de grado comercial, ¿verdad? "Optimización de preferencia directa" ("Direct Preference Optimization", o DPO).

Alicia
Sí. DPO cambia fundamentalmente cómo aprenden los modelos generativos la calidad.

Beto
Permíteme explicar por qué. Porque el aprendizaje por refuerzo tradicionalmente requiere construir un modelo de recompensa completamente separado solo para calificar la salida de la IA, lo cual es torpe y honestamente a menudo inexacto. Por lo que entiendo, DPO omite al intermediario por completo.

Alicia
Lo hace. En lugar de intentar calcular una puntuación matemática, el modelo simplemente se le muestran dos pistas de audio generadas a partir de exactamente la misma indicación. Una pista ganadora y una pista perdedora.

Beto
Oh, vaya.

Alicia
Sí, y se forza matemáticamente a alinear sus generaciones futuras más cerca de la ganadora y más lejos de la perdedora. Está aprendiendo la preferencia humana directamente a través de pruebas A/B.

Beto
Y los conjuntos de datos que crearon para esta etapa DPO eran increíblemente dirigidos. Tenían un conjunto basado en PER, donde PER significa "tasa de error de espuma" ("foam error rate").

Alicia
Sí.

Beto
Mostraban al modelo las dos pistas, y la ganadora era la que tenía una pronunciación vocal más clara, entrenando efectivamente al modelo para que dejara de arrastrar sus palabras.

Alicia
Exacto.

Beto
Y tenían otro conjunto basado en similitud de estilo, donde la ganadora era la pista que seguía más exactamente las etiquetas de indicación complejas.

Alicia
Esa etapa de optimización final es lo que transforma el modelo de simplemente hacer sonido a hacer música articulada y altamente específica.

Beto
Lo que nos lleva a la pregunta definitiva. Tengo que asumir que poner un modelo de código abierto recién acuñado frente a gigantes de código cerrado, como Suno V5 o Udio, compañías con enormes granjas de servidores corporativos y cómputo ilimitado, sería una masacre absoluta.

Alicia
Lo pensarías, ¿verdad? Pero los resultados de la evaluación objetiva fueron realmente impresionantes. HeartMuLa no solo compitió, logró una victoria definitoria en la inteligibilidad de las letras. Esa tasa de error PER o P-E-R que acabamos de discutir.

Beto
Desglósanos los números para nosotros. ¿Cómo se ve realmente esa victoria?

Alicia
Bueno, probaron los modelos a través de cinco idiomas diferentes: Inglés, chino, japonés, coreano y español. En general, HeartMuLa logró la tasa de error más baja.

Beto
Eso es increíble.

Alicia
Para darte un número concreto, en inglés, HeartMuLa alcanzó un PER de 0.09. Suno V5, como comparación, estaba en 0.13.

Beto
Así que una tasa de error de 0.09 significa esencialmente que la IA está alucinando, arrastrando o tartamudeando significativamente menos sílabas que Suno.

Alicia
Exacto.

Beto
Esa es una diferencia masiva cuando realmente estás escuchando una canción. Nada rompe la ilusión de la música más rápido que una IA que suena como si tuviera la boca llena de canicas.

Alicia
Arruina completamente el ambiente.

Beto
Totalmente.

Pero tengo una pregunta sobre la velocidad. Los modelos comerciales pueden soltar canciones en segundos debido a esas enormes granjas de servidores. ¿Puede un usuario normal ejecutar HeartMuLa? ¿O tarda tres días en renderizar una sola pista?

Alicia
Esa es la gran pregunta, porque la latencia es la mayor barrera para la adopción de código abierto. Generar música autoregresivamente, lo que significa que la IA está adivinando la siguiente nota una y otra vez, miles de veces, normalmente tarda para siempre.

Beto
¿Por qué es eso?

Alicia
Porque el sistema tiene que recalcular todo su contexto anterior solo para adivinar el siguiente token.

Beto
Correcto. Es como intentar escribir una novela, pero tener que releer todo el libro cada vez que quieres añadir una sola palabra.

Alicia
Esa es exactamente la limitación computacional. Pero si conectamos esto con la imagen más grande, el equipo de HeartMuLa implementó una aceleración de inferencia seria usando herramientas como la alineación KV-Cache, flash attention y gráficos CD-DA.

Beto
Vamos a desglosar esos mecanismos para el oyente. ¿Qué están haciendo realmente esas herramientas para acelerarlo?

Alicia
Esencialmente, le dan a la IA una memoria a corto plazo altamente optimizada. KV-Cache, por ejemplo, almacena los cálculos anteriores para que el modelo no tenga que repensar constantemente toda la canción solo para generar la siguiente milésima de segundo de audio.

Beto
De acuerdo. Eso ahorra mucho tiempo.

Alicia
Sí. Y los gráficos CD-DA les permiten mapear las partes estáticas e inmutables del proceso computacional y simplemente congelarlas. Al optimizar cómo se accede a la memoria, reducen el tiempo de generación de extremo a extremo de 398 segundos a solo 73 segundos.

Beto
Una aceleración de 5.4 veces solo por optimizar la arquitectura de la memoria. Eso reduce la latencia tanto que la generación interactiva en streaming en tiempo real es totalmente viable.

Alicia
Realmente lo es.

Beto
Puedes darle una indicación y comienza a reproducir el primer verso donde casi inmediatamente mientras termina de generar el coro en segundo plano.

Alicia
Hace que la tecnología sea genuinamente utilizable para el creador de todos los días, no solo para investigadores con supercomputadoras.

Beto
Entonces, ¿qué significa todo esto?

Demos un paso atrás. HeartMuLa ha demostrado que la generación de canciones de alta fidelidad, de seis minutos, multilingüe y altamente controlable no tiene que vivir dentro de una caja negra corporativa.

Alicia
Está al descubierto ahora.

Beto
A través de innovaciones como un códec de 12.5 hertz, ese arquitecto de transformadores dual y la configuración de diseñador de interiores, y la optimización de preferencia directa, la comunidad de código abierto ahora tiene una línea base de grado comercial. Cualquiera puede descargar esto y construir sobre ello.

Alicia
Esto democratiza por completo la tecnología, pero con esa democratización viene una responsabilidad muy práctica, que los investigadores abordan realmente en su artículo.

Beto
¿Qué hacen?

Alicia
Sí, porque reconocen que estas herramientas están volviéndose indistinguibles de la producción de estudio humana. Abogan activamente por la marca de agua (watermarking) del audio generado por IA.

Beto
Lo que tiene sentido práctico. Si la calidad es tan buena, las plataformas y los oyentes necesitan un mecanismo técnico para verificar lo que fue generado por un algoritmo y lo que realmente se grabó en el estudio.

Alicia
Se trata de mantener la transparencia a medida que la tecnología escala, y nos deja con un cambio profundo en cómo interactuamos con la música.

Beto
¿De qué manera?

Alicia
Bueno, a medida que pasamos de ser creadores que ponemos nuestros dedos en cuerdas de acero a curadores que construyen cuidadosamente indicaciones de IA, ¿cómo cambiará nuestra relación emocional con las canciones que amamos?

Beto
Es un experimento mental fascinante. Cuando escuchas una ejecución vocal desgarradora y sabes que el alma detrás de esas voces no es un ser humano que haya experimentado la pérdida, sino solo un algoritmo exquisitamente entrenado de 12.5 hertz que mapeó la probabilidad estadística de una entrega melancólica y fonética. La canción, ¿sigue significando la misma cosa para ti?

Alicia
El algoritmo está generando la emoción, pero realmente depende de nosotros decidir cómo la valoramos.

Beto
Esa es la verdadera pregunta de ahora en adelante. La caja negra está abierta, pero las preguntas filosóficas apenas están comenzando.

Bueno, en esa nota, gracias por acompañarnos en esta inmersión profunda. Sigan cuestionando la información y la música que los rodea. Los encontraremos la próxima vez.