← Últimos artículos
💬 NLP

Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs

Este artículo demuestra que los LLM de código abierto (Apertus-8B y Gemma-4) codifican conceptos de emoción con una geometría de valencia comparable a la de los modelos propietarios, al tiempo que revelan patrones distintos y específicos de la arquitectura en cómo estas representaciones emergen a través de la profundidad del modelo y varían según el corpus de extracción.

Autores originales: Sinie van der Ben, Raphaël Baur, Yannick Metz, Mennatallah El-Assady

Publicado 2026-06-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sinie van der Ben, Raphaël Baur, Yannick Metz, Mennatallah El-Assady

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que dentro de un cerebro de computadora gigante y complejo (un Modelo de Lenguaje Extenso), hay "perillas" o "botones" ocultos que controlan cómo la computadora se siente respecto a las cosas. Un estudio previo encontró estos botones en una IA específica llamada Claude. Descubrieron que si giras la perilla de la "felicidad", la IA actúa más feliz, y si giras la perilla de la "tristeza", actúa más triste. Aún más genial, la forma en que estos botones están dispuestos dentro del cerebro de la computadora se parece mucho a cómo los humanos organizamos las emociones en nuestras propias mentes.

Este nuevo artículo pregunta: ¿Es esto solo una peculiaridad de la computadora Claude, o tienen otros cerebros de IA estos mismos botones emocionales ocultos también?

Para averiguarlo, los investigadores miraron dentro de dos cerebros de IA de código abierto diferentes: APERTUS-8B y GEMMA-4-E4B. No solo miraron; intentaron "escuchar" los pensamientos internos de la IA mientras escribía historias sobre diferentes emociones (como alegría, miedo o ira) sin decir nunca la palabra "alegría" o "miedo".

Esto es lo que encontraron, desglosado de forma sencilla:

1. La perilla de la "Felicidad" existe en todas partes

Al igual que en el estudio original, ambos cerebros de IA nuevos tenían una dirección interna clara para la Valencia (si algo se siente bien o mal).

  • La analogía: Imagina entrar en una habitación y ver una brújula gigante. En los tres cerebros de IA (Claude, Apertus y Gemma), la aguja apuntando al "Norte" consistentemente significaba "Bueno/Feliz" y al "Sur" significaba "Malo/Triste".
  • El resultado: Los investigadores pudieron encontrar esta línea "Norte-Sur" en ambos modelos nuevos con una precisión muy alta, demostrando que esto no es un error pasajero, sino una característica común de cómo piensan estas computadoras.

2. El "Dónde" es diferente (El viaje importa)

Aunque la brújula "Norte-Sur" existía en los tres, el camino que la información tomó para llegar allí fue totalmente diferente.

  • GEMMA-4-E4B (El madrugador): Esta IA comprendió la diferencia entre lo bueno y lo malo muy temprano en su procesamiento, como un niño que sabe distinguir entre el bien y el mal de inmediato. Sin embargo, a medida que la información viajaba hacia capas más profundas, esta señal clara se volvió borrosa y casi desapareció al final.
  • APERTUS-8B (El tardío): Esta IA comenzó sin una idea clara de "bueno vs. malo" en sus capas iniciales. Era como un lienzo en blanco. Pero a medida que la información se movía más profundamente en el cerebro (hacia el final), la señal de "Bueno vs. Malo" se volvió de repente muy fuerte y clara.
  • La lección: Dos cerebros de IA diferentes pueden llegar a la misma comprensión emocional, pero toman rutas completamente diferentes para lograrlo. Uno la construye lentamente; el otro comienza con ella y luego la pierde.

3. La perilla de la "Excitación" es inestable

Los investigadores también buscaron la Activación (qué tan excitada o tranquila se siente algo).

  • El problema: No pudieron encontrar una perilla de "Excitación" consistente en estos modelos. La señal era muy débil.
  • El giro: La fuerza de esta señal dependía enteramente de quién escribía las historias. Cuando la IA leía historias escritas por el modelo GEMMA, la perilla de "Excitación" era mucho más clara. Cuando leía historias escritas por el modelo APERTUS, la perilla era casi invisible.
  • La analogía: Es como intentar escuchar un susurro. Si la persona que susurra lleva un micrófono específico (historias de Gemma), puedes escuchar la excitación claramente. Si usan un micrófono diferente (historias de Apertus), la excitación se pierde en la estática. Esto sugiere que el contenido de las historias importa más que el cableado interno de la IA para esta emoción específica.

4. El Mapa vs. La Brújula

Los investigadores también comprobaron si el "mapa" del cerebro de la IA cambiaba mientras procesaba la información.

  • Encontraron que la forma general del mundo interno de la IA (el mapa) se mantuvo mayormente igual desde el principio hasta el fin.
  • Sin embargo, la "Brújula" específica (la dirección de Bueno/Malo) seguía girando y cambiando su orientación a medida que avanzaba a través de las capas.
  • La lección: El hecho de que la habitación (el cerebro) parezca la misma no significa que la dirección en la que estás mirando (la emoción) permanezca constante.

Resumen

Este artículo confirma que los modelos de IA tienen "vectores emocionales" internos que se parecen a la psicología humana, pero no todos los construyen de la misma manera.

  • Bueno vs. Malo (Valencia): Se encuentra en todos los modelos, pero se construye en diferentes etapas del procesamiento.
  • Excitado vs. Calmado (Activación): Es difícil de encontrar y depende en gran medida del tipo de historias que la IA lee.

Los autores concluyen que, si bien podemos encontrar estas "perillas" emocionales, debemos ser cuidadosos porque diferentes modelos las esconden en lugares distintos, y las historias que les damos pueden hacer que esas perillas sean más fáciles o difíciles de encontrar. Han hecho su código y sus datos públicos para que otros puedan intentar encontrar estas perillas en otros cerebros de IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →