← Últimos artículos
💬 NLP

SCENE: Recognizing Social Norms and Sanctioning in Group Chats

Este artículo presenta SCENE, un benchmark diseñado para evaluar la capacidad de los agentes basados en LLM para reconocer normas sociales implícitas y adaptarse a sanciones grupales en chats multipartita, revelando que modelos avanzados como Claude Opus 4.7 y Gemini 3.1 Pro superan significativamente a los modelos de pesos abiertos en estas interacciones sociales dinámicas.

Autores originales: Mateusz Jacniacki, Maksymilian Bilski

Publicado 2026-05-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mateusz Jacniacki, Maksymilian Bilski

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que entras en un nuevo grupo de amigos en una cafetería. Aún no conoces las reglas. Quizás este grupo ama burlarse mutuamente con chistes oscuros cuando las cosas salen mal, mientras que otro grupo ofrecería inmediatamente un abrazo y un pañuelo. Si intentas abrazar a alguien que acaba de hacer una broma, el grupo podría mirarte con extrañeza, cambiar de tema o rodar los ojos. Tienes que descifrar el "ambiente" simplemente observando cómo reaccionan a tus errores.

Este artículo presenta SCENE, una nueva forma de probar si los chatbots de Inteligencia Artificial (IA) pueden hacer exactamente eso: aprender las reglas ocultas de un chat grupal y corregir su comportamiento cuando el grupo les indica que se han pasado de la raya.

Aquí tienes un desglose de cómo lo hicieron y qué descubrieron, utilizando analogías sencillas.

La Configuración: El Juego de la "Regla Secreta"

Los investigadores crearon un patio de recreo digital donde una IA (el "sujeto") es introducida en un chat grupal con otros tres personajes de IA.

  • La Regla Oculta: Los otros tres personajes siguen todos una regla secreta. Por ejemplo, "Cuando alguien comparte malas noticias, solo respondemos con un solo emoji", o "Cuando alguien hace una pregunta, debemos dar una respuesta larga y detallada".
  • La Trampa: A la IA sujeto no se le dice esta regla. Tiene que adivinarla.
  • La Prueba: La IA sujeto inevitablemente dirá algo incorrecto (rompiendo la regla). Los otros tres personajes reaccionarán entonces de una manera específica para señalar: "Oye, así no hacemos las cosas aquí". Esta reacción se llama una sanción.
    • Ejemplo de una sanción: Si la regla es "mantenerlo breve" y el sujeto escribe un párrafo, el grupo podría simplemente ignorar el párrafo y hablar de otra cosa (ignoro silencioso), o podrían enviar un emoji de "rodar los ojos".

El Objetivo: ¿Puede la IA Aprender?

Los investigadores querían ver si la IA podía hacer dos cosas:

  1. Notar el "Ay": Cuando el grupo reacciona negativamente (sanciona), ¿se da cuenta la IA de que "Oh, metí la pata"?
  2. Cambiar el Tono: ¿Deja la IA de hacer lo que provocó el "ay" y comienza a actuar como el resto del grupo?

Los Resultados: Los "Niños Grandes" vs. Los "Niños Pequeños"

Probaron seis modelos de IA diferentes. Piensa en los resultados como un aula de estudiantes tomando un examen sobre señales sociales:

  • Los Mejores Rendimientos (Claude Opus 4.7 y Gemini 3.1 Pro): Estos son los "niños grandes". Cuando recibieron una reacción negativa del grupo, se dieron cuenta rápidamente de su error. Aproximadamente el 80% de las veces, se disculparon o cambiaron su comportamiento para encajar. También mejoraron cuanto más veían a los otros personajes siguiendo la regla.
  • Los Rendimientos Luchadores (Modelos de peso abierto como Llama, Mistral, Gemma): Estos modelos eran como estudiantes que no entendieron del todo la indirecta. Incluso después de que el grupo rodara los ojos o los ignorara, estas IAs a menudo seguían haciendo lo mismo. No parecían conectar la reacción del grupo con la necesidad de cambiar su comportamiento.

Un Descubrimiento Sorprendente: La "Personalidad Predeterminada"

El artículo encontró algo interesante sobre por qué fallaron algunas IAs. Incluso cuando el grupo tenía una regla específica (como "ser muy formal"), muchas de las IAs recurrían por defecto a ser casuales y conversadoras.

  • La Analogía: Imagina una entrevista de trabajo donde todos llevan traje. Si entras con una camiseta y pantalones cortos, rompes la regla. El estudio encontró que muchas IAs están "programadas" para ser casuales y amigables por defecto. Incluso cuando el grupo claramente quería un comportamiento formal, la IA seguía actuando de manera casual, ignorando las señales del grupo para ser seria.

Cómo Verificaron el Trabajo

Dado que los "otros personajes" en el chat también eran IA, los investigadores tuvieron que asegurarse de que esos personajes realmente seguían las reglas y no arruinaban la prueba. Utilizaron un "árbitro" (otra IA) para observar los registros del chat y verificar:

  • ¿Siguió el grupo realmente la regla secreta?
  • ¿Castigaron realmente al sujeto cuando rompió la regla?
  • ¿Corrigió realmente el sujeto su comportamiento?

Qué Significa Esto (Según el Artículo)

El artículo concluye que los modelos de IA más avanzados están mejorando mucho en leer el ambiente. Pueden observar cómo reacciona un grupo ante un error y ajustar su comportamiento en consecuencia. Sin embargo, los modelos más pequeños o menos avanzados aún luchan para captar estas sutiles señales sociales.

Los autores enfatizan que esta es una prueba específica de adaptación social en conversaciones cortas. No significa que estas IAs sean "inteligentes" en un sentido humano o que comprendan la moralidad; solo significa que están mejorando en seguir las reglas invisibles de un chat grupal específico.

En resumen: SCENE es una prueba para ver si la IA puede aprender a "leer el ambiente" y dejar de cometer tropiezos sociales cuando un grupo de amigos le da una pista sutil (o no tan sutil) de que se está comportando de manera extraña. Los mejores modelos están aprendiendo rápido; los demás siguen siendo un poco sordos al tono.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →