Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models
Este estudio demuestra que, aunque los modelos de lenguaje de vanguardia superan la línea base aleatoria al jugar a "Cards Against Humanity", su alineación con las preferencias humorísticas humanas es modesta y están significativamente más de acuerdo entre sí que con los humanos, lo que sugiere que sus juicios pueden estar influenciados por sesgos estructurales en lugar de una comprensión genuina del humor.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que el humor es como un idioma secreto que solo los humanos entendemos perfectamente. Es una mezcla de cultura, timing, y saber cuándo romper las reglas. Ahora, imagina que le pedimos a cinco supercomputadoras inteligentes (los Modelos de Lenguaje o LLMs) que jueguen un juego de fiesta muy famoso y un poco "subido de tono" llamado Cards Against Humanity (Cartas contra la Humanidad).
El objetivo de este estudio es sencillo: ¿Pueden estas máquinas entender qué es gracioso para los humanos, o tienen su propio sentido del humor que no nos coincide?
Aquí tienes la explicación de la investigación, contada como una historia:
1. El Juego: Una fiesta de cartas
En este juego, hay una carta negra con una frase incompleta (ejemplo: "Después de cuatro años de universidad, todavía no sé cómo...") y diez cartas blancas con respuestas posibles. Los jugadores deben elegir la respuesta más graciosa.
Los investigadores tomaron 9,894 rondas de juegos reales jugados por humanos y les pidieron a cinco de las IAs más avanzadas del mundo (como GPT, Claude, Gemini, etc.) que jugaran las mismas rondas.
2. El Resultado Sorprendente: "No son tan graciosos como creemos"
Cuando las IAs eligieron sus respuestas, compararon sus elecciones con las de los humanos.
- La realidad: Las IAs acertaron un poco más que si hubieran cerrado los ojos y elegido al azar (como adivinar en un examen), pero no acertaron mucho. Solo coincidieron con los humanos entre el 13% y el 18% de las veces.
- La analogía: Es como si fueras a una fiesta y tuvieras que elegir la mejor broma. Si eligieras al azar, acertarías el 10%. Las IAs acertaron un 15%. Están un poco mejor que el azar, pero siguen siendo muy malas contando chistes que a la gente le gusten realmente.
3. El Giro Irónico: "Se entienden mejor entre ellas que con nosotros"
Aquí viene lo más curioso. Los investigadores descubrieron algo extraño:
- Las IAs no se ponen de acuerdo con los humanos, pero sí se ponen de acuerdo entre ellas.
- Si le preguntas a dos IAs diferentes qué carta es la más graciosa, es muy probable que elijan la misma.
- La metáfora: Imagina que las IAs son un grupo de alienígenas que han estudiado la Tierra. No entienden por qué a los humanos les gusta un chiste sobre un político, pero entre los alienígenas, todos están de acuerdo en que un chiste sobre "cosas del cuerpo" o "situaciones sexuales" es lo más divertido. Han desarrollado un "sentido del humor de robot" que es consistente, pero que no coincide con el nuestro.
4. ¿Por qué hacen esto? (Los "Trucos" de las Máquinas)
Los investigadores investigaron por qué las IAs eligen lo que eligen y encontraron dos "trucos" o sesgos:
- El Sesgo de Posición (La carta de la derecha): Las IAs tienen una debilidad extraña por la posición de la carta. Por ejemplo, la IA "DeepSeek" elige casi siempre la tercera carta de la lista, sin importar si es graciosa o no. Es como si tuvieran un hábito de siempre mirar el tercer plato en un menú.
- El Sesgo de Tema (Lo que les gusta): Las IAs eligen mucho más a menudo cartas sobre cuerpos, fluidos y temas sexuales que los humanos. Por otro lado, evitan temas sobre política o identidad, que a los humanos sí nos parecen graciosos en este juego.
- Analogía: Es como si las IAs fueran como un niño que solo quiere comer helado (temas sexuales/cuerpo) y nunca come verduras (política), aunque el menú tenga de todo.
5. La Conclusión: ¿Entienden o solo adivinan?
El estudio sugiere que las IAs no están "entendiendo" el humor de verdad. En su lugar, están usando atajos matemáticos.
- Se basan en patrones de su entrenamiento (que a veces les dicen que eviten temas polémicos).
- Se basan en la posición de la carta en la pantalla.
- Han creado un "código de humor" propio que es muy consistente entre ellas, pero que es un desastre para conectar con el sentido del humor humano.
En resumen
Este paper nos dice que, aunque las IAs son geniales escribiendo poemas o código, el humor es un territorio difícil. Las máquinas han desarrollado su propio "sentido del humor" que es muy predecible entre ellas, pero que a menudo nos hace decir: "¿En serio? ¿Eso es lo que encontraron gracioso?".
No es que sean tontas; es que su "alma" (o algoritmo) ha sido entrenada para ser segura y predecible, y el humor humano, especialmente el tipo de humor de Cards Against Humanity, es a menudo caótico, arriesgado y muy humano.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.