← Últimos artículos
💬 NLP

LLMs Infer Cultural Context but Fail to Apply It When Responding

Este artículo presenta el conjunto de datos CAPRI para demostrar que, si bien los modelos de lenguaje de gran tamaño pueden inferir el contexto cultural y recordar las convenciones pertinentes, frecuentemente fallan al aplicar este conocimiento para generar respuestas culturalmente adaptadas a menos que se les guíe explícitamente para ello.

Autores originales: Yisong Miao, Jian Zhu, Vered Shwartz

Publicado 2026-06-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yisong Miao, Jian Zhu, Vered Shwartz

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un bibliotecario muy inteligente y culto que ha leído casi todos los libros del mundo. Este bibliotecario sabe mucho sobre diferentes países: sabe que la gente en Francia usa Celsius para la temperatura, que la gente en EE. UU. usa Fahrenheit y que los números de teléfono se ven diferentes en Japón que en Brasil.

Sin embargo, este artículo revela un fallo divertido y frustrante en la forma en que trabaja este bibliotecario. Él conoce los hechos, pero se olvida de usarlos al hablar contigo.

Aquí está el desglose de la investigación utilizando analogías sencillas:

1. La prueba: El juego del "Detective Cultural"

Los investigadores crearon un juego llamado CAPRI (Inferencia de Respuesta Cultural y Pragmática). Imagina a un chatbot hablando con un usuario. El usuario deja pistas sutiles sobre de dónde es, como mencionar un sitio web francés específico (Fnac.com) o usar un formato de número de teléfono francés.

El chatbot tiene dos tareas:

  1. Detectar la pista: Descubrir: "Ah, este usuario probablemente es francés".
  2. Adaptar la respuesta: Cuando el usuario pregunta: "¿Cuál es la temperatura?" (mostrando la imagen de un termómetro), el bot debería decir "40°C" (estilo francés) en lugar de "104°F" (estilo estadounidense).

2. El problema: El "Sabelotodo" que no escucha

Los investigadores probaron los modelos de IA más inteligentes disponibles. Esto fue lo que encontraron:

  • La parte del detective (Tarea 1): La IA es increíble en esto. Si le das una o dos pistas, adivina correctamente el país del usuario casi el 100% de las veces. Conoce los hechos.
  • La parte de la adaptación (Tarea 2): Aquí es donde falla. Aunque la IA sabe que el usuario es francés, a menudo ignora ese conocimiento y da la respuesta en unidades estadounidenses (Fahrenheit) de todos modos.

La analogía: Es como un camarero que sabe que eres vegetariano (porque le dijiste que no comes carne), pero cuando pides una hamburguesa, te trae un filete de todos modos porque está en "piloto automático" y no conectó los puntos entre tu identidad y tu pedido.

3. La solución: "Pensar en voz alta"

Los investigadores probaron un truco para arreglarlo. Le pidieron a la IA que pensara en voz alta antes de responder. Le dijeron: "Primero, averigua de dónde es el usuario. Luego, decide qué unidad usar basándote en eso".

Cuando hicieron esto, la IA mejoró mucho. Fue como decirle al camarero: "Detente y piensa: Espera, esta persona es vegetariana. Necesito cambiar el filete por una ensalada". Una vez que la IA se vio obligada a pausar y razonar paso a paso, finalmente comenzó a dar respuestas culturalmente apropiadas.

4. El "Ajuste por Defecto"

El artículo también analizó qué sucede cuando la IA no tiene pistas en absoluto (sin números de teléfono, sin menciones de sitios web).

  • Suposición de país: Si la IA tiene que adivinar el país sin pistas, generalmente adivina Estados Unidos.
  • Suposición de unidad: Pero aquí está el giro: aunque adivina que es EE. UU., a menudo sigue usando el sistema métrico (Celsius, kilómetros), que es algo que EE. UU. no usa.

Es como si la IA tuviera una "personalidad por defecto" que es una mezcla de un ciudadano estadounidense que habla como un europeo. No es verdaderamente neutral; tiene sus propios sesgos ocultos basados en dónde se construyó el modelo y en qué datos fue entrenado.

5. Cosas subjetivas (Tiempo y "Algunos")

Los investigadores también probaron conceptos "difusos" que no tienen reglas estrictas, como qué hora del día es (¿son las 6 PM "tarde" o "noche"?) o cuántos huevos hay en una cesta ("unos pocos" frente a "algunos").

  • La buena noticia: A medida que la IA recibe más pistas, comienza a cambiar sus respuestas para coincidir con diferentes culturas.
  • La mala noticia: Sin pistas, las respuestas "por defecto" de la IA a menudo se inclinan hacia la cultura de la empresa que construyó el modelo (por ejemplo, un modelo chino se inclina hacia las interpretaciones chinas, un modelo estadounidense hacia las estadounidenses).

La conclusión final

El artículo concluye que los modelos de IA actuales son como enciclopedias que aún no han aprendido a ser buenos conversadores. Almacenan hechos culturales en una parte de su cerebro y la capacidad de usarlos en otra, pero no vinculan automáticamente ambas cosas.

Para que sean verdaderamente útiles, no podemos confiar solo en que "conozcan" la cultura; tenemos que enseñarles explícitamente a pausar, pensar en quién están hablando y luego ajustar su respuesta. Hasta entonces, pueden saber que eres francés, pero aun así te dirán la temperatura en Fahrenheit.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →