CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
Este artículo presenta CommonWhy, un conjunto de datos de 15.000 preguntas «por qué» basadas en entidades que evalúa la capacidad de razonamiento causal de sentido común y de explicación abductiva de los modelos de lenguaje grandes, revelando deficiencias significativas en los modelos actuales a pesar de la disponibilidad de conocimiento de apoyo en Wikidata.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un asistente robótico muy inteligente y bien leído. Le has hecho miles de preguntas como: "¿Es cierto que Harry Potter puede volar?" o "¿Poseía Aristóteles una computadora portátil?". El robot se ha vuelto muy bueno para responder esas preguntas de "Sí" o "No", porque puede escanear su inmensa biblioteca de hechos y encontrar la respuesta.
Pero ahora, imagina que le haces al robot una pregunta mucho más complicada: "¿Por qué Katarina Barley no necesitó un visado para ver la final de la Liga de Campeones de 2024?"
Aquí es donde el robot empieza a tropezar. Este es el problema que el artículo CommonWhy intenta resolver.
El Problema: El Robot No Puede "Conectar los Puntos"
Los autores argumentan que, aunque los robots son excelentes en la recuperación de hechos (encontrar un hecho específico en un libro), son pésimos en el razonamiento causal (descubrir por qué sucedió algo conectando diferentes hechos con el sentido común).
Piénsalo así:
- La Recuperación de Hechos es como buscar un número de teléfono en una guía.
- El Razonamiento Causal es como ser un detective. Tienes que mirar el número de teléfono, darte cuenta de que la persona vive en un país diferente, recordar que ese país tiene un acuerdo de exención de visados con el país de origen de la persona, y luego concluir: "¡Ah, por eso no necesitó un visado!".
Los robots actuales a menudo fallan en este trabajo de detective. Pueden adivinar la respuesta, inventar hechos (alucinaciones) o simplemente quedarse atascados porque la respuesta no está escrita en una sola frase en sus datos de entrenamiento.
La Solución: Un Nuevo "Examen de Detective"
Los investigadores crearon un nuevo conjunto de datos llamado CommonWhy. Piensa en esto como un enorme "Examen de Detective" de 15.000 preguntas diseñado específicamente para probar qué tan bien estos robots pueden descubrir por qué suceden las cosas.
Así es como construyeron este examen:
- Las Reglas (Axiomas): Primero, dieron al IA algunas reglas básicas del mundo, como: "Si eres ciudadano del País A, y el País B permite que los ciudadanos del País A visiten sin visado, entonces no necesitas un visado".
- Los Personajes (Entidades): Tomaron personas, lugares y eventos reales de una base de datos gigante llamada Wikidata (como una Wikipedia para datos estructurados).
- Las Preguntas: Mezclaron las reglas con los personajes para crear preguntas. Por ejemplo: "¿Por qué Persona X no necesitó un visado para ir a Evento Y?"
- Las Respuestas: Crucialmente, no solo buscaron una respuesta correcta. En el mundo real, a menudo hay múltiples razones. Quizás a la Persona X no le hizo falta un visado porque es ciudadano del país anfitrión, o quizás porque es diplomático. El conjunto de datos incluye todas estas posibilidades válidas.
Los Resultados: Los Robots Reprobaron el Examen
Los investigadores probaron los modelos de IA más inteligentes disponibles hoy en día (incluidos los últimos modelos de "razonamiento") en este examen. Los resultados fueron sorprendentes y un poco preocupantes:
- Se quedaron atascados: Incluso los mejores modelos solo acertaron alrededor del 68% de las respuestas. Es una calificación reprobatoria para un sistema que esperamos que sea superinteligente.
- Inventaron cosas: Cuando los modelos sí acertaron la respuesta, a menudo incluyeron hechos falsos para llegar a ella. Es como un estudiante que obtiene la respuesta correcta de matemáticas pero usa una fórmula inventada para llegar a ella.
- El Problema de la "Cola Larga": Los robots lo hicieron aún peor cuando las preguntas involucraban personas o lugares poco conocidos o menos famosos (la "cola larga"). Parecían depender de memorizar hechos famosos en lugar de razonar realmente a través de la lógica.
- Las herramientas antiguas no funcionan: Intentaron usar herramientas estándar diseñadas para preguntas de bases de datos (KGQA), pero esas herramientas fallaron miserablemente. Están construidas para encontrar hechos, no para explicar por qué suceden las cosas.
El Panorama General
El artículo concluye que tenemos un nuevo desafío muy difícil para la IA. No podemos seguir pidiendo a los robots que memoricen hechos o respondan preguntas simples de "Verdadero/Falso". Si queremos que interactúen efectivamente con el mundo real, necesitamos enseñarles a ser detectives: cómo combinar hechos duros con sentido común para explicar por qué el mundo funciona como funciona.
CommonWhy es la primera herramienta que tenemos para medir si los robots están realmente mejorando en este tipo de pensamiento, o si simplemente están mejorando en adivinar. Por ahora, el artículo dice que, en su mayoría, solo están adivinando.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.