Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks
Este artículo evalúa la validez predictiva de los referentes de sentido común ampliamente adoptados mediante la prueba de 23 modelos en diversas tareas y concluye que estos referentes ofrecen evidencia solo dependiente de la tarea, en lugar de una evidencia amplia, de la competencia de un LLM en tareas de razonamiento del mundo real aplicadas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de averiguar si un nuevo estudiante es inteligente. Le das un examen estandarizado con preguntas de opción múltiple sobre la vida cotidiana, como "¿Si dejo caer un vaso, se romperá?" o "¿Por qué está llorando el niño?". Si obtiene una puntuación alta, asumes que es bueno entendiendo el mundo. Así es como los científicos prueban actualmente la Inteligencia Artificial (IA). Utilizan "benchmarks" (pruebas de referencia): cuestionarios estáticos diseñados para ver si la IA tiene "sentido común", que es solo una palabra elegante para las reglas básicas y no escritas de cómo funcionan el mundo, las personas y la física. Pero aquí está el truco: el hecho de que un estudiante saque la máxima nota en un examen de opción múltiple no significa que realmente pueda navegar una situación de la vida real, como negociar con un amigo o arreglar un juguete roto. La gran pregunta que se hacen los investigadores es: ¿estas puntuaciones de los exámenes realmente predicen qué tan bien manejará la IA las tareas del mundo real, o simplemente son buenos tomando el examen en sí?
Este artículo, titulado "Benchmarking the Benchmarks" (Evaluando los Benchmarks), emprende una misión de detective para descubrir si estos cuestionarios populares de IA son realmente útiles. Los autores, Ine Gevers y Walter Daelemans, trataron estos benchmarks como un pronóstico del tiempo. Querían saber: si el pronóstico dice "soleado" (una puntuación alta en el benchmark), ¿significa eso realmente que el día será soleado (la IA tendrá éxito en una tarea real)? Para probar esto, no solo miraron un examen; reunieron 23 modelos de IA diferentes (piensa en ellos como 23 estudiantes diferentes) y les dieron cuatro famosos cuestionarios de sentido común, además de cuatro versiones "reelaboradas" de esos mismos cuestionarios que habían sido limpiadas para eliminar errores complicados. Luego, observaron cómo estos mismos modelos se desempeñaban en ocho desafíos diferentes y más complejos del mundo real, como descifrar si alguien está siendo sarcástico, entender significados ocultos en una conversación o predecir qué sucede después en un evento físico.
Los resultados podrían sorprenderte. Los autores descubrieron que limpiar los cuestionarios no hizo que fueran mejores para predecir el desempeño en el mundo real. Es como tomar un examen de matemáticas, borrar los errores tipográficos y volverlo a imprimir; los estudiantes que sacaron una A antes siguen sacando una A, y los que tuvieron dificultades siguen teniendo dificultades, pero el examen sigue sin decirte si realmente pueden arreglar un coche. De hecho, para la mayoría de las tareas del mundo real, las puntuaciones de los cuestionarios fueron predictores terribles. Los únicos momentos en que los cuestionarios fueron útiles fueron para tareas muy específicas: descifrar "Falsas Creencias" (entender que otra persona puede saber algo que tú no sabes) y "TRIP" (predecir los pasos físicos de un evento). Aun así, la conexión no era perfecta.
El estudio sugiere que estos benchmarks no están midiendo un único y amplio superpoder de "sentido común". En su lugar, están midiendo qué tan bien un modelo puede realizar un tipo específico de examen de opción múltiple. Si quieres que una IA sea buena entendiendo el sarcasmo o las emociones sociales, obtener una puntuación alta en estos cuestionarios estándar no garantiza que lo sea. Los autores concluyen que no podemos simplemente mirar una tabla de clasificación y asumir que la IA superior es la más inteligente para cada trabajo. Las puntuaciones son útiles para algunas cosas muy estrechas, pero no son una bola de cristal mágica para la inteligencia general. El artículo argumenta que debemos dejar de asumir que corregir las preguntas del examen soluciona automáticamente la capacidad del examen para predecir el éxito en el mundo real, y en su lugar, enfocarnos en probar la IA de formas que realmente se parezcan al mundo real.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.