Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability
Este artículo presenta Gakucho, un benchmark multimodal a gran escala derivado de la Evaluación Nacional de Capacidad Académica de Japón que incluye 900.000 distribuciones agregadas de respuestas estudiantiles para permitir una evaluación directa y fundamentada en humanos de los modelos de lenguaje grandes multimodales en tareas educativas auténticas de educación primaria y secundaria.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que quieres probar qué tan inteligente es un nuevo robot. Por lo general, podrías darle un cuestionario inventado o un problema de libro de texto que parece perfecto en una pantalla de computadora. Pero este artículo dice: "Probemos algo diferente". En lugar de un examen falso, demos al robot un examen real de secundaria de Japón, del tipo que 900,000 estudiantes reales tomaron.
Aquí tienes el desglose simple de lo que hicieron y descubrieron los investigadores:
1. La "Cocina" de Pruebas del "Mundo Real"
Los investigadores tomaron exámenes oficiales de la Evaluación Nacional de la Capacidad Académica de Japón. Estos no son archivos de texto digitales limpios. Son documentos reales y desordenados llenos de:
- Diagramas y Mapas: Como un mapa del tiempo con líneas onduladas.
- Bocadillos de Texto: Texto dentro de burbujas estilo cómic.
- Texto Vertical: El japonés a menudo se escribe de arriba hacia abajo, lo cual es complicado para las computadoras.
- Tablas y Gráficos: Números dispuestos en cuadrículas.
Piensa en esto como intentar leer una receta escrita en una servilleta arrugada con un boceto de una olla al lado, en lugar de un PDF digital limpio. Los investigadores tuvieron que "traducir" cuidadosamente estas páginas desordenadas a un formato que las computadoras pudieran entender sin perder la apariencia y sensación originales.
2. El Ingrediente Secreto: La "Multitud Humana"
La parte más genial de este proyecto es que no solo guardaron las preguntas; guardaron las respuestas de 900,000 estudiantes reales.
Imagina que tienes una pregunta de examen. Por lo general, solo conoces la respuesta "correcta". Aquí, los investigadores saben exactamente qué porcentaje de estudiantes la respondió correctamente, qué porcentaje la respondió incorrectamente y cómo la respondieron mal.
- Por qué esto importa: Permite a los investigadores comparar el cerebro del robot directamente contra una gigantesca multitud de cerebros humanos. Pueden ver: "¿Cometió el robot el mismo error que cometería un humano, o cometió un error extraño de robot?"
3. Probando a los Robots
Suministraron estos exámenes reales a varios modelos de IA famosos (como GPT-4, Gemini y Claude) para ver cómo les iba.
Los Resultados:
- Ciencias: Los robots fueron bastante buenos, especialmente cuando podían "ver" los diagramas. Es como si finalmente entendieran que una imagen de un volcán es importante para la pregunta.
- Matemáticas: Fueron excelentes con números simples, pero tropezaron cuando las matemáticas requerían leer un gráfico o una figura dibujada de manera extraña. Si el robot no podía "leer" la imagen, no podía resolver las matemáticas.
- Japonés (Idioma): Este fue el más difícil. Los robots tuvieron dificultades con el texto escrito verticalmente y con reconocer caracteres específicos (Kanji) dentro de imágenes. Es como pedirle a un robot que lea una nota escrita a mano en una servilleta; a menudo adivinaron o inventaron palabras en lugar de leer exactamente lo que estaba allí.
4. El Problema del "Juez"
Los investigadores probaron dos formas de calificar a los robots:
- Profesores Humanos: Personas reales leyeron las respuestas.
- Jueces de IA: Otra IA (GPT-4o) calificó las respuestas de la primera IA.
El Giro:
- Para Ciencias y Matemáticas, el Juez de IA fue un sustituto bastante bueno de un profesor humano. Ambos estuvieron mayormente de acuerdo sobre quién aprobó y quién reprobó.
- Para Japonés, el Juez de IA estaba confundido. A menudo discrepaba con los humanos. El artículo sugiere que, para tareas complejas de lenguaje, aún no puedes confiar simplemente en que una IA califique a otra IA; aún necesitas a un humano en el proceso.
5. Donde los Robots Tropezaron
El artículo destaca algunos fallos divertidos pero reveladores:
- El Problema de la "Cita Falsa": Cuando la prueba le pedía al robot "copiar esta oración exactamente de la imagen", el robot a veces inventaba una oración que sonaba bien pero que en realidad no estaba allí. Alucinó en lugar de leer.
- El Problema del "Dibujo": Una pregunta le pedía al robot que mirara un carácter japonés específico y explicara por qué su equilibrio visual estaba mal. Los robots no podían "ver" los detalles diminutos del dibujo lo suficientemente bien como para responder.
La Conclusión
Este artículo construyó un nuevo patio de recreo realista para probar la IA. En lugar de probar a los robots con datos limpios y perfectos, los probaron con la realidad desordenada, visual y compleja de un examen escolar real.
Descubrieron que, aunque la IA se está volviendo más inteligente, aún lucha con la "lógica visual" específica de los exámenes del mundo real, especialmente cuando se trata de leer texto dentro de imágenes o comprender los errores sutiles que cometen los estudiantes reales. También demostraron que no siempre puedes confiar en que una IA califique a otra IA, especialmente en materias de lenguaje.
Dónde encontrarlo: Los investigadores pusieron todos estos datos (las preguntas, las imágenes y las respuestas de 900,000 estudiantes) a disposición de cualquiera para usarlos, para que otros científicos puedan realizar sus propias pruebas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.