← Últimos artículos
🤖 AI

Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

Este artículo presenta ProverbIT, un referente de proverbios italianos que revela que los modelos de lenguaje de gran tamaño tienen dificultades para distinguir los finales correctos de los proverbios de sinónimos literales en tareas de opción múltiple, lo que sugiere que su rendimiento depende más de patrones memorizados que de una comprensión semántica profunda del lenguaje figurado culturalmente arraigado.

Autores originales: Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni

Publicado 2026-08-06
📖 4 min de lectura☕ Lectura para el café

Autores originales: Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás caminando por una biblioteca gigante donde los estantes no solo están llenos de libros, sino de toda la historia de la conversación humana. Este es el mundo de los Modelos de Lenguaje Extensos (LLM). Piensa en estos sistemas de IA como lectores súper rápidos y súper obsesivos que se han devorado casi todo lo escrito en internet. Son increíblemente buenos detectando patrones, como saber que si alguien dice "Está lloviendo gatos y...", la siguiente palabra es casi con seguridad "perros". Utilizan este reconocimiento de patrones para escribir correos electrónicos, resolver problemas matemáticos e incluso escribir código.

Pero aquí está la parte complicada: el hecho de que una IA haya leído un millón de historias no significa que realmente entienda los chistes, el sarcasmo o los dichos antiguos ocultos en ellas. Aquí es donde entran los proverbios. Un proverbio es un dicho corto y sabio transmitido de generación en generación, como "No cuentes tus pollitos antes de que nazcan". Estos no son solo palabras aleatorias; son atajos culturales que dependen de una experiencia humana compartida. Para una computadora, descifrar un proverbio es como intentar resolver un acertijo donde la respuesta depende de conocer el sentimiento de la cultura, no solo la definición de diccionario de las palabras. Los científicos tienen curiosidad: ¿Realmente entienden estos modelos de IA el chiste, o solo están adivinando basándose en qué palabras suelen andar juntas?

Esto es exactamente lo que los investigadores detrás del artículo ProverbIT querían averiguar. Crearon una prueba especial, un "examen" hecho enteramente de proverbios italianos, para ver qué tan bien podían manejar estos acertijos culturales los diferentes modelos de IA. No se limitaron a pedirle a la IA que terminara la frase; les tendieron una trampa. Les dieron a los modelos una lista de finales, pero se aseguraron de que el final correcto no estuviera en la lista. En su lugar, la lista estaba llena de falsificaciones ingeniosas: algunas que sonaban similares, otras que significaban lo mismo pero sonaban ridículas, y otras que eran simplemente erróneas. La única opción correcta era "Ninguna de las anteriores".

Los resultados fueron un poco impactantes. Cuando los investigadores simplemente le pedían a la IA que terminara el proverbio por su cuenta, casi todos los modelos acertaban. Era como pedirle a un estudiante que recitara un poema que había memorizado; lo lograron con éxito. Pero en el momento en que los investigadores cambiaron al examen de opción múltiple con la pregunta "trampa", las puntuaciones se desplomaron. Incluso los modelos de "razonamiento" más avanzados —aquellos diseñados para pensar paso a paso como un humano— tropezaron gravemente. En lugar de darse cuenta de que la respuesta correcta no estaba y elegir "Ninguna de las anteriores", eligieron obstinadamente una de las opciones falsas.

¿Por qué sucedió esto? Los investigadores miraron dentro del "cerebro" de la IA (su proceso de pensamiento) y encontraron un fallo fascinante. Los modelos conocían el final correcto. En su pensamiento interno, mencionaban la frase correcta una y otra vez. Pero al momento de tomar una decisión final, parecían ignorar su propio conocimiento. Estaban tan concentrados en encontrar una palabra que sonara bien o que pareciera un sinónimo que no podían decir: "Espera, la respuesta real no está aquí". Es como un estudiante que sabe que la respuesta es "42", ve un examen con las opciones "40", "44" y "46", y luego marca con confianza "44" porque es el número más cercano, olvidando por completo que la respuesta real ni siquiera está en la página.

El estudio sugiere que, si bien estos modelos de IA son increíbles memorizando patrones y recordando hechos, todavía luchan con un tipo específico de pensamiento: el razonamiento negativo. Esta es la capacidad de mirar un conjunto de opciones y darse cuenta de que "Ninguna de estas es correcta". Dependen mucho de lo que han visto antes en lugar de comprender verdaderamente el significado detrás de las palabras. Así que, aunque estos cerebros digitales se vuelven más inteligentes cada día, todavía tienen mucho que aprender sobre las piezas sutiles, truculentas y, a veces, ausentes de la sabiduría humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →