← Últimos artículos
💻 computer science

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

El artículo presenta "Blind-Spots-Bench", un nuevo referente que comprende 235 tareas sencillas para los humanos pero desafiantes para la IA que revela brechas de rendimiento significativas entre modelos de código cerrado y de pesos abiertos, al tiempo que destaca debilidades persistentes en los sistemas multimodales actuales que los referentes existentes no logran detectar.

Autores originales: Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé

Publicado 2026-07-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás jugando a un videojuego donde el jefe de la IA acaba de derrotar cada nivel que has superado en tu vida. Está destrozando récords de puntuación, resolviendo acertijos matemáticos más rápido que una calculadora y escribiendo poesía que te hace llorar. Pensarías: "Vale, esta IA es básicamente un supergenio". Pero luego, le haces una pregunta sencilla: "¿Puedes dibujar un perro con exactamente cinco patas?" o "Escribe una frase que tenga exactamente 31 caracteres".

De repente, la IA supergenio tropieza con sus propios pies. Dibuja un perro con seis patas, o escribe una frase de 32 caracteres. Es como un campeón mundial de ajedrez que de repente olvida cómo atarse los cordones de los zapatos.

Esto es exactamente lo que los investigadores de la EPFL descubrieron con su nuevo test, llamado blind-spots-bench. No se limitaron a observar qué tan inteligentes son estos modelos de IA en los grandes y sofisticados exámenes de los que todo el mundo habla. En su lugar, crearon una "prueba de estrés" compuesta por 23 años de tareas diminutas y complicadas que son súper fáciles para los humanos, pero que parecen hacer tropezar incluso a las IA más avanzadas.

El descubrimiento del "Punto Ciego"

El equipo recopiló estas preguntas complicadas de estudiantes de un curso de IA de posgrado. Se les pidió a los estudiantes que encontraran las cosas específicas que los chatbots de IA más inteligentes de finales de 2025 simplemente no podían hacer bien. Limpiaron las preguntas y construyeron un sistema para calificar las respuestas automáticamente.

Cuando ejecutaron sus pruebas, encontraron algunas cosas sorprendentes:

1. La ventaja del "Niño Rico"
El artículo sugiere que los modelos "de código cerrado" (aquellos que no puedes descargar y ejecutar por tu cuenta) son significablemente mejores en estos puntos ciegos que los modelos de "pesos abiertos" (aquellos que cualquiera puede usar). Incluso cuando ambos tipos de modelos parecen obtener puntuaciones similares en los benchmarks regulares, los de código cerrado superan a los de código abierto por aproximadamente un 10% en este test de estrés específico. Es como dos corredores que parecen igualmente rápidos en una pista, pero cuando les pides que corran a través de un laberinto haciendo malabares, el que tiene el equipo de entrenamiento más caro gana.

2. Más grande no siempre es mejor
Podrías pensar que hacer un modelo de IA más grande (añadiendo más "potencia cerebral") solucionaría estos errores absurdos. Pero el artículo midió esto y encontró que escalar no siempre ayuda. En algunos casos, una versión más pequeña de un modelo funcionó mejor que su gigante hermano. Por ejemplo, en la familia Qwen3.5, el modelo de 35 mil millones de parámetros a veces superó a la versión masiva de 397 mil millones de parámetros en ciertos acertijos lógicos. Es como cómo un elefante gigante puede tener dificultades para pasar por una puerta pequeña por la que un gato pasa fácilmente.

3. Las herramientas no lo arreglan todo
Algunas personas pensaron: "Si la IA no sabe contar, ¡pues démosle una calculadora!". Los investigadores probaron esto permitiendo que los modelos usaran herramientas de ejecución de código. Los resultados fueron agridulces. Para algunos modelos, el uso de herramientas les ayudó a obtener la respuesta correcta y les ahorró tiempo. Pero para otros, como GPT-5.4, el uso de herramientas en realidad los hizo peores. Es como darle a un chef un cuchillo nuevo y elegante; a veces cortan más rápido, pero otras veces simplemente se cortan el pulgar y arruinan la comida.

4. La crisis del "Conteo"
Uno de los mayores puntos ciegos que el artículo midió es el conteo. Ya sea contar objetos en una imagen o generar una imagen con un número específico de elementos, los modelos tuvieron dificultades. Incluso los mejores modelos solo acertaron cerca del 60% de estas tareas de conteo. Es una debilidad persistente, como un músico que puede tocar una sinfonía compleja pero no puede mantener un simple compás de 4/4.

Lo que este test no dice

Los autores son muy cuidadosos de no exagerar sus resultados. Declaran explícitamente que esto no es una prueba de "jefe final" que demuestre que la IA está rota para siempre. Admiten que el conjunto de datos es relativamente pequeño (solo 235 preguntas) y fue creado por estudiantes, lo que significa que podría estar sesgado hacia las debilidades específicas de los modelos que estaban probando en ese momento. También señalan que no incluyeron una base humana para comparar las puntuaciones directamente, por lo que no sabemos exactamente qué tan "mejor" son los humanos, solo que los humanos encuentran estas tareas triviales.

La conclusión

El artículo sugiere que, si bien la IA se está volviendo increíblemente buena en tareas generales, todavía tiene "puntos ciegos" en habilidades muy específicas y concretas como el conteo, el razonamiento espacial y el seguimiento de límites estrictos de caracteres. Los modelos de código cerrado mantienen actualmente una ligera ventaja en la resolución de estos puntos, pero ningún modelo ha dominado todos todavía.

Piensa en blind-spots-bench no como un informe de notas que dice "la IA está fallando", sino como una herramienta de diagnóstico. Es como un mecánico realizando una prueba específica en un coche que funciona perfectamente en la autopista pero se detiene ante una señal de alto. Nos ayuda a ver exactamente dónde está fallando el motor para que podamos arreglarlo, en lugar de simplemente asumir que el coche es perfecto porque es rápido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →