Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
이 논문은 폐쇄형 모델과 오픈 웨이트 모델 간의 상당한 성능 격차를 드러내는 동시에 기존 벤치마크가 감지하지 못하는 현재 멀티모달 시스템의 지속적인 약점을 부각하는, 인간에게는 단순하지만 AI에게는 도전적인 235개의 과제로 구성된 새로운 벤치마크인 "Blind-Spots-Bench"를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 비디오 게임을 하고 있다고 상상해 보세요. AI 보스가 당신이 이겨온 모든 레벨을 방금 막 격파했습니다. 고득점을 갈아치우고, 계산기보다 빠르게 수학 퍼즐을 풀며, 당신을 울게 만드는 시를 써 내려갑니다. 당신은 "와, 이 AI는 거의 천재 수준인데?"라고 생각할 것입니다. 하지만 그러다 당신이 아주 간단한 질문을 던집니다. "다리가 정확히 다섯 개인 개를 그려줘"라거나 "정확히 31글자인 문장을 써줘"라고 말이죠.
순식간에, 그 초천재 AI는 자기 발에 걸려 넘어집니다. 개를 여섯 다리로 그리거나, 32글자짜리 문장을 써버립니다. 마치 세계적인 체스 챔피언이 갑자기 신발 끈 묶는 법을 까먹은 것과 같습니다.
이것이 바로 EPFL의 연구진이 blind-spots-bench라고 불리는 새로운 테스트를 통해 발견한 내용입니다. 그들은 단순히 모두가 이야기하는 거창하고 화려한 시험들로 AI 모델의 지능을 측정하지 않았습니다. 대신, 인간에게는 매우 쉽지만 가장 진보된 AI조차 당황하게 만드는 235개의 작고 까다로운 과제들로 구성된 "스트레스 테스트"를 만들었습니다.
"사각지대(Blind Spot)"의 발견
연구팀은 이 까다로운 질문들을 AI 대학원 과정의 학생들로부터 수집했습니다. 학생들은 2025년 후반기 가장 똑똑한 AI 챗봇들이 무엇을 제대로 해내지 못하는지 구체적인 지점들을 찾아내도록 요청받았습니다. 연구진은 이 질문들을 정제하고 답변을 자동으로 채점하는 시스템을 구축했습니다.
테스트를 실행한 결과, 몇 가지 놀라운 사실이 밝혀졌습니다.
1. "부잣집 아이"의 이점
논문은 매우 비싼 "폐쇄형 소스(closed-source)" 모델(직접 다운로드하여 실행할 수 없는 모델들)이 "오픈 웨이트(open-weight)" 모델(누구나 사용할 수 있는 모델들)보다 이러한 사각지대에서 훨씬 더 뛰어난 성능을 보인다고 제안합니다. 두 유형의 모델이 일반적인 벤치마크에서는 비슷한 점수를 기록하더라도, 이 특정 스트레스 테스트에서는 폐쇄형 모델이 오픈형 모델보다 약 10% 더 높은 점수를 받았습니다. 이는 마치 트랙 위에서는 똑같이 빨라 보이는 두 명의 주자가 있지만, 미로 속에서 저글링을 하며 달리라고 하면 값비싼 훈련 장비를 갖춘 쪽이 승리하는 것과 같습니다.
2. 크다고 항상 좋은 것은 아니다
당신은 AI 모델을 더 크게 만드는 것(더 많은 "두뇌 능력"을 추가하는 것)이 이런 바보 같은 실수를 해결해 줄 것이라고 생각할 수도 있습니다. 하지만 논문은 이를 측정했고, 규모를 키우는 것이 항상 도움이 되지는 않는다는 것을 발견했습니다. 어떤 경우에는 모델의 작은 버전이 거대한 형제 모델보다 더 나은 성과를 내기도 했습니다. 예를 들어, Qwen3.5 제품군에서 350억 개의 파라미터를 가진 모델이 때때로 3,970억 개의 파라미터를 가진 거대 모델보다 특정 논리 퍼즐에서 더 뛰어난 성능을 보였습니다. 이는 마치 거대한 코끼리가 고양이가 쉽게 통과하는 작은 문을 통과하는 데 애를 먹는 것과 같습니다.
3. 도구가 모든 것을 해결해주지는 않는다
어떤 이들은 "AI가 숫자를 못 센다면, 계산기를 쥐여주자!"라고 생각했을 것입니다. 연구진은 모델들이 코드 실행 도구를 사용하게 함으로써 이를 테스트했습니다. 결과는 엇갈렸습니다. 일부 모델의 경우, 도구를 사용하는 것이 정답을 맞히는 데 도움이 되었고 시간을 절약해 주었습니다. 하지만 GPT-5.4와 같은 다른 모델들의 경우, 도구를 사용하는 것이 오히려 성능을 악화시켰습니다. 이는 요리사에게 멋진 새 칼을 쥐여주는 것과 같습니다. 때로는 더 빨리 썰 수 있게 해주지만, 때로는 손가락을 베어 요리를 망쳐버리기도 하는 것과 같습니다.
4. "숫자 세기"의 위기
논문이 측정한 가장 큰 사각지대 중 하나는 **숫자 세기(counting)**입니다. 그림 속의 물체를 세는 것이든, 특정 개수의 아이템이 포함된 이미지를 생성하는 것이든, 모델들은 고전했습니다. 최고의 모델들조차 이러한 숫자 세기 과제의 약 60% 정도만 제대로 수행했습니다. 이는 복잡한 교향곡은 연주할 수 있지만 단순한 4/4 박자는 지키지 못하는 음악가처럼, 지속적인 약점으로 남아 있습니다.
이 테스트가 말하지 않는 것
저자들은 자신의 결과를 과장하지 않도록 매우 주의를 기울였습니다. 그들은 이것이 "AI가 영원히 고장 났다"는 것을 증명하는 "최종 보스" 테스트가 아님을 명시했습니다. 그들은 데이터셋이 상대적으로 작으며(질문 235개뿐), 학생들이 직접 만들었기 때문에 당시 테스트했던 모델들의 특정 약점에 편향될 수 있음을 인정했습니다. 또한, 점수를 직접 비교하기 위한 인간 기준점(human baseline)을 포함하지 않았기 때문에, 인간이 얼마나 더 "나은지" 정확히는 알 수 없으며, 단지 인간에게는 이 과제들이 사소하다는 점만 알 수 있다고 언급했습니다.
결론
이 논문은 AI가 일반적인 작업에는 매우 능숙해지고 있지만, 숫자 세기, 공간 추론, 엄격한 글자 수 제한과 같은 매우 구체적이고 실체적인 기술에서는 여전히 "사각지대"를 가지고 있음을 시사합니다. 폐쇄형 모델들이 현재 이러한 사각지대를 해결하는 데 있어 약간의 우위를 점하고 있지만, 아직 이 모든 것을 완벽히 마스터한 모델은 없습니다.
blind-spots-bench를 "AI가 실패했다"는 성적표가 아니라 하나의 진단 도구로 생각하십시오. 이것은 고속도로에서는 완벽하게 달리지만 정지 표지판 앞에서는 멈춰 서는 자동차에 대해 정비사가 실시하는 특정 테스트와 같습니다. 이는 우리가 단순히 차가 빠르다는 이유만으로 완벽하다고 가정하는 대신, 엔진이 어디서 덜컥거리는지 정확히 파악하여 고칠 수 있도록 도와줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.