BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams
이 논문은 브라질의 주요 대학 입시(2022~2025)에서 추출한 395개의 개방형 질문으로 구성된 새로운 벤치마크인 BLUEX v2를 소개하며, 이를 통해 21개의 최첨단 거대언어모델(LLM)을 포르투갈어 서술형 과제에 대해 평가하여 상당한 성능 격차를 드러내고 수학적 추론 및 이미지 이해에서의 과제를 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇 그룹의 지능을 테스트하기 위해 "하늘은 무슨 색인가요? A) 파란색, B) 빨간색"과 같은 간단한 객관식 질문을 던지고 있다고 상상해 보세요. 그들은 정답인 알파벳을 아주 잘 골라냈습니다. 하지만 이 논문의 연구진인 BLUEX v2는, 알파벳을 고르는 것은 쉽다는 것을 깨달았습니다. 진정한 지능의 시험은 하늘이 왜 파란지 전체 에세이를 쓰고, 그것을 증명하기 위해 도표를 그리는 것입니다.
이 논문은 AI 모델의 능력을 테스트하기 위해 특별히 설계된, 훨씬 더 어려운 새로운 "기말고사"를 소개합니다. 특히 포르투갈어로 말하고 쓰는 능력을 테스트하도록 설계되었습니다.
다음은 이들의 연구 내용을 쉬운 비유를 사용하여 정리한 내용입니다.
1. 문제점: "객관식"의 함정
이전에는 연구자들이 브라질의 대학 입학 시험 중 1차 시험만 가지고 AI를 테스트했습니다. 1차 시험을 생각해보면, 그것은 정답에 동그라미를 치는 퀴즈 게임과 같습니다. AI가 패턴을 인식하거나 답을 찍기에 매우 쉽습니다.
하지만 이 시험의 2차 과정(BLUX v2가 집중하는 부분)은 학생이 긴 문장의 상세한 답변을 작성하고, 복잡한 수학 문제를 단계별로 풀며, 지도나 그래프를 해석해야 하는 최종 논문 심사와 같습니다. 기존의 테스트는 AI가 실제로 인간처럼 생각하고 글을 쓸 수 있는지를 측정하지 못했습니다. 단지 정답을 인식할 수 있는지만을 측정했을 뿐입니다.
2. 해결책: AI를 위한 새로운 "기말고사"
연구팀은 2022년에서 2025년 사이 브라질의 최고 대학들(UNICOMP 및 USP)에서 출제된 395개의 실제 문항으로 구성된 거대한 데이터셋인 BLUEX v2를 만들었습니다.
- 질문 구성: 이 질문들은 단순한 텍스트가 아닙니다. 약 **56%**는 정답을 맞히기 위해 반드시 이해해야 하는 이미지, 차트 또는 지도를 포함하고 있습니다.
- 형식: AI는 A, B, C, D 중 하나를 고르는 것이 아니라 자유 형식의 답변을 작성해야 합니다.
- 주제: 역사와 사회학부터 물리학과 수학에 이르기까지 9가지 다양한 과목을 다룹니다.
3. 로봇을 채점하는 방법: "AI 선생님"
수천 개의 테스트에 대해 5페이지 분량의 에세스를 사람이 빠르게 채점하는 것은 어렵습니다. 그래서 연구진은 AI가 선생님 역할을 하는 시스템을 구축했습니다.
- 채점 기준(Rubric): 먼저, AI를 사용하여 "공식 정답"을 읽고 이를 체크리스트(루브릭)로 세분화했습니다. 예를 들어, 답변에 "ATP"와 "근육 수축"이 언급되어야 한다면, 체크리스트에는 이 두 항목이 들어갑니다.
- 심판: 또 다른 AI(심판)가 학생 로봇의 답변을 읽고 리스트의 항목들을 체크합니다. ATP를 언급했나요? 네. 근육 수축을 언급했나요? 아니요.
- 점수: 로봇은 체크리스트 항목을 얼마나 충족했느냐에 따라 0점에서 10점 사이의 점수를 받습니다.
- 증거: "AI 선생님"이 환각 현상(hallucination)을 일으키지 않는지 확인하기 위해, 연구진은 AI의 채점을 실제 인간 교사들의 채점과 비교했습니다. AI는 인간과 89.5% 일치하는 결과를 보였습니다. 이는 매우 높은 점수로, 자동 채점이 신뢰할 수 있음을 증명합니다.
4. 결과: 누가 통과하고 누가 낙제했는가?
그들은 이 시험에 21개의 서로 다른 AI 모델(로봇)을 테스트했습니다.
- 점수 분포: 점수는 최저 4.18에서 최고 9.10까지 분포했습니다. 이는 이 테스트가 똑똑한 로봇과 그렇지 않은 로봇을 구별해내는 데 효과적임을 보여줍니다.
- 승자: 최고의 성적을 거둔 모델은 Gemini 3.1 Pro나 GPT-5와 같은 거대하고 값비싼 모델들이었습니다.
- 패자: 규모가 작은 오픈 소스 모델들은 고전했으며, 최저 점수는 약 4.18점을 기록했습니다.
- 브라질의 스타: 흥 흥미롭게도, 브라질에서 만든 모델(Sabiá-4)은 글로벌 거물들과 거의 대등할 정도로 매우 우수한 성능을 보였으며, 이는 현지 학습이 도움이 된다는 것을 보여줍니다.
5. "어려운 부분": 로봇이 넘어지는 지점
최고의 로봇들도 두 가지 특정 부분에서 어려움을 겪었습니다.
- 수학적 추론: 이것이 가장 어려운 과목이었습니다. 멋진 이야기를 쓸 수 있지만 나눗셈은 못 하는 사람처럼, AI들은 아름다운 포르투갈어 에세이를 쓸 수는 있었지만 수학적 단계를 틀리는 경우가 많았습니다.
- 이미지 이해: 질문에 그래프나 지도가 포함된 경우, 로봇들의 점수는 평균적으로 약 0.5점 하락했습니다. 이는 마치 학생에게 수학 문제를 주면서 숫자를 구겨진 종이 위에 그려준 것과 같아서, AI가 문제를 풀 수 있을 만큼 세부 사항을 명확하게 "보는" 데 어려움을 겪었습니다.
6. 테스트 비용
연구진은 비용에 대해서도 투명하게 공개했습니다. 질문을 던지고, 이미지 설명을 생성하고, 답변을 채점하는 이 모든 실험을 실행하는 데 약 $127가 들었습니다. 이는 이 정도 규모의 연구치고는 놀라울 정도로 저렴하며, 수백만 달러를 쓰지 않고도 AI를 엄격하게 테스트할 수 있음을 보여줍니다.
핵심 요약
BLUEX v2는 포르투갈어 AI를 테스트하기 위한 새로운, 더 강력한 표준입니다. 이는 단순한 퀴즈를 넘어 AI가 글을 쓰고, 추론하며, 이미지를 보도록 강제합니다. 결과에 따르면 AI는 포르투갈어로 글을 쓰고 논쟁하는 데 매우 능숙해지고 있지만, 여전히 복잡한 수학과 시각적 데이터를 해석하는 데는 어려움을 겪고 있습니다. 이 벤치마크는 연구자들에게 다음 개선 사항에 어디에 집중해야 할지에 대한 명확한 지도를 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.