Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options
이 논문은 기존 4 지선다식 평가가 우연성이나 위치 편향으로 인해 모델의 실제 능력을 과대평가할 수 있음을 지적하고, 100 개의 선택지를 제시하는 대규모 옵션 평가 프로토콜을 통해 모델의 신뢰성을 더 정확하게 검증할 수 있음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"AI 가 정말로 똑똑한지, 아니면 그냥 운이 좋거나 요령을 부린 것일 뿐인지"**를 확인하는 새로운 방법을 제안합니다.
기존의 AI 평가 방식이 가진 치명적인 약점을 지적하고, 이를 해결하기 위해 100 개의 선택지가 있는 새로운 시험을 고안했죠. 마치 "바늘 찾기" 게임을 4 개의 상자에서 100 개의 상자로 늘려서 AI 의 진짜 실력을 가려내는 것과 같습니다.
이 논문의 핵심 내용을 일상적인 비유로 쉽게 설명해 드릴게요.
1. 문제: "4 개의 선택지"는 너무 쉬워서 속임수가 통합니다
지금까지 AI 를 평가할 때는 보통 4 개나 5 개의 선택지 중 정답을 고르게 했습니다. (예: A, B, C, D)
- 비유: 시험지 지문이 4 개만 있다면, AI 는 정답을 몰라도 "C 가 정답일 확률이 높지?" 혹은 "A 와 B 는 틀린 것 같으니 C 나 D 중 하나를 찍자" 하는 식으로 **요령 (Shortcut)**을 부릴 수 있습니다.
- 결과: AI 가 90% 이상을 맞추더라도, 그건 진짜 지식이 아니라 운이나 통계적 요령일 뿐일 수 있습니다. 마치 4 개의 문 중 하나를 고르는 게임에서 운 좋게 계속 맞는 것과 비슷하죠.
2. 해결책: "100 개의 선택지"로 압도적인 혼란을 줍니다
저자들은 AI 의 진짜 실력을 보기 위해 선택지를 100 개로 늘렸습니다.
- 비유: 이제 4 개의 문이 아니라 100 개의 문이 있습니다. 그중 단 하나만 '잠긴 문 (정답)'이고 나머지는 모두 '가짜 문 (오답)'입니다.
- 효과: 운으로 맞출 확률은 25%(4 개 중 1 개) 에서 **1%(100 개 중 1 개)**로 뚝 떨어집니다. 이제 AI 는 요령 부릴 수 없고, 정말 그 문이 왜 잠겨 있는지 (오류가 있는지) 분석해야만 맞출 수 있습니다.
3. 실험: 한국어 맞춤법 오류 찾기 게임
이 새로운 시험을 위해 한국어 맞춤법 오류를 찾는 게임을 만들었습니다.
- 상황: 100 개의 문장 중 단 하나만 맞춤법이 틀린 문장입니다. 나머지 99 개는 모두 완벽하게 맞는 문장입니다.
- 목표: AI 가 그 단 하나의 틀린 문장을 찾아내야 합니다.
4. 놀라운 결과: "잘하는 척"하던 AI 들이 무너졌습니다
이 100 개 선택지 시험을 시켜보니 기존 평가와는 완전히 다른 결과가 나왔습니다.
- 최고급 AI (예: Gemini): 4 개 선택지에서도 잘했고, 100 개 선택지에서도 여전히 잘했습니다. 진짜 실력자입니다.
- 중급 AI 들 (예: HyperCLOVA X, EXAONE): 4 개 선택지 시험에서는 거의 100% 를 맞췄습니다. 하지만 100 개 선택지 시험으로 넘어가자마자 성적이 70% 이상 폭락했습니다.
- 이유: 이들은 진짜 분석을 못 하고, **"일단 앞쪽의 문장부터 찍어보자"**는 요령을 썼기 때문입니다. 선택지가 100 개로 늘어나자 요령이 먹히지 않아 무너진 것입니다.
5. 왜 이런 일이 일어났을까? (두 가지 실패 원인)
논문은 AI 가 왜 무너졌는지 두 가지 원인을 찾아냈습니다.
- 진짜 지식 부족 (Semantic Confusion): 100 개의 문장이 너무 비슷해서, AI 가 진짜 틀린 부분을 찾아내는 능력이 부족했습니다.
- 위치 편향 (Position Bias): AI 가 답을 못 찾을 때, **중간이나 뒤쪽을 보지 않고 무조건 '맨 앞쪽 (1~10 번)'**을 찍는 버릇이 생겼습니다.
- 비유: 시험지 100 장을 볼 때, 답을 못 찾으면 "일단 1 번부터 10 번까지 찍어보자"는 식으로 포기하고 요령을 부린 것입니다.
6. 결론: "긴 문장"이 문제인가, "선택지"가 문제인가?
혹시 100 개 선택지가 너무 길어서 AI 가 읽지 못해서 실패한 걸까? (긴 문맥 처리 능력 부족)
- 실험: 선택지 수는 그대로 두되, 문장 사이에 **의미 없는 글자 (패딩)**를 넣어 길이를 늘려봤습니다.
- 결과: 길이가 길어지는 것만으로는 성능이 크게 떨어지지 않았습니다.
- 결론: 문제는 문장의 길이가 아니라, **100 개의 비슷한 선택지 사이에서 진짜 정답을 골라내는 '경쟁 (Ranking)'**이 너무 어려워서 실패한 것입니다.
📝 한 줄 요약
"지금까지 AI 가 4 개의 선택지에서 100% 를 맞췄다고 해서 진짜 똑똑한 게 아닙니다. 100 개의 선택지 중에서 단 하나를 찾아내는 '진짜 시험'을 치러야만, AI 가 요령을 부린 것인지, 진짜 지식을 가진 것인지 알 수 있습니다."
이 논문은 앞으로 AI 를 평가할 때, 선택지를 더 많이 늘려서 (Stress Test) AI 가 혼란스러운 상황에서도 얼마나 신뢰할 수 있는지 확인해야 한다고 주장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.