← 최신 논문
💬 NLP

ABCD: All Biases Come Disguised

이 논문은 선다형 질문 평가에서 모델이 정답 위치나 라벨에 의존하는 편향을 줄이기 위해, 정답을 무작위 순서로 배치하고 유사도 모델을 활용해 답변을 직접 비교하는 새로운 평가 프로토콜을 제안하며 이를 통해 평가의 강건성을 크게 향상시켰음을 보여줍니다.

원저자: Mateusz Nowak, Xavier Cadet, Peter Chin

게시일 2026-02-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mateusz Nowak, Xavier Cadet, Peter Chin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎭 1. 문제: AI 는 '정답 위치'를 외우고 있을까?

지금까지 AI(대형 언어 모델) 의 능력을 평가할 때는 주로 **객관식 문제 (MCQ)**를 사용했습니다.
예를 들어, "사과를 고르세요. A. 바나나, B. 사과, C. 포도"처럼요.

하지만 연구진들은 AI 가 문제를 읽지 않고도 정답을 맞출 수 있는 '비밀 경로'를 발견했습니다. 마치 시험지를 풀 때 내용을 읽지 않고 다음과 같은 패턴만 보고 답을 고르는 학생들처럼요:

  • 위치 편향: "아, 정답은 항상 B에 있구나!" (실제 내용은 상관없음)
  • 라벨 편향: "A 는 항상 틀리고, C 는 항상 맞네." (A, B, C 라는 글자 자체에 의미를 부여함)
  • 예시 편향: "앞에 나온 예시 문제들에서 정답이 D 가 많았으니, 이번 문제도 D 일 거야." (문맥을 읽지 않고 통계만 따름)

이런 현상을 **'NonsenseQA(말도 안 되는 질문)'**라는 가짜 시험지로 테스트해 보니, AI 들 중에는 의미 없는 단어 조합으로 된 질문에서도 95% 이상을 맞추는 모델들이 있었습니다. AI 가 '지식'이 있어서가 아니라, 시험지의 패턴을 악용하고 있었기 때문입니다.

🛠️ 2. 해결책: "A, B, C"를 지우고, "전체 문장"으로 답하게 하기

연구진은 AI 가 속지 않도록 하는 새로운 평가 방법, **'M&D (Matched-and-Dashed)'**를 제안합니다.

기존 방식 (S&L):

  • 보기: A. 사과, B. 바나나, C. 포도
  • AI 의 답: **"B"**라고만 말하게 함.
  • 문제점: AI 가 'B'라는 글자나 위치만 보고 찍을 수 있음.

새로운 방식 (M&D):

  • 보기: - 사과, - 바나나, - 포도 (A, B, C 같은 글자를 없애고 '-'로 통일)
  • AI 의 답: **"사과"**라고 전체 문장으로 말하게 함.
  • 비유: 시험지 지시사항을 "정답의 알파벳만 적지 말고, 정답이 무엇인지 문장으로 설명해 줘"라고 바꾼 것입니다.

그리고 AI 가 말한 "사과"와 보기 중 "사과"가 의미적으로 얼마나 비슷한지 컴퓨터가 계산해서 (의미 유사도) 정답을 판정합니다.

📊 3. 결과: AI 의 '진짜 실력'이 드러나다

이 새로운 방식으로 다시 시험을 치르니 놀라운 일이 일어났습니다.

  • NonsenseQA(가짜 시험): AI 들의 점수가 확 떨어졌습니다. 95% 를 맞던 AI 가 25%(무작위 추측 수준) 로 떨어졌습니다. 이는 AI 가 이제 더 이상 '위치'나 '글자'에 의존할 수 없게 되어, 실제로 문제를 이해하지 못하면 찍을 수 없게 되었다는 뜻입니다.
  • 실제 시험 (MMLU, GPQA 등): AI 의 평균 점수는 조금만 떨어졌지만, 시험지 순서를 바꿔도 점수가 들쑥날쑥하지 않게 (안정적으로) 변했습니다.

한 줄 요약:

"기존 방식은 AI 가 시험지의 '트릭'을 이용해 고득점을 내게 했지만, 새로운 방식은 AI 가 진짜로 문제를 이해하고 있는지를 가려냅니다."

💡 4. 왜 중요한가요? (일상적인 예시)

마치 스승이 학생을 평가할 때를 생각해보세요.

  • 기존 방식: 학생이 "정답은 B 입니다"라고만 말하면 점수를 줍니다. 학생은 내용을 몰라도 B 가 정답인 줄 알고 외우면 됩니다.
  • 새로운 방식: 학생에게 "왜 그 답이 맞는지 이유를 말로 설명해 봐"라고 합니다. 내용을 모르면 설명할 수 없으니, 진짜 실력이 있는 학생만 점수를 받습니다.

이 연구는 AI 가 고급 지능을 가진 것처럼 보이는지, 아니면 단순히 시험지의 단서를 찾아내는 '지능 없는 계산기'인지를 구분하는 나침반이 되어줍니다.

🚀 결론

이 논문의 핵심은 **"AI 를 평가할 때는 시험지 자체의 결함 (편향) 을 없애고, AI 가 진짜로 생각했는지 확인해야 한다"**는 것입니다.

이 새로운 방법 (M&D) 은 AI 개발자들에게 더 공정하고 정확한 평가 기준을 제공하며, 우리가 AI 에게 의존해야 할 때 (예: 의료, 법률 등) AI 가 실제로 그 일을 잘할 수 있는지 신뢰할 수 있는 기준이 되어줄 것입니다.

한마디로: "AI 가 시험지를 속이는 게 아니라, 진짜로 문제를 풀고 있는지 확인하는 새로운 규칙을 만들었습니다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →