Accuracy and Order Sensitivity Diverge Under Label-Free Strategies
이 논문은 대규모 언어 모델이 객관식 문제 풀이 과정에서 선택지 레이블을 보지 못하게 하는 것이 위치 편향(positional bias)을 성공적으로 제거하기는 하지만, 정확도를 개선하지 못하고 오히려 성능을 저하시킨다는 점을 입증하며, 이는 주요 병목 현상이 매칭 메커니즘이 아니라 선택지를 숨기는 것임을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 교실에서 객관식 시험을 치르고 있다고 상상해 보세요. 당신은 정답을 알고 있지만, 선생님이 페이지 위의 선택지 순서를 섞어 놓았습니다. 갑자기 당신은 답을 몰라서가 아니라, 새로운 배열 때문에 뇌가 혼란을 느껴 틀린 알파벳을 고르게 됩니다. 이것이 바로 거대 언어 모델(LLM)의 기묘한 세계입니다. 이들은 인간처럼 대화하고 글을 쓰는 매우 똑똑한 컴퓨터 프로그램입니다. 과학자들은 이 모델들이 얼마나 '아는지' 테스트하기 위해 객관식 질문을 사용하지만, 한 가지 결함을 발견했습니다. 모델들이 마치 정답이 페이지의 어디에 놓여 있는지에 너무 민감하게 반응하는 불안한 학생처럼 행동한다는 것입니다. 만약 선택지가 A, B, C, D 순서로 되어 있다면 모델은 맞출 수도 있지만, 이를 B, A, D, C로 섞으면 틀릴 수도 있습니다. 이로 인해 테스트 점수를 신뢰할 수 없게 되는데, 왜냐하면 모델이 실제로 똑똑한 것인지 아니면 단순히 글자의 패턴을 잘 맞추는 것인지 구분할 수 없기 때문입니다. 연구자들은 우리가 이 AI 모델들이 정말로 말하는 것을 신뢰할 수 있도록 이 문제를 해결하고자 합니다.
이 논문에서 퀸즈 벨파스트 대학교의 두 과학자, 칼 한나(Karl Hanna)와 첸 펑(Chen Feng)은 이 '섞기 문제'를 해결하기 위한 영리한 아이디어를 테스트해 보기로 했습니다. 그들은 다음과 같이 자문했습니다. 만약 모델이 여러 가지 선택지를 전혀 보지 않은 채, 먼저 평범한 영어로 자신의 답을 쓰게 한다면 어떻게 될까? 그런 다음, 두 번째 단계에서 모델에게 자신이 쓴 답을 올바른 알파벳과 일치시키도록 요청하는 것입니다. 이것은 학생에게 연습장에 답을 먼저 적게 한 다음, 나중에 시험지를 건네주며 알맞은 답안지에 동그라미를 치라고 하는 것과 같습니다. 이들의 희망은 생각하는 단계 동안 선택지를 숨김으로써, 모델이 그 순서에 영향을 받지 못하게 하는 것이었습니다. 또한 그들은 모델이 레시피를 결정하기 전에 재료 하나하나를 따로 맛보는 것처럼, 각 선택지를 하나씩 독립적으로 살펴보게 하여 재료의 순서로 인해 발생할 수 있는 편향을 제거하려는 두 번째 방법도 시도했습니다.
하지만 결과는 다소 실망스러웠습니다. 연구진은 두 가지 주요 질문 세트(MMLU 및 ARC-Challenge)에 걸쳐 6개의 서로 다른 AI 모델을 대상으로 이 방법들을 테스트했습니다. 그들은 이들의 '라벨 프리(label-free)' 전략 중 어느 것도 모델을 확실히 더 똑똑하게 만들지 못했다는 것을 발견했습니다. 사실, '먼저 쓰고 나중에 맞추기' 방식은 거의 모든 경우에서 모델의 정답률을 오히려 떨어뜨렸습니다. 선택지를 숨기는 것 자체가 문제였던 것으로 보입니다. 선택지를 보지 못하면 모델은 자신의 답을 어떻게 표현해야 할지 파악할 수 없었고, 이는 많은 혼란과 오류로 이어졌습니다. 표준적인 테스트만큼 효과적이었던 유일한 버전은 모델이 생각하는 동안 여전히 선택지를 볼 수 있었던 방식뿐이었습니다.
더욱 놀랍게도, 과학자들은 모델을 정답 순서에 덜 민감하게 만든다고 해서 그것이 자동으로 정확도를 높여주는 것은 아니라는 사실을 발견했습니다. 예를 들어, 한 모델은 섞인 알파벳 순서에는 훨씬 덜 혼란스러워하게 되었지만, 테스트 점수는 여전히 떨어졌습니다. 이는 마치 학생이 글자 순서에 따라 찍는 습관은 버렸지만, 여전히 내용을 충분히 숙지하지 못해 성적이 오르지 않는 것과 같습니다. 이 논문은 단순히 '위치 편향(positional bias, 답이 배치된 위치로 인한 혼란)'을 제거하는 것이 반드시 더 높은 점수를 보장하는 것은 아니라고 결론짓습니다. 사실, 답을 섞고 투표를 하는 전통적인 방식(순환 순열이라 불리는 방식)이 이 화려한 새로운 기술들보다 더 효과적이었습니다. 핵심적인 교훈은, 우리가 편향을 수정할 수는 있지만 그것이 반드시 모델이 더 똑똑해진다는 것을 의미하지는 않으며, 때로는 테스트 설계를 너무 영리하게 만들려고 노력하는 것이 오히려 모델의 답변 능력을 망가뜨릴 수 있다는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.