← 최신 논문
💬 NLP

Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?

본 연구는 선택지의 수와 구체적인 어휘를 포함한 질문의 형식이 추론 작업에서 대규모 언어 모델의 성능에 상당한 영향을 미치며, 종종 추론 단계의 정확성과 최종 답변의 정확성 사이에 괴리를 초래한다는 사실을 밝혀냈다.

원저자: Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

게시일 2026-04-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 학생 (AI) 이 논리 퍼즐을 얼마나 잘 푸는지 테스트하려는 교사가 되어 상상해 보세요. 이 학생이 수학이나 논리를 진정으로 이해하는지, 아니면 단순히 정답을 맞히는 것인지 확인하고 싶을 것입니다.

이 논문은 연구자들이 다섯 명의 서로 다른 AI 학생에게 동일한 논리 문제를 제시했지만, 질문 방식을 세 가지 매우 다른 방법으로 제시한 연구의 성적표와 같습니다:

  1. 에세이 스타일 (단답형): "여기 문제가 있습니다. 이를 풀고 답을 알려주세요."
  2. 객관식 스타일: "여기 문제가 있습니다. 이 5 개 또는 11 개의 옵션 중 정답을 선택하세요."
  3. 참/거짓 스타일: "여기 문제와 특정 답이 있습니다. 이 답이 참 (True) 인가요, 거짓 (False) 인가요?"

연구자들은 궁금해했습니다: 질문하는 방식이 AI 의 수행 능력에 영향을 미칠까요?

간단히 설명한 주요 결론은 다음과 같습니다:

1. "맞히기 게임" 효과

가장 큰 놀라움은 정확한 최종 답을 얻는다고 해서 항상 AI 가 올바른 과정을 거친 것은 아니다는 점입니다.

  • 유사 사례: 객관식 시험을 치르는 학생을 상상해 보세요. 학생은 수학 문제를 푸는 방법을 모를 수도 있지만, "C"라고 추측해서 정답을 맞힐 수 있습니다. 답안지 (버블 시트) 만 보면 100% 를 맞은 것처럼 보이지만, 계산용지 (스크래치 페이퍼) 를 보면 엉뚱한 내용만 적혀 있을 수 있습니다.
  • 발견: AI 는 종종 추론 과정이 틀렸음에도 객관식 문제에서 올바른 글자를 "추측"하여 맞혔습니다. 반대로, AI 가 완벽한 계산을 수행했음에도 마지막에 옵션에 혼란을 느껴 잘못된 글자를 선택하기도 했습니다.
  • 교훈: 최종 답안만 확인한다면, AI 가 실제로보다 더 똑똑하다고 오해할 수 있습니다.

2. "메뉴" 문제 (객관식)

연구자들이 AI 에게 선택지를 제시했을 때, 옵션의 수와 사용된 단어가 매우 중요했습니다.

  • 선택지가 너무 많을 때: 옵션이 5 개에서 11 개로 늘어났을 때, AI 의 수행 능력은 종종 떨어졌습니다. 5 가지 아이스크림 맛을 고르는 것과 50 가지를 고르는 것의 차이처럼, AI 는 압도되어 더 많이 추측하게 되었습니다.
  • "그 외" 옵션: 연구자들은 "그 외 (Something else)"또는 "위 모두 아님 (None of the above)"이라는 이상한 옵션을 추가했습니다.
    • "그 외"가 정답인 경우, AI 는 계산을 올바르게 수행했음에도 이를 선택하는 데 종종 어려움을 겪었습니다. 숫자가 틀렸더라도 구체적인 숫자를 선택하는 것을 선호하는 것처럼 보였습니다.
    • AI 는 또한 "선호하는 자리" 편향을 보였습니다. 정답과 상관없이 첫 번째 옵션이나 마지막 옵션을 더 자주 선택했습니다.

3. "예/아니오" 함정 (참/거짓)

"참 (True) 또는 거짓 (False)" 질문을 할 때, 사용된 구체적인 단어가 결과를 바꾸었습니다.

  • 참 vs 거짓: AI 는 정답이 맞을 때 "참"이라고 말하는 것이, 오답일 때 "거짓"이라고 말하는 것보다 일반적으로 더 잘했습니다. 이는 동의하는 경향이 있는 것처럼 보였습니다.
  • 문구: "참 또는 거짓"에서 "예 또는 아니오"로 프롬프트를 변경하면 AI 는 일부 작업에서 성능이 현저히 떨어졌습니다. 마치 사람이 "가고 싶으세요?"라는 질문에는 "네"라고 답하지만, "가고 싶다는 것이 사실인가요?"라는 질문에는 주저하는 것과 같습니다. AI 는 이러한 미세한 언어적 변화에 민감합니다.

4. "지시사항" 혼란

연구자들은 "문제를 먼저 풀고, 그런 다음 그것이 참인지 거짓인지 결정하세요"와 같은 지시사항을 추가하여 AI 를 돕고자 했습니다.

  • 결과: 때로는 도움이 되었지만, 종종 AI 를 혼란스럽게 하거나 수행 능력을 떨어뜨렸습니다. AI 는 때로 지시사항에 너무 집중하여 문제의 실제 논리를 잊어버리기도 했습니다.

요약: 우리가 무엇을 배워야 할까요?

이 논문은 AI 의 지능을 판단하기 위해 최종 점수만 보면 안 된다는 것을 결론지었습니다.

  • AI 에게 객관식 질문을 하면, 논리를 이해하지 못한 채 올바른 글자를 추측하여 "속임수"를 쓸 수 있습니다.
  • 참/거짓 질문을 할 때, 사용하는 구체적인 단어가 AI 를 속여 정확도를 떨어뜨릴 수 있습니다.
  • AI 가 정말로 똑똑한지 알기 위해서는 최종 답안지 (버블) 만 확인하는 것이 아니라, 그 "계산용지 (추론 단계)"를 확인해야 합니다.

연구자들은 이러한 특이점을 이해하도록 미래 개발자들을 돕기 위해 새로운 테스트 세트 (벤치마크) 를 구축했습니다. 이는 우리가 AI 를 테스트할 때 단순히 추측하는 능력이 아닌, 생각하는 능력을 평가하도록 보장하기 위함입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →