Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?
본 연구는 선택지의 수와 구체적인 어휘를 포함한 질문의 형식이 추론 작업에서 대규모 언어 모델의 성능에 상당한 영향을 미치며, 종종 추론 단계의 정확성과 최종 답변의 정확성 사이에 괴리를 초래한다는 사실을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
새로운 학생 (AI) 이 논리 퍼즐을 얼마나 잘 푸는지 테스트하려는 교사가 되어 상상해 보세요. 이 학생이 수학이나 논리를 진정으로 이해하는지, 아니면 단순히 정답을 맞히는 것인지 확인하고 싶을 것입니다.
이 논문은 연구자들이 다섯 명의 서로 다른 AI 학생에게 동일한 논리 문제를 제시했지만, 질문 방식을 세 가지 매우 다른 방법으로 제시한 연구의 성적표와 같습니다:
- 에세이 스타일 (단답형): "여기 문제가 있습니다. 이를 풀고 답을 알려주세요."
- 객관식 스타일: "여기 문제가 있습니다. 이 5 개 또는 11 개의 옵션 중 정답을 선택하세요."
- 참/거짓 스타일: "여기 문제와 특정 답이 있습니다. 이 답이 참 (True) 인가요, 거짓 (False) 인가요?"
연구자들은 궁금해했습니다: 질문하는 방식이 AI 의 수행 능력에 영향을 미칠까요?
간단히 설명한 주요 결론은 다음과 같습니다:
1. "맞히기 게임" 효과
가장 큰 놀라움은 정확한 최종 답을 얻는다고 해서 항상 AI 가 올바른 과정을 거친 것은 아니다는 점입니다.
- 유사 사례: 객관식 시험을 치르는 학생을 상상해 보세요. 학생은 수학 문제를 푸는 방법을 모를 수도 있지만, "C"라고 추측해서 정답을 맞힐 수 있습니다. 답안지 (버블 시트) 만 보면 100% 를 맞은 것처럼 보이지만, 계산용지 (스크래치 페이퍼) 를 보면 엉뚱한 내용만 적혀 있을 수 있습니다.
- 발견: AI 는 종종 추론 과정이 틀렸음에도 객관식 문제에서 올바른 글자를 "추측"하여 맞혔습니다. 반대로, AI 가 완벽한 계산을 수행했음에도 마지막에 옵션에 혼란을 느껴 잘못된 글자를 선택하기도 했습니다.
- 교훈: 최종 답안만 확인한다면, AI 가 실제로보다 더 똑똑하다고 오해할 수 있습니다.
2. "메뉴" 문제 (객관식)
연구자들이 AI 에게 선택지를 제시했을 때, 옵션의 수와 사용된 단어가 매우 중요했습니다.
- 선택지가 너무 많을 때: 옵션이 5 개에서 11 개로 늘어났을 때, AI 의 수행 능력은 종종 떨어졌습니다. 5 가지 아이스크림 맛을 고르는 것과 50 가지를 고르는 것의 차이처럼, AI 는 압도되어 더 많이 추측하게 되었습니다.
- "그 외" 옵션: 연구자들은 "그 외 (Something else)"또는 "위 모두 아님 (None of the above)"이라는 이상한 옵션을 추가했습니다.
- "그 외"가 정답인 경우, AI 는 계산을 올바르게 수행했음에도 이를 선택하는 데 종종 어려움을 겪었습니다. 숫자가 틀렸더라도 구체적인 숫자를 선택하는 것을 선호하는 것처럼 보였습니다.
- AI 는 또한 "선호하는 자리" 편향을 보였습니다. 정답과 상관없이 첫 번째 옵션이나 마지막 옵션을 더 자주 선택했습니다.
3. "예/아니오" 함정 (참/거짓)
"참 (True) 또는 거짓 (False)" 질문을 할 때, 사용된 구체적인 단어가 결과를 바꾸었습니다.
- 참 vs 거짓: AI 는 정답이 맞을 때 "참"이라고 말하는 것이, 오답일 때 "거짓"이라고 말하는 것보다 일반적으로 더 잘했습니다. 이는 동의하는 경향이 있는 것처럼 보였습니다.
- 문구: "참 또는 거짓"에서 "예 또는 아니오"로 프롬프트를 변경하면 AI 는 일부 작업에서 성능이 현저히 떨어졌습니다. 마치 사람이 "가고 싶으세요?"라는 질문에는 "네"라고 답하지만, "가고 싶다는 것이 사실인가요?"라는 질문에는 주저하는 것과 같습니다. AI 는 이러한 미세한 언어적 변화에 민감합니다.
4. "지시사항" 혼란
연구자들은 "문제를 먼저 풀고, 그런 다음 그것이 참인지 거짓인지 결정하세요"와 같은 지시사항을 추가하여 AI 를 돕고자 했습니다.
- 결과: 때로는 도움이 되었지만, 종종 AI 를 혼란스럽게 하거나 수행 능력을 떨어뜨렸습니다. AI 는 때로 지시사항에 너무 집중하여 문제의 실제 논리를 잊어버리기도 했습니다.
요약: 우리가 무엇을 배워야 할까요?
이 논문은 AI 의 지능을 판단하기 위해 최종 점수만 보면 안 된다는 것을 결론지었습니다.
- AI 에게 객관식 질문을 하면, 논리를 이해하지 못한 채 올바른 글자를 추측하여 "속임수"를 쓸 수 있습니다.
- 참/거짓 질문을 할 때, 사용하는 구체적인 단어가 AI 를 속여 정확도를 떨어뜨릴 수 있습니다.
- AI 가 정말로 똑똑한지 알기 위해서는 최종 답안지 (버블) 만 확인하는 것이 아니라, 그 "계산용지 (추론 단계)"를 확인해야 합니다.
연구자들은 이러한 특이점을 이해하도록 미래 개발자들을 돕기 위해 새로운 테스트 세트 (벤치마크) 를 구축했습니다. 이는 우리가 AI 를 테스트할 때 단순히 추측하는 능력이 아닌, 생각하는 능력을 평가하도록 보장하기 위함입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.