Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark
이 논문은 이탈리아 속담 벤치마크인 ProverbIT을 소개하며, 대규모 언어 모델들이 객관식 과제에서 올바른 속담의 결말과 문자 그대로의 유의어를 구별하는 데 어려움을 겪는다는 점을 밝힘으로써, 이들의 성능이 심층적인 의미론적 이해보다는 문화적으로 내재된 비유적 언어의 암기된 패턴에 더 많이 의존하고 있음을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 도서관을 걷고 있다고 상상해 보세요. 그 선반에는 책뿐만 아니라 인류 대화의 전 역사가 쌓여 있습니다. 이것이 바로 **거대 언어 모델(LLM)**의 세계입니다. 이 AI 시스템들을 인터넷에 쓰인 거의 모든 것을 집어삼킨, 엄청나게 빠르고 집요한 독서가라고 생각해보세요. 이들은 "비가 내무니 고양이와..."라고 말하면 다음 단어가 거의 확실하게 "개"가 될 것이라는 점을 알아채는 것처럼, 패턴을 찾아내는 데 매우 능숙합니다. 이들은 이러한 패턴 매칭을 사용하여 이메일을 쓰고, 수학 문제를 풀며, 심지어 코드를 작성하기도 합니다.
하지만 여기에 까다로운 점이 있습니다. AI가 백만 개의 이야기를 읽었다고 해서, 그 안에 숨겨진 농담이나 비꼬는 말투, 혹은 오래된 격언을 진정으로 이해한다는 뜻은 아니라는 점입니다. 여기서 속담이 등장합니다. 속담은 "김칫국부터 마시지 마라"와 같이 세대를 거쳐 전해 내려오는 짧고 지혜로운 말입니다. 이것들은 단순히 무작위적인 단어들의 나열이 아닙니다. 이것들은 공유된 인간 경험에 의존하는 문화적 지름길입니다. 컴퓨터에게 속담을 파악하는 것은, 사전적 정의가 아니라 문화적 느낌을 알아야만 풀 수 있는 수수께끼를 푸는 것과 같습니다. 과학자들은 궁금해합니다. 이 AI 모델들이 정말로 농담을 이해하는 것일까요, 아니면 그저 단어들이 보통 어떻게 함께 어울리는지를 바탕으로 추측하고 있는 것일까요?
이것이 바로 ProverbIT 논문의 연구자들이 알고 싶어 했던 핵심입니다. 그들은 다양한 AI 모델이 이러한 문화적 수수께끼를 얼마나 잘 다룰 수 있는지 알아보기 위해, 이탈리아 속담으로만 구성된 특별한 테스트, 즉 "퀴즈"를 만들었습니다. 그들은 단순히 AI에게 문장을 완성하라고 요청한 것이 아니라, 함정을 놓았습니다. 모델들에게 선택지 목록을 주었지만, 정답은 목록에 포함되지 않도록 했습니다. 대신, 목록은 비슷하게 들리거나, 의미는 같지만 우스꽝스럽게 들리거나, 혹은 아예 틀린 것들로 채워진 교묘한 가짜들로 채워졌습니다. 유일한 정답은 "해당 사항 없음(None of the above)"이었습니다.
결과는 다소 충격적이었습니다. 연구자들이 AI에게 스스로 속담을 완성하라고 요청했을 때는 거의 모든 모델이 정답을 맞혔습니다. 마치 암기한 시를 낭송하라는 요청을 받은 학생처럼, 그들은 완벽하게 해냈습니다. 하지만 연구자들이 "함정"이 있는 객관식 퀴즈로 바꾸자, 점수는 급락했습니다. 인간처럼 단계별로 생각하도록 설계된 가장 진보된 "추론" 모델들조차도 심하게 비틀거렸습니다. 정답이 없다는 것을 깨닫고 "해당 사항 없음"을 선택하는 대신, 그들은 고집스럽게 가짜 선택지 중 하나를 골랐습니다.
왜 이런 일이 일어났을까요? 연구자들은 AI의 "두뇌"(사고 과정) 내부를 들여다보았고, 매혹적인 결함을 발견했습니다. 모델들은 정답을 알고 있었습니다. 그들의 내부 사고 과정에서, 그들은 맞는 구절을 반복해서 언급했습니다. 하지만 최종 선택을 할 때, 그들은 자신의 지식을 무시하는 것처럼 보였습니다. 그들은 어떤 단어가 적절하게 들리거나 동의어처럼 보이는지에 너무 집중한 나머지, "잠깐, 진짜 답은 여기 없는데"라고 말하지 못했습니다. 이는 마치 정답이 "42"라는 것을 알고 있는 학생이 "40", "44", "46"이라는 선택지를 보고, 실제 정답이 페이지에 없다는 사실을 완전히 잊어버린 채 가장 가까운 숫자인 "44"를 자신 있게 동그라미 치는 것과 같습니다.
이 연구는 AI 모델들이 패턴을 암기하고 사실을 회상하는 데는 뛰어나지만, 특정 종류의 사고, 즉 **부정적 추론(negative reasoning)**에는 여전히 어려움을 겪고 있음을 시사합니다. 이는 선택지 목록을 보고 "이 중 맞는 것이 없다"라고 깨닫는 능력입니다. 그들은 단어 뒤에 숨겨진 의미를 진정으로 이해하기보다는, 이전에 보았던 것에 크게 의존합니다. 따라서 이 디지털 두뇌들이 매일 더 똑똑해지고는 있지만, 인간의 지혜가 가진 미묘하고 까다로우며, 때로는 빠져 있는 조각들에 대해서는 아직 배울 것이 많습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.