Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation
이 논문은 정교한 프롬프트 기법이 거대언어모델의 성능을 향상시킨다는 가설에 이의를 제기하며, 포괄적인 실증 연구를 통해 전문가적 또는 귀납적 프레임워크를 통한 미미한 개선 외에는 베이스라인 프롬프트가 복잡한 방법들보다 일관되게 우수한 성능을 보인다는 점을 입증함으로써, 이 분야가 프롬프트 엔지니어링보다 진정한 모델의 발전에 우선순위를 두어야 함을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑한 로봇에게 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 한동안 사람들은 로봇에게 매우 길고 복잡한 지시 사항을 주는 것만이 좋은 답을 얻는 유일한 방법이라고 믿었습니다. 사람들은 "로봇에게 단계별로 생각하라거나, 지도를 그리라거나, 특정 전문가인 척하라고 말하면 더 똑똑해질 거야"라고 생각했습니다. 이것은 마치 학생에게 "그냥 답만 쓰지 말고, 정답을 고르기 전에 네 기분이 어떤지에 대해 5문단짜리 에세이를 써라"라고 말하는 것과 같습니다. 이 아이디어가 너무 인기를 끌어서 연구자들은 점점 더 복나한 "프롬프팅(prompting)" 기술들을 만들어내기 시작했고, 정교한 지시가 많을수록 로봇의 성능이 좋아질 것이라고 가정했습니다. 하지만 만약 그 모든 추가적인 수다 때문에 로봇이 혼란에 빠진다면 어떻게 될까요? 만약 가장 단순한 지시가 실제로 가장 좋은 방법이라면 어떨까요? 이것이 바로 IBM의 연구팀이 현대 AI의 두뇌인 거대 언 언어 모델(LLM)이 객관식 질문을 어떻게 처리하는지 조사하며 던진 핵심 질문이었습니다. 그들은 그 화려한 기술들이 실제로 도움이 되고 있는지, 아니면 불필요하게 상황을 복잡하게 만들고 있는지를 확인하고 싶었습니다.
"Simplicity Paradox(단순성의 역설)"라는 제목의 이 논문은 연구진이 8가지의 서로 다른 질문 방식과 10가지의 까다로운 퍼즐 세트를 대상으로, 27가지 버전의 AI 모델을 사용하여 수행한 거대한 실험입니다. 명확한 그림을 얻기 위해 그들은 43만 번 이상의 평가를 실행했습니다. 그리고 여기서 놀라운 반전이 발견되었습니다. 복잡한 기술들은 대개 AI의 성능을 떨어뜨리거나, 잘해봐야 질문을 직접 던졌을 때와 비슷한 수준에 그쳤다는 것입니다.
이렇게 생각해 보세요. 당신이 시험을 보고 있다고 상상해 봅시다. "베이스라인(Baseline)" 방식은 그냥 질문을 읽고 답을 고르는 것입니다. "복잡한(Complex)" 방식들은 "탐정인 척하고, 세 가지 단서를 나열하고, 도표를 그린 다음, 답을 하라"는 지시를 받는 것과 같습니다. 연구진은 대부분의 AI 모델에서 탐정 페르소나와 도표 그리기가 오히려 속도를 늦춘다는 것을 발견했습니다. 실제로 연구진이 모든 AI가 정확히 동일한 질문을 보도록 공정하게 비교했을 때, 단순하고 직접적인 프롬프트가 세 번째로 좋은 성적을 거두었습니다. 이를 약간 앞선 단 두 가지 방법은 아주 미세한 조정이었습니다. AI에게 "신뢰성 엔지니어"처럼 행동하라고 하거나 "귀납적 추론"을 사용하라고 하는 것이었습니다. 이것들은 약 3% 포인트 정도의 작은 상승을 가져왔습니다. 하지만 AI가 스스로 예시를 생성하게 하거나 유추를 통해 문제를 해결하도록 하는 것과 같은 정말 화려한 방법들은 처참하게 무너졌습니다. "Self-Analogical(자기 유추)"이라 불리는 한 방법은 점수가 21.38%에 불과했는데, 이는 무작위로 찍는 것과 거의 차이가 없는 수준이었습니다. 마치 AI가 자신의 지시 사항에 너무 얽매여서 질문에 답하는 법을 잊어버린 것과 같습니다.
이 연구는 또한 몇 가지 흥가로운 특징들을 밝혀냈습니다. 첫째, 그들은 Qwen3-30B-A3B-Thinking-2507이라는 더 작은 AI 모델이 훨씬 더 크고 강력한 모델들(어떤 모델들은 13배나 더 큼)을 일대일 순위 경쟁에서 이겼다는 것을 발견했습니다. 이는 더 많은 "두뇌 능력(파라미터)"을 갖는 것이 항상 최고의 점수를 보장하는 것은 아니며, 때로는 더 작고 잘 튜닝된 모델이 더 날카로울 수 있음을 시사합니다. 둘째, 그들은 "생각하는 시간(또는 토큰)"에 대해 살펴보았습니다. 그들은 단순히 "생각하기" 스위치를 켜는 것만으로도 엄청난 변화를 일으켜, 일부 모델의 점수를 최대 22% 포인트까지 높일 수 있다는 것을 발견했습니다. 하지만 일단 스위치가 켜진 후에는, 모델에게 더 많은 생각 시간(예산을 저에서 중으로 늘림)을 주는 것이 컴퓨터 자원을 훨씬 더 많이 소모하면서도 정확도는 겨우 1~4점 정도만 추가할 뿐이었습니다. 이것은 마치 러너가 이기기 위해 달리기를 시작해야 한다는 것을 깨달았지만, 그들에게 필요 이상으로 8배나 더 오래 달리라고 말하는 것이 그들을 훨씬 더 빠르게 만들지는 못하는 것과 같습니다.
마지막으로, 연구진은 퍼즐 자체의 난이도를 살펴보았습니다. 그들은 AI가 여전히 완벽과는 거리가 멀다는 것을 발견했습니다. 가장 어려운 퍼즐에서 최고의 모델들은 정답률이 약 36%에 불과했던 반면, 가장 쉬운 퍼즐에서는 83%를 기록했습니다. 이 큰 격차는 AI가 단순히 질문을 던지는 더 나은 방법을 찾는 것보다, 실제로 배우고 개선할 수 있는 여지가 여전히 많다는 것을 의미합니다. 이 논문은 AI 커뮤니티가 일을 너무 복잡하게 만들었을 수도 있다고 결론짓습니다. 복잡한 지시 설명서를 만드는 데 모든 에너지를 쏟는 대신, 모델 자체를 더 똑똑하게 만들고 더 어려운 문제들을 다루는 데 집중해야 한다는 것입니다. "단순성의 역설"은 때때로 가장 강력한 도구는 그저 단순하고 직접적인 질문이라는 사실을 깨닫는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.