← 최신 논문
💬 NLP

Self-reflecting Large Language Models: A Hegelian Dialectical Approach

이 논문은 대규모 언어 모델을 위해 상반되는 아이디어를 반복적으로 합성하여 새로운 과학적 아이디어 구상과 오류 수정 추론 능력을 모두 향상시키는 헤겔의 변증법 기반 자기 성찰 프레임워크를 제안하며, 수학적, 기호적, 지식 집약적 벤치마크 전반에서 상당한 성능 향상을 입증한다.

원저자: Sara Abdali, Michael Solodko, Can Goksen, Saeed Amizadeh, Julie E. Maybee, Kazuhito Koishida, Pashmina Cameron

게시일 2026-08-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sara Abdali, Michael Solodko, Can Goksen, Saeed Amizadeh, Julie E. Maybee, Kazuhito Koishida, Pashmina Cameron

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 정말 까다로운 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 하지만 해결책에 가까워질 때마다 당신의 뇌는 루프에 빠져버립니다. 당신은 계속해서 "내가 맞아, 내가 맞아"라고 생각하며, 세 단계 전에서 저지른 실수를 결코 바로잡지 못합니다. 이것은 대규모 언어 모델(LLM)이라고 불리는 초지능형 컴퓨터 프로그램들이 흔히 겪는 문제입니다. 이들은 대화하고 글을 쓰는 데는 뛰어나지만, 복잡한 수학이나 과학 문제를 추론하려고 할 때 종종 자기 발에 걸려 넘어지곤 합니다. 이를 해결하기 위해 과학자들은 모델에게 스스로를 "성찰(self-reflect)"하게 하여, "잠깐, 이건 말이 안 되는데"라고 말하도록 가르치려 노력해 왔습니다. 하지만 종종 모델들은 고집스럽게 굴곤 합니다. 일단 자신이 좋은 답을 얻었다고 생각하면, 설령 그것이 틀렸더라도 생각을 바꾸기를 거부합니다. 마이크로소프트와 뉴욕의 한 대학교 연구진이 작성한 이 논문은 중대한 질문을 던집니다. 어떻게 하면 이 모델들이 단순히 제자리를 맴도는 대신, 진정으로 마음을 바꾸고 더 나은 답을 찾게 할 수 있을까? 그들은 철학의 오래된 개념인 "헤겔의 변증법(Hegelian Dialectic)"에서 답을 찾습니다. 이것을 매우 구조적이고 긴장감 넘치는 토론 클럽이라고 생각해 보세요. 단순히 "내가 맞다"라고 말하는 대신, 모델은 두 역할을 수행하도록 강요받습니다. 하나는 아이디어를 제안하는 사람이고, 다른 하나는 그 아이디어의 결함을 찾아내는 엄격한 비평가 역할을 하는 것입니다. 그다음, 제3의 캐릭터가 개입하여 이 두 가지를 하나의 새로운, 더 나은 아이디어로 통합하며, 그 과정에서 양측의 장점을 모두 유지합니다. 이는 컴퓨터가 이미 알고 있는 것을 반복하는 대신, 스스로와 논쟁함으로써 더 똑똑해지도록 강제하는 방법입니다.

저자들은 LLM이 이 철학적 드라마를 단계별로 연기하는 새로운 프레임워크를 제안합니다. 그들은 이를 "자기 변증적(self-dialectical)" 과정이라고 부릅니다. 이 마법이 일어나는 과정은 다음과 같습니다. 먼저, 모델은 "명제(Proposition)"라고 부르는 초기 아이디어를 제시합니다. 그다음, 모델은 "반대되는 아이디어(Opposing Idea)"를 생성해야 합니다. 이것은 단순히 무작위적인 추측이 아닙니다. 모델은 원래의 아이디어에서 구체적인 결함이나 허점을 찾아내는 비평가처럼 행동하도록 지시받습니다. 이 단계를 "지양(Sublation)"이라고 합니다. 마지막으로, 모델은 이 두 가지 상충하는 관점을 결합하여 "통합된 아이디어(Unified Idea)", 즉 "정립(Specation)"을 만들어내려 노력합니다. 이 새로운 아이디어는 단순한 절충안이 아닙니다. 그것은 첫 번째 아이디어의 문제점을 해결하면서도 그 강점을 유지하는 더 높은 차원의 해결책이어야 합니다. 연구진은 이 방법을 수학 문장제 문제(GSM-8k 및 GSM-hard 데이터셋 포함), 기호 논리 퍼즐 처리, 복잡한 지식 질문 답변(MMLU Pro) 등 다양한 유형의 작업에 테스트했습니다. 그 결과, 이 방법이 모델이 표준적인 프롬프팅 방식으로 작업할 때보다 성능을 유의미하게 향상시킨다는 것을 발견했습니다. 예를 들어, GSM-Symbolic이라는 어려운 수학 테스트에서, 이 방법은 GPT-4o-mini의 정확도를 0.709에서 0.770으로, Qwen 2.5-7B 모델의 경우 0.587에서 0.623으로 높였습니다.

연구에서 가장 흥적인 부분 중 하나는 이 과정 동안 모델이 얼마나 "창의적"이어야 하는지를 파악하는 것이었습니다. 연구진은 이를 조절하기 위해 "온도(temperature)"라는 개념을 사용했습니다. 온도를 모델의 상상력을 조절하는 다이얼이라고 상상해 보세요. 낮은 설정은 모델을 매우 집중하게 만들어 가장 뻔한 답에 머물게 하는 반면, 높은 설정은 모델을 더 자유분방하게 만들어 더 기발하고 새로운 조합을 시도하게 합니다. 팀은 이 다이얼을 사용하는 두 가지 방법을 테스트했습니다: 전체 과정 동안 일정한 설정을 유지하거나, "동적 어닐링 스케줄(dynamic annealing schedule)"을 사용하는 것입니다. 어닐링 스케줄은 높은 온도(많은 창의적 탐색)로 여정을 시작하여 과정이 진행됨에 따라 점차 낮은 온도(집중적이고 신중한 정교화)로 다이얼을 낮추는 것과 같습니다. 그들은 이 방법이 모든 상황에 완벽하지 않다는 것을 발견했습니다. 어떤 모델과 작업에는 일정한 온도가 가장 잘 맞았고, 어떤 경우에는 창의적인 상태에서 집중적인 상태로 변화하는 동적 스케줄이 최선의 결과를 냈습니다. 예를 들어, GSM-8k 수학 테스트에서 동적 어닐링 스케줄은 GPT-4o가 0.955의 정확도에 도달하도록 도와, 일정한 온도의 점수인 0.953을 약간 앞질렀습니다. 그러나 동일한 테스트에서 Qwen 2.5-7B 모델의 경우, 일정한 온도가 약간 더 나았습니다. 이는 모델의 창의성을 튜닝하는 "최선의" 방법이 특정 문제와 사용되는 컴퓨터 두뇌에 따라 달라짐을 시사합니다.

모델이 만들어낸 새로운 아이디어들이 실제로 좋은 것인지 확인하기 위해, 연구진은 주의를 기울여야 했습니다. 모든 수학 문제나 과학적 아이디어를 확인할 인적 전문가가 없었기 때문에, 그들은 "다중 에이전트 다수결 투표(Multi-Agent Majority Voting, MAMV)"라고 불리는 시스템을 고안했습니다. 여러 대의 서로 다른 AI 모델이 원탁에 둘로 둘러앉아 있는 모습을 상상해 보세요. 각 모델은 독립적으로 새로운 통합 아이디어가 타당한지(말이 되는지?), 그리고 참신한지(실제로 새로운 것인지?)에 대해 투표합니다. 만약 다수의 AI 심판들이 "예"라고 답하면 그 아이디어는 수용됩니다. 만약 "아니오"라고 한다면 과정은 중단됩니다. 이를 통해 연구진은 인간 교수진 없이도 대규모로 이 방법을 테스트할 수 있었습니다. 결과는 이러한 구조화된 자기 비판이 단순히 모델에게 "다시 시도해 봐"라거나 "더 열심히 생각해 봐"라고 요청하는 것보다 훨씬 더 낫다는 것을 보여주었습니다. 헤겔 방식을 사용하는 모델들은 자신의 논리적 오류를 포착하고 수정하는 데 더 뛰어났으며, 이는 수학과 과학에서 더 정확한 답으로 이어졌습니다.

하지만 저자들은 이것이 모든 것을 해결하는 마법의 지팡이는 아니라는 점을 분명히 밝히고 있습니다. 그들은 모델이 너무 창의적이 되면(온도가 너무 높으면), 주제에서 완전히 벗어나거나 터무нде한 내용을 내놓을 수 있다는 것을 발견했습니다. 반대로 너무 집중하면(온도가 너무 낮으면), 똑같은 실수를 계속 반복할 수도 있습니다. 또한, 아이디어가 얼마나 "새로운지" 측정하는 것은 매우 어렵습니다. 모델은 자신이 놀라운 새로운 이론을 발견했다고 생각할 수도 있지만, 실제로는 훈련 데이터에서 읽었던 내용을 기억해 낸 것일 수도 있습니다. 연구진은 자신들의 방법이 항상 과학적으로 옳은 아이디어를 생성하는 것은 아니며, 진정한 검증에는 여전히 인간 전문가가 필요하다는 점을 인정합니다. 또한 모델이 좋은 반대 의견을 생성하지 못해 루프에 빠지거나, 단순히 같은 단락을 반복하는 경우도 발생한다고 언급했습니다. 그럼에도 불구하고, 이 논문은 자기 성찰을 단순한 "네 작업을 확인해 봐"라는 명령이 아니라 구조화된 토론으로 취급하는 것이 AI가 더 명확하게 생각하도록 돕는 강력한 방법임을 시사합니다. 모델이 자신의 결함에 직면하고 더 나은 답을 합성하도록 강제함으로써, 우리는 단순히 똑똑해 보이는 것이 아니라 실제로 더 잘 추론할 수 있는 시스템을 구축할 수 있을지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →