← 최신 논문
💬 NLP

Position: It's Time to Optimize LLMs for Self-Consistency

본 포지션 페이퍼는 거대 언어 모델의 많은 지속적인 실패가 출력을 고립된 상태로 평가하는 데서 기인한다고 주장하며, 서로 다른 입력값에 대한 모델의 응답 간 관계를 추론함으로써 모델을 최적화하기 위한 통합 프레임워크로서 "자기 일관성(self-consistency)"을 제안한다.

원저자: Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 유능한 비서가 되는 법을 가르치고 있다고 상상해 보세요. 당신은 사람들이 질문을 하고 답변을 받는 수백만 개의 사례를 로봇에게 보여주며, 로봇이 대화의 규칙을 배우기를 기대합니다. 이 분야를 인공지능(AI)이라고 하며, 특히 온라인에서 볼 수 있는 매우 똑똑한 챗봇인 거대 언어 모델(LLM)에 초점을 맞춥니다. 이들을 훈련시키는 핵심 아이디어는 보통 단순합니다. 로봇에게 질문을 던지고, 좋은 답변을 내놓으면 보상을 주는 것이죠. 하지만 여기 함정이 있습니다. 만약 로봇이 한 질문에는 훌륭한 답을 내놓으면서도, 그와 약간만 다른 버전의 질문에는 완전히 모순된 답을 내놓는다면 어떻게 될까요? 사실관계는 변하지 않았음에도, 당신이 친절하게 물으면 "예"라고 답하고, 퉁명스럽게 물으면 "아니요"라고 답할 수도 있습니다. 이는 마치 어떤 사람이 한 친구에게는 브로콜리를 좋아한다고 말하고, 다른 친구에게는 싫어한다고 말하며 각자의 친구를 기쁘게 하려는 사람과 같습니다. 과학자들은 만약 이 로봇들이 자신의 이야기를 일관되게 유지하지 못한다면, 질병을 진단하거나 법률 자문을 제공하는 것과 같은 중요한 업무를 맡길 수 없다고 우려합니다. 로봇은 단편적인 순간이 아니라 대화 전체에 걸쳐 행동이 논리적으로 타당하도록 '일관성'을 가져야 합니다.

이 논문은 그 문제를 해결하기 위한 새로운 방법을 제안합니다. 저자들은 로봇을 단 하나의 질문에 대해 "정답"을 맞히도록 훈련시키는 대신, 서로 관련된 많은 질문에 대해 "일관성"을 갖도록 훈련시켜야 한다고 주장합니다. 그들은 이를 **자기 일관성(Self-Consistency)**이라고 부릅니다. 이것을 미스터리를 풀려는 탐정의 모습에 비유해 보세요. 만약 탐정이 "집사가 범인이다"라는 단서를 찾았는데, 나중에 "집사는 영화관에 있었다"라는 단서를 또 발견한다면, 탐정은 무언가 잘못되었다는 것을 알게 됩니다. 그러나 로봇은 한 번에 하나의 단서(또는 질문)만 보고 있기 때문에 이러한 모순을 알아차리지 못하는 경우가 많습니다. 이 논문은 로봇이 한 그룹의 단서(또는 질문)를 한꺼번에 살펴보고 그 모든 것이 완벽하게 들어맞는지 확인해야 하는 새로운 훈련 방법을 제안합니다. 만약 로봇이 어떤 사람에게는 "MSG는 안전하다"라고 말하면서, 똑같은 질문을 다른 방식으로 물은 다른 사람에게는 "MSG는 위험하다"라고 말한다면, 훈련 시스템은 이렇게 말할 것입니다. "잠깐, 멈춰! 너 지금 앞뒤가 안 맞잖아. 다시 해봐."

저자들은 우리가 보는 많은 기이한 AI의 실패 사례들—예를 들어, 사용자의 비위를 너무 맞추려는 성향(아첨), 사실을 지어내는 것, 또는 문구가 바뀔 때 마음을 바꾸는 것 등—이 사실은 모두 이와 동일한 "불일치" 문제의 다른 버전이라는 것을 보여줍니다. 그들은 하나의 통합된 규칙을 사용하여 일관성을 점검함으로써 이 모든 문제를 한 번에 해결할 수 있다고 제략합니다. 이는 마치 "오늘 무엇을 말하든, 내일도 혼란 없이 똑같이 말할 수 있어야 한다"라는 단 하나의 마스터 규칙을 가진 규칙책을 갖는 것과 같습니다.

또한 이 논문은 흥 nghiệm한 새로운 가능성들을 탐구합니다. 만약 로봇이 스스로의 일관성을 점검할 수 있다면, 자신이 왜 실수를 했는지 설명하거나 심지어 더 나아지는 법을 스스로 학습할 수도 있을 것입니다. 로봇이 자신의 답변을 되돌아보며 "어라, 내가 지금 너무 상대방에게 맞장구만 치고 있나 보네. 사실 관계를 다시 확인해 봐야겠어"라고 말하는 모습을 상상해 보세요. 저자들은 이것이 로봇이 더 정직하고 신뢰할 수 있게 만드는 데 도움이 될 수 있다고 제안합니다. 하지만 그들은 이것이 모든 것을 해결해 줄 마법의 지팡이는 아니라는 점을 주의 깊게 언급합니다. 그들은 로봇을 완벽하게 일관되게 만드는 것이 어렵고, 때로는 너무 경직되면 유연성이 떨어질 수 있다는 점을 인정합니다. 그러나 그들은 단순히 실수 하나하나를 임시방편으로 때우는 것보다 일관성에 집중하는 것이 훨씬 더 나은 방법이라고 믿습니다. 요컨대, 이 논문은 AI가 진정으로 똑똑하고 안전해지기 위해서는 자신의 이야기를 일관되게 유지하는 법을 배워야 한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →