Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction
이 논문은 대규모 언어 모델이 개별적인 제약 조건은 능숙하게 따를 수 있지만, 여러 제약 조건을 동시에 만족시키는 능력은 특히 어휘적 세부 사항보다 구조적 추론에 영향을 미치는 실패의 독립적인 누적으로 인해 5~6개 이상의 제약 조건이 넘어가면 곱연산적으로 붕괴한다는 것을 입증하기 위해 제약 포화 평가(Constraint Saturation Evaluation, CSE) 벤치마크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 케이크를 굽고 있다고 상상해 보세요. 하지만 단순히 레시피 하나를 따르는 것이 아니라, 규칙 목록을 받았습니다. "밀가루를 정확히 200g 사용하세요", "설탕은 넣지 마세요", "케이크는 파란색이어야 합니다", "모양은 별 모양이어야 합니다"와 같은 규칙들 말이죠. 규칙이 하나라면 쉽습니다. 두 개나 세 개라면 아마 해낼 수 있을 것입니다. 하지만 누군가 당신에게 한꺼번에 50개의 규칙을 건네준다면 어떻게 될까요? 이것이 바로 이야기를 쓰고, 질문에 답하며, 문제를 해결하는 초지능형 컴퓨터 프로그램인 **대규모 언어 모델(LLM)**의 세계입니다. 이 모델들은 거의 모든 도서관의 책을 읽은 디지털 요리사들과 같습니다. 과학자들은 이 요리사들이 단일 지시를 따르는 데 매우 뛰어나다는 것을 이미 알고 있었습니다. 하지만 당신이 한 번에 수십 개의 지시를 수행하도록 요청했을 때 어떤 일이 벌어지는지는 아무도 확신하지 못했습니다. 피곤한 주자가 속도가 느려지는 것처럼 성능이 조금 떨어지는 것일까요? 아니 아니면 바람을 불면 무너지는 카드 성처럼 갑자기 무너져 내리는 것일까요? 이 질문은 매우 중요합니다. 우리가 이 AI 요리사들을 안전 시스템, 법률 문서, 복잡한 코드와 같은 실제 세계의 도구를 만드는 데 사용하기 시작함에 따라, 그들이 실수를 하기 전까지 정확히 몇 개의 규칙을 처리할 수 있는지 알아야 하기 때문입니다.
이 연구는 이 AI 모델들을 거대한 주방에서의 과학 실험처럼 다룹니다. 마리야 바실레바(Mariya Vasileva)가 이끄는 연구진은 **제약 충족 평가(Constraint Saturation Evaluation, CSE)**라고 불리는 특별한 테스트 환경을 구축했습니다. 이것을 AI의 두뇌를 위한 "스트레스 테스트"라고 생각하면 됩니다. 그들은 단순히 모델에게 이야기를 써달라고 요청한 것이 아니라, 한 번에 1개에서 12개까지의 특정 규칙을 따르도록 했습니다. 이 규칙들은 "답변은 반드시 정확히 3개의 단락으로 구성되어야 합니다", "'e'라는 글자를 사용할 수 없습니다", 또는 "모든 문장은 'A'로 시작해야 합니다"와 같이 엄격하고 변경 불가능한 것들이었습니다. 연구진은 AI가 동시에 모든 규칙을 얼마나 잘 지킬 수 있는지 관찰했습니다.
결과는 놀랍고도 다소 극적이었습니다. 연구 결과, AI 모델은 규칙이 추가됨에 따라 단순히 조금씩 피곤해지는 것이 아니라, **임계점(tipping point)**에 도달한다는 사실이 밝혀졌습니다. 블록을 쌓는다고 상상해 보세요. 처음 몇 개의 블록을 쌓을 때는 탑이 안정적입니다. 하지만 특정 높이에 도달하면—가장 똑똑한 모델들의 경우에도 약 5~6개의 규칙 정도가 되면—탑은 단순히 흔들리는 것이 아니라 갑자기 무너져 내립니다. 연구진은 AI가 8개의 규칙이 있을 때 개별 규칙의 40%는 여전히 맞출 수 있지만, 8개를 동시에 모두 맞출 확률은 6% 미만으로 떨어진다는 것을 발견했습니다. 이는 마치 한 가지 음을 완벽하게 연주하거나 혹은 두 개까지는 할 수 있지만, 열두 가지 다른 악기가 동시에 연주되는 복잡한 교향곡을 연주하라고 하면 멜로디를 완전히 잊어버리는 음악가와 같습니다.
연구는 또한 왜 이런 현상이 발생하는지도 밝혀냈습니다. 규칙들은 게임 속 적들처럼 서로 싸우는 것이 아닙니다. 대신, 그들은 연쇄 반응처럼 작용합니다. 만약 AI가 답변의 작은 부분 하나를 실수한다면—예를 들어 문장의 개수를 세는 것을 잊어버린다면—문장에 의존하는 모든 규칙이 동시에 실패하게 됩니다. 규칙들이 서로를 혼란스럽게 만드는 것이 아니라, AI의 "작업 기억(working memory)"이 과부하되는 것입니다. 연구진은 시간을 두고 무언가를 추적해야 하는 규칙들(단어 수를 세거나 패턴을 유지하는 것 등)이 단순한 규칙들("특정 단어를 사용하지 마세요"와 같은)보다 두 배 더 빨리 무너진다는 것을 발견했습니다.
아마도 가장 흥ientes한 부분은 연구진이 이를 해결하기 위해 시도한 내용일 것입니다. 그들은 다음과 같이 물었습니다. "AI가 미리 계획을 세우게 하거나, 스스로 다시 시도하게 함으로써 도와줄 수 있을까?" 그들은 AI에게 답변을 계획할 수 있는 "연습장(scratchpad)"을 주거나, 자신의 실수를 스스로 수정하게 했습니다. 결과는 어땠을까요? 그것은 아주 조금 도움이 되었고, 아마도 AI가 한두 개의 규칙을 더 처리할 수 있게 해주었지만, 붕괴를 막지는 못했습니다. 논문에 따르면 유일한 진짜 해결책은 애초에 각 개별 규칙을 따르는 능력을 더 향상시키는 것입니다. 너무 많은 것을 저글링하는 수학적 한계로 인해 발생하는 성능 저하를 계획이나 재시도만으로는 고칠 수 없습니다.
결국, 이 논문은 명확한 선을 긋습니다. 테스트된 가장 똑똑한 AI 모델들의 경우, 신뢰할 수 있는 다중 규칙 지시 수행의 한계는 대략 5~6개의 제약 조건입니다. 그 이상이 되면 시스템은 불안정해지는데, 이는 AI가 "멍청해서"가 아니라, 한 번에 머릿속에 담아야 하는 것들의 순수한 숫자가 수학적 붕elli를 일으키기 때문입니다. 이는 가장 진보된 디지털 요리사들에게도 한 번에 따를 수 있는 레시피의 한계가 있다는 점을 상기시켜 줍니다. 만약 우리가 그들이 더 많은 일을 하기를 원한다면, 단순히 더 많은 지시를 주는 것이 아니라 그들을 더 강하게 만들어야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.