Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation
이 논문은 제약 조건이 누적됨에 따라 대규모 언어 모델의 지시 이행 성능이 쌍체 간의 충돌로 인해 비선형적으로 저하됨을 입증하는 벤치마크를 소개하며, 학습이 필요 없는 프롬프트 컴파일러가 약한 모델의 경우 이 문제를 효과적으로 완화하는 반면 강한 모델에는 거의 영향을 미치지 않음을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하지만 약간은 글자 그대로만 받아들이는 로봇 조수에게 지시를 내리려 한다고 상상해 보세요. 만약 당신이 "이야기를 써줘"와 같이 한 가지 일만 요청한다면, 로봇은 아마도 아주 훌륭하게 해낼 것입니다. 하지만 한꺼번에 스무 개의 서로 다른 규칙을 쏟아부으면 어떻게 될까요? "정확히 50단어를 사용할 것", "JSON 파일 형식으로 만들 것", "인용문을 세 개 포함할 것", "'e'라는 글자를 사용하지 말 것", "요약으로 시작할 것", 그리고 "해적처럼 말할 것" 같은 것들 말이죠. 이것이 바로 **대규모 언어 모델(LLM)**의 세계입니다. 이들은 오늘 우리가 사용하는 많은 챗봇과 도구들의 뒤에 있는 AI 두뇌입니다. 이들은 인간의 명령을 따르도록 훈련되었지만, 완벽하지는 않습니다. 과학자들은 오랫동안 규칙을 너무 많이 주면 모델이 실수를 하기 시작한다는 것을 알고 있었습니다. 하지만 사람들은 그들이 얼마나 심하게 실패하는지, 어떤 규칙들이 서로 충돌하는지, 혹은 로봇의 두뇌를 처음부터 다시 학습시키지 않고도 이를 해결할 방법이 있는지에 대해서는 정확히 알지 못했습니다. 이 논문은 로봇이 어디에서 혼란을 느끼는지, 그리고 우리가 어떻게 그것을 정리하도록 도울 수 있는지 알아보기 위해 이 복잡한 규칙 더미 속으로 깊이 파고듭니다.
거대한 지시 사항 적층 붕괴 (The Great Instruction Stack Collapse)
AI에게 프롬프트를 주는 것을 요리사에게 레시피 카드를 건네는 것에 비유해 보세요. 만약 카드가 "샌드위치를 만드세요"라고 적혀 있다면 요리사는 행복할 것입니다. 하지만 갑자기 레시 Recipe 카드 위에 "빨간색 재료만 사용할 것", "빵은 허용되지 않음", "파란색 그릇에 담아낼 것", 그리고 "손을 사용하지 말 것!"이라고 적힌 포스트잇이 겹겹이 붙어 있다고 상상해 보세요. 만약 이 포스트잇 스무 장을 레시피 위에 쌓아 놓는다면, 요리사는 단순히 혼란스러워하는 데 그치지 않고, 규칙 중 절반을 아예 포기해 버릴 것입니다. 그들은 샌드위치를 만들 수는 있겠지만, 빨간색 재료를 사용하는 규칙은 잊어버릴 수 있습니다. 파란색 그릇을 사용할 수는 있겠지만, "빵 금지" 규칙은 무시할 수도 있습니다. 그리고 무서운 점은 무엇일까요? 요리사는 자신이 실패했다는 사실을 말해주지 않는다는 것입니다. 그저 이상한 샌드위치를 내놓으며 이렇게 말할 뿐입니다. "여기 있습니다."
**"Instruction Stacking Collapse"**라는 제목의 이 논문은 정확히 이런 현상이 어떻게 발생하는지에 대한 심층적인 연구입니다. 연구진은 세 가지 최상위 AI 모델(Claude Sonnet 4.6, GPT-5-mini, Gemini 2.5 Flash)이 늘어나는 지시 사항 더미를 얼마나 잘 처리할 수 있는지 테스트하기 위해 거대한 놀이터를 구축했습니다. 그들은 단 하나의 규칙으로 시작하여, 한 번에 최대 20개의 규칙까지 서서히 늘려 나갔습니다.
충돌: 규칙들이 서로 싸울 때
결과는 극적이었습니다. AI가 따라야 할 지시 사항이 단 하나일 때, 모델은 약 **96%**의 확률로 정답을 맞히며 슈퍼스타처럼 행동했습니다. 하지만 규칙의 더미가 20개로 늘어나자 성능이 폭락했습니다.
- 가장 강력한 모델(Claude Sonnet)은 성공률이 약 **60%**로 떨어졌습니다.
- 중간 단계 모델(Gemini)은 **43%**로 떨어졌습니다.
- 가장 약한 모델(GPT-5-mini)은 벽에 부딪혀, 단 **20%**의 지시 사항만을 올바르게 수행했습니다.
이는 완만하고 지루한 하락이 아니었습니다. 그것은 "붕괴"였습니다. 연구진은 규칙들이 단순히 사라지는 것이 아니라, 서로 적극적으로 싸우고 있다는 것을 발견했습니다. 그들은 "충돌 지도(conflict map)"를 발견했습니다. 예를 들어, AI에게 "유효한 JSON을 출력하라"(특정한 컴퓨터 코드 형식)고 지시하면서 동시에 "마크다운 헤더를 사용하라"(예: ##제목)고 지시하면, AI는 막히게 됩니다. 두 가지를 동시에 할 수 없기 때문입니다. 만약 JSON을 선택하면, 마크다운 규칙을 조용히 깨뜨립니다. 만약 마크다운을 선택하면, JSON 규칙을 깨뜨립니다. 연구 결과, "JSON 출력"이라는 지시가 가장 큰 문제아였으며, 9개의 다른 일반적인 규칙과 충돌을 일으키는 것으로 나타났습니다.
마법 같은 해결책: 지시 컴파일러 (The Instruction Compiler)
그렇다면 해결책은 단순히 AI에게 규칙을 적게 주는 것일까요? 반드시 그렇지는 않습니다. 연구진은 다음과 같이 질문했습니다. "AI에게 새로운 것을 가르치지 않고, AI가 보기 전에 프롬프트를 수정할 수 있을까?"
그들은 **지시 컴파일러(Instruction Compiler)**라는 도구를 발명했습니다. 이 컴파일러를 요리사에게 전달하기 전, 당신의 지저분한 스무 장의 포스트잇을 미리 살펴보는 매우 체계적인 조수로 생각하세요. 컴파일러는 세 가지 일을 합니다:
- 그룹화: 모든 "형식" 규칙을 모으고, 모든 "길이" 규칙을 모읍니다.
- 병합: 두 규칙이 같은 내용을 말하고 있다면, 이를 하나의 명확한 문장으로 합칩니다.
- 우선순위 설정: 만약 두 규칙이 충돌한다면(예: "JSON 사용" vs "마크다운 사용"), 컴파일러는 "이 두 가지가 충돌할 경우, JSON을 먼저 수행하라"는 메모를 추가합니다.
이 컴파일러는 한 번 실행되어 깔끔하고 조직된 체크리스트를 생성하며, 그 동일한 체크리스트가 AI가 답변하는 모든 질문에 사용됩니다. 이는 요리사에게 지저분한 메모 더미 대신, 완벽하게 작성된 단 하나의 레시피 카드를 주는 것과 같습니다.
놀라운 결과: 누가 도움을 받는가?
이 이야기에서 가장 흥미로운 부분은 여기입니다. 연구진은 이 "깔끔한 레시피 카드"가 모두에게 똑같이 도움이 될 것이라고 예상했습니다. 하지만 그렇지 않았습니다. 혜택은 요리사(AI 모델)가 얼마나 "똑똑한가"에 따라 완전히 달랐습니다.
- 약한 모델들(예: GPT-5-mini)의 경우: 컴파일러는 구원 투수였습니다. 컴파일러는 성공률을 +11 퍼센트 포인트 끌어올렸습니다. 80%의 확률로 실패하던 모델을 69%의 확률로 실패하는 모델로 바꾸어 놓았습니다. 이는 매우 중요한데, 왜냐하면 이 약한 모델들이 속도가 빠르고 저렴하기 때문에 실제 세상에서 가장 많이 사용되기 때문입니다.
- 가장 강력한 모델들(예: Claude Sonnet)의 경우: 컴파일러는 거의 아무런 도움이 되지 않았습니다. 사실, 성능을 약간 **감소(-1.2 포인트)**시켰습니다.
왜 그럴까요? 논문에 따르면, 가장 강력한 모델들은 이미 지저분한 스무 개의 규칙 더미를 보고도 스스로 구조, 충돌, 우선순위를 파악할 수 있을 만큼 똑똑하기 때문입니다. 그들은 노트를 정리해 줄 컴파일러를 필요로 하지 않습니다. 오히려 추가된 노트들이 그들의 사고를 방해할 뿐입니다. 반면, 약한 모델들은 혼란스러운 상황에 압도당합니다. 그들에게는 혼돈을 명확한 단계별 계획으로 번역해 줄 컴파일러가 필요합니다.
이것이 당신에게 의미하는 바
이 연구는 우리에게 두 가지 큰 교훈을 줍니다. 첫째, 우리가 AI에게 많은 규칙이 담긴 복잡한 일을 시킬 때, 단순히 텍스트의 벽을 던져주고 제대로 작동하기를 기대해서는 안 된다는 것입니다. 규칙은 붕괴될 것이며, AI는 조용히 실패할 것입니다. 둘째, 이를 해결하기 위해 더 크고 똑똑한 로봇을 만들 필요는 없습니다. 때로는 해결책이 더 나은 '조직화'에 있습니다.
이 논문은 단순하고 무료인, 지시 사항을 재구성하는 도구가 약한 AI 모델들을 구출하여 우리가 매일 사용하는 작업에서 훨씬 더 신뢰할 수 있게 만들 수 있음을 증명합니다. 이는 AI의 세계에서, 때때로 가장 똑똑한 방법은 로봇을 더 똑똑하게 만드는 것이 아니라, 지시 사항을 더 명확하게 만드는 것임을 상기시켜 줍니다. 그리고 아주 똑똑한 로봇들에게는, 스스로 알아서 판단하는 것을 더 선호할지도 모릅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.