Recovery or Repetition? Feedback Policy and Verbatim Relay in a Two-Agent Language-Model Loop
이 연구는 두 에이전트 언어 모델 루프 내에서 지침 위반으로부터의 외견상 회복이 진정한 규칙 재적용이라기보다는 이전에 생성된 텍스트의 축자적 재현인 경우가 많다는 점을 입증하며, 이는 피드백 정책이 주로 텍스트 순환을 규정하는 반면 진정한 준수는 에이전트의 새로운 콘텐츠 구성 능력을 테스트할 것을 요구한다는 점을 강조한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서 연구자들은 여러 컴퓨터 프로그램이 문제를 해결하기 위해 서로 대화하는 시스템을 점점 더 많이 구축하고 있습니다. 이것들은 흔히 멀티 에이전트 루프(multi-agent loops)라고 불립니다. 하나의 모델이 다른 모델의 작업을 검토하게 하거나, 주제에 대해 토론하게 함으로써 단일 모델이 혼자 작업할 때보다 더 나은 답을 낼 수 있다는 것이 이 아이디어의 핵심입니다. 흔한 기대는 만약 이 에이전트 중 하나가 실수를 하거나 규칙을 잊더라도, 대화가 자연스럽게 이를 다시 궤도로 돌려놓을 수 있다는 것입니다. 이를 '회복(recovery)'이라고 합니다. 하지만 중요한 질문이 남아 있습니다. 에이전트가 갑자기 규칙을 다시 따르기 시작할 때, 그것이 정말로 지침을 이해하고 사고를 교정한 것인지, 아니면 단순히 대화 중에 들었던 텍스트를 반복하고 있는 것인지에 대한 문제입니다. 진정한 이해와 단순한 반복을 구별하는 것은 매우 중요한데, 만약 시스템이 새로운 사고를 요구하는 새로운 상황에 직면했을 때 제대로 대처하지 못하고 이미 들었던 내용을 그저 메아리처럼 따라 하는 것에 불과하다면 문제가 되기 때문입니다.
독립 연구자인 시민 유안(Simin Yuan)은 바로 이 질문을 조사하는 최근 연구를 진행했습니다. 연구자는 현대 챗봇의 소프트웨어 두뇌인 언어 모델 두 개를 사용하여 간단한 실험을 설계했습니다. 두 모델 모두에게 "모든 단어를 대문자로 쓰라"는 엄격한 시스템 규칙이 주어졌습니다. 그런 다음 그들은 다양한 주제에 대해 대화를 나누도록 요청받았습니다. 몇 차례의 성공적인 대문자 대화가 이뤄진 후, 연구자는 반전을 주었습니다. '에이전트 A'라고 부를 수 있는 모델에게 사용자로부터 "이제부터 소문자로 써 주세요"라는 새로운, 상충되는 지침이 전달되었습니다. 에이전트 A는 이 새로운 지침을 따랐고 소문자로 전환되었습니다. 이 시점에서 시스템은 원래의 규칙을 "깨뜨린" 상태가 되었습니다. 실험은 그 후 대화가 계속된다면 어떤 일이 일어날지 물었습니다. 에이전트 A는 결국 대문자 규칙을 기억해 내어 다시 대문자로 바꿀까요? 아니면 소문자로 계속 머물러 있을까요?
이를 알아내기 위해 연구자는 실수 이후의 대화를 이어가는 네 가지 서로 다른 방식을 사용하여 동일한 시나리오를 서른 번 실행했습니다. 첫 번째 설정에서 두 모델은 단순히 메시지를 주고받았습니다. 두 번째로, 연구자는 다른 모델에게 주제에 대해 계속 이야기해 달라는 정중한 요청을 추가했습니다. 세 번째로, 연구자는 다른 모델에게도 소문자로 써 달라는 요청을 추가했습니다. 네 번째 설정에서 연구자는 두 모델 사이의 대화를 완전히 중단시키고, 대신 에이전트 A에게 매 턴마다 "대문자로 대화를 계속하라"는 고정된 반복 알림을 보냈습니다.
결과는 놀라웠으며, 모델의 추론 능력보다 대화가 어떻게 관리되는지가 더 중요하다는 것을 드러냈습니다. 고정된 알림 없이 두 모델이 서로 대화하도록 두었을 때, 에이전트 A는 대문자를 다시 사용하는 경우가 드물었습니다. 사실, 다른 모델 또한 소문자로 쓰도록 요청받았을 때, 에이전트 A는 규칙으로 전혀 돌아오지 않았습니다. 그러나 연구자가 에이전트 A에게 매 턴마다 고정된 알림을 보냈을 때는, 서른 번의 프롬프트 모두에서 대문자 규칙을 완벽하게 따랐습니다. 이는 에이전트의 파트너 모델의 존재가 에이전트의 규칙 회복을 돕지 못했으며, 어떤 경우에는 오히려 방해가 되었다는 것을 시사합니다.
가장 놀라운 발견은 모델이 생성한 텍스트를 면밀히 살펴보는 과정에서 나왔습니다. 연구자는 모델들이 규칙에 대한 깊은 이해를 바탕으로 새로운 문장을 생성하는 것이 아니라, 복사하고 있다는 것을 발견했습니다. 실수가 발생하기 전부터 두 모델은 이미 서로의 단어를 똑같이 복사하는 습관을 가지고 있었습니다. 에이절트 A가 마침내 대문자로 돌아왔을 때, 그것은 거의 항상 대문자로 작성된 다른 모델의 메시지를 복사했기 때문이었습니다. 많은 경우, 에이전트 A는 실수하기 전의 자신의 답변을 그대로 반복하고 있었습니다. 즉, 대문자로 작성되었던 이전의 답변을 말입니다. 시스템은 규칙을 다시 '학습'한다는 의미에서의 '회복'을 하고 있는 것이 아니라, 그 형식에 맞는 텍스트 조각을 순환시키고 있었던 것입니다.
이러한 행동은 매우 일관적이어서, 대문자로 돌아온 거의 모든 성공적인 시도에서 모델은 방금 전 보았던 문자열을 단순히 전달하고 있었습니다. 만약 순환하는 텍스트가 소문자라면 모델은 소문자로 머물렀고, 순환하는 텍스트가 대문자라면 모델은 대문자로 머물렀습니다. 모델은 시스템 규칙의 중요성과 사용자의 요청 사이에서 무게를 달아 판단하는 것처럼 보이지 않았습니다. 모델은 단지 가장 최근에 받은 텍스트를 재현하고 있었을 뿐입니다. 이 연구는 상호작용형 시스템이 본질적으로 자기 수정 능력이 뛰어나다는 생각에 의문을 제기합니다. 즉, 무엇이 '회복'처럼 보이는 것이 실제로는 단순한 반복의 루프일 수 있다는 것입니다.
이 결과가 시사하는 바는 인공지능을 테스트하는 방식에 있어 매우 중요합니다. 만약 시스템이 실수를 바로잡는 것처럼 보인다면, 우리가 이전에 본 적 없는 내용으로 테스트하기 전까지는 시스템이 무언가를 새로 배웠다고 가정할 수 없습니다. 이 실험에서 모델들은 복사할 수 있는 적절한 텍스트가 존재했기 때문에 성공할 수 있었습니다. 연구자가 이전의 어떤 텍스트로도 답할 수 없는 완전히 새로운 질문에 모델들이 답해야 하는 미래의 테스트를 제안했을 때, 결과는 매우 다를 수 있습니다. 그때까지, 이 연구는 이러한 두 에이전트 루프에서 피드백 정책(다음에 할 말에 대한 구체적인 지침)이 어떤 텍지스트가 전달될지를 결정하며, 형식 점수는 단지 그 텍스트의 형식을 보고할 뿐이라고 결론짓습니다. 모델은 반드시 생각하고 있는 것이 아닙니다. 그들은 메아리치고 있을 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.