← 최신 논문
💬 NLP

Interrupting the Loop: Periodic Subject Changes Raise Judged Surprise and Connection in Base Language Models

이 논문은 기본 언어 모델의 생성 스트림을 새로운 주제들로 주기적으로 중단시키는 것이 단순한 습관화에 비해 판단된 놀라움과 연결성을 유의미하게 증가시킨다는 점을 입증하는 동시에, 이러한 국소적 이득이 일관된 장문 문서로 구성되지는 않는다는 점과 특정 평가 아티팩트가 인지된 창의성을 부풀릴 수 있다는 점을 밝혀낸다.

원저자: Roberto I. Ono Filho

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Roberto I. Ono Filho

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터에게 구체적인 줄거리도, 캐릭터도, 목표도 주지 않은 채 이야기를 써보라고 요청한다고 상상해 보십시오. 그저 단 한 문장을 건네주며 그것을 영원히 계속 이어가라고 말하는 것입니다. 인공지능의 세계에서 이것은 기계가 스스로 내버려 두었을 때 어떻게 생각하는지를 테스트하는 표준적인 방법입니다. 흔히 기계가 새롭고, 놀랍거나, 창의적인 무언가를 만들어낼 것이라는 기대가 따릅니다. 하지만 가이드가 될 만한 과업이 없으면, 이 기계들은 대개 정체되고 맙니다. 마치 자신이 무슨 말을 하려 했는지 잊어버린 사람이 똑같은 문장을 계속해서 반복하기 시작하는 것처럼, 이들은 같은 구절을 반복하거나 숫자의 목록을 생성하는 반복적인 루프에 빠집니다. 이러한 행동은 코드의 오류가 아니라, 시스템이 자신의 최근 출력을 참조하여 방금 쓴 내용을 강화하며 새로운 아이디어가 고갈될 때까지 반복하려는 자연스러운 경향입니다.

연구자들은 진정한 참신함을 끌어내기 위해 이 순환을 끊을 수 있을지 오랫동안 궁금해해 왔습니다. 그들은 기계가 다음 단어를 선택하는 방식을 바꾸거나, 이상한 프롬프트를 입력하는 등의 시도를 해왔지만, 가장 유망한 경로는 바로 그 '루프' 자체였습니다. 즉, 기계가 자신의 출력을 읽고 그것을 다음 단계의 입력값으로 사용하는 과정 말입니다. 만약 기계가 자신의 생각 속을 헤매다 보면, 마치 사람이 문제를 머릿속에 담아둔 채로 시간을 보낸 뒤 갑작스러운 통찰을 얻는 것처럼 새로운 방향을 발견할 수도 있다는 아이디어입니다. 한 연구팀은 극도로 정밀하게 이 아이디어를 테스트하기 위해, 인간의 창의성을 모방하도록 설계된 복잡한 시스템을 해체하여 어떤 부분이 실제로 작동하고 어떤 부분이 그저 소음(noise)에 불 불과한지를 확인하고자 했습니다.

연구진은 인간의 뇌가 작동하는 방식에서 영감을 받은 정교한 아키텍처로 시작했습니다. 그들은 지루함이나 반복의 징후를 감시하는 '모니터', 텍스트가 작성되는 동안 이를 평가하는 '판사', 그리고 기계의 메모리가 막혔을 때 이를 초기화하는 메커니즘을 갖춘 시스템을 구축했습니다. 그들은 이를 '스캐폴드(scaffold, 비계)'라고 불렀습니다. 이는 진행 상황을 평가하고 필요할 때 개입하여 이야기를 계속 전개시키도록 설계된 복잡한 기계였습니다. 그러나 테스트 결과, 이 정교한 부분들은 대체로 쓸모가 없었습니다. 모니터는 거의 작동하지 않았고, 루프 내부의 판사는 변화를 유도하는 신호를 보내지 않았습니다. 시스템은 작동하고 있었지만, 그들이 만든 복잡한 기계 덕분이 아니었습니다.

연구팀이 시스템을 분해했을 때, 전체 효과는 매우 단순한 두 가지 동작에서 비롯되었다는 것을 발견했습니다. 첫 번째는 똑같은 단어를 너무 빨리 반복하는 것에 대해 가벼운 페널티를 주는 기술이었는데, 이는 텍스트가 문자 그대로 자기 자신에게 되돌아가는 것을 막아주었습니다. 두로 훨씬 더 중요한 것은 단순한 '중단'이었습니다. 연구진은 몇 백 단어마다 기계를 멈추고 주제를 완전히 바꾸는 새로운 문장을 주입했습니다. 마치 기계가 빵을 세고 있는 제빵사에 대해 쓰고 있을 때, 누군가 조용히 이야기 속에 "한편, 이름 없는 도시에서는"이라는 쪽지를 끼워 넣고 나서 기계가 거기서부터 다시 계속 쓰게 만드는 것과 같았습니다. 이 단 한 번의 행위, 즉 몇 백 단어마다 주제를 바꾸는 것만으로도 텍스트가 놀랍고 인간 독자와 연결되어 있다고 느껴지게 만들었으며, 복잡한 모니터링 시스템보다 글의 품질을 훨씬 더 크게 높였습니다.

이 연구는 또한 기계의 창의성을 측정하는 방식에 대한 놀라운 결함을 드러냈습니다. 연구진은 인공지능을 사용하여 짧은 텍스트 창을 보고 이야기가 흥미로운지 결정하며 점수를 매겼습니다. 그들은 이 '판사'가 쉽게 속는다는 것을 발견했습니다. 만약 기계에게 네 개의 '새로운 주제' 문장을 돌아가며 사용하도록 준다면, 기계는 그 패턴을 학습하여 이전의 글을 복사하며 마치 새로운 글인 것처럼 꾸며낼 수 있었습니다. 짧은 창만을 보는 판사는 그 텍스트가 수백 단어 전의 복제본이라는 사실을 알아채지 못했고, 그래서 실제로는 복사본임에도 불구하고 '놀라움'과 '연결성'에 높은 점수를 주었습니다. 연구진이 이전에 본 적 없는 새로운 텍스트만을 대상으로 판단하도록 수정했을 때 점수는 떨어졌지만, 핵심적인 발견은 여전히 유효했습니다. 즉, 주제를 바꾸는 단순한 행위가 글을 더 낫게 만든다는 사실입니다.

하지만 이 연구는 이러한 개선이 실제로 무엇을 의미하는지에 대해 냉혹한 결론을 내리기도 했습니다. 중단(interruption) 작업이 작은 단위의 텍스트를 더 좋게 보이게 만들기는 했지만, 하나의 일관된 전체를 만들어내지는 못했습니다. 연구진이 4,500단어의 전체 이야기를 처음부터 끝까지 읽었을 때, 중단된 텍스트는 발전하는 서사가 아니라는 것을 발견했습니다. 대신 그것은 단절된 재시작들의 집합이었습니다. 기계는 제빵사에 대해 쓰다가, 도시로 넘어갔다가, 다시 노파에 대해 쓰는 식으로 써 내려갔지만, 이 실타래들을 하나의 통합된 이야기로 엮어내지는 못했습니다. 기계는 새로운 시작을 하는 데는 능숙했지만, 시간이 흐름에 따라 유지되는 구조를 구축하는 데는 서툴렀습니다.

이러한 한계는 연구진이 시스템을 실질적인 문제에 적용하여, 물건을 상자에 담는 수학 퍼즐을 풀게 했을 때도 동일하게 나타났습니다. 중단 작업은 기계가 훨씬 더 많은 유효한 해결책을 생성하게 만들었지만, 그중 어떤 것도 기계가 스스로 찾아낼 수 있는 최선의 해결책보다 더 나은 것은 아니었습니다. 중단은 변이 연산자(variation operator)로서 더 많은 옵션을 만들어냈지만, 최선의 옵션 자체의 질을 높이지는 못했습니다. 기계에게는 좋은 아이디어를 선택하고 그것을 바탕으로 구축해 나가는 방법이 필요했는데, 현재의 시스템에는 그 단계가 없었습니다.

연구진은 결론적으로, 우리가 기계에서 보는 참신함은 깊은 창의적 불꽃이나 복잡한 내부적 평가에서 오는 것이 아니라, 단순한 구조적 트릭에서 온다고 보았습니다. 즉, 기계가 반복하는 것을 막고 몇 백 단어마다 새로운 생각을 강제로 시작하게 만드는 것입니다. 이러한 단순한 개입은 텍스트를 순간적으로 놀랍고 연결되게 느끼게 할 수는 있지만, 발전하는 이야기를 만들거나 문제를 해결해주지는 못합니다. 이 연구는 진정한 창의성을 얻기 위해서는 단순히 기계가 지루해하지 않도록 하는 방법 이상의 것이 필요함을 시사합니다. 즉, 기계가 배운 것을 기억하고 그 위에 쌓아 올려, 일련의 새로운 시작들을 하나의 의미 있는 여정으로 바꾸어 놓을 수 있는 방법이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →