← 최신 논문
🤖 AI

LZ Penalty: An information-theoretic repetition penalty for autoregressive language models

이 논문은 LZ77 코드 길이에 기반하여 정보 이론적 반복 페널티를 도입함으로써, 추론 능력을 저해하지 않으면서도 탐욕적 디코딩(greedy decoding) 과정 중 자기회귀 언어 모델에서 발생하는 퇴보적 반복을 효과적으로 제거하고 기존의 업계 표준 페널티보다 우수한 성능을 보이는 LZ 페널티를 소개한다.

원저자: Antonio A. Ginart, Naveen Kodali, Jason Lee, Caiming Xiong, Silvio Savarese, John R. Emmons

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Antonio A. Ginart, Naveen Kodali, Jason Lee, Caiming Xiong, Silvio Savarese, John R. Emmons

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 언어 모델이라고 알려진 강력한 컴퓨터 프로그램 계층이 존재합니다. 이 시스템들은 문장에서 다음에 올 단어를 예측하도록 훈련되었으며, 이를 통해 이야기를 쓰고, 질문에 답하며, 심지어 긴 추론 과정을 생성함으로써 복잡한 수학 문제를 해결할 수도 있습니다. 이러한 예측을 수행하기 위해, 모델은 방대한 가능성의 목록 중에서 가장 확률이 높은 다음 단어를 선택하는 통계적 과정에 의존합니다. 그러나 한 가지 지속적인 문제가 이러한 시스템들을 괴롭혀 왔는데, 특히 모델이 어려운 과제를 수행하도록 요청받았을 때 발생합니다. 모델은 때때로 루프(loop)에 갇히곤 합니다. 새로운 아이디어로 나아가는 대신, 모델은 동일한 단어나 구절을 계속해서 반복하기 시작하여 출력을 무의미한 상태로 저하시킵니다. 이 현상은 퇴행적 반복(degenerate repetition)이라고 알려져 있으며, 출력이 일관되고 오류가 없어야 하는 신뢰할 수 있는 결정론적 작업에 이러한 모델을 사용하는 데 있어 중요한 장벽이 되어 왔습니다.

수년 동안 엔지니어들은 모델의 선택에 간단한 페널티를 적용함으로써 이를 해결하려고 노력해 왔습니다. 이러한 페널티는 모델이 최근에 이미 사용한 단어를 선택하는 것을 저지하는 부드러운 자극 역할을 합니다. 한 방법은 단어가 몇 번 나타났는지 계산하여 그 확률을 낮추는 것이고, 다른 방법은 단순히 이전에 등장했던 단어에 대해 페널티를 부여하는 것입니다. 이러한 방식은 일상적인 대화에서는 잘 작동하지만, 모델이 깊은 추론에 몰두할 때는 종종 실패합니다. 논리 퍼즐을 풀기 위해 매우 긴 텍스트 시퀀스를 생성하는 추론 모델들은 표준적인 수정 조치에도 불구하고 빈번하게 반복적인 순환에 빠집니다. 그 결과, 시스템은 초반에는 강력하게 시작할지 모르나 결국 반복되는 단어들의 더듬거리는 루프로 붕괴되어 출력을 쓸모없게 만듭니다.

Salesforce AI Research의 연구진은 완전히 다른 분야에서 영감을 얻은 새로운 해결책을 제안했습니다. 그들의 연구는 모델의 명료한 사고 능력을 희생하지 않으면서도 이러한 반복적인 루프를 막기 위해 설계된 '렘펠-지브(Lempel-Ziv) 페널티'라는 방법을 도입합니다. 핵심 아이디어는 문장에서 다음 단어를 예측하는 것과 데이터 파일의 압축 사이에 존재하는 근본적인 연결 관계에 기초합니다. 컴퓨팅의 세계에서 압축 알고리즘은 데이터 내의 패턴과 반복을 찾아 파일을 더 작게 만드는 방식으로 작동합니다. 만약 단어 시퀀스가 자주 반복된다면, 압축 알고리즘은 이를 매우 효율적으로 기술하여 더 적은 비트의 정보를 사용할 수 있습니다. 연구진은 만약 자신들이 모델의 현재 텍스트 스트림이 얼마나 쉽게 압축될 수 있는지를 측정할 수 있다면, 그 정보를 사용하여 모델을 반복적인 패턴으로부터 멀어지도록 유도할 수 있다는 점을 깨달았습니다.

연구진은 모델이 텍스트를 생성하는 동안 실시간으로 특정 유형의 압축 알고리즘인 렘펠-지브 알고리즘을 시뮬레이션하는 시스템을 개발했습니다. 이 알고리즘은 최근의 텍스트 이력을 슬라이딩 윈도우(sliding window) 방식으로 살펴보며, 단어 시퀀스의 가장 긴 일치 항목을 찾습니다. 모델이 새로운 단어를 고려할 때, 시스템은 그 단어가 전체 압축 파일의 크기를 얼마나 변화시킬지를 계산합니다. 만약 새로운 단어가 압축 알고리즘이 쉽게 인코딩할 수 있는 길고 중복된 패턴을 만들어낸다면, 시스템은 해당 단어에 페널티를 적용하여 선택될 확률을 낮춥니다. 반대로, 만약 그 단어가 쉽게 압축될 수 없는 새롭고 예측 불가능한 정보를 도입한다면, 페널티는 낮거나 존재하지 않습니다. 이 접근 방식은 단순히 단일 단어가 몇 번 나타나는지를 세는 기존 방식과는 달리, 반복되는 시퀀스의 길이와 그 시퀀스가 얼마나 이전에 발생했는지를 살펴봅니다.

이 새로운 접근 방식을 테스트하기 위해, 연구진은 320억 개의 파라미터를 가진 모델과 140억 개의 파라미터를 가진 두 가지 고급 추론 모델에 이를 적용했습니다. 그들은 자신들의 새로운 페널티를 오늘날 업계 표준으로 사용되는 방식들과 비교했습니다. 결과는 놀라웠습니다. 표준적인 빈도 또는 반복 페널티를 사용할 때, 연구진이 반복을 방지하기 위해 설정을 조정했음에도 불구하고 모델은 여전히 약 4%의 확률로 퇴행적 반복 루프에 빠졌습니다. 대조적으로, 새로운 렘펠-지브 페널티는 이러한 반복적 실패율을 사실상 제로로 줄였습니다. 모델은 반복적인 루프에 갇히지 않고 길고 복잡한 추론 체인을 생성할 수 있었으며, 어려운 벤치마크 테스트에서의 정확도 또한 변함없이 유지되었습니다. 이는 새로운 방식이 모델의 진정한 추론 능력에 간섭하지 않으면서도 루프를 유발하는 중복성을 성공적으로 제거했음을 시사합니다.

연구진은 또한 이 새로운 페널티를 실행하는 데 드는 계산 비용을 조사했습니다. 시스템이 텍스트를 생성할 때마다 매 단어마다 압축 단계를 시뮬레이션해야 하기 때문에, 약간의 추가 작업이 필요합니다. 그러나 그들은 이 오버헤드가 놀라울 정도로 작다는 것을 발견했습니다. 대규모 모델의 경우, 속도 저하는 1% 미만이었으며, 이는 실제 사용 시 거의 인지하기 어려운 미미한 차이였습니다. 이러한 효율성은 이 방법이 즉각적인 채택을 위한 실용적인 솔루션임을 보여주며, 상당한 새로운 컴퓨팅 파워를 요구하지 않고도 추론 모델을 더 신뢰할 수 있게 만드는 방법을 제공합니다.

연구진은 이 방법이 자연어에 특화되어 있다는 한계점을 언급했습니다. 압축 알고리즘은 언어가 특정 통계적 특성, 즉 단어가 시간이 지남에 따라 예측 가능한 방식으로 반복되는 경향이 있다는 가정에 의존합니다. 이 방법은 텍스트에 대해서는 매우 효과적으로 작동하지만, 연구진은 특정 조정을 거치지 않는다면 이미지나 오디오와 같은 다른 유형의 데이터에는 효과적이지 않을 수 있다고 경고합니다. 또한, 이 시스템은 모든 가능한 시나리오에 완벽한 것은 아닙니다. 예를 들어, 사용자가 모델에게 특정 글자를 백 번 반복하라고 명시적으로 요청한다면, 페널티가 해당 명령을 방해할 수 있습니다. 그러나 일관된, 비반복적인 추론을 목표로 하는 대다수의 작업에 있어서, 이 새로운 방법은 견고한 해결책이 될 것으로 보입니다.

이러한 발견은 우리가 인공지능을 제어하는 방식에 대한 인식의 전환을 시사합니다. 단순히 단어의 개수를 기준으로 단어를 금지하는 투박한 도구에 의존하는 대신, 이 접근 방식은 정보 이론의 수학적 원리를 사용하여 텍스트 자체의 구조를 이해합니다. 텍스트 생성을 압축 과정으로 취급함으로써, 연구진은 생각의 신호를 보존하면서 반복이라는 노이즈를 자연스럽게 걸러내는 도구를 만들어냈습니다. 이를 통해 오픈 소스 추론 모델이 이전에는 달성하기 어려웠던 수준의 결정론적 운용이 가능해졌으며, 일관성이 매우 중요한 분야에서 더 신뢰할 수 있는 애플리케이션의 문을 열어주었습니다. 이 연구는 데이터 압축의 관점에서 문제를 바라봄으로써, 언어 모델의 발전을 오랫동안 저해해 온 고질적인 결함에 대해 우아한 해결책을 찾을 수 있음을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →