← 최신 논문
💬 NLP

XTC: Head-Aware Sampling by Excluding Top Choices

이 논문은 다양한 대규모 언어 모델에서 유창성과 지시 이행 정확도를 유지하면서도 생성의 다양성과 창의성을 크게 향상시키기 위해 지배적인 고확률 토큰들을 선택적으로 제거하는 경량 디코딩 전략인 XTC(Exclude Top Choices)를 소개한다.

원저자: Philipp Emanuel Weidmann, Allen Roush, Judah Goldfeder, Sanjay Basu, Ravid Shwartz-Ziv

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Philipp Emanuel Weidmann, Allen Roush, Judah Goldfeder, Sanjay Basu, Ravid Shwartz-Ziv

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터 프로그램이 글쓰기를 배울 때, 인간처럼 문장 단위로 생각하는 것이 아닙니다. 대신, 이들은 앞에 나온 단어들을 바탕으로 다음에 올 단어를 예측하며, 긴 가능성의 목록 중에서 하나를 선택합니다. 오랫동안 이러한 프로그램들이 다양하고 흥미로운 텍스트를 쓰게 만드는 표준적인 방법은, 드문 단어들을 사용하도록 유도하거나 아주 가능성이 낮은 단어들을 잘라내는 것이었습니다. 이 방식은 엉뚱한 소리를 피하는 데는 효과적이었지만, 종종 다른 문제를 야기했습니다. 바로 텍스트가 안전하고, 반복적이며, 이상할 정도로 균일해진다는 점이었습니다. 컴퓨터가 이야기의 다음 내용을 이어갈 여러 가지 좋은 방법들을 알고 있을 때조차, 마치 옆에 경치 좋은 길이 있음에도 항상 큰 길만을 선택하는 여행자처럼, 거의 항상 가장 명백하고 일반적인 선택지를 골랐습니다. 다른 강력한 선택지들이 존재함에도 불구하고 가장 안전한 선택에 집착하는 이러한 성향은, 기계가 생성한 글에서 창의성을 조용히 앗아가고 있었습니다.

한 연구팀이 이제 이러한 특정한 습관을 고치기 위해 XTC(Exclude Top Choices, 상위 선택지 제외)라고 불리는 새로운 방법을 도입했습니다. 이 기술은 목록의 하단에 있는 가능성 낮은 단어들을 살펴보거나 전체 선택지 목록을 평탄하게 만들려고 노력하는 대신, 목록의 상단에 집중합니다. 이 방법은 컴퓨터가 두 개 이상의 매우 좋은 선택지 사이에서 진정으로 결정을 내리지 못할 때까지 기다립니다. 그런 상황이 발생하면, 이 방법은 가장 인기 있는 선택지를 후보에서 의도적으로 제거하여, 컴퓨터가 남은 강력한 대안들 중에서 선택하도록 강제합니다. 이는 컴퓨터가 정말로 갈림길에 섰을 때만 작동하는 단순한 스위치와 같으며, 결과물이 터무니없어지지 않으면서도 다양성을 유지하도록 보장합니다.

연구진은 이 아이디어를 120억 개의 파라미터를 가진 작은 모델부터 700억 개의 파라미터를 가진 거대 모델에 이르기까지 여러 종류의 대규모 언어 모델에 테스트했습니다. 그들은 모델들에게 창의적인 이야기를 쓰게 하고, 아이디어를 구상하게 하며, 대화를 나누게 하여, 새로운 방법과 기존의 텍etto 생성 방식들을 비교했습니다. 결과는 명확하고 일관적이었습니다. XTC를 사용할 때, 생성된 텍스트는 단어와 구절의 다양성이 측정 가능한 수준으로 증가하며 현저히 더 다양해졌습니다. 동시에, 텍스트의 반복성도 훨씬 줄어들어, 모델이 동일한 세 단어 구절을 반복하는 횟수가 훨씬 적어졌습니다. 한 테스트 세트에서는 글의 다양성이 11%에서 15% 사이로 개선되었고, 흔한 구절의 반복은 거의 절반 가까이 감소했습니다.

결정적으로, 연구진은 이러한 다양성의 증가가 품질이나 명료함을 희생시키며 나타난 것이 아님을 발견했습니다. 인간 자원봉사자들과 다른 고급 컴퓨터 프로그램들이 글을 평가했을 때, 그들은 XTC로 생성된 텍스트가 창의성과 흥미 면에서 표준 버전보다 높게 평가되며 이를 선호했습니다. 글은 유창하고 읽기 쉬운 상태를 유지했으며, 전반적인 품질의 눈에 띄는 저하도 없었습니다. 또한 이 방법은 매우 정밀하게 적용되었습니다. 설정을 너무 과하게 설정하지 않는 한, 특정 지시 사항을 따르거나 코드를 작성하는 것과 같이 엄격한 정확성이 요구되는 작업에는 간섭하지 않았습니다. 실제로 연구진이 XTC를 단순히 컴퓨터를 더 무작위하게 만드는 전통적인 방법과 비교했을 때, XTC는 지시 사항을 따르는 능력을 훨씬 더 잘 보존하면서도 동일한 수준의 다양성을 달로 달성했습니다.

이 연구는 또한 이 새로운 접근 방식이 기존의 도구들과 함께 잘 작동한다는 것을 보여주었습니다. XTC는 무작위성이나 반복을 제어하는 다른 방법들과 결합될 수 있으며, 그 이점들은 서로 상쇄되기보다 합쳐지는 효과를 냅니다. 표준적인 온도(temperature) 설정과 결합했을 때, 그 조합은 어떤 경우에는 반복을 70% 이상 줄이는 동시에 다양성을 거의 40%까지 끌어올리며 더 큰 개선을 만들어냈습니다. 연구진은 이러한 효과가 다양한 유형의 모델과 다양한 수준의 컴퓨터 메모리 압축 환경에서도 유효함을 확인했으며, 이는 이 방법이 견고하고 널리 적용 가능하다는 것을 시사합니다.

이 발견이 중요한 이유는 이것이 수년간 이러한 시스템을 조정해 온 방식의 사각지대를 다루고 있기 때문입니다. 이전의 방법들은 반복적인 글쓰기의 문제가 목록의 하단에 있는 아주 낮거나 이상한 단어들로부터 온다고 가정했습니다. 이 새로운 연구는 진짜 문제가 상단에 있다는 것을 보여줍니다. 즉, 컴퓨터가 자신의 가장 안전한 선택지에 너무 확신을 가진 나머지 다른 완벽하게 좋은 대안들을 무시한다는 것입니다. 컴퓨터가 진정으로 불확실할 때만 시스템을 부드럽게 밀어냄으로써, 이 방법은 더 자연스럽고 인간다운 표현의 범위를 열어줍니다. 이 기술은 이미 개발자들이 사용하는 여러 인기 있는 오픈 소스 도구들에 채택되었으며, 이는 인공지능의 글쓰기가 기계처럼 느껴지기보다 창의적인 파트너처럼 느껴지게 만드는 실질적인 방법을 제공하고 있음을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →