← 최신 논문
💬 NLP

POLARIS: Guiding Small Models to Write Long Stories

이 논문은 POLARIS를 소개하는데, 이는 LLM-as-a-judge 보상과 인간 참조 주입을 결합하여 Qwen3.5-9B와 같은 소형 모델이 더 큰 모델에 필적하는 고품질의 장문 이야기를 생성하면서도 강력한 길이 준수 및 일반화 능력을 유지할 수 있도록 하는 저연산 GRPO 학습 레시피이다.

원저자: Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 창의적인 비유를 사용하여 핵심 개념을 쉽게 풀어낸 POLARIS 논문에 대한 설명입니다.

거대한 문제: 작은 작가들은 지쳐버린다

당신에게 아주 똑똑하지만 몸집이 작은 로봇 작가(소형 모델)가 있다고 상상해 보세요. 만약 이 로봇에게 짧은 단편 소설을 써달라고 하면 아주 잘 해냅니다. 하지만 긴 장편 소설을 써달라고 하면 두 가지 나쁜 일이 발생합니다.

  1. 포기한다: 이야기가 끝나기도 전에 쓰기를 멈춰버립니다.
  2. 정신을 놓는다: 이야기가 길어질수록 내용이 엉망이 되거나, 반복적이거나, 지루해집니다.

거대하고 비싼 슈퍼컴퓨터(예: "프런티어 모델")는 긴 이야기를 잘 쓸 수 있지만, 대부분의 사람들이 사용하기에는 비용이 너무 많이 듭니다. 이 논문의 저자들은 이렇게 질문했습니다. "우리는 어떻게 하면 슈퍼컴퓨터 없이도 작고 저렴한 로봇이 길고 수준 높은 이야기를 쓰도록 가르칠 수 있을까?"

해결책: POLARIS

그들은 POLARIS라는 특별한 훈련 레시피를 만들었습니다. 이것을 로봇을 위한 특별한 코칭 방법이라고 생각하면 됩니다. 단순히 로봇이 혼자 연습하게 두는 대신, 그들의 훈련 캠프에 두 가지 비밀 재료를 추가했습니다.

재료 1: "엄격한 편집자" (LLM 판사)

보통 AI를 훈련시킬 때는 단순히 "좋음" 또는 "나쁨"이라고만 말하는 단순한 "성적표"를 사용합니다. 이는 마치 선생님이 학생에게 이유도 말해주지 않고 그냥 "C 학점"이라고 성적을 주는 것과 같습니다.

POLARIS는 매우 발전된 AI인 프런티어 LLM 판사엄격한 편집자로 활용합니다.

  • 작동 방식: 이 편집자는 단순히 점수만 주는 것이 아니라, 이야기를 읽고 상세한 **루브릭(Rubic, 평가 기준표)**을 작성합니다.
  • 체크리스트: 편집자는 "캐릭터의 목소리가 뚜렷했는가?" (좋음) 또는 "이야기가 반복적이었는가?" (나쁨)와 같은 16가지 서로 다른 항목을 살펴봅니다.
  • 비유: 유명 작가가 당신의 글을 읽고 구체적인 피드백을 주는 글쓰기 워크숍을 상상해 보세요. *"대사가 너무 딱딱해요"*라거나 *"결말이 너무 급하게 마무리되었습니다"*와 같은 메모를 남기는 것입니다. 로봇은 단순한 등급이 아니라, 이러한 구체적인 메모를 통해 배웁니다.

재료 2: "인간의 닻" (인간 참조 주입)

이것이 가장 독특한 부분입니다. 일반적인 훈련 그룹에서는 로봇이 5개의 서로 다른 이야기를 생성하면 컴퓨터가 그중 가장 좋은 것을 골라 학습합니다. 하지만 때로는 5개의 이야기 모두가 평범할 수 있으며, 이 경우 로봇은 "괜찮지만 아주 뛰어나지는 않은" 글을 쓰는 루프에 빠지게 됩니다.

POLARIS는 모든 그룹에 **인간의 닻(Human Anchor)**을 추가합니다.

  • 작동 방식: 모든 프롬프트에 대해, 시스템은 로봇이 자신의 시도와 함께 실제 사람이 쓴 이야기를 반드시 함께 보도록 강제합니다.
  • 비유: 학생들이 수학 문제를 풀고 있는 그룹을 상상해 보세요. 보통 그들은 서로의 답안만을 비교합니다. 하지만 이 수업에서는 선생님이 칠판에 완벽하게 풀린 예시 문제를 적어 놓습니다. 학생들은 단순히 추측하는 것이 아니라, 목표로 삼을 수 있는 "북극성"을 갖게 됩니다. 로봇이 설령 인간의 이야기를 그대로 베끼지는 않더라도, 그 고품질의 예시를 보는 것만으로도 로봇의 "야망"을 높게 유지하고 낮은 품질의 글에 안주하는 것을 방지합니다.

결과: "작지만" 강력한 한 방을 날리는 모델

저자들은 표준 90억 파라미터 모델(Qwen3.5-9B)을 가져와 이 방법을 사용하여 약 1,400개의 단편 소설로 훈련시켰습니다.

  • 놀라운 점: 이 로봇은 단 4,000단어 길이의 이야기까지만 학습했음에도 불구하고, 품질을 잃지 않고 최대 12,000단어(3배 더 긴 길이!)까지 쓰는 법을 배웠습니다!
  • 비교:
    • 기본 모델 대비: 훈련되지 않은 버전보다 훨씬 뛰어납니다.
    • 거대 모델 대비: 자신보다 3배나 더 크고(270억 파라미터) 훨씬 비싼 모델들과 거의 대등한 성능을 보여줍니다.
    • "스트레스 테스트": 대부분의 소형 모델은 긴 이야기를 쓰라고 하면 무너집니다. 하지만 POLARIS는 유일하게 강한 모습을 보이며, 이야기의 일관성을 유지하고 요청된 길이를 실제로 완수해 냈습니다.

이것이 왜 중요한가

이 논문은 "길이 일반화(Length Generalization, 학습한 것보다 더 길게 쓰는 능력)"가 아주 훌륭한 스트레스 테스트라고 주장합니다.

  • 비유: 러너에게 1마일 경주를 훈련시키면, 2마일 지점에서 지칠 수도 있습니다. 하지만 만약 그가 멈추지 않고 3마일을 달릴 수 있다면, 그것은 그가 단순히 짧은 스피드를 가진 것이 아니라 진정한 지구력을 갖추었음을 증명하는 것입니다.
  • POLARIS는 적절한 "코칭"(엄격한 편집자와 인간의 닻)이 있다면, 작은 모델도 거대 모델의 지구력을 가질 수 있다는 것을 증명했습니다.

요약

POLARIS는 소형 AI 모델이 길고 창의적인 이야기를 쓸 수 있도록 가르치는 영리하고 저렴한 훈련 방법입니다. 그 방법은 다음과 같습니다:

  1. 스마트한 AI 편집자로부터 상세하고 구체적인 피드백을 받습니다.
  2. 높은 목표를 유지할 수 있도록 고품질의 인간 예시를 보여줍니다.

그 결과, 적절한 코칭을 통해 작은 모델이 거대하고 비싼 모델만큼 긴 이야기를 쓸 수 있게 되었으며, 이를 실행하기 위해 슈퍼컴퓨터가 필요하지도 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →