← 최신 논문
💬 NLP

Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models

본 논문은 확산 언어 모델의 분류기 없는 안내 스케일을 고정된 하이퍼파라미터가 아닌 동적이고 학습 가능한 제어 동작으로 간주하는 강화 학습 프레임워크를 제안하며, 다양한 NLP 작업에서 적응형 안내 궤적이 제어 가능성과 생성 품질 간의 균형을 크게 개선함을 보여줍니다.

원저자: Fan Zhou, Tim Van de Cruys

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fan Zhou, Tim Van de Cruys

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

연극을 연출한다고 상상해 보세요. 배우들 (AI) 이 대본을 한 줄씩 외우려고 노력하는 상황입니다. 그들은 물음표로 가득 찬 빈 페이지로 시작해, 한 걸음씩 나아가며 몇 단어를 더 채워 넣다가 마침내 문장 전체를 완성합니다.

AI 텍스트 생성 세계에는 클래식프리 가이던스 (Classifier-Free Guidance, CFG) 라는 인기 도구가 있습니다. CFG 를 연출가의 확성기로 생각하세요. 연출가가 "키워드에 집중해!" 또는 "슬픈 톤으로 만들어!"라고 외치면, 그 확성기는 배우들이 그 지시를 주시하도록 하기 위해 지시를 증폭시킵니다.

문제: "일률적"인 확성기
지금까지 연출가들은 이 확성기를 고정된 볼륨 조절 노브처럼 취급해 왔습니다. 그들은 "좋아, 이 연극 내내 볼륨을 10 점 만점에 7 점으로 설정하자"라고 결정하고는 다시는 건드리지 않았습니다.

이 논문의 저자들은 이것이 나쁜 아이디어라고 주장합니다. 실제 연극과 마찬가지로, 이야기가 진행됨에 따라 요구사항은 변합니다:

  • 연극 초반: 배우들이 기본 구조를 올바르게 잡도록 확성기를 크게 켜야 합니다 (예: "배로 시작해", "이 10 개의 단어를 포함해").
  • 연극 후반: 만약 확성기를 최대 볼륨으로 유지하면 배우들이 너무 스트레스를 받아 소리를 지르고 대화의 흐름을 망칠 수 있습니다. 이야기가 숨을 쉬고 자연스럽게 들리도록 볼륨을 낮춰야 합니다.

초반부터 끝까지 같은 볼륨 수준을 유지하는 것은 트레이드오프를 강요합니다. 규칙을 따르지만 로봇처럼 들리거나, 자연스럽지만 규칙을 무시하는 것 중 하나를 선택해야 합니다.

해결책: 학습하는 스마트 연출가
이 논문은 새로운 접근법을 제안합니다: 확성기 볼륨을 고정된 설정으로 취급하지 말고, 학습해야 할 기술로 취급하세요.

볼륨을 인간이 수동으로 결정하는 대신, 저자들은 강화 학습 (Reinforcement Learning) 이라는 방법을 사용하여 AI 조연출가를 훈련시켰습니다 (간식과 함께 개를 훈련시키는 것으로 생각하세요).

  1. 게임: 조연출가는 연극이 한 걸음씩 펼쳐지는 것을 지켜봅니다.
  2. 행동: 각 단계에서 조연출가는 크게 외칠지 (높은 가이던스), 속삭일지 (낮은 가이던스) 를 결정합니다.
  3. 보상: 연극이 끝날 때, 조연출가는 두 가지 기준에 따라 "간식" (점수) 을 받습니다: 배우들이 규칙을 따랐는가? 그리고 연극이 잘 들리는가?
  4. 학습: 수많은 리허설을 통해 조연출가는 볼륨을 조절하는 구체적인 "대본"을 학습합니다. "키워드" 연극의 경우 초반에 크게 외치고 후반에 속삭여야 한다는 것을 배우고, "감정" 연극 (텍스트를 슬프거나 기쁘게 만들기) 의 경우 분위기를 잡기 위해 초반에 크게 외친 뒤 즉시 소리를 줄여야 한다는 것을 배웁니다.

그들이 발견한 것
연구자들은 세 가지 다른 유형의 "연극"에 대해 이를 테스트했습니다:

  1. 키워드 생성: 10 개의 특정 단어를 반드시 포함해야 하는 문장을 작성합니다.
  2. 길이 제어: 문장을 원래 길이의 40~80% 로 짧게 다시 씁니다.
  3. 감정 전환: 의미를 잃지 않고 행복한 문장을 슬픈 문장으로 (또는 그 반대로) 바꿉니다.

결과:

  • 구식 방법 (고정 볼륨): AI 는 규칙을 제대로 따르지 못하거나 소리가 끔찍하게 들렸습니다.
  • 신식 방법 (학습하는 연출가): AI 는 모든 작업에 대한 "적정 지점"을 찾았습니다. 구조가 구축될 때는 엄격하게, 디테일이 다듬어질 때는 부드럽게 행동하는 법을 배웠습니다.
    • 키워드와 길이의 경우, AI 는 크게 시작해서 점점 조용해지는 ("언덕" 모양) 방식을 학습했습니다.
    • 감정의 경우, 감정을 확실히 잡기 위해 매우 크게 시작한 뒤 즉시 조용해지는 방식을 학습했습니다.

핵심 결론
이 논문은 AI 텍스트 생성을 위한 "볼륨 노브"가 시작하기 전에 선택하는 고정된 숫자가 되어서는 안 된다고 증명합니다. 텍스트가 쓰이는 동안 변하는 동적 도구여야 합니다. AI 에게 언제 엄격해야 하고 언제 유연해야 하는지 학습시킴으로써, 지시를 따르면서도 읽기에 자연스러운 텍스트를 달성했습니다.

간단히 말해: 그들은 AI 의 제어 설정을 한 번 설정하고 잊어버리는 온도계처럼 취급하는 것을 멈추고, 음악이 완벽하게 들리도록 실시간으로 오케스트라의 볼륨을 조절하는 지휘자처럼 취급하기 시작했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →