← 최신 논문
💻 computer science

STAGE: Controlled Objective Admission for Multi-Preference LLM Alignment

이 논문은 보상 편차 게이트(reward-deviation gates)와 적응형 프로빙(adaptive probing)을 기반으로 목적 함수를 유지함으로써 정적 스칼라화(static scalarization) 방식보다 우수한 성능을 입증하며, LLM 정렬 과정에서 다중 선호도 목적 함수의 수용 시점과 가중치를 동적으로 관리하는 안정성 유도형 액티브 세트 컨트롤러인 STAGE를 소개한다.

원저자: Yongqi Tong, Zhenyu Zhang, Ruirui Wang, Kewei Fu, Shaoqing Lin, Sijie Dong, Jiang-Ming Yang, Xin Zhang, Jianshe Li

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yongqi Tong, Zhenyu Zhang, Ruirui Wang, Kewei Fu, Shaoqing Lin, Sijie Dong, Jiang-Ming Yang, Xin Zhang, Jianshe Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 '얼라인먼트(alignment, 정렬)'라고 알려진 점점 커지는 과제가 있습니다. 우리가 대규모 언어 모델에게 유용하도록 가르칠 때, 한 가지를 더 잘하게 만들면 의도치 않게 다른 기능이 나빠지는 현상을 자주 발견하곤 합니다. 모델이 질문에 매우 빠르고 창의적으로 답하는 법을 배우는 대신, 사실 관계에 소홀해지거나 안전 규칙을 무시하게 될 수도 있습니다. 수년 동안 연구자들은 모델이 수행하기를 원하는 모든 것들—유용성, 안전성, 정확성, 정직성—을 하나의 점수로 결합하여 이 문제를 해결하려고 노력해 왔습니다. 그들은 이 서로 다른 목표들을 마치 스무디의 재료처럼 섞은 뒤, 최종적인 맛을 최적화하도록 모델에게 요구했습니다. 하지만 이 접근 방식은 한 가지 중요한 질문을 남겨둡니다. 모델이 언제 각 특정 재료에 대해 신경 쓰기 시작해야 할까요? 처음부터 모든 것에 완벽해지려고 노력해야 할까요, 아니면 이 복잡한 요구사항들을 도입하는 더 나은 방법이 있을까요?

Ant International의 연구진은 이 질문에 답하기 위해 STAGE라고 불리는 새로운 방법을 제안했습니다. 모델에게 15가지의 서로 다른 목표를 한꺼번에 다루도록 강요하는 대신, 그들은 모델이 준비되었을 때만 하나씩 목표를 도입하는 시스템을 설계했습니다. 악기를 배우는 학생을 상상해 보십시오. 첫날부터 복잡한 교향곡을 건네준다면 그 학생은 아마 실패할 것입니다. 만약 간단한 음계부터 시작하여 현재의 곡을 마스터했을 때 비로소 다음 단계의 더 어려운 곡으로 넘어간다면, 학생은 훨씬 더 잘 발전할 수 있습니다. STAGE는 이러한 '타이밍'의 원리에 따라 작동합니다. 이는 모델의 현재 목표 수행 능력을 관찰하는 컨트롤러 역할을 합니다. STAGE는 모델의 행동이 현재 설정된 목표들에 대해 안정화되고 더 이상 격하게 요동치지 않을 때까지 기다립니다. 그러고 나서야 다음 목표를 훈련 과정에 투입하며, 이를 통해 모델이 새로운 것을 배울 때 이미 배웠던 것을 잊어버리지 않도록 보장합니다.

연구진은 윤리적 준수와 사실적 정확성부터 창의성과 수치 민감도에 이르기까지 15가지의 뚜렷한 선호도를 가진 모델을 사용하여 이 아이디어를 테스트했습니다. 그들은 STAGE 방식을 처음부터 15가지 목표를 동시에 학습하려고 시도하는 여러 다른 접근 방식들과 비교했습니다. 결과는 명확했습니다. STAGE로 훈련된 모델은 전반적으로 현저히 더 나은 성능을 보였습니다. 다양한 벤치마크에서 테스트했을 때, STAGE로 훈련된 모델은 평균 44.81점을 기록한 반면, 모든 것을 한꺼번에 배우려 했던 가장 우수한 경쟁 방법은 39.32점에 그쳤습니다. 이 격차는 연구진이 더 크고 강력한 모델에서 이 방법을 테스트했을 때 더욱 두드러졌으며, 여기서도 STAGE는 큰 차이로 앞서 나갔습니다. 이 연구는 모델이 새로운 요구사항에 노출되는 '시기'가 그 요구사항 자체만큼이나 중요하다는 점을 시사합니다.

이 발견의 핵심적인 부분은 이러한 목표들의 순서를 어떻게 정하느냐를 이해하는 것이었습니다. 연구진은 단순히 무작위 순서나 고정된 순서를 선택하지 않았습니다. 대신, 짧은 초기 테스트를 실행하여 어떤 목표가 모델이 배우기에 자연적으로 더 어려운지, 그리고 어떤 목표가 더 쉬운지를 확인했습니다. 그들은 창의성이나 추론 품질 같은 목표는 변동성이 크고 학습하기 어려운 반면, 유용성이나 윤리적 준수 같은 목표는 파악하기 쉽다는 것을 발견했습니다. STAGE는 이 정보를 사용하여 쉬운 목표부터 시작하여 점진적으로 어려운 목표를 추가하는 커리큘럼을 구축했습니다. 그러나 이 시스템은 단순히 엄격한 일정만을 따르는 것은 아니었습니다. 여기에는 '인내(patience)' 메커니즘이 포함되어 있어, 모델이 현재의 목표 세트를 필요한 만큼 계속 연습할 수 있도록 허용했습니다. 만약 모델이 새로운 목표에 대해 안정화되는 데 어려움을 겪는다면, 시스템은 다음 목표를 추가하기 전에 더 오래 기다려 모델이 압도당하는 것을 방지했습니다.

연구는 단순히 목표를 하나씩 추가하는 것만으로는 충분하지 않으며, 모델이 이전의 것들을 기억해야 한다는 점도 밝혀냈습니다. 일부 기존 방식에서는 새로운 목표가 도입될 때 모델이 이전의 목표들을 처리하는 법을 잊어버리는 '파괴적 망각(catastrophic forgetting)' 현상이 나타나곤 했습니다. STAGE는 모든 이전에 승인된 목표들을 훈련 과정 내내 활성화 상태로 유지함으로써 이 문제를 해결했습니다. 모델이 단계별로 이동함에 따라, 모델은 새로운 것을 배우는 동시에 이전의 목표들도 계속해서 최적화했습니다. 이러한 누적적 접근 방식 덕분에 모델의 지식은 과거의 진전을 지우지 않고 꾸준히 성장할 수 있었습니다. 연구진은 이 기능을 제거했을 때 성능이 무너지는 것을 발견했으며, 이는 초기 목표를 유지하는 것이 다중 목표 훈련의 성공에 필수적임을 입증했습니다.

타이밍과 유지의 메커니즘을 넘어, 연구진은 모델이 목표에 가중치를 두는 방식 또한 중요하다는 것을 발견했습니다. 단일 단계의 훈련 과정 동안, 시스템은 모델이 현재 성능이 낮은 목표에 자동으로 더 많은 주의를 기울였습니다. 만약 모델이 정확도 면에서는 잘하고 있지만 창의성 면에서 고전하고 있다면, 훈련 과정은 자연스럽게 창의성을 개선하는 데 더 많은 에너지를 집중했습니다. 이러한 적응형 가중치 부여는 새로운 목표가 도입되는 와중에도 특정 목표가 소홀히 다뤄지지 않도록 보장했습니다. 스마트한 가중치 부여, 새로운 목표를 추가하는 신중한 타이밍, 그리고 이전 목표를 절대 버리지 않는 전략의 결합은 다른 모든 테스트된 방법들을 능가하는 견고한 훈련 루프를 만들어냈습니다.

이 연구 결과는 인공지능을 어떻게 훈련시켜야 하는지에 대한 새로운 관점을 제공합니다. 오랫동안 초점은 서로 다른 보상들을 하나의 숫자로 어떻게 결합할 것인가에 맞춰져 왔습니다. 하지만 이 논문은 그보다 더 중요한 질문은 그 보상들을 '언제' 도입하느냐라는 점을 시사합니다. 새로운 목표의 도입을 모델 자체의 안정성에 의해 유도되는 통제된 과정으로 다룸으로써, 연구자들은 더 똑똑할 뿐만 아니라 더 신뢰할 수 있는 시스템을 구축할 수 있습니다. 이 연구가 인공지능 얼라인먼트의 모든 문제를 해결했다고 주장하는 것은 아니지만, 학습의 속도를 관리하는 것이 어떻게 더 나은 결과로 이어질 수 있는지에 대한 구체적이고 실질적인 사례를 제공합니다. 모델들이 너무 많은 것을 너무 빨리 수행하도록 요구받는 분야에서, STAGE는 때때로 모든 것을 배우는 가장 좋은 방법은 한 번에 한 단계씩 나아가는 것임을 증명하며, 더 조용하고 신중한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →