← 최신 논문
💬 NLP

Language Chain in Alignment: Cross-Lingual Ranking Preference Optimization

본 논문은 영어 선호 지식과 계층적 순위 구조를 활용하여 다국어 대규모 언어 모델의 정렬, 지시 이행 및 지식 활용 능력을 크게 향상시키는 새로운 프레임워크인 교차 언어 순위 선호 최적화(Cross-Lingual Ranking Preference Optimization, CRPO)를 제안한다.

원저자: Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 현대 인공지능의 엔진으로서, 인간의 대화를 모방하는 방식으로 이야기를 쓰고, 문제를 해결하며, 질문에 답할 수 있는 능력을 갖추고 있습니다. 이러한 시스템이 진정으로 도움이 되기 위해서는 단순히 사람이 무엇을 묻는지 이해하는 것을 넘어, 인간의 가치와 기대에 부합하는 방식으로 응답해야 합니다. '얼라인먼트(alignment, 정렬)'라고 알려진 이 과정은 보통 모델에게 좋은 답변과 나쁜 답변의 수천 가지 사례를 보여줌으로써 모델이 도움이 되는 답변을 선호하도록 학습시키는 과정을 포함합니다. 그러나 중대한 문제가 발생했습니다. 이러한 모델들이 영어로는 규칙을 따르는 데 매우 뛰어나지만, 다른 언어로 수행할 때는 종종 실수를 한다는 점입니다. 사용자가 한국어, 인도네시아어, 또는 스와힐리어로 질문을 하면, 모델은 영어로 답하거나 문법적으로는 맞지만 무의미하거나 도움이 되지 않는 응답을 생성할 수 있습니다. 이러한 격차는 수십억 명의 사람들이 이러한 도구의 잠재력을 온전히 누리지 못하게 만들며, 고품질의 AI 지원이 주로 영어 사용자들에게만 허락된 특권이 되는 세상을 만들고 있습니다.

고려대학교 연구진은 이러한 격차를 메우기 위해 모델이 영어의 강점을 학습하고 그 지혜를 다른 언어에 적용할 수 있도록 하는 새로운 방법을 개발했습니다. '교차 언어 순위 선호 최적화(Cross-Lingual Ranking Preference Optimization, CRPO)'라고 불리는 이들의 접근 방식은 언어 학습을 일련의 고립된 레슨이 아니라 연결된 사슬로 취급합니다. 모델에게 한 언어에서 가장 좋은 답변을 고르고 다른 언어에서 또 다른 가장 좋은 답변을 고르는 법을 각각 따로 가르치는 대신, 이 방법은 이들을 하나로 묶는 구조화된 계층 구조를 만듭니다. 영어를 할 때는 수학을 잘하지만 프랑스어로는 어려움을 겪는 학생을 알고 있는 교어를 상상해 보십시오. 교사는 두 과목을 처음부터 다시 가르치기보다, 학생의 뛰어난 영어 수학 능력을 가이드로 삼아 프랑스어 개념을 이해하도록 돕습니다. 이와 유사하게, CRPO는 영어에서 무엇이 좋은 답변인지에 대한 모델의 탄탄한 이해를 활용하여 다른 언어에서의 행동을 안내함으로써, 사용된 언어와 관계없이 응 response의 품질이 높게 유지되도록 합니다.

핵심적인 혁신은 모델이 답변을 비교하도록 훈련하는 방식에 있습니다. 전통적인 방식은 대개 한 번에 두 가지 옵션, 즉 좋은 답변과 나쁜 답변만을 살펴봅니다. 이러한 이진적 접근 방식은 영어에는 잘 작동하지만, 여러 언어가 관여될 때 필요한 복잡성을 포착하는 데는 실패합니다. 새로운 방법은 네 가지 옵션을 동시에 살펴봄으로써 이 관점을 확장합니다: 대상 언어에서의 좋은 답변, 대상 언어에서의 나쁜 답변, 영어에서의 좋은 답변, 그리고 영어에서의 나쁜 답변입니다. 연구진은 모델이 대상 언어에서의 좋은 답변을 가장 가치 있게 여기고, 그다음으로 영어에서의 좋은 답변, 그다음으로 대상 언어에서의 나쁜 답변, 마지막으로 영어에서의 나쁜 답변을 따르도록 하는 특정 순위 시스템을 설계했습니다. 이 구조는 모델에게 올바른 언어로 말하는 것도 중요하지만, 콘텐츠의 품질이 훨씬 더 중요하다는 점을 깨닫게 합니다. 모델은 고품질의 영어 응답이 저품질의 대상 언어 응답보다 여전히 더 낫다는 것을 배우지만, 궁극적인 목표는 대상 언어로 고품질의 응답을 생성하는 것임을 배웁니다.

이 아이디어를 테스트하기 위해 연구진은 이 방법을 세 가지 대규모 언어 모델에 적용하고, 가용 데이터 수준이 다양한 다섯 가지 언어(중국어, 인도네시아어, 한국어, 스와힐리어, 벵골어)에 대해 훈련시켰습니다. 그들은 이 새로운 방법을 다국어 성능을 향상시키기 위해 이전에 사용되었던 표준 기술들과 비교했습니다. 결과는 새로운 접근 방식의 명확하고 일관된 우위를 보여주었습니다. 거의 모든 테스트에서, 이 방법으로 훈련된 모델들은 대상 언어로 지시를 따르고 유용한 정보를 제공하는 데 더 뛰어났습니다. 예를 들어, 데이터가 부족하여 모델이 흔히 어려움을 겪는 스와힐리어 나 벵골어로 질문에 답하라는 요청을 받았을 때, 새로운 방법은 기존 방식보다 훨씬 더 나은 결과를 만들어냈습니다. 어떤 경우에는 개선 효과가 극적이었는데, 예를 들어 Llama-3 모델과 함께 스와힐리어를 사용하는 특정 구성에서 모델이 표준 베이스라인을 상회하는 60% 이상의 승률을 달성한 반면, 기존 방식은 대등한 성적조차 내지 못하는 경우가 많았습니다.

연구진은 또한 왜 이 방법이 이토록 잘 작동했는지에 대해 더 깊이 조사했습니다. 모델의 내부 계산을 검토함으로써, 연구진은 새로운 접근 방식이 단순히 나쁜 답변을 억제하는 것을 넘어 좋은 답변 생성을 적극적으로 장려한다는 것을 발견했습니다. 언어 문제를 해결하려는 많은 이전 시도에서 모델은 실수를 피하는 법은 배웠지만, 반드시 고품질의 콘텐츠를 생산하는 법까지 배운 것은 아니었습니다. 그러나 이 새로운 방법은 모델이 올-바른 언어에 대한 강력한 선호도를 유지하면서도 최선의 응답을 선택할 가능성을 높였습니다. 이는 모델이 어떤 언어로든 도움을 주는 콘텐츠를 자신 있게 생성할 수 있는 더 안정적이고 신뢰할 수 있는 시스템을 구축했습니다. 연구진은 또한 이 다른 언어들로 모델을 가르치는 것이 영어 성능에 해를 끼치지 않는지 확인했습니다. 그들은 모델이 영어에서도 실제로 약간 더 나은 성능을 보였다는 것을 발견했으며, 이는 이 방법이 단순히 초점을 옮기는 것이 아니라 모델의 전반적인 이해를 강화했음을 시사합니다.

이 연구는 인공지능을 진정으로 글로벌하게 만드는 데 있어 중요한 진전을 의미합니다. 한 언어에서의 지식이 다른 언어의 성능을 향상시키기 위해 효과적으로 전달될 수 있음을 보여줌으로써, 연구진은 더 포용적인 AI 시스템을 구축하기 위한 청사진을 제공했습니다. 이 연구 결과는 고품질의 다국어 AI를 가로막는 장벽이 데이터의 부족이 아니라, 적절한 훈련 전략의 부재라는 점을 시사합니다. 이 새로운 접근 방식을 통해 영어 사용자들과 나머지 세계 사이의 격차가 줄어들기 시작하며, 사용하는 언어와 관계없이 모두가 첨단 AI 지원을 받을 수 있는 미래를 제안합니다. 광범없이 널리 쓰이는 중국어부터 스와힐리어와 같은 저자원 언어에 이르기까지 다양한 언어에 걸친 이 방법의 성공은, 이 해결책이 견고하고 확장 가능하다는 것을 나타내며, 영어만큼이나 모든 언어에서 유능한 차세대 언어 모델의 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →