← 최신 논문
💬 NLP

CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations

이 논문은 온-폴리시 데이터를 활용한다는 전제 하에 언어별 선호도 주석이 필요 없이 영어로 훈련된 보상 모델을 사용하여 자기 생성 응답으로 교차 언어적 대비 선호도 튜닝을 수행하는 CroCo 라는 방법을 소개하며, 이는 다양한 작업에서 다국어 LLM 성능을 효과적으로 향상시킨다고 보여줍니다.

원저자: Mike Zhang, Ali Basirat, Desmond Elliott

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mike Zhang, Ali Basirat, Desmond Elliott

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "CROCO: 자기 생성물을 활용한 교차 언어적 선호도 조정"이라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어낸 것입니다.

핵심 아이디어: 다국어 비평가 없이 다국어 요리사를 가르치는 법

여러 언어를 구사하는 재능 있는 요리사 (AI 모델) 가 있지만, 실제로 인간이 좋아하는 더 맛있는 요리를 배워야 한다고 상상해 보세요. 보통 요리사를 가르치려면 요리사와 같은 언어를 구사하는 미식 비평가 (리뷰어) 가 요리를 맛보고 "이건 훌륭하고, 저건 형편없다"라고 말해줘야 합니다.

문제:
AI 세계에는 영어에 능통한 '비평가' (보상 모델) 는 풍부하지만, 덴마크어, 네덜란드어, 이탈리아어 등에 능통한 비평가는 매우 드뭅니다. 전통적으로 다국어 요리사를 개선하기 위해 연구자들은 영어 지시를 다른 언어로 번역하거나 각 언어마다 전용 비평가를 고용하려 했습니다. 이는 비용이 많이 들고 느리며, 종종 요리사가 원래 요리를 만드는 법을 잊어버리게 만드는 '치명적 망각 (catastrophic forgetting)'이라는 문제를 초래했습니다.

해결책 (CROCO):
이 논문의 저자들은 CROCO라는 현명한 단축키를 제안합니다. 모든 언어마다 비평가가 필요하지 않고, 단 한 명의 영어 구사 비평가와 **대비적 선호도 조정 (Contrastive Preference Tuning)**이라는 기법을 사용합니다.

작동 원리는 다음과 같습니다:

1. "자기 생성" 뷔페

요리사 (AI) 에게 특정 언어 (예: 덴마크어 이야기) 에 대한 레시피 하나를 단 한 가지 버전으로만 요리하라고 요청하는 대신, 64 가지 버전을 요리하도록 요청합니다.

2. "한 명의 비평가" 채점표

단 한 명의 영어 구사 비평가가 64 가지 버전을 모두 맛봅니다. 비평가의 언어가 영어라 하더라도, 일관성 있고 도움이 되는 덴마크어 이야기와 터무니없고 혼란스러운 이야기의 차이는 구별할 수 있습니다. 비평가는 각 버전에 점수를 매깁니다.

  • 핵심 통찰: 비평가가 덴마크어 이야기의 절대적인 질을 정확히 알 필요는 없습니다. 일관성만 있으면 됩니다. 이야기 A 가 90 점, 이야기 B 가 10 점을 받으면, 숫자가 완벽하지 않더라도 비평가는 A 가 B 보다 낫다는 것을 압니다.

3. "적정선" 짝짓기

이것이 마법의 트릭입니다. 연구자들은 단순히 '최고'와 '최악'의 이야기를 고르지 않습니다.

  • 최고의 이야기 (승자) 를 선택합니다.
  • 승자보다 명확히 나쁘지만 절대 최악은 아닌 보통 수준의 이야기를 선택합니다 (구체적으로는 평균 점수보다 약 2 표준 편차 낮은 것).

스포츠 코치에게 비유해 보겠습니다. 코치가 선수에게 금메달리스트의 영상과 신발 끈에 걸려 넘어지는 사람의 영상을 보여주는 대신, 금메달리스트와 몇 실수는 했지만 경기를 계속한 선수를 보여준다고 상상해 보세요. 이 '대비'는 선수가 배우기에 더 쉽습니다.

4. 교훈 (DPO)

AI 는 이 두 가지 특정 이야기를 비교하며 배웁니다: "나는 승자를 목표로 해야 하고, 보통 수준의 스타일은 피해야 한다." AI 가 두 가지 사이의 **차이 (간격)**를 배우기 때문에, 비평가의 채점 시스템이 특정 언어에 대해 약간 '틀어졌더라도' 문제가 되지 않습니다. 순위 매기기가 일관되기만 하면 AI 는 올바른 교훈을 배우게 됩니다.

발견된 결과

연구자들은 14 개 언어 (덴마크어, 네덜란드어, 프랑스어, 독일어, 이탈리아어, 스페인어, 그리고 웨일스어와 아일랜드어 같은 저자원 언어 포함) 에서 두 가지 다른 AI 모델 (작은 모델과 중간 크기 모델) 을 테스트했습니다.

  • "번역"의 함정: 영어 학습 데이터를 단순히 다른 언어로 번역하여 AI 에게 직접 가르쳤을 때 (지도 미세 조정), AI 는 혼란을 겪고 해당 언어를 잘 구사하는 법을 잊어버렸습니다. 마치 프랑스 요리사에게 번역된 이탈리아 요리책을 암기하게 강요한 것과 같아, 단어는 틀리고 원래 실력은 잊어버리게 된 것입니다.
  • CROCO 의 성공: "자기 생성 + 한 명의 비평가" 방식을 사용하면 AI 는 거의 모든 언어에서 향상되었습니다.
    • 수학 및 코딩과 같은 구조화된 작업과 창의적 글쓰기와 같은 개방형 작업 모두에서 실력이 향상되었습니다.
    • 작은 모델과 큰 모델 모두에서 작동했습니다.
    • 훈련 중에 본 적이 없는 언어에서도 작동했는데, 이는 언어 간에 전이되는 일반적인 '더 나은 요리' 기술을 배웠음을 보여줍니다.

"비법 소스" 요구 사항

이 논문은 이 방법이 작동하려면 두 가지 엄격한 규칙을 따라야만 한다고 밝혔습니다:

  1. 자신의 요리 (On-Policy Data) 를 사용해야 합니다: AI 는 64 가지 이야기를 스스로 생성해야 합니다. 다른 AI 가 생성한 이야기로 가르치면 방법이 실패합니다. 마치 요리사가 다른 사람의 실수가 아닌 자신의 실수에서 배우는 것과 같습니다.
  2. "오프라인" 접근 방식이 더 좋습니다: 모든 이야기를 채점한 후에 AI 에게 가르쳐야 합니다. AI 가 실시간으로 이야기를 생성하는 동안 가르치려 하면 (온라인), AI 는 비평가의 즉각적인 피드백에 혼란을 느껴 잘 배우지 못합니다.

결론

이 논문은 AI 를 여러 언어에서 더 잘 구사하도록 가르치기 위해 다국어 전문가 팀이 필요하지 않음을 증명합니다. 단지 일관된 영어 구사 비평가 한 명과 AI 가 자신의 언어로 '좋은' 답변과 '나쁜' 답변의 차이를 보여줄 수 있는 현명한 방법만 있으면 됩니다.

절대적인 품질이 아닌 답변 간의 상대적 차이에 초점을 맞춤으로써, AI 는 각 언어마다 전용 교사가 필요하지 않고 영어를 잊어버리지 않으면서도 덴마크어, 이탈리아어, 웨일스어 등을 더 잘 구사할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →