← 최신 논문
💬 NLP

MOSAIC: Masked Objective with Selective Adaptation for In-domain Contrastive Learning

이 논문은 마스크드 언어 모델링(masked language modeling)과 대조 학습(contrastive objectives)을 공동으로 최적화함으로써 일반 도메인 텍스트 임베딩 모델을 특화된 도메인에 효과적으로 적응시키고, 고자원 및 저자원 설정 모두에서 NDCG@10의 상당한 성능 향상을 달성하는 다단계 프레임워크인 MOSAIC를 소개한다.

원저자: Vera Pavlova, Mohammed Makhlouf

게시일 2026-01-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vera Pavlova, Mohammed Makhlouf

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 역사, 공상과학, 요리, 스포츠 등 모든 장르의 책을 수백만 권 읽은 아주 똑똑한 사서가 있다고 상상해 보세요. 이 사서는 이야기 사이의 일반적인 연결 고리를 찾는 데 매우 능숙합니다. 하지만 만약 당신이 그에게 꾸란의 특정 구절을 찾아달라고 하거나 복잡한 의학 연구 논문을 설명해 달라고 요청한다면, 그는 어려움을 겪을 수도 있습니다. 그는 문장의 구조는 알지만, 이러한 특정 분야의 전문 용어나 깊은 문화적 뉘의(nuance)는 알지 못하기 때문입니다.

이 논문은 이 사서(AI 모델)가 일반적인 지능을 잃지 않으면서도 특정 분야의 전문가가 될 수 있도록 훈련하는 새로운 방법인 MOSAIC를 소개합니다.

MOSAIC가 어떻게 작동하는지, 간단한 단계별로 설명해 드리겠습니다.

문제점: "제너럴리스트(일반론자)"의 함정

오늘날 대부분의 AI 모델은 "제너럴리스트"입니다. 이들은 방대한 양의 인터넷 텍스트로 학습되었습니다.

  • 문제점: 만약 당신이 일반적인 사서에게 의학 서적만을 주어 의학을 가르치려 한다면, 그는 일반적인 대화를 하는 법을 잊어버리거나 새로운 단어들 때문에 혼란에 빠질 수 있습니다.
  • 기존 방식: 이전의 방법들은 모델에게 오직 새로운 단어들만 가르치거나(이 경우 문장을 이해하는 능력이 떨어짐), 혹은 오직 문장 간의 연결만을 가르치는(이 경우 새로운 단어를 배우는 데 도움이 되지 않음) 방식 중 하나를 택했습니다. 이는 마치 레이싱 카를 운전하는 법을 가르치면서 엔진만 보여주거나, 아니면 핸들만 보여주는 것과 같아서, 두 가지를 동시에 보여주지는 못했습니다.

해결책: MOSAIC 레시피

저자들은 MOSIC라고 불리는 3단계 훈련 과정을 만들었습니다. 이것은 마치 신입 사원에게 특수 직무 교육을 하는 것과 같습니다.

1단계: 어휘 확장 (새로운 도구 추가)

먼저, 팀은 특정 분야(예: 생물 의학 또는 이슬람 텍스트)를 살펴보고 일반적인 사서가 모르는 독특한 단어들을 모두 찾아냅니다.

  • 비유: 사서의 사전이 50,000개의 단어로 이루어져 있다고 가정해 봅시다. 팀은 여기에 9,000개의 새로운 전문 용어(예: "myocardial infarction" 또는 특정 꾸란 용어)를 추가합니다.
  • 비결: 기존의 사전을 버리는 것이 아니라, 단순히 확장하는 것입니다. 이는 전체 도서관을 다시 구축할 필요가 없는 저렴하고 쉬운 단계입니다.

2단계: "선택적" 훈련 (비법 소스)

이 부분이 가장 중요한 부분입니다. 팀은 두 가지 유형의 레슨을 동시에 사용하여 사서를 훈련시킵니다.

  1. "빈칸 채우기" 레슨 (MLM): 모델은 문장에서 빠진 단어를 보고 그것을 추측해야 합니다.
  2. "짝 맞추기" 레슨 (Contrastive): 모델은 어떤 두 문장이 서로 어울리는지, 혹은 그렇지 않은지를 판별해야 합니다.

혁신 요소: 과거에는 이 두 가지 레슨을 동시에 수행하는 것이 재앙에 가까웠습니다. "빈칸 채우기" 레슨이 너무 시끄러워서 "짝 맞추기" 레슨을 압도해 버렸기 때문입니다.

  • MOSAIC의 해결책: 팀은 모델에게 이렇게 말합니다. "'빈칸 채우기' 레슨을 할 때는, 방금 배운 새로운 전문 용어들 추측해라."
  • 비유: 선생님이 학생의 공부를 도와주는 상황을 상상해 보세요. 선생님이 학생에게 책에 있는 모든 단어를 정의하라고 요구하는 대신(이는 너무 오래 걸리고 학생을 혼란스럽게 합니다), "이 50개의 어렵고 새로운 단어들에만 집중해라"라고 말하는 것과 같습니다. 이를 통해 학생은 전체적인 이야기를 이해하는 능력을 망가뜨리지 않으면서도 새로운 자료에 집중할 수 있습니다.

3단계: "미세 조정" (기술 연마)

모델이 새로운 단어와 그 단어들이 문장 속에서 어떻게 어울리는지를 배운 후, 팀은 "빈칸 채우기" 레슨을 완전히 중단합니다.

  • 비유: 이제 사서가 새로운 어휘를 익혔으므로, 다시 "짝 맞추기" 연습에만 집중하게 합니다. 이는 모델이 검색 엔진으로서 가장 중요한 기술인, 문장 사이의 올바른 연결 고리를 찾는 능력을 탁월하게 유지하도록 보장합니다.

결과: 효과가 있는가?

팀은 이 방법을 매우 다른 두 세계에서 테스트했습니다.

  1. 생물 의학 (고자원 분야): 데이터가 엄청나게 많은 분야(수백만 건의 의학 논문).
  2. 이슬람 텍스트 (저자원 분야): 영어 데이터가 매우 적은 분야.

결과:

  • 두 경우 모두, MOSAIC로 훈련된 모델은 원래의 제너럴리스트 모델보다 관련 정보를 훨씬 더 잘 찾아냈습니다.
  • 의학 분야에서는 강력한 경쟁 모델들과 비교했을 때 정확도가 최대 13.4% 향상되었습니다.
  • 데이터가 부족한 이슬람 분야에서도 모델은 훨씬 더 신뢰할 수 있었습니다. 다른 모델들과 비교했을 때, 관련 정보를 전혀 찾지 못하는 "제로(zero)" 오류가 훨씬 적었습니다.

이것이 왜 중요한가

이 논문은 이 방법이 단순하고, 저렴하며, 효과적이라고 주장합니다.

  • 모델 전체를 처음부터 다시 훈련시키기 위해 거대한 슈퍼컴퓨터를 필요로 하지 않습니다.
  • 복잡한 구조적 변경을 요구하지 않습니다.
  • 단순히 새로운 단어를 추가하고, 모델이 일반적인 기술을 잊지 않으면서도 그 단어들을 사용하는 법을 가르치기 위한 스마트한 훈련 일정을 사용합니다.

요약하자면, MOSAIC는 똑똑한 일반 AI를 데려와 특정 분야의 전문 학위를 수여하여, 혼란에 빠진 초보자가 아닌 진정한 전문가로 만드는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →