← 최신 논문
💬 NLP

Improving Cross-Format Robustness in Language Models with Multi-Format Training

이 논문은 데이터의 일부만을 다양한 답변 형식으로 증강하는 효율적인 "FormatMix" 전략을 통해 멀티 포맷 학습을 통합하는 것이 대규모 언어 모델의 작업 성능과 포맷 간 강건성을 모두 유의미하게 향상시킨다는 점을 입증하며, 포맷의 다양성이 단순히 추가적인 지도 학습 그 자체보다 더 중요하다는 것을 증명한다.

원저자: June M. Liu, Shaomian Zheng, He Cao, Dingnan Jin, Qing Cui, Jun Zhou

게시일 2026-06-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: June M. Liu, Shaomian Zheng, He Cao, Dingnan Jin, Qing Cui, Jun Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "퀴즈 쇼" vs "실제 대화"

매우 똑똑한 학생이 한 명 있다고 상상해 보세요. 이 학생은 객관식 시험을 아주 잘 봅니다. A, B, C, D 중 정답을 거의 매번 골라낼 수 있죠. 하지만 만약 당신이 똑같은 질문을 다른 방식으로 던진다면—예를 들어 "정답을 문장으로 쓰세요"라거나 "이 문장이 참인지 거짓인지 말하세요"라고 한다면—그 학생은 갑자기 틀려버립니다.

이것이 바로 이 논문이 다루는 문제입니다. 거대 언어 모델(LLM)은 바로 그 학생과 같습니다. 이들은 형식에 매우 민감합니다. 모델은 지식을 알고 있을지 몰라도, 그 지식은 질문이 특정 "유니폼"(예: 객관식 퀴즈)을 입고 있을 때만 꺼내 쓸 수 있습니다. 질문의 본질은 같더라도 유니폼이 바뀌면 모델은 혼란에 빠집니다.

해결책: 모델의 "교차 훈련(Cross-Training)"

연구자들은 모델이 더 유연해져서, 질문이 퀴즈든, 빈칸 채우기든, 혹은 자유로운 대화든 상관하지 않도록 가르칠 수 있는지 확인하고 싶었습니다.

그들은 **다중 형식 훈련(Multi-Format Training)**이라는 특별한 훈련법을 만들었습니다. 이것은 마치 뇌를 위한 체육관 운동과 같습니다:

  • 기존 방식 (객관식 전용): 모델은 오직 객관식 문제에 답하는 연습만 했습니다. 특정 스타일에 매우 능숙해졌지만, 다른 스타일에는 취약했습니다.
  • 새로운 방식 (다중 형식): 연구자들은 동일한 질문을 네 가지 다른 "의상"으로 다시 작성했습니다:
    1. 객관식 (MCQ): 표준 퀴즈 형태.
    2. 참/거짓 (TF): 단순한 예/아니오 문장.
    3. 빈칸 채우기 (FIB): 단어가 빠진 문장.
    4. 주관식 (OPEN): 자유로운 형식의 질문.

그런 다음, 연구자들은 모델이 이 네 가지 서로 다른 형식을 사용하여 동일한 근본 지식에 답하도록 훈련시켰습니다.

핵심 결과: 그들이 발견한 것

1. 다양성이 비결이다
연구자들은 단순히 모델에게 객관식 문제를 더 많이 주는 것은 큰 도움이 되지 않는다는 것을 발견했습니다. 그것은 마치 학생에게 퀴즈를 1,000개 더 주는 것과 같아서, 학생은 퀴즈를 더 잘하게 될 뿐 실제 대화에는 능숙해지지 않았습니다.
하지만 다른 형식들(참/거짓, 빈칸 채우기 등)을 섞어 주었을 때, 모델은 **강건(Robust)**해졌습니다. 모델은 질문이 어떻게 던져지든 상관없이 지식은 동일하다는 것을 배웠습니다. 모델은 어떤 스타일도 처리할 수 있는 "카멜레온"이 되었습니다.

2. 모든 것을 다시 쓸 필요는 없다
여러분은 "이 문제를 해결하려면 전체 훈련 라이브러리를 네 가지 형식으로 전부 다시 써야 하나요?"라고 생각할 수 있습니다. 그것은 엄청나게 크고 비용이 많이 드는 일입니다.
논문은 지름길을 찾아냈습니다: 전체 질문의 약 30%만 다시 쓰면 됩니다.

  • 10,000권의 책이 있는 도서관을 상상해 보세요. 모든 책을 네 가지 언어로 번역할 필요는 없습니다.
  • 만약 10,000권 중 3,000권(30%)만 네 가지 형식으로 모두 번역한다면, 모델은 그 패턴을 학습하여 전체 라이브러리를 번역했을 때 얻을 수 있는 이점의 거의 대부분을 얻게 됩니다.
  • 훨씬 더 좋은 방법은, 모델이 형식 전환을 가장 어려워했던 30%의 질문을 골라내는 것입니다. 이는 무작위로 선택하는 대신 학생의 가장 취약한 과목에 집중하는 튜터와 같습니다.

3. 큰 모델이 도움이 되지만, 훈련이 더 큰 도움을 준다
연구자들은 이 방법을 다양한 크기의 모델(소형 및 대형)에 대해 테스트했습니다.

  • 큰 모델은 자연적으로 소형 모델보다 조금 더 유연합니다 (마치 타고난 운동선수처럼).
  • 하지만, 큰 모델조차도 질문 형식이 바뀔 때 여전히 어려움을 겪었습니다.
  • "다중 형식 훈련"은 큰 모델을 더욱 일관성 있게 만들어 주었으며, 이는 이것이 단순히 '덩치가 커서' 얻는 것이 아니라 '가르칠 수 있는 기술'임을 증명했습니다.

요약

이 논문은 **형식의 다양성(Format Diversity)**이 AI를 신뢰할 수 있게 만드는 핵심이라고 결론짓습니다.
질문 방식이 바뀐다고 해서 당황하지 않는 AI를 원한다면, AI의 뇌 구조를 바꿀 필요가 없습니다. 훈련 과정에서 동일한 사실을 다양한 "옷"(형식)으로 보여주기만 하면 됩니다.

데이터의 아주 적은 부분에 대해서만 이러한 "교차 훈련"을 수행함으로써, 인터넷 전체를 다시 쓸 필요 없이 AI를 훨씬 더 신뢰할 수 있고 질문의 표현 방식에 덜 민감하게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →