← 최신 논문
💬 NLP

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

본 논문은 검색 증강 생성 환경의 소규모 언어 모델을 위해, 자체 생성된 합성 데이터를 활용하고 여러 선호도 쌍을 효과적으로 활용하기 위해 미분 가능한 소프트 집계 메커니즘을 사용하는 3단계 선호도 최적화 프레임워크인 RIMS를 제안하며, 이를 통해 노이즈가 있는 검색 조건에서 최신 베이스라인 모델들을 효과적으로 능가한다.

원저자: Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 아주 똑똑하지만 아주 작은 로봇에게 까다로운 질문에 답하는 법을 가르치려 한다고 상상해 보세요. 이 로봇은 "소규모 언어 모델(SLM)"입니다. 마치 몇 권의 책을 읽었지만 도서관 전체를 암기하지는 못한, 명석한 고등학생과 같습니다. 당신이 어려운 질문을 던지면, 로봇은 긴장해서 엉뚱한 말을 지어낼 수도 있습니다. 이를 돕기 위해, 당신은 인터넷 검색 결과라는 "컨닝 페이퍼"를 제공하는데, 이 기술을 "검색 증강 생성(RAG)"이라고 부릅니다.

하지만 문제가 하나 있습니다. 인터넷은 엉망진창일 수 있습니다. 당신의 컨닝 페이퍼에는 사실, 혼란스러운 소문, 혹은 노골적인 거짓말이 뒤섞여 있을 수 있습니다. 크고 강력한 로봇(대규모 언어 모델)이라면 거짓말을 찾아내고 무시할 수 있겠지만, 우리의 작은 로봇은 어떨까요? 이 로봇은 종종 소음에 혼란을 느껴 잘못된 정보를 믿고 틀린 답을 내놓곤 합니다. 과학자들은 로봇에게 여러 가지 답 중에서 하나를 선택하도록 가르치는 "선호도 최적화(preference optimization)"라는 방법으로 이를 해결하려 노력해 왔습니다. 하지만 기존의 교육 방식은 로봇이 저지른 단 하나의 최악의 실수만을 보고 나머지는 무시하는 엄격한 코치와 같았습니다. 다른 단서들을 무시하는 것이 오히려 로봇을 더 혼란스럽게 만든다는 사실이 밝혀졌습니다.

이 논문은 RIMS(Retrieval-Augmented Generation via Smoothed Multi-pair Aggregation)라고 불리는 새로운 훈련 방법을 소개합니다. RIMS는 단 하나의 "최악의 사례"만을 골라 고치라고 지시하는 엄격한 코치 대신, 로봇이 생성한 모든 사례를 살펴보는 현명한 멘토처럼 행동합니다. RIMS는 좋은 단서와 나쁜 단서를 부드럽게 섞어 하나의 매끄러운 교훈으로 만듭니다. 이는 작은 로봇이 정보가 엉망인 상황에서도 컨닝 페이퍼 속의 소음을 훨씬 더 잘 식별할 수 있도록 돕습니다. 연구진은 이 방법을 네 가지의 까다로운 질의응답 게임에 테스트했으며, 그 결과 RIMS가 기존의 엄격한 방식들보다 훨씬 더 많은 정답을 맞히는 데 도움을 준다는 것을 발견했습니다.

문제점: 작은 로봇과 시끄러운 도서관

이야기를 자세히 들여다봅시다. 우리는 작고 효율적인 AI 모델(SLM)을 가지고 있습니다. 이들은 엄청난 전력을 필요로 하지 않기 때문에 휴대폰이나 작은 컴퓨터에서 실행하기에 좋습니다. 하지만 이들의 "두뇌 용량"은 작습니다. 거대 모델만큼 많은 것을 알지는 못하죠. 이를 해결하기 위해, 우리는 이들을 검색 엔진(RAG)에 연결하여 사실을 찾아볼 수 있게 합니다.

문제는 검색 엔진이 완벽하지 않다는 것입니다. 때때로 검색 엔진은 전혀 관련이 없거나 심지어 모순되는 문서들을 가져오기도 합니다. 작은 AI가 진실과 온갖 헛소리가 뒤섞인 문서 더미를 읽으려고 할 때, AI는 종종 압도당합니다. 잘못된 사실을 붙잡고 그것을 진실인 양 자신 있게 말해버릴 수도 있습니다.

기존 방식: "가장 힘든 실수"를 찾는 코치

이 AI들을 더 잘 가르치기 위해, 연구자들은 선호도 최적화라는 기술을 사용합니다. 질문에 대해 열 가지 서로 다른 답변을 보여준다고 상상해 보세요. 어떤 것은 좋고, 어떤 것은 나쁩니다. 목표는 AI가 좋은 것을 선호하고 나쁜 것을 거부하도록 가르치는 것입니다.

이전에 인기 있었던 방식(RoseRAG라고 불림)은 매우 엄격한 코치처럼 행동했습니다. AI가 열 개의 답변을 생성하면, 코치는 그것들을 보고 이렇게 말합니다. "좋아, 정말 나쁜 답변 하나와 정말 좋은 답변 하나가 보이네. 나머지 여덟 개는 무시하겠어. 우리는 이 단 하나의 '최선'과 '최악'의 쌍만 가지고 훈련할 거야."

이 논문은 이것이 정보의 낭비라고 주장합니다. 여덟 개의 답변을 버림으로써, 코치는 왜 다른 답변들이 더 좋았는지 혹은 나빴는지에 대한 귀중한 단서들을 무시하게 됩니다. 이는 학생이 시험을 보고 문제를 틀렸을 때, 선생님이 그 특정 실수 하나만 바로잡아 줄 뿐, 학생이 다른 세 문제도 약간 틀렸다는 사실은 무시하는 것과 같습니다. 학생은 큰 그림을 놓치게 됩니다.

새로운 방식: RIMS와 "매끄러운 혼합"

저자들은 RIMS를 제안하며, 이는 코칭 스타일을 완전히 바꿉니다. 단 하나의 "승자"와 "패자"를 고르는 대신, RIMS는 AI가 생성한 모든 답변을 살펴봅니다.

여기 마법 같은 기술이 있습니다. RIMS는 LogSumExp(LSE)라는 수학적 도구를 사용하여 "매끄러운 혼합(smooth blend)"을 만듭니다. 열 가지 재료(열 개의 답변)가 들어있는 국사발을 상상해 보세요. 기존 방식은 가장 짠 한 숟가락과 가장 싱거운 한 숟가락만 떠서 나머지는 버리는 방식입니다. 하지만 RIMS는 국사발 전체를 가져와서 완벽하고 균형 잡힌 맛이 나도록 모두 섞어버립니다.

이 "매끄러운" 혼합물은 모든 답변으로부터 신호를 담고 있는 하나의 통합된 교훈을 만들어냅니다. 쉬운 문제나 어려운 문제를 가리지 않고 모두 함께 무게를 둡니다. 이것을 "미분 가능한 소프트 집계(differentiable soft aggregation)"라고 합니다. "미분 가능하다"는 것은 수학적으로 AI가 이 혼합물을 통해 매끄럽게 학습할 수 있다는 뜻이며, "소프트하다"는 것은 어떤 답변에 집중할지에 대해 극단적이고 냉혹한 결정을 내리지 않는다는 뜻입니다.

연구 결과

연구진은 네 가지 "멀티홉(multi-hop)" 질의응답 벤치마크에서 RIMS를 테스트했습니다. 이 게임들은 정답을 얻기 위해 여러 조각의 정보를 연결해야 하는 퀴즈 게임과 같으며, 검색 결과에는 종종 방해 요소들이 가득합니다. 연구진은 두 가지 서로 다른 소규모 AI 모델(Qwen2.5-1.5B 및 Gemma-2-2b)을 대상으로 테스트를 진행했습니다.

결과는 명확했습니다:

  • 더 높은 점수: RIMS는 정확한 정답을 맞히는 능력(Exact Match)과 올바른 단어를 일치시키는 능력(F1 score) 모두에서 기존의 최고 방식들(예: RoseRAG)을 지속적으로 앞질렀습니다.
  • 노이즈 처리 능력: 연구진이 검색 결과에 "노이즈"(관련 없는 문서)를 점점 더 많이 추가했을 때, 기존 방식들은 무너지기 시작했습니다. 그러나 RIMS는 성능을 잘 유지했습니다. 이는 RIMS가 지저한 정보에 대해 훨씬 더 견고하다는 것을 입증했습니다.
  • 이론적 증명: 저자들은 단순히 이 방식이 작동할 것이라고 추측한 것이 아니라, 수학적으로 증명했습니다. 그들은 이 "매끄러운" 방식이 학습 과정에서의 "분산(variance, 즉 무작위성)"을 줄여준다는 것을 증명했습니다. 간단히 말해, 기존 방식이 직선을 그리려다 손이 떨리는 상태라면, RIMS는 안정적인 손과 같습니다. 또한, 그들의 매끄러운 방식에서 발생하는 "오차"를 통제하고 매우 작게 유지할 수 있다는 것도 보여주었습니다.

이것이 중요한 이유

이 논문은 작고 효율적인 AI 모델을 위해 데이터를 버려서는 안 된다는 점을 시사합니다. AI가 일련의 답변을 생성할 때마다, 그 각각의 답변에는 단서가 들어있습니다. 이 모든 단서를 "매끄러운" 방식으로 결합함으로써, 우리는 정보가 엉망인 상황에서도 이 작은 로봇들이 훨씬 더 똑똑하고 신뢰할 수 있게 만들 수 있습니다. 이는 슈퍼컴퓨터 없이도 일상적인 기기에서 강력한 AI를 사용할 수 있게 만드는 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →