← 최신 논문
🤖 machine learning

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

이 논문은 먼저 인간이 작성한 솔루션에 고전적인 인스트럭션 튜닝을 적용한 다음, 그 결과물인 모델을 기존의 추론 모델과 병합하여 도메인 특화 추론 능력을 회복시킴으로써, 검증 가능한 영역과 검증 불가능한 영역 모두에서 추론 언어 모델을 향상시키는 비용 효율적인 방법을 제안한다.

원저자: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 한 종류의 새로운 퍼즐을 풀 수 있도록 똑똑하고 생각이 너무 많은 학생을 가르치려 한다고 상상해 보세요. 이 학생은 "추론 언어 모델(Reasoning Language Model)"이라는 특별한 종류의 컴퓨터 프로그램으로, 자신의 풀이 과정을 보여주도록 훈련되었습니다. 이 학생은 수학 문제나 코딩 과제를 해결하기 전, 마치 미스터리를 해결하는 탐정처럼 길고 단계적인 사고 과정을 글로 써 내려갑니다. 이렇게 "생각을 소리 내어 말하는" 습관이 이 모델을 까다로운 작업에 능숙하게 만드는 비결입니다.

하지만 여기에는 함정이 있습니다. 보통 이 학생에게 새로운 기술을 가르치려면, 정답이 맞는지 즉시 확인할 수 있는 방법(수학 정답지 같은 것)이나 올바르게 생각하는 법을 보여줄 아주 똑똑한 선생님이 필요합니다. 하지만 재미있는 이야기 요약이나, 테스트가 없는 특정 컴퓨터 프로그램의 버그를 수정하는 일처럼 정답지가 없는 것을 가르치고 싶다면 어떻게 될까요? 인간이 작성한 '정답' 예시는 아주 많지만, 그 정답에는 '사고 과정'이 적혀 있지 않습니다. 만약 당신이 이 모델에게 사고 과정 없이 단순히 정답만을 암기하도록 강요한다면, 모델은 특정 퍼즐에 대한 정답은 맞힐 수 있겠지만, 일반적인 사고 방식은 잊어버리게 될 것입니다. 모델은 문제를 해결하는 탐정이 되는 대신, 답만 반복하는 앵무새가 되어버릴 것입니다.

이것이 바로 ETH 취리히의 연구진이 새로운 논문에서 다룬 퍼즐입니다. 그들은 이 "사고하는" 모델들이 일반적인 사고 능력을 잃지 않으면서도 새로운 기술을 배울 수 있도록 하는 영리한 2단계 트릭을 발견했습니다. 먼저, 모델이 단순한 "정답 위주의" 예시로부터 학습하도록 합니다. 이는 마치 시험 공부를 위해 벼락치기를 하는 학생과 같습니다. 이 과정은 모델이 특정 작업에는 더 능숙해지게 만들지만, 자신의 풀이 과정을 보여주는 습관을 잃게 만듭니다. 그다음, 그들은 마법 같은 "병합(merge)"을 수행합니다. 그들은 이렇게 새로 훈련된 모델을 원래의 똑똑하게 사고하던 모델과 다시 혼합합니다. 이것은 갓 추출한 특정 작업용 커피 한 잔과 원래의 진한 에스프레소 한 잔을 섞는 것과 같습니다. 이 혼합 비율을 세심하게 조절함으로써, 그들은 모델이 새로운 기술을 유지하면서도 문제를 추론하는 능력을 다시 기억해 낼 수 있는 "최적의 지점(sweet spot)"을 찾아냈습니다.

연구진은 이 방법을 네 가지 서로 다른 스마트 모델과 두 가지 매우 다른 작업, 즉 Rust 프로그래밍 언어로 코드를 작성하는 것과 긴 뉴스 기사를 요약하는 것에 테스트했습니다. 그 결과, 그들의 방법이 놀라운 효과를 거두었다는 것을 발견했습니다. 모델은 특정 작업에서 훨씬 더 나은 성능을 보였으며(코딩 점수는 최대 12점 향상되었고 요약 점수는 약간 향상됨), 일반적인 훈련 시 보통 파괴되어 버리는 추론 능력을 거의 완벽하게 회복했습니다. 더욱이, 이 모든 과정은 믿을 수 없을 정도로 저렴하고 빨랐습니다. 연구진은 동일한 문제를 해결하려는 다른 방법들이 훨씬 더 많은 비용과 시간을 소요하는 반면, 자신들의 방법으로는 1시간 미만의 시간 동안 3달러 미만의 비용으로 모델을 적응시킬 수 있다고 계산했습니다.

요약하자면, 이 논문은 이러한 추론 모델을 업그레이드하기 위해 매우 비싼 "정답 확인" 시스템이나 천재적인 선생님이 필요하지 않다는 점을 시사합니다. 이미 존재하는 방대한 양의 단순한 "질문-답변" 데이터를 사용하고, 약간의 수학적 혼합을 더하면, 모델의 뇌를 망가뜨리지 않고도 새로운 기술을 부여할 수 있습니다. 이는 명확한 해결책이 없는 미스터리를 해결하는 법을 배울 때조차 우리의 AI 탐정들을 예리하게 유지할 수 있는, 저비용 고효율의 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →