← 최신 논문
🤖 machine learning

Forward Pass Domain Adaptation (Without Cross-Layer Backpropagation)

이 논문은 역전파 없이 단일 출력층 오차 신호를 타겟 층에 직접 적용함으로써 표준 미세 조정과 대등한 성능을 인도메인 및 오프도메인 벤치마크 모두에서 유지하면서도, 대규모 언어 모델을 위한 도메인 적응 방법으로서 현저히 높은 처리량과 낮은 메모리 사용량을 달성하는 순방향 패스 전용(Forward-Pass-Only, FPO) 학습을 소개한다.

원저자: Rivaan Patil, Simon Dennis, Hao Guo, Kevin Shabahang

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Rivaan Patil, Simon Dennis, Hao Guo, Kevin Shabahang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 오늘날 사용 가능한 가장 진보된 인공지능 도구들의 핵심 엔진이며, 한때 기계에게는 불가능해 보였던 유창함으로 글을 쓰고, 추론하며, 문제를 해결할 수 있는 능력을 갖추고 있습니다. 이러한 모델을 의료 진단이나 법률 문서 분석과 같은 특정 작업을 위해 유용하게 만들기 위해, 연구자들은 일반적으로 이들을 "미세 조정(fine-tuning)"합니다. 이 과정은 모델에 방대한 양의 새로운 전문 데이터를 보여주고, 모델이 그 새로운 세계의 패턴을 학습하도록 내부 설정을 조정하는 과정을 포함합니다. 그러나 이러한 조정은 엄청나게 비용이 많이 듭니다. 모델을 앞으로 실행하여 답을 확인하고, 다시 뒤로 돌아가 더 나은 결과를 얻기 위해 시스템의 모든 부분을 정확히 어떻게 변경해야 하는지 파악하기 위해 강력한 컴퓨터가 필요하기 때문입니다. 이 역방향 단계는 모델을 실행하는 데 필요한 메모리의 보통 3배에 달하는 막대한 양을 요구하며, 이는 일반 소비자용 컴퓨터나 속도가 중요한 상황에서는 수행하는 것을 불가능하게 만듭니다.

캘리포니아 대학교 산타크루즈 캠퍼스와 멜버른 대학교의 연구진은 이 값비싼 역방향 단계를 완전히 건너뛸 수 있는 방법을 발견했습니다. 그들은 거대 언어 모델의 경우, 새로운 정보를 학습하는 데 필요한 가장 중요한 조정이 네트워크의 끝부분인 마지막 층들에서 주로 일어난다는 사실을 발견했습니다. 이 마지막 층들에만 집중하고 단 한 번의 순방향 패스(forward pass)에서 얻을 수 있는 정보만을 사용하여 필요한 변화를 계산함으로써, 그들은 '순방향 패스 전용 MLP 학습(Forward-Pass-Only MLP training)'이라는 새로운 훈련 방법을 만들어냈습니다. 이 접근 방식은 모델이 자신의 구조를 뒤로 훑어보지 않고도 새로운 기술을 학습할 수 있게 해주며, 메모리 요구량을 약 40% 줄이고 프로세스를 표준 방식보다 거의 3배 더 빠르게 만듭니다. 결정적으로, 이러한 속도와 효율성은 모델이 이미 알고 있던 것을 잊어버리는 일반적인 비용 없이 이루어집니다. 전통적인 방식은 새로운 전문 지식을 배울 때 모델의 일반적인 능력을 저하시키는 경우가 많지만, 이 새로운 기술은 모델의 원래 지식을 온전히 유지합니다.

이 발견의 핵심은 이러한 모델이 정보를 처리하는 방식에 대한 단순하지만 심오한 관찰에 기초합니다. 표준 훈련 세션에서 컴퓨터는 모델 출력의 맨 끝에서 오차 신호를 계산한 다음, 그 신호를 레이어별로 역방향으로 보내 네트워크 내부의 가중치를 조정합니다. 연구진은 모델의 마지막 4분의 1에 해당하는 층들에 대해, 필요한 조정의 방향이 경로를 역추적할 필요 없이 출력과 현재 모델의 상태만을 사용하여 계산할 수 있는 신호와 거의 동일하다는 것을 깨달았습니다. 그들은 이 아이디어를 30억 개에서 80억 개의 파라미터를 가진 6가지 서로 다른 공개 모델에 테스트했으며, 실제 조정의 방향이 이 더 단순한 순방향 신호와 밀접하게 일치한다는 것을 발견했습니다. 이 정렬은 유용할 만큼 강력했는데, 신호들이 대략 절반 정도의 경우에서 거의 같은 방향을 가리켰으며, 이러한 일관성은 서로 다른 모델 아키텍처 전반에 걸쳐 유지되었습니다.

이 이론을 실제 적용하기 위해, 연구진은 단일 컴퓨터 칩에서 실행하는 데 약 2분이 걸리는 빠른 진단 도구를 개발했습니다. 이 도구는 특정 모델의 각 레이어에 대해 단순한 순방향 신호가 복잡한 역방향 신호와 얼마나 잘 일치하는지를 측정합니다. 이는 연구자들에게 네트워크의 어느 부분에서 역방향 패스를 안전하게 건너뛸 수 있는지 보여주는 지도 역할을 합니다. 일단 이러한 "실행 가능한" 후기 레이어들이 식별되면, 훈련 과정은 근본적으로 변합니다. 시스템은 나중에 역전시키기 위해 모델이 거친 모든 단계를 기록하는 거대하고 복잡한 기록을 구축하는 대신, 단순히 모델을 순방향으로 실행하고, 끝에서 오차를 계산한 다음, 대상 레이어에 직접적인 수정을 적용합니다. 역방향 패스는 결코 구축되지 않으며, 계산의 이력을 저장하기 위해 메모리가 낭비되지도 않습니다. 이는 많은 사람들이 자신의 하드웨어에서 거대 모델을 미세 조정하는 것을 막아왔던 주요 병목 현상을 제거합니다.

이 방법을 세 가지 서로 다른 모델 제품군에 테스트한 결과는 놀라웠습니다. 속도 측면에서, 새로운 접근 방식은 표준 미세 조정보다 2.7배에서 3.2배 더 빨랐으며, 이를 통해 연구자들은 동일한 시간 내에 훨씬 더 많은 데이터를 처리할 수 있었습니다. 단일 고성능 그래픽 카드와 같이 메모리가 제한된 하드웨어에서, 이 방법은 표준 방식이 메모리 제한으로 인해 충돌할 수 있는 상황에서도 훨씬 더 큰 데이터 배치를 동시에 처리할 수 있게 해주었습니다. 아마도 가장 중요한 점은 이 방법이 모델의 일반 지능을 보존했다는 것입니다. 연구진이 일반 상식 질문에 답하거나 논리 퍼즐을 푸는 것과 같은 다양한 관련 없는 작업에 대해 적응된 모델을 테스트했을 때, 모델은 훈련 전과 거의 동일한 성능을 보였습니다. 반면, 표준 방식으로 훈련된 모델은 일반적인 작업에 대한 성능이 크게 떨어지는 경우가 많았는데, 이는 '파괴적 망각(catastrophic forgetting)'이라고 알려진 현상입니다. 새로운 방법은 이 함정을 피하여, 모델의 광범위한 능력을 안정적으로 유지하면서 새로운 전문 분야를 학습하게 했습니다.

연구진은 또한 왜 이러한 일반 지식의 보존이 일어나는지 탐구했습니다. 그들은 이 방법과 후기 레이어만을 업데이트하되 여전히 느린 역방향 패스를 사용하는 하이브리드 접근 방식을 비교했습니다. 그들은 일반 지식의 보존이 새로운 계산 방법 자체의 트릭이 아니라, 네트워크의 후기 레이어로 변화를 제한한 결과라는 것을 발견했습니다. 언어와 추론의 근본적인 구성 요소를 다루는 초기 레이어들은 손대지 않은 채로 두어, 모델의 핵심 이해도를 덮어쓰는 것을 방지했습니다. 그러나 새로운 방법은 이 "안전한" 영역에서 작동할 수 있는 유일한 실질적인 방법인데, 왜냐하면 표준 역방향 패스는 단 몇 개의 레이어에만 국한하여 적용할 때 너무 느리고 메모리 집약적이라서 실행이 불가능하기 때문입니다. 새로운 접근 방식은 학습이 효율적이고 망각이 최소화되는 이 영역에서 작동하는 것을 가능하게 합니다.

이 방법은 매우 효과적이지만, 한계도 존재합니다. 이 기술로 훈련된 모델은 전체의 느린 방식을 사용한 모델만큼 새로운 도메인을 깊이 있게 학습하지는 못했습니다. 즉, 가르친 특정 작업에 대해 약간 낮은 개선도를 보였습니다. 이것이 트레이드오프(trade-off)입니다. 새로운 방법은 속도, 메모리 효율성, 그리고 일반 지식의 보존 측면에서 막대한 이점을 얻는 대신, 새로운 작업에 대한 최대 성능을 약간 희생합니다. 연구진은 많은 실제 응용 사례, 예를 들어 특정 사용자에 맞춰 모델을 개인화하거나 소비자용 하드웨어에서 특정 산업에 맞게 모델을 적응시키는 경우, 이 트레이드오프가 충분히 가치 있는 일이라고 제안합니다. 이 방법은 과거에 데이터 센터가 필요했던 과정을 단일 기기에서 실행할 수 있는 것으로 바꾸어 놓으며, 과도한 전문화로 인한 피해로부터 모델의 원래 지능을 안전하게 보호하면서 적응의 문을 넓혀줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →