← 최신 논문
🤖 machine learning

Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation

본 논문은 내부 라우팅과 공유된 Tucker 코어를 통해 샘플별 적응 행렬을 생성함으로써 이질적인 도메인 전반에 걸친 보편적인 시각적 적응을 가능하게 하는 매개변수 효율적인 프레임워크인 Self-Routed Tensor Adapters(SRTA)를 제안하며, 이는 기존의 MoE 기반 방식보다 현저히 적은 학습 가능한 매개변수로 경쟁력 있는 정확도를 달성한다.

원저자: Suraj Yadav

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Suraj Yadav

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 컴퓨터는 놀라울 정도로 보는 능력이 뛰어나게 되었습니다. 컴퓨터는 사진 속의 고양이를 식별하거나 거리의 정지 표지판을 포착하는 데 있어 인간의 시각에 필적하는 수준의 정확도를 보여줍니다. 이러한 능력은 수십억 개의 이미지로 학습된 거대 모델로부터 비롯되며, 이를 통해 모델은 시각적 세계에 대한 일반적인 이해를 학습합니다. 그러나 이 강력한 시스템들은 종-종 경직되어 있습니다. 엔지니어가 이러한 모델에게 새로운 환경(예를 들어, 탁한 강물과 투명한 수족관 사이에서 서로 다른 종류의 물고기를 구별하는 것)에서 특정 객체를 인식하도록 가르치려 할 때, 모델은 어려움을 겪습니다. 새로운 환경의 시각적 스타일, 조명, 배경이 이전에 학습했던 것과 너무 다르기 때문입니다. 이를 해결하기 위해 연구자들은 보통 거대한 모델 전체를 다시 학습시켜야 하는데, 이 과정은 느리고 비용이 많이 들 뿐만 아니라 모델이 이미 보유하고 있는 일반적인 지식을 파괴하기도 합니다. 더 효율적인 접근 방식이 등장했는데, 과학자들은 메인 브레인을 건드리지 않고 모델에 작고 특화된 조정을 가합니다. 이는 새로운 카메라를 처음부터 만드는 대신, 카메라에 작고 전문적인 렌즈를 추가하는 것과 같습니다. 하지만 이러한 작은 조정조차도 문제에 직면합니다. 단일하고 고정된 조정 방식으로는 컴퓨터가 탐색해야 할 다양한 시각적 세계의 광범위한 다양성을 처리할 수 없다는 점입니다.

인드라프라스타 정보 기술 연구소(IIIT Delhi)의 연구원 수라지 야다브(Suraj Yadav)는 이 퍼즐을 풀기 위한 새로운 방법을 제안했습니다. 목표는 고정된 사전 학습 비전 모델을 지식의 파편화나 막대한 추가 컴퓨팅 파워 없이도 동시에 여러 도메인에 적응시킬 수 있는 시스템을 만드는 것이었습니다. 이전의 시도들은 모델이 여러 개의 특화된 하위 루틴, 즉 '전문가(experts)'를 가지고 있고 별도의 컨트롤러가 각 이미지에 대해 어떤 전문가를 사용할지 결정하는 '전문가 혼합(mixture of experts)' 방식을 사용했습니다. 효과적이긴 했지만, 이 컨트롤러는 별도의 문지기 역할을 하며 추가적인 복잡성과 파라미터를 더하게 됩니다. 야다브의 연구인 '셀프 라우티드 텐서 어댑터(Self-Routed Tensor Adapters)'는 이러한 외부 문지기를 완전히 제거했습니다. 별도의 컨트롤러에게 경로를 선택하도록 요청하는 대신, 새로운 시스템은 이미지 자체가 모델이 어떻게 적응해야 하는지를 결정하게 하며, 이는 다양한 학습 스타일을 실시간으로 혼합하는 작고 공유된 구조를 사용합니다.

이 새로운 방법의 핵심은 모델이 새로운 지식을 저장하는 방식을 영리하게 재사고한 데 있습니다. 모델의 적응 공간을 분리되고 고립된 전문가들의 집합이 아니라, 시각적 요소들의 단일하고 공유된 라이브러리로 상상해 보십시오. 이 라이브러리 안에서 모델은 서로 조합하고 섞을 수 있는 핵심적인 적응 가능 조각들을 보유합니다. 새로운 이미지가 도착하면, 시스템은 이를 저차원 공간으로 투영하고 그 투영을 사용하여 라이브러리의 각 조각을 얼마나 사용할지 계산합니다. 이 계산은 별도의 의사 결정 네트워크 없이 이미지 자체의 특징으로부터 자동적이고 직접적으로 이루어집니다. 그런 다음 시스템은 이 조각들을 혼합하여 특정 이미지에 맞는 맞춤형 적응을 만들어냅니다. 만약 이미지가 스케치 형태라면 시스템은 라이브러리의 '스케치' 부분에서 더 많은 것을 가져오고, 사진 형태라면 '사진' 부분에서 더 많은 것을 가져옵와 같습니다. 이러한 혼합은 매끄럽게 일어나며, 이를 통해 모델은 고유한 도메인을 위해 특화되는 동시에 유사한 도메인 간에 공통된 지식을 공유할 수 있습니다.

모델이 이러한 혼합 결정을 올바르게 학습하도록 보장하기 위해, 연구진은 프로세스의 매 단계마다 시스템을 안내하는 학습 기법을 도입했습니다. 그들은 모델이 최종 정답 여부만 알게 될 경우, 프로세스의 초기 단계에서 정보를 올바르게 라우팅하는 법을 배우는 데 어려움을 겪을 수 있다는 것을 발견했습니다. 그래서 그들은 네트워크의 각 레이어에서 라우팅 결정을 감독하는 이차적인 학습 신호를 추가하여, 모델이 어떤 시각적 요소가 어떤 도메인에 속하는지 더 명확한 경로를 학습할 수 있도록 했습니다. 이는 모델이 다양한 유형의 이미지에 대해 뚜렷한 경로를 개발하면서도 전체적인 구조를 작고 효율적으로 유지하도록 돕습니다.

이 접근 방식의 결과는 그 효율성 면에서 놀랍습니다. 예술 스타일부터 실제 사진, 숫자 인식에 이르기까지 다양한 시각적 도메인을 포함하는 다섯 가지 벤치마크에서 테스트했을 때, 새로운 방법은 기존의 최첨단 방식들과 경쟁할 만하거나 때로는 약간 더 나은 정확도를 달당했습니다. 그러나 진정한 돌파구는 비용에 있습니다. 네 가지 도메인이 있는 설정에서 새로운 방법은 그 결과를 얻기 위해 277만 개의 학습 가능한 파라미터만을 필요로 했습니다. 반면, 별도의 전문가 뱅크를 사용하는 선도적인 대안 방법은 동일한 작업을 위해 952만 개의 파라미터를 필요로 했습니다. 여섯 가지 도메인 설정에서는 격차가 더 벌어져, 새로운 방법은 단 300만 개의 파라미터를 사용한 반면 경쟁 모델은 1,431만 개를 사용했습니다. 이는 새로운 시스템이 약 3~5배 적은 파라미터를 사용하면서도 유사한 성능을 제공한다는 것을 의미합니다.

연구진은 또한 시스템이 내부적으로 어떻게 작동하는지 관찰했습니다. 라우팅 결정을 시각화했을 때, 서로 매우 다른 도메인(예: 서로 다른 예술 스타일)의 경우 시스템이 마치 하나의 설정으로 스위치를 켜는 것처럼 특정 경로만을 독점적으로 활성화하도록 학습하는 것을 발견했습니다. 더 유사하거나 중첩되는 도만한 경우, 시스템은 여러 경로를 함께 혼합하여 지식을 공유하는 법을 배웠습니다. 이러한 동작은 시스템이 단순히 각 도메인에 대한 별도의 규칙을 암기하는 것이 아니라, 도메인 간의 관계를 이해하는 유연하고 공유된 표현을 학습하고 있음을 시사합니다. 이 연구는 보편적인 시각적 적응을 위해 거대한 별도의 전문가 군단이나 복잡한 외부 컨트롤러가 필요하지 않음을 시사합니다. 대신, 입력값이 스스로의 적응을 가이드할 수 있게 하는 작고 공유된 구조를 통해 훨씬 적은 계산 비용으로 높은 성능을 달성할 수 있으며, 이는 대규모 비전 모델을 더욱 다재다능하고 효율적으로 만드는 유망한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →