← 최신 논문
🤖 machine learning

PVeRA: Probabilistic Vector-Based Random Matrix Adaptation

본 논문은 기존 파라미터 효율적 적응 방법들보다 VTAB-1k 벤치마크에서 더 우수한 성능을 달성하고 입력 모호성을 더 잘 처리하기 위해 공유 저랭크 행렬을 수정하는 VeRA 어댑터의 확률적 확장인 PVeRA를 소개합니다.

원저자: Leo Fillioux, Enzo Ferrante, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Leo Fillioux, Enzo Ferrante, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 세상 거의 모든 책을 읽은 거대하고 지극히 똑똑한 지식 도서관 (즉, '기초 모델') 이 있다고 가정해 봅시다. 이 도서관은 훌륭하지만, 매우 크고 무거워 이동하기 어렵습니다. 만약 이 도서관에 특정 새로운 기술—예를 들어 희귀한 꽃을 식별하거나 특정 의학적 상태를 진단하는 것—을 가르치고 싶다면, 보통은 이를 '파인튜닝'해야 합니다.

문제점: 전통적인 파인튜닝은 새로운 주제에 맞춰 전체 백과사전을 다시 쓰는 것과 같습니다. 이는 많은 시간, 비용, 그리고 연산 능력을 요구합니다. 게다가 새로운 주제에 대한 예시가 몇 개뿐이라면, 도서관은 혼란을 겪고 기존 지식을 잊어버릴 수 있습니다 (과적합).

현재의 해결책 (어댑터): 이를 해결하기 위해 과학자들은 '어댑터'를 발명했습니다. 이는 도서관의 선반에 붙이는 작고 가벼운 포스트잇과 같습니다. 책들을 다시 쓰는 대신, 새로운 작업을 처리하는 방법을 안내하기 위해 이 메모들을 추가하는 것입니다. 가장 인기 있는 포스트잇 종류 중 하나는 VeRA입니다. VeRA 는 전체 도서관에 걸쳐 공유되는 고정된 (변하지 않는) 무작위 패턴 쌍을 사용하며, 이러한 패턴이 어떻게 활용될지 조정하기 위해 소수의 작은 숫자 (벡터) 만 학습합니다. 이는 효율적이지만 다소 경직되어 있어, 모든 입력에 대해 하나의 고정된 결정만을 내립니다.

새로운 아이디어: PVeRA
이 논문의 저자들은 PVeRA(확률적 벡터 기반 무작위 행렬 어댑터) 를 제안합니다. 그들이 무엇을 했는지 간단히 설명하면 다음과 같습니다:

1. 단일 추측에서 '가능성의 구름'으로

안개 낀 사진에서 동물을 식별하려 한다고 상상해 보세요.

  • 옛 방법 (VeRA): 모델은 안개를 보고 "이것은 100% 코끼리입니다"라고 말합니다. 고정된 규칙에 기반한 하나의 경직된 추측을 내리는 것입니다.
  • 새 방법 (PVeRA): 모델은 안개를 보고 "이것은 대부분 코끼리처럼 보이지만, 말일 가능성도 약간 있으며 안개 때문에 약간 불확실합니다"라고 말합니다.

PVeRA 는 포스트잇이 하나의 숫자만 담는 것이 아니라 분포(가능성의 구름) 를 담도록 변경합니다. 단일 고정 조정을 선택하는 대신, 모델은 가능한 조정의 범위를 학습합니다. 학습 과정에서 이 구름에서 무작위로 샘플링함으로써, 모델은 스스로의 약간 다른 여러 버전을 가지고 연습하게 됩니다. 이는 데이터의 '안개'(모호함) 를 훨씬 더 잘 처리하도록 도와줍니다.

2. 이것이 '안전망'과 같은 이유

이 논문은 이러한 확률적 접근 방식이 모델에 두 가지 초능력을 부여한다고 주장합니다:

  • 신뢰 구간 (당신은 얼마나 확신합니까? 측정계):
    모델이 가능성의 구름에서 샘플링하기 때문에, 동일한 이미지를 10 번 보게 요청할 수 있습니다.

    • 만약 10 번 모두 동일한 확신으로 "코끼리"라고 말한다면, 이는 확신이 있다는 뜻입니다.
    • 만약 6 번은 "코끼리", 3 번은 "말", 1 번은 "얼룩말"이라고 말한다면, 이는 불확실하다는 뜻입니다.
      논문은 PVeRA 가 추가적인 복잡한 수학 없이 자연스럽게 이러한 "신뢰 구간"을 생성할 수 있음을 보여줍니다. 이는 모델이 추측할 때 언제인지 알려주는 내장된 정직도 측정계와 같습니다.
  • 더 적은 데이터로 더 나은 성능:
    저자들은 자연 사진부터 의료 이미지 및 구조화된 데이터에 이르기까지 19 가지 다른 데이터셋에서 이를 테스트했습니다. 그 결과 PVeRA 는 원래의 VeRA 와 다른 인기 있는 어댑터들보다 일관되게 더 좋은 성능을 보였습니다. 특히 다양한 유형의 작업 전반에 걸쳐 안정적으로 작동하는 데 탁월했습니다.

3. 병합의 '마법'

가장 멋진 기능 중 하나는 PVeRA 가 학습 중에 '구름' 형태의 가능성을 사용하지만, 실제 사용 시에는 이를 주 모델에 병합할 수 있다는 점입니다.

  • 비유: 연설을 연습할 때 전달 방식의 100 가지 버전을 시도해 보았다고 상상해 보세요. 충분히 연습한 후에는 연설의 가장 좋은 버전을 선택하여 암기합니다.
  • 결과: 실제로 연설을 할 때 (추론 시) 100 가지 버전을 시도할 필요가 없습니다. 다듬어진 한 가지 버전만 전달하면 됩니다.这意味着 PVeRA 는 실제로 사용할 때 기존 방법만큼 빠르지만, 학습 중에는 더 똑똑하게 학습한 것입니다.

4. '외부인'을 찾아내기

논문은 또한 PVeRA 가 분포를 학습하기 때문에 자신이 모르는 것을 더 잘 찾아낸다는 점을 발견했습니다.

  • 비유: 고양이와 개로 훈련된 모델에게 토스터 사진을 보여주면, 경직된 모델은 토스터가 고양이와 약간 비슷하다며 확신 있게 "고양이"라고 말할 수 있습니다. 반면 PVeRA 모델은 "정말 불확실합니다. 내부 신뢰도가 제각각입니다"라고 말할 수 있습니다.
  • 저자들은 모델의 내부 '불확실성 신호'가 이전에 보지 못한 것들 (분포 외 데이터) 에 대해 훨씬 강력하게 반응함을 보여주었습니다. 이는 모델이 혼란스러워할 때 알아야 하는 안전이 중요한 작업에 더 나은 도구가 됩니다.

요약

이 논문은 기존 도구인 VeRA 의 더 똑똑하고 유연한 버전인 PVeRA를 소개합니다. 모델에게 단일 고정 답변이 아닌 '확률'과 '가능성의 범위'로 생각하도록 가르침으로써 다음과 같은 효과를 얻습니다:

  1. 다양한 작업에서 더 나은 성능을 발휘합니다.
  2. 모르는 것을 알아냅니다(더 나은 불확실성 추정).
  3. 복잡한 수학은 학습 중에만 사용되고 모델이 실제로 작동할 때는 사용되지 않기 때문에 빠른 속도를 유지합니다.

이는 본질적으로 모델의 '포스트잇'을 경직된 지시사항에서 모호함을 자신감 있게 탐색하도록 돕는 유연한 확률적 안내로 업그레이드하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →