← 최신 논문
🤖 machine learning

AdaPaD: Adaptive Parallel Deflation for PEFT with Self-Correcting Rank Discovery

AdaPaD은 기존 LoRA 방법들에 비해 경쟁력 있는 성능을 유지하면서 어댑터 크기를 획기적으로 줄인 PEFT 를 위한 적응형 병렬 소멸 프레임워크를 도입하여, 자기 수정 오차 수렴과 동적 랭크 탐색을 통해 랭크 1 구성 요소를 동시에 학습합니다.

원저자: Barbara Su, Fangshuo Liao, Anastasios Kyrillidis

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Barbara Su, Fangshuo Liao, Anastasios Kyrillidis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 매우 복잡한 퍼즐 (대형 언어 모델) 을 상상해 보세요. 이 퍼즐에 새로운 기술을 가르치고 싶다고 가정해 봅시다. 퍼즐 전체를 다시 만들 필요는 없습니다. 그저 몇 개의 맞춤형 조각 (저랭크 적응, LoRA) 을 추가하여 더 잘 작동하도록 하면 됩니다.

문제는 다음과 같습니다: 얼마나 많은 맞춤형 조각이 필요하며, 어디에 배치해야 할까요?

대부분의 기존 방법은 퍼즐의 모든 부분에 대해 고정된 수의 조각을 추측합니다 (이는 종종 낭비적입니다) 또는 사람 줄 서서 서비스를 받는 것처럼 조각을 하나씩 추가합니다. 줄의 첫 번째 사람이 실수를 하면 그 실수가 퍼즐에 영구적으로 '동결'되며, 그 뒤에 서 있는 모든 사람들은 그 오류를 우회해야 합니다.

ADAPAD는 게임의 규칙을 바꾸는 새로운 방법입니다. 간단한 비유를 통해 작동 원리를 설명해 보겠습니다.

1. 구식 방법: '동결된 실수' 줄

마스터피스 그림을 그리기 위해 한 층씩 페인트를 덧발라 나가는 화가 팀을 상상해 보세요.

  • 화가 1이 붓질을 합니다. 실수를 하면 그 실수가 고정됩니다.
  • 화가 2는 그 실수를 고치기 위해 그 위에 그림을 그리려 하지만, 실수 주변으로만 그릴 수 있습니다. 화가 2 의 실수도 역시 고정됩니다.
  • 화가 3은 이전 두 실수 모두를 우회해야 합니다.
  • 결과: 마지막 화가에 도달할 때쯤이면 캔버스에는 수리 불가능한 오류의 더미가 쌓여 있습니다. 화가를 더 많이 추가할수록 초기 오류가 누적되어 최종 그림은 더 나빠집니다.

2. ADAPAD 방식: '자기 수정' 원탁

ADAPAD 는 줄을 없앱니다. 대신 모든 화가를 원탁에 앉혀 동시에 작업하게 합니다.

  • 팀: 10 명의 화가가 동시에 작업한다고 상상해 보세요.
  • 마법 (자기 수정): 화가가 붓질을 할 때마다 그룹에 보여줍니다. 다음 번에 그림을 그릴 때, 그들은 원래의 빈 캔버스만 보는 것이 아니라, 다른 사람들이 만든 그림의 최신 버전을 봅니다.
  • 결과: 화가 1 이 1 라운드에서 실수를 하더라도, 화가 2 가 1 라운드에서 그 실수를 덮어칠 수 있습니다. 2 라운드에서는 화가 1 이 화가 2 의 수정 사항을 보고 자신의 붓질을 조정하여 맞춥니다. 오류가 고정되지 않고 라운드가 진행됨에 따라 수정됩니다. 그림은 더러운 것이 쌓이는 대신, 매번 통과할 때마다 더 깨끗해집니다.

3. '선제 학습' (워밍업)

구식 줄 방식에서는 후반부 화가들 (화가 5~10) 이 처음 네 명이 끝날 때까지 가만히 기다립니다. 이는 시간 낭비입니다.

ADAPAD 는 말합니다: "기다리지 마세요!"

  • 화가 14 가 작업하는 동안, 화가 510 은 가만히 앉아 있는 것이 아닙니다. 그들은 테이블 옆에서 개인 연습을 하고 있습니다. 그들은 현재 그림 버전을 상대로 붓질을 연습하며, 메인 그룹에 공식적으로 합류하기 전에 자신의 특정 업무를 매우 잘 수행할 수 있도록 준비합니다.
  • 그들이 마침내 메인 라운드에 합류할 때, 그들은 초보자가 아니라 이미 전문가가 됩니다.

4. '동적 랭크 발견' (팀 확장)

보통 시작할 때 결정해야 합니다: "하늘에는 정확히 5 명의 화가를, 땅에는 5 명의 화가를 사용하자." 하지만 하늘에는 8 명이 필요하고 땅에는 2 명만 필요한 경우는 어떨까요?

ADAPAD 는 추측하지 않습니다. 작은 팀 (섹션당 화가 1 명) 과 공유 예산 (허용된 화가 총수 제한) 으로 시작합니다.

  • 누가 가장 열심히 일하고 누가 가장 큰 개선을 이루는지 지켜봅니다.
  • '하늘' 섹션이 어려움을 겪고 더 많은 도움이 필요하면, ADAPAD 는 "좋습니다, 연습 화가를 하늘 메인 팀으로 승진시키겠습니다"라고 말합니다.
  • '땅' 섹션이 잘하고 있다면, 그 규모는 작게 유지됩니다.
  • 결과: 퍼즐 각 부분의 팀 규모는 인간의 추측이 아니라 작업 자체에 의해 발견됩니다.

왜 이것이 중요한가요?

이 논문은 세 가지 주요 성과를 주장합니다:

  1. 더 나은 품질: 오류가 고정되는 대신 수정되므로 최종 결과가 더 정확합니다.
  2. 더 작은 크기: 실제로 필요한 곳에만 화가를 추가하므로, 최종 '어댑터'(모델에 추가된 추가 코드) 는 표준 방법보다 약 30% 작아지면서도 동일한 작업을 수행합니다.
  3. 더 빠른 속도: 줄 서서 작업하는 것이 아니라 모두 동시에 (병렬로) 작업하므로, 여러 컴퓨터에서 최대 2.6 배 더 빠를 수 있습니다.

요약하자면: ADAPAD 는 경직되고 오류가 발생하기 쉬운 조립 라인을, 서로의 실수를 고쳐 주는 유연하고 자기 수정이 가능한 팀으로 바꿉니다. 그리고 팀은 필요한 곳에서만 성장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →