ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models
ZOMP는 교차 모달 저계수 재매개변수화, 그래디언트 보정 모멘텀, 그리고 동적 계수 스케줄을 활용함으로써 기존의 제로 차수 접근 방식들을 여러 벤치마크에서 능가하며, 동시 섭동 확률 근사법을 사용하여 동결된 CLIP 모델의 비전 및 텍스트 브랜치 모두에서 딥 프롬프트를 최적화하는 쿼리 효율적인 완전 순방향 방식이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 사진이 무엇에 관한 것인지 사진을 보는 즉시 설명하거나 완벽한 문장으로 장면을 묘사할 수 있는 천재적인 사서와 같은 초지능형 로봇이 있다고 상상해 보세요. 이 로봇은 이미지와 언어를 모두 이해하도록 인터넷 전체를 읽고 학습한 '비전-언어 모델(Vision-Language Model)'입니다. 이 로봇은 정말 강력합니다. 하지만 여기에는 함정이 있습니다. 보통 이 로봇에게 희귀한 꽃의 종류나 이상한 의료 스캔 영상 같은 새로운 기술을 가르치려면, 로봇이 자신의 뇌를 스스로 '재배선(rewire)'하도록 해야 합니다. 이 과정은 마치 거대한 도서관이 대중에게 개방된 상태에서 도서관 내부를 재조직하려는 것처럼 매우 무겁고, 엄청난 컴퓨팅 파워와 메모리를 필요로 합니다.
때로는 그렇게 할 수 없는 상황도 있습니다. 예를 들어, 로봇이 당신의 주머니 속에 있는 아주 작은 배터리 구동 장치 안에 살고 있거나, 혹은 로봇이 어떻게 생각하는지 들여다볼 수 없는 비밀 서비스의 채팅창을 통해서만 대화해야 하는 경우입니다. 이런 경우에는 로봇의 뇌를 재배선할 수 없습니다. 대신 새로운 지침을 속삭여 줄 수만 있을 뿐이죠. 이것을 '프롬프트 튜닝(prompt tuning)'이라고 부릅니다. 로봇의 뇌를 바꾸는 대신, 새로운 퍼즐을 풀 수 있도록 특별한 힌트나 '프롬프트'를 제공하는 것입니다. 문제는 완벽한 힌트를 찾는 것이 보통 엄청난 시행착오를 필요로 한다는 점입니다. 만약 당신이 로봇의 내부 사고 과정(그래디언트)을 볼 수 없다면, 그것은 눈을 가린 채 건초더미 속에서 바늘을 찾는 것과 같습니다. 제대로 맞추기 위해 수천 번의 추측이 필요할 수도 있으며, 이는 실생활에서 너무 느리고 비용이 많이 드는 일입니다.
여기서 ZOMP라는 새로운 방법이 등장합니다. ZOMment는 '눈을 가린 채 바늘 찾기' 문제를 해결하기 위해 검색 방식을 바꾸는 영리한 탐정이라고 생각하면 됩니다. 모든 세부 사항을 한꺼번에 추측하는 대신, ZOMP는 가장 중요한 부분부터 먼저 추측한 다음 나머지 부분을 천천히 채워 나가는 똑똑한 전략을 사용합니다.
작동 방식은 다음과 같은 재미있는 비유를 통해 설명할 수 있습니다.
"공유된 청사진(Shared Blueprint)" 기법
보통 로봇에게 새로운 것을 가르치려 할 때, 로봇의 '눈(시각)'과 '목소리(텍스트)'를 위한 별도의 힌트를 작성해야 합니다. 만로 두 가지 모두에 대해 깊고 복잡한 힌트를 동시에 작성하려고 하면, 가능한 경우의 수가 너무 많아져서 눈을 가린 검색은 길을 잃게 됩니다. ZOMP는 게임의 규칙을 바꿉니다. "두 가지 모두를 위한 공유된 청사진을 사용하자"라고 말이죠. 상상해 보세요, 눈과 목소리를 위한 힌트가 모두 동일한 작은 레고 블록 세트로 만들어진다고 말입니다. 당신은 그 적은 수의 블록을 어떻게 배치할지만 결정하면 되고, 그러면 그 블록들이 자동으로 눈과 목소리 모두를 위한 올바른 힌트를 구축하게 됩니다. 이를 통해 힌트가 깊고 복잡함에도 불구하고 검색 공간을 작고 관리 가능한 수준으로 유지할 수 있습니다.
"예산 기반 인덱스 확장(Budget-Indexed Expansion)"
공유된 청사판이 있더라도, 눈을 가린 상태에서 모든 블록을 한꺼번에 배치하는 것은 여전히 어렵습니다. 그래서 ZOMP는 "예산" 시스템을 사용합니다. 당신에게 최적의 힌트를 찾기 위한 제한된 횟수의 추측(쿼리)이 있다고 가정해 봅시다. ZOMP는 우선 가장 중요하고 첫 번째인 블록 하나를 가지고 노는 것부터 시작합니다. 그리고 그 하나의 조각에 대해 올바른 방향을 찾아냅니다. 일단 올-바른 궤도에 올랐다고 확신하면, 그다음 블록을 '잠금 해제'하고, 그다음 블록을 푸는 식으로, 신뢰할 수 있는 방향이 생길 때마다 천천히 검색 범위를 확장합니다. 이는 운전을 배우는 것과 같습니다. 처음에는 빈 주차장(작은 검색 공간)에서 시작하여 익숙해진 뒤, 천천히 동네 도로로 나가고, 마지막으로 고속도로로 이동합니다. 첫날부터 바로 고속도로에서 운전하려고 하지 않는 것과 같습니다.
"모멘텀(Momentum)" 기억력
검색 과정에서 눈이 가려져 있기 때문에, 당신이 얻는 단서들은 종종 소음이 섞여 있고 불안정할 수 있습니다. 마치 요동치는 배 위에서 걷는 것과 같습니다. ZOMP는 여기에 "모멘텀" 기억력을 더합니다. 이것은 파도에 반응하는 것뿐만 아니라 바다가 밀어내는 일반적인 방향을 기억하는 서퍼를 생각하면 됩니다. 설령 파도가 자신을 옆으로 밀쳐내더라도, 서퍼는 자신이 어디로 가고 있었는지 기억하기 때문에 계속해서 올바른 방향으로 나아갈 수 있습니다. 이는 로봇이 노이즈를 무시하고 실제로 작동하는 경로를 고수할 수 있도록 도와줍니다.
결과
연구진은 꽃 식별부터 위성 이미지의 차량 인식에 이르기까지 13가지의 서로 다른 과제를 통해 이 방법을 테스트했습니다. 그들은 ZOMP와 다른 방법들에게 정확히 동일한 횟수의 추측(5,000회 쿼리)을 주었습니다. 결과는 ZOMP가 다른 방법들보다 일관되게 더 나은 힌트를 찾아냈다는 것을 보여주었습니다. 단순히 약간 더 나은 수준이 아니라, 로봇이 보통 어려움을 겪는 까다로운 작업에서 훨씬 더 높은 정확도를 보였습니다.
정말 멋진 점은 ZOMP가 단순히 훈련된 특정 작업에만 잘하는 것이 아니라는 점입니다. ZOMP는 본 적 없는 생소하고 이상한 상황(예: 실제 사진 대신 물체의 스케치를 인식하는 경우)도 더 잘 처리했습니다. 이는 ZOMP가 주의 깊고 효율적으로 검색함으로써, 단순히 훈련 예시를 암기하는 것이 아니라 로봇이 가진 기존 지식을 사용하는 더 똑똑한 방법을 배웠음을 시사합니다.
요약하자면, ZOMP는 로봇을 더 똑똑하게 만들기 위해 반드시 뇌를 재배선할 필요는 없다는 것을 증명합니다. 공유된 청사판을 사용하고, 검색을 천천히 확장하며, 방향에 대한 꾸준한 기억을 유지함으로써, 당신이 오직 속삭임만 전달할 수 있고 시도 횟수도 제한적인 상황에서도 강력한 AI에게 새로운 기술을 가르칠 수 있습니다. 이는 당신의 주머니 속에 슈퍼컴퓨터를 넣지 않고도 이러한 거대 모델의 잠재력을 최대한 끌어낼 수 있는 실용적이고 효율적인 방법입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.