← 최신 논문
💻 computer science

Prompt-based Adaptation in Large-scale Vision Models: A Survey

본 논문은 시각 프롬팅 (VP) 과 시각 프롬팅 튜닝 (VPT) 의 개념적 경계를 명확히 하고 이를 '프롬프트 기반 적응 (PA)'이라는 통합 프레임워크로 체계화하여, 다양한 도메인 적용 사례와 향후 연구 방향을 포괄적으로 다룬 최초의 종합적 조사 논문입니다.

원저자: Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

게시일 2026-03-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📚 배경: 거대한 도서관과 새로운 손님

상상해 보세요. **거대한 AI 모델 (예: 비전 트랜스포머)**은 수천 권의 책 (이미지 데이터) 을 읽은 지식豊富な 도서관 사서입니다. 이 사서는 이미 세상을 아주 잘 알고 있습니다.

하지만 이제 이 사서에게 **"의사로서 X-ray 를 보고 병을 찾아라"**나 "드론으로 농작물을 감시하라" 같은 새로운 업무를 시키려고 합니다.

  • 기존 방식 (Full Fine-tuning): 사서에게 모든 책을 다시 읽고, 모든 지식을 지우고 새로운 업무에 맞춰 완전히 재교육시키는 것입니다.
    • 문제점: 시간이 너무 오래 걸리고, 돈도 많이 들며, 원래 가지고 있던 훌륭한 지식 (예: 고양이와 개를 구별하는 능력) 을 잃어버릴 위험이 있습니다.
  • 이 논문의 해결책 (Prompt-based Adaptation): 사서의 머리를 바꾸지 않고, **작은 메모나 스티커 (프롬프트)**만 붙여서 새로운 업무를 수행하도록 유도하는 것입니다.

🛠️ 두 가지 주요 전략: "입구에서 도와주는 사람" vs "내부에서 도와주는 사람"

이 논문은 이 작은 메모 (프롬프트) 를 붙이는 방식에 따라 두 가지로 나눕니다.

1. 비주얼 프롬프팅 (VP): "입구에서 도와주는 안내원"

  • 비유: 도서관 입구에 서 있는 안내원이 방문객 (이미지) 에게 스티커나 그림을 붙여줍니다.
    • 예를 들어, "이 사진은 X-ray 라서 병을 찾아야 해"라고 적힌 스티커를 사진 모서리에 붙여주는 거죠.
    • 특징: 사서 (AI 모델) 는 그대로 두고, **입구 (입력 데이터)**만 살짝 변형시킵니다.
    • 장점: 사서의 내부 구조를 건드리지 않아도 되므로, 블랙박스 (중요한 내부 구조를 알 수 없는) 모델에서도 쓸 수 있습니다.
    • 유형:
      • 고정형: 미리 정해진 스티커 (예: "여기 봐"라고 화살표 그리는 것).
      • 학습형: 상황에 따라 스티커 내용을 조금씩 바꾸는 것.
      • 생성형: 방문객마다 딱 맞는 맞춤형 스티커를 그 자리에서 만들어 붙여주는 것.

2. 비주얼 프롬프팅 튜닝 (VPT): "책장 사이로 숨은 메모"

  • 비유: 사서가 책을 읽는 **책장 사이사이에 작은 메모 (토큰)**를 끼워 넣습니다.
    • "이 페이지는 의료용이야, 평소보다 더 자세히 봐"라고 책장 사이에 숨겨진 메모를 넣는 겁니다.
    • 특징: 사서의 내부 (모델의 레이어) 에 학습 가능한 작은 메모를 추가합니다.
    • 장점: 사서의 깊은 지식과 새로운 업무를 더 정교하게 연결해 줍니다. 복잡한 문제 (예: 3D 점 구름 분석, 비디오 이해) 에 훨씬 강력합니다.
    • 유형:
      • 학습형: 메모 내용을 직접 학습시켜 최적화합니다.
      • 생성형: 들어온 이미지 내용을 보고 그 순간에 맞는 메모를 만들어 끼워 넣습니다.

🌍 어디에 쓰일까요? (실생활 예시)

이 기술은 다양한 분야에서 활약하고 있습니다.

  1. 의료 (병원):

    • VP: 의사가 X-ray 사진에 "여기 종양일 가능성이 높아"라고 점이나 박스를 찍어주면, AI 가 그 부분을 집중해서 진단합니다. (사람이 직접 개입하는 방식)
    • VPT: AI 가 X-ray 를 볼 때, "의료용 데이터야"라는 내부 메모를 받아서 일반 사진과 다르게 해석합니다.
  2. 자율주행 (비 오는 날):

    • 비가 와서 시야가 흐릿하면, VP는 흐린 화면을 보정하는 필터처럼 작동하거나, VPT는 "비가 오고 있으니 도로 경계선을 더 주의해서 봐"라는 내부 지시를 줍니다.
  3. 공장 (불량품 검사):

    • 새로운 종류의 불량품이 나오면, 전체 공장을 다시 설계할 필요 없이 작은 프롬프트만 추가하면 AI 가 바로 그 불량품을 찾아냅니다.
  4. 우주/위성:

    • 지구에서 본 사진과 우주에서 본 사진은 너무 다릅니다. VPT를 통해 AI 가 우주 사진을 볼 때 "위성 이미지야"라는 새로운 기준을 세우게 합니다.

⚖️ 어떤 것을 골라야 할까요? (선택 가이드)

논문의 결론을 쉽게 정리하면 이렇습니다.

  • 모델을 열 수 없다면 (블랙박스)? 👉 **VP (입구 안내원)**를 쓰세요. 외부에서 스티커만 붙이면 되니까요.
  • 정말 복잡한 문제를 해결해야 한다면? 👉 **VPT (내부 메모)**를 쓰세요. 사서의 깊은 사고 과정까지 조정할 수 있어서 성능이 더 좋습니다.
  • 컴퓨터 성능이 부족하다면? 👉 VP가 더 가볍습니다. (단, 메모리 사용량은 비슷할 수 있습니다.)

🚧 앞으로의 과제 (주의할 점)

이 기술이 아주 훌륭하지만, 아직 해결해야 할 문제들도 있습니다.

  1. 안전성: 악의적인 사람이 작은 메모 (프롬프트) 를 조작해서 AI 가 엉뚱한 일을 하도록 만들 수 있을까요? (예: "이건 고양이"라고 속여서 AI 를 혼란스럽게 하는 것)
  2. 안정성: 프롬프트를 조금만 다르게 설정해도 결과가 크게 달라질 수 있어, 항상 똑같은 결과를 내기 위해 노력해야 합니다.
  3. 속도: 프롬프트를 붙이고 계산하는 과정이 조금 더 걸릴 수 있어, 실시간으로 반응해야 하는 상황 (예: 자율주행) 에선 속도를 높이는 연구가 필요합니다.

💡 한 줄 요약

이 논문은 **"거대한 AI 를 다시 가르치지 않고, 작은 메모나 스티커만 붙여서 새로운 일을 잘하게 만드는 방법"**을 체계적으로 정리한 최고의 가이드북입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →