← 최신 논문
💻 computer science

CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD Detection

본 논문은 도메인 일관성 헤시안을 달성하기 위해 에너지 점수의 기울기 크기를 최소화함으로써 분포 외 일반화와 오픈 세트 검출을 동시에 최적화하는 비전-언어 사전 학습 모델을 위한 통합 미세 조정 프레임워크인 CRoFT를 제안한다.

원저자: Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 독서량이 풍부한 CLIP이라는 이름의 사서 한 명을 상상해 보세요. 이 사서는 수백만 권의 책을 읽고 수백만 장의 사진을 본 덕분에, 사진이 약간 흐릿하거나 기이한 각도에서 찍혔더라도 이전에 본 '개'나 '자동차' 같은 것들을 식별하는 데 놀라울 정도로 능숙합니다.

그러나 현실 세계는 혼란스럽습니다. 때로는 이 사서에게 새로운 사진을 분류해 달라고 요청할 때, 다음과 같은 두 가지 구체적인 문제에 직면하게 됩니다:

  1. 스타일 변화 문제 (공변량 이동): 사서에게 개의 사진을 보여주지만, 그것이 스케치 스타일로 그려진 것이거나 흑백 사진이거나 비 속에서 찍힌 것일 수 있습니다. 사서는 그것이 개임을 알고 있지만, 그들이 공부한 책들과는 너무 다른 스타일 때문에 혼란을 겪고 "확신이 서지 않는다"고 말할 수 있습니다.
  2. 알려지지 않은 동물 문제 (오픈셋 OOD): 사서에게 판다의 사진을 보여줍니다. 그들은 훈련 책에서 판다를 본 적이 없습니다. "이게 뭔지 모르겠다"라고 말하는 대신, 사서는 자신이 아는 상자 안에 억지로 넣으려 합니다. 예를 들어, "아, 저건 분명 곰이야!" 또는 "저건 개야!"라고 말합니다. 이는 시스템이 확신을 가지고 틀린 답을 내놓기 때문에 위험합니다.

대부분의 이전 방법들은 이 두 문제 중 하나를 해결하려다 다른 하나를 망쳐놓았습니다. 사서에게 스케치를 더 잘 처리하도록 가르치면 알려지지 않은 동물을 찾는 능력이 떨어질 수 있고, 알려지지 않은 동물을 찾도록 가르치면 스케치를 처리하는 방법을 잊어버릴 수 있습니다.

해결책: CRoFT (이중 확인 사서)

이 논문은 CRoFT라는 새로운 방법을 소개합니다. CRoFT는 사서가 혼란을 겪지 않고 두 가지 일을 동시에 할 수 있도록 가르치는 특별한 훈련 프로그램이라고 생각하세요.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다:

1. "에너지 점수" (신뢰도 미터)

이 논문은 "에너지 점수"라는 개념을 사용합니다. 사서가 사진을 볼 때마다 "신뢰도 미터"가 있다고 상상해 보세요.

  • 낮은 에너지: "이것이 개라는 데 매우 확신이 있습니다."
  • 높은 에너지: "이건 이상하게 느껴집니다. 확신이 서지 않아요."

목표는 사서가 아는 것들 (개) 에 대해서는 미터가 낮아지고, 모르는 것들 (판다) 에 대해서는 높아지도록 만드는 것입니다.

2. 비밀 트릭: "언덕 평탄화"

저자들은 기발한 수학적인 트릭을 발견했습니다. 사서에게 "신뢰도 미터"를 매우 안정적으로 만들도록 가르치면 (수학적으로 이는 '기울기 크기'를 최소화하거나 '헤세 행렬'을 일관되게 만드는 것을 의미함), 두 가지 마법 같은 일이 동시에 일어난다는 것입니다:

  • 트릭 A: 사서가 "이상한" 사진 (오픈셋) 을 더 잘 찾아내게 됩니다. 판다에 대해 미터가 명확하게 치솟습니다.
  • 트릭 B: 사서가 스타일 변화에 더 강건해집니다 (OOD 일반화). 내부의 세계 "지도"가 더 매끄럽고 일관되기 때문에, 개의 스케치도 여전히 그들에게 개처럼 느껴집니다.

등산객에게 평평하고 매끄러운 길을 걷도록 가르치는 것과 같습니다. 길이 평평하면 작은 돌 (스타일 변화) 에 넘어지지 않을 뿐만 아니라, 절벽 가장자리 (알려지지 않은 동물) 가 다가오는지도 명확하게 볼 수 있습니다.

3. "적대적 훈련" (스트레스 테스트)

사서가 진짜 현실 세계에 완전히 준비되었는지 확인하기 위해 CRoFT 는 "스트레스 테스트"를 만듭니다.

  • 사서가 개의 사진을 공부하고 있다고 상상해 보세요.
  • CRoFT 는 그 사진의 약간 왜곡된 "환각" 버전을 만듭니다 (매우 나쁜 스케치나 기이한 필터처럼 보이지만 여전히 개처럼 보이는).
  • 사서는 그런 "나쁜" 사진을 인식하도록 강제로 연습하게 됩니다.
  • 이러한 "최악의 시나리오"를 연습함으로써 사서는 매우 강해집니다. 사진이 기이하게 보일지라도 라는 아이디어는 여전히 존재한다는 것을 배우게 됩니다.

결과

이 논문은 이 "이중 확인" 접근법 (에너지 지형 평탄화 + 스트레스 테스트) 을 사용하면 사서 (AI 모델) 가 다음과 같이 된다고 주장합니다:

  1. 알려지지 않은 것을 찾아내는 데 더 능숙해짐: 판다가 개라고 추측하는 것을 멈춥니다. "이건 모르겠다"라고 말합니다.
  2. 기이한 스타일을 처리하는 데 더 능숙해짐: 개의 스케치를 개의 사진만큼 잘 인식합니다.

그들의 테스트에서 이 방법은 이전 방법들보다 훨씬 뛰어났습니다. 알려지지 않은 동물을 찾아내는 능력을 최대 **20%**까지 향상시켰고, 스타일 변화로 인해 모델이 혼란을 겪는 횟수를 줄였습니다.

간단히 말해: CRoFT 는 AI 모델이 서로 다른 스타일을 처리하는 유연성과 이전에 본 적이 없는 것을 보았을 때 인정하는 정직함을 모두 갖도록 가르치는 훈련 방법이며, 이는 모델이 세상을 "생각"하는 방식을 매끄럽게 만들어 달성됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →