← 최신 논문
💻 computer science

SECOND: Mitigating Perceptual Hallucination in Vision-Language Models via Selective and Contrastive Decoding

이 논문은 비전 - 언어 모델의 객체 환각 문제를 해결하기 위해 인간 시각 지각과 유사한 방식으로 다중 스케일 시각 정보를 선택적이고 대조적으로 결합하는 'SECOND'라는 새로운 접근법을 제안하고, 이를 통해 다양한 벤치마크에서 기존 방법보다 우수한 성능을 입증했습니다.

원저자: Woohyeon Park, Woojin Kim, Jaeik Kim, Jaeyoung Do

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Woohyeon Park, Woojin Kim, Jaeik Kim, Jaeyoung Do

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ 문제: 인공지능의 "착각"

지금까지의 인공지능 (VLM) 은 사진을 볼 때 마치 초보 탐정처럼 행동했습니다.

  • 상황: 사진 속의 개를 찾아달라고 하면, AI 는 전체 사진을 빠르게 훑어보다가 "아, 저기 개가 있겠지!"라고 추측합니다.
  • 문제: 하지만 AI 는 실제 개가 없어도, 배경의 구름이나 그림자만 보고 "개 있어요!"라고 거짓말을 하곤 합니다. 이를 **'시각적 환각'**이라고 합니다.

💡 해결책: SECOND (선택적 대비 해독)

이 논문이 제안한 SECOND는 AI 에게 **"조급하게 결론 내리지 말고, 단계별로 꼼꼼히 확인해라"**라고 가르치는 방법입니다.

1. 단계별 탐정 훈련 (다중 스케일 선택)

SECOND 는 AI 가 사진을 볼 때 한 번에 다 보지 않고, 4 단계에 걸쳐 점진적으로 자세히 살펴보게 합니다.

  • 1 단계 ( Amateur - 초보 탐정): 사진의 아주 작은 축소판 (저해상도) 을 봅니다. "어떤 게 있을지 대략적인 느낌만 잡습니다." 이때는 개가 있는지 없는지 정확히 모릅니다.
  • 2~3 단계 (중간 단계): 초보 탐정이 "여기 뭔가 있네?"라고 의심한 부분만 확대해서 봅니다. AI 는 "아, 저기만 자세히 봐야겠다"라고 선택합니다.
  • 4 단계 (Expert - 전문 탐정): 최종적으로 의심스러운 부분만 고해상도로 아주 자세히 봅니다.

비유: 마치 망원경을 사용하는 것과 같습니다.

  • 처음엔 맨눈으로 넓은 하늘을 봅니다 (저해상도).
  • 별이 있을 것 같은 곳만 망원경으로 확대합니다 (선택).
  • 그중에서도 가장 의심스러운 별만 최고급 망원경으로 아주 가까이서 봅니다 (고해상도).
  • 이렇게 하면 "저게 개구리인가?"라고 착각할 확률이 줄어듭니다.

2. 대비를 통한 진리 찾기 (Contrastive Decoding)

이 기술의 핵심은 **초보 탐정 (Amateur)**과 **전문 탐정 (Expert)**의 말을 비교하는 것입니다.

  • 초보 탐정: "아마 개가 있을 거야." (대충 본 것)
  • 전문 탐정: "아니, 자세히 보니 개가 없어. 저건 그냥 나무 그늘이야." (자세히 본 것)
  • SECOND 의 결정: 두 사람의 말을 대조해 봅니다. 초보 탐정이 착각한 부분을 전문 탐정이 바로잡아 주면, AI 는 **"아, 내가 착각했구나"**라고 깨닫고 정확한 답을 내놓습니다.

비유: 시험지 채점을 생각해보세요.

  • 학생 A(초보) 가 "정답은 A 입니다"라고 적었습니다.
  • 학생 B(전문) 가 "아니, B 가 정답이야"라고 적었습니다.
  • 선생님이 두 답을 비교하며 "B 가 더 논리적이야"라고 판단하면, 최종 정답은 B 가 됩니다. SECOND 는 이 과정을 자동으로 수행하여 AI 의 실수를 잡아냅니다.

🚀 왜 이 방법이 좋은가요?

  1. 불필요한 정보 제거: 사진 전체를 다 자세히 보면 AI 는 혼란스러워합니다. SECOND 는 관심 있는 부분만 골라내서 자세히 보게 하므로, AI 가 덜 헷갈립니다.
  2. 학습 없이 가능: 새로운 AI 모델을 처음부터 다시 가르칠 필요 (학습) 가 없습니다. 기존 AI 에 이 '단계별 확인' 방법만 적용하면 바로 효과가 나옵니다.
  3. 정확도 향상: 실험 결과, 이 방법을 쓰면 AI 가 없는 개를 있다고 말하는 실수가 크게 줄어들고, 실제 객체를 찾는 능력도 좋아졌습니다.

📝 한 줄 요약

"SECOND 는 인공지능에게 '한 번에 다 보지 말고, 의심스러운 부분만 단계별로 확대해서 자세히 확인한 뒤, 초보와 전문가의 의견을 비교해 정답을 찾아라'라고 가르쳐서, AI 가 망상 (환각) 을 덜 꾸게 만든 기술입니다."

이 기술은 앞으로 AI 가 의료 진단, 자율 주행, 보안 감시 등 실수가 치명적인 분야에서 더 신뢰할 수 있게 만드는 데 큰 역할을 할 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →