← 최신 논문
🤖 machine learning

Online Self-Calibration Against Hallucination in Vision-Language Models

이 논문은 외부 감독에 의존하지 않고 환각 현상을 효과적으로 완화하기 위해 대규모 시각-언어 모델 내의 생성-판별 간극을 활용하여 몬테카를로 트리 탐색과 직접 선호도 최적화를 통해 선호 데이터를 구축하는 온라인 자기 보정 프레임워크인 OSCAR 를 제안합니다.

원저자: Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

게시일 2026-05-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"시각-언어 모델의 환각에 대한 온라인 자기 보정"이라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 풀어보겠습니다.

문제: "과신하는" 화가

상상해 보세요. 사진 속의 것을 묘사하는 데 매우 뛰어난 재능을 가진 화가 (AI 모델) 가 있습니다. 하지만 나쁜 버릇이 하나 있습니다. 세부 사항을 정확히 파악하지 못할 때, "잘 모르겠어요"라고 말하지 않고 대신 비슷한 사진에서 보통 어떤 일이 일어나는지 기반으로 추측한다는 것입니다.

거실 사진을 보여주면, 벽이 실제로는 하얗고 벽난로 위에 거울이 없는데도, "파란 벽이 있고 벽난로 위에 거울이 있습니다"라고 자신 있게 말합니다. 그들은 환각을 일으키는 것, 즉 존재하지 않는 사실을 만들어내는 것입니다.

구식 방법: "과도한 교사"의 실수

이전에는 연구자들이 이 문제를 해결하기 위해 (GPT 같은) 훨씬 더 똑똑한 AI 인 "수퍼 교사"를 고용해 완벽한 설명을 작성하게 한 뒤, 학생 화가에게 이 완벽한 설명을 복사하도록 강요했습니다.

논문의 발견: 이는 역효과를 낳았습니다.
수학 천재인 교수가 학생에게 고급 미적분을 가르치려 할 때를 생각해 보세요. 교수는 학생의 뇌가 아직 처리할 수 없는 미세하고 복잡한 세부 사항을 봅니다. 학생이 교수의 노트를 복사하려 할 때, 그들은 실제로 수학을 수 없으며 단지 단어를 외울 뿐입니다.

  • 결과: 학생은 사진을 보지 않고 외운 단어에 기반해 추측하기 시작합니다. 자신의 눈으로 실제로 볼 수 없는 것을 묘사하려 하기 때문에 환각이 심해집니다. 논문은 이를 감독-지각 불일치라고 부릅니다.

해결책: "자기 점검"을 하는 형사

저자들은 화가가 처음부터 이야기를 창조하는 것 (생성) 에는 서툴지만, 특정 세부 사항이 사실인지 점검하는 것 (판별) 에는 꽤 능숙하다는 사실을 깨달았습니다.

  • 생성: "이 방을 묘사해 보세요." -> 화가는 거울이 있다고 추측합니다.
  • 판별: "이 방에 거울이 있나요?" -> 화가는 자세히 살펴보고 "아니요, 없습니다"라고 말합니다.

논문은 이를 생성-판별 간극이라고 부릅니다. 이 모델은 이야기꾼보다는 형사에 더 가깝습니다.

새로운 방법: OSCAR ("나무 등반가")

수퍼 교사가 필요 없이 이 문제를 해결하기 위해, 저자들은 OSCAR이라는 시스템을 구축했습니다. 이는 산을 오르는 최상의 경로를 찾기 위해 나무를 탐험하는 등반가와 같습니다.

  1. 나무 탐색 (MCTS): AI 는 한 문장을 쓰고 넘어가는 대신, 설명의 여러 가지 다른 버전을 상상합니다. 이는 나무처럼 가지를 뻗어 다양한 문장 경로를 생성합니다.
  2. 이중 단계 보상 시스템:
    • 1 단계 (노드 점검): AI 가 각 문장을 작성할 때마다 형사처럼 행동합니다. 스스로에게 묻습니다. "방금 그림에 없는 물체를 언급했나?" 만약 "네, 제가 만들어낸 것입니다"라는 답이 나오면, 그 경로는 낮은 점수를 받습니다.
    • 2 단계 (최종 게이트): 전체 설명이 작성되면 AI 는 전체를 점검합니다. 설명에 어떤 만들어진 물체가 포함되어 있다면, 전체 경로에 제로 점수가 매겨집니다. 이는 "한 번이라도 거짓말하면 상을 받지 못한다"는 안전 장치 게이트와 같습니다.
  3. 나무 오르기: AI 는 이러한 점수를 이용해 나무를 다시 올라갑니다. 어떤 경로가 "환각이 없는" 설명으로 이어졌는지 확인하고, 다음에는 그 경로를 택하도록 학습합니다.

결과: 직접 하며 배우기

천재 교사의 설명을 복사하도록 강요받는 대신, AI 는 반복을 통해 배웁니다.

  1. 이미지를 묘사해 봅니다.
  2. 자신의 "형사 기술"을 이용해 자신의 실수를 찾습니다.
  3. 그 실수로부터 배워 다음에는 더 잘하도록 합니다.

결과:

  • 추측 감소: AI 는 가짜 거울이나 파란 벽과 같은 물체를 더 이상 invention 하지 않습니다.
  • 정확도 향상: 이미지와 관련된 "예/아니오" 질문에 답변하는 능력이 훨씬 향상됩니다.
  • 창의성 유지: 지루해지지 않습니다. 여전히 유창하고 풍부한 설명을 작성하지만, 이제는 실제로 보는 것에 기반합니다.

요약

이 논문은 AI 가 자신이 보는 것에 대해 거짓말을 하지 않게 하려면, 이해할 수 없는 답을 복사하도록 강요해서는 안 된다고 주장합니다. 대신, AI 가 자신의 "형사 기술"을 이용해 자신의 작업을 점검하고, 다양한 가능성을 탐험하며, 자신의 실수에서 반복적으로 배우게 해야 합니다. 이는 수퍼 스마트한 인간 (또는 AI) 이 모든 단계를 감독할 필요 없이 AI 를 더 정직하고 신뢰할 수 있게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →