← 최신 논문
💻 computer science

DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning

본 논문은 언어 기반 파이프라인을 활용하여 전문 데이터셋을 생성하고, 다면적 보상을 기반으로 한 GRPO 강화 학습을 적용하여 멀티모달 언어 모델의 답변 정확도와 증거 기반 일관성을 크게 향상시키는 반사실 추론 프레임워크인 DeFacto 를 소개합니다.

원저자: Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 그림에 관한 질문을 답해야 하는 시험을 치르고 있다고 상상해 보세요. 대부분의 똑똑한 컴퓨터 프로그램 (멀티모달 대규모 언어 모델이라고 불림) 은 책에서 읽은 내용을 바탕으로 추측하는 데 매우 능숙한 학생들과 비슷하지만, 정작 눈앞에 있는 실제 그림은 종종 무시합니다. 그들은 올바른 답을 줄 수도 있지만, 그 이유는 틀릴 수 있으며, 아예 사진의 잘못된 부분을 바라볼 수도 있습니다.

이 논문은 이러한 문제를 해결하기 위해 DeFacto(사실상, 즉 '현실적으로'를 의미하는 'De Facto'의 약자) 라는 새로운 방법을 소개합니다. DeFacto 를 학생이 답을 작성하기 전에 실제로 그림을 보고 있음을 증명하도록 강요하는 엄격한 선생님이라고 생각하세요.

다음은 간단한 비유로 설명한 작동 방식입니다:

1. 문제: "가짜 전문가"

현재 AI 모델들은 종종 세 가지 특정 "부정" 습관을 겪습니다:

  • 눈가림 추측: 그들은 이미지의 잘못된 부분을 보고 잘못된 답을 얻습니다.
  • 운 좋은 추측: 그들은 이미지의 잘못된 부분을 보지만, 운이나 텍스트 암기를 통해 우연히 올바른 답을 맞춥니다.
  • 정직한 실수: 그들은 이미지의 올바른 부분을 보지만, 여전히 연결점을 찾지 못해 답을 틀립니다.

이 논문은 "똑똑한" 것만으로는 부족하다고 주장합니다. AI 는 충실해야 하며, 이는 그 답이 실제로 무엇을 보았는지에 직접적으로 연결되어야 함을 의미합니다.

2. 해결책: "빠진 조각" 게임

AI 가 부정 행위를 멈추도록 가르치기 위해 연구자들은 반사실적 사고라는 특별한 훈련 게임을 만들었습니다. "월도 찾기" 게임을 상상해 보세요. 하지만 약간의 변형이 있습니다:

  • 1 라운드 (긍정적 사례): 당신은 AI 에게 단서가 보이는 전체 그림을 보여줍니다. AI 는 단서 (예: 빨간 모자나 특정 표지판) 를 찾아 질문에 답해야 합니다. 맞으면 금별을 받습니다.
  • 2 라운드 (반사실적 사례): 이것이 마법 같은 부분입니다. 연구자들은 AI 가 필요로 하는 정확한 단서 (예: 빨간 모자) 를 검은 상자로 덮어씌웁니다 (마스크 처리). 이제 AI 에게 동일한 질문을 합니다.
    • AI 가 어쨌든 추측하려 하면 큰 패널티를 받습니다.
    • AI 가 **"모르겠습니다, 단서가 없습니다"**라고 말하면 금별을 받습니다.
    • 이것이 중요한 이유: 이는 증거가 없으면 답을 아는 척해서는 안 된다는 것을 AI 에게 가르칩니다. 환각을 일으키기보다 무지를 인정하는 법을 배웁니다.
  • 3 라운드 (무작위 마스크 처리 사례): 연구자들은 중요하지 않은 부분 (예: 하늘이나 배경의 나무) 을 덮어씌웁니다. AI 는 여전히 올바르게 답해야 합니다. 이는 AI 가 "검은 상자"가 항상 "답하지 말라"는 뜻이라고 배우는 것을 막습니다. AI 는 "빠진 증거"와 "관련 없는 배경"을 구별하는 법을 배웁니다.

3. 훈련 과정: "채점된 숙제"

연구자들은 이러한 질문들을 손으로 작성하지 않았습니다 (그렇게 하려면 영원히 걸릴 것입니다). 대신 그들은 다음과 같은 로봇 파이프라인을 구축했습니다:

  1. 질문을 읽습니다.
  2. 이미지의 중요한 부분 (예: "셔츠의 텍스트"나 "나무의 잎") 을 자동으로 찾습니다.
  3. 이러한 "덮어씌우기" 버전의 이미지를 수천 개 생성합니다.

그들은 AI 를 훈련시키기 위해 DeFacto-100K(100,000 개의 예시) 라는 거대한 데이터셋을 만들었습니다.

그런 다음, GRPO(그룹 상대 정책 최적화) 라는 특별한 훈련 방법을 사용했습니다. 이는 AI 가 게임을 4 번 연속 플레이하는 것을 지켜보는 코치라고 생각하세요. AI 가 한 라운드에서 나머지 세 라운드의 평균보다 더 잘하면 보상을 받습니다. 이는 AI 가 일관되게 학습하도록 돕습니다: 항상 증거를 찾고, 그것이 사라지면 "모르겠습니다"라고 말하세요.

4. 결과: 더 나은 학생

이 새로운 "DeFacto" AI 를 다른 최상위 모델들과 비교하여 테스트했을 때:

  • 더 많은 질문에 올바르게 답했습니다.
  • 속이기 훨씬 어려웠습니다. 증거가 숨겨졌을 때, DeFacto AI 는 계속 추측하는 다른 모델들보다 훨씬 더 자주 "모르겠습니다"라고 올바르게 말했습니다.
  • 더 정직했습니다. 그것은 답을 정당화하기 위해 이유를 지어내는 것을 멈췄습니다. 만약 그것이 답을 정당화하기 위해 이미지의 특정 부분을 가리켰다면, 그 부분에는 실제로 증거가 포함되어 있었습니다.

요약

간단히 말해, DeFacto는 AI 모델이 정직한 탐정이 되도록 가르치는 훈련 방법입니다. 그들이 어쩌면 참일 것이라고 생각하는 것에 기반하여 답을 추측하는 대신, 다음과 같이 훈련받습니다:

  1. 구체적인 시각적 증거를 찾습니다.
  2. 증거가 없으면 모른다고 인정합니다.
  3. 증거가 있으면 그것을 사용하여 답을 증명합니다.

이 논문은 이것이 AI 추론을 더 신뢰할 수 있게 하고 현실에 기반하게 만들어, 좋게 들리지만 사실이 아닌 이야기를 지어내는 것을 방지한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →