← 최신 논문
💻 computer science

Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization

이 논문은 언어 선입견에 따른 시각 정보 간과로 인한 멀티모달 추론 모델의 환각 문제를 해결하기 위해, 불필요한 추론 토큰을 압축하고 환각을 유발하는 부정적 신호를 활용한 대비적 선호도 최적화를 결합한 C3PO 프레임워크를 제안합니다.

원저자: Hao Fang, Jinyu Li, Jiawei Kong, Tianqu Zhuang, Kuofeng Gao, Bin Chen, Shu-Tao Xia

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hao Fang, Jinyu Li, Jiawei Kong, Tianqu Zhuang, Kuofeng Gao, Bin Chen, Shu-Tao Xia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎨 상황: 그림을 보고 설명하는 '화가' AI

생각해 보세요. AI 는 그림을 보고 그 내용을 설명하는 '화가'입니다. 그런데 최근 AI 는 그림을 볼 때, 자신의 머릿속에 있는 상식 (언어적 편견) 에만 의존해서 그림에 없는 물건을 만들어내거나 엉뚱한 이야기를 지어내는 경우가 많습니다.

예를 들어, 그림에 '스프'만 있는데 AI 는 "아, 스프가 있으니까 포크도 있겠지!"라고 말하며 포크를 그려버리는 거죠. (실제론 포크가 없습니다.)

🔍 문제 발견: 왜 더 똑똑해졌는데 거짓말은 늘어날까?

연구자들은 "AI 가 추론 (생각하는 과정) 을 하도록 가르치니 더 똑똑해졌을 텐데, 왜 거짓말은 더 심해지지?"라고 의아해했습니다. 두 가지 핵심 원인을 찾아냈습니다.

  1. 눈을 감고 생각하기 (시각 무시):
    AI 가 "생각하는 과정 (CoT)"을 길게 늘어놓게 되자, 실제 그림을 보는 눈 (시각 신호) 은 더 흐려지고, 대신 머릿속의 상식 (언어적 편견) 에만 의존하게 되었습니다. 마치 그림을 보지 않고 "보통 스프에는 포크가 있으니까..."라고만 외우며 답을 내는 것과 같습니다.
  2. 생각의 쓰레기 (불필요한 말):
    AI 가 생각할 때, 중요한 정보보다 **불필요한 말 (중복된 텍스트)**을 너무 많이 섞어놓습니다. 이게 마치 "포크가 있을 거야, 왜냐하면... (중략) ...아무튼 포크가 있을 거야"라고 100 줄이나 써놓고 정작 중요한 건 빼먹는 꼴입니다.

💡 해결책: C3PO (코트 압축과 선호도 최적화)

이 문제를 해결하기 위해 연구팀은 C3PO라는 두 단계 훈련 방법을 개발했습니다.

1 단계: 생각의 정리 (CoT Compression) - "불필요한 잡담 줄이기"

AI 가 그림을 보고 생각할 때, 중요한 정보만 남기고 불필요한 잡담을 잘라내는 훈련을 시킵니다.

  • 비유: AI 가 "오늘 날씨가 좋네요. 그래서 저는 산에 갔어요. 산에는 나무가 많고... (중략) ...그래서 포크가 있을 거예요"라고 길게 말하다가, **"산에 나무가 많고 포크가 있을 거예요"**라고 핵심만 남기게 하는 거죠.
  • 효과: 잡담이 줄어들면 AI 는 그림을 더 집중해서 보게 되고, 엉뚱한 상식 (포크) 을 지어낼 확률이 줄어듭니다.

2 단계: 옳고 그름의 구분 (Contrastive Preference Optimization) - "잘한 생각 vs 엉뚱한 생각 가르치기"

AI 에게 "이건 좋은 생각, 저건 나쁜 생각"을 직접 가르쳐줍니다.

  • 좋은 생각 (Positive): AI 가 만든 생각에 전문가 (더 똑똑한 AI) 가 "여기서 포크는 없으니 고쳐라"라고 수정해 준 정답에 가까운 생각을 보여줍니다.
  • 나쁜 생각 (Negative): 연구팀이 고의로 AI 를 혼란스럽게 만들어 거짓말을 하게 유도한 생각 (예: 그림을 흐리게 하거나 "포크가 있을 거라고 믿어봐"라고 속이는 질문을 던짐) 을 보여줍니다.
  • 훈련: AI 는 "이런 나쁜 생각은 하지 말아야지, 좋은 생각만 해야지"라고 비교 학습을 통해 배웁니다.

🏆 결과: 거짓말이 줄고, 그림을 더 잘 보게 됨

이 방법을 적용한 결과, 다양한 AI 모델들이 그림에 없는 물건을 지어내는 거짓말 (할루시네이션) 이 크게 줄어들었습니다.

  • 기존 방법들은 오히려 거짓말을 더 늘리기도 했지만, C3PO 는 그림을 더 정확히 보게 만들고, 답변의 신뢰도를 높였습니다.
  • 마치 눈을 감고 생각하던 화가가, 눈을 뜨고 그림을 자세히 보게 되어 훨씬 정확한 그림 설명을 하게 된 것과 같습니다.

📝 한 줄 요약

"AI 가 그림을 볼 때 머릿속 상식에만 의존하지 않도록, 불필요한 잡담을 잘라내고 (압축), 옳은 생각과 틀린 생각을 비교하며 (선호도 최적화) 훈련시켜 거짓말을 막았습니다."

이 연구는 AI 가 더 똑똑해질수록 생기는 '거짓말' 문제를 해결하는 첫걸음으로, 앞으로 더 신뢰할 수 있는 AI 를 만드는 데 큰 도움이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →