← 최신 논문
🤖 AI

CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

본 논문은 새롭게 구축된 갈등 귀속 코퍼스(Conflict Attribution Corpus)를 활용하여 멀티모달 거대 언어 모델이 내재적인 의미적 또는 물리적 불일치를 식별함으로써 일반화 가능한 가짜 뉴스를 탐지하는 능력을 향도록 하는 갈등 중심 추론 프레임워크인 CORE를 제안하며, 이를 통해 기존의 최첨단 방법들과 비교하여 퓨샷(few-shot) 및 제로샷(zero-shot) 시나리오에서 우수한 성능을 달성한다.

원저자: Jinjie Shen, Yaxiong Wang, Yujiao Wu, Lechao Cheng, Tianrui Hui, Nan Pu, Zhihui Li, Zhun Zhong

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jinjie Shen, Yaxiong Wang, Yujiao Wu, Lechao Cheng, Tianrui Hui, Nan Pu, Zhihui Li, Zhun Zhong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 사람들이 이야기, 사진, 뉴스를 거래하는 거대하고 북적이는 시장이라고 상상해 보십시오. 최근에 새로운 종류의 상인이 도착했습니다: 바로 생성형 AI입니다. 이 상인들은 그림을 그리고 이야기를 쓰는 데 너무나 능숙해서, 완전히 진짜처럼 보이는 "가짜 뉴스"를 만들어낼 수 있습니다. 마치 대통령이 축구 트로피를 받는 모습의 초상화를 그려내어, 그런 일이 실제로 일어나지 않았음에도 불구하고 마치 일어난 것처럼 보이게 만드는 숙련된 위조범과 같습니다.

문제는 기존의 보안 요원(현재의 탐지 도구들)이 특정 유형의 가짜를 잡아내도록 훈련되어 있다는 점입니다. 만약 그들이 "비뚤어진 미소"를 포착하는 법을 안다면 그것을 잡아낼 수 있겠지만, 만약 위조범이 수법을 "이상한 조명"으로 바꾼다면 기존의 보안 요원들은 혼란에 빠집니다. 그들은 위조범이 스타일을 바꿀 때마다 처음부터 다시 훈련받아야 하며, 여기에는 너무 많은 시간과 데이터가 소요됩니다.

CORE의 등장: "갈등 탐정"

이 논문의 저자인 진지에 션(Jinjie Shen)과 그의 팀은 모든 가짜 뉴스가 한 가지 공통점을 가지고 있다는 사실을 깨달았습니다: 바로 말이 안 된다는 것입니다. 즉, 내부적인 모순을 가지고 있습니다.

이것을 미스터리를 해결하는 탐정에 비유해 보겠습니다.

  • 기존 방식: 탐정이 알려진 모든 범죄자의 얼굴을 암기합니다. 만약 새로운 범죄자가 다른 얼굴을 하고 나타나면, 탐정은 실패합니다.
  • CORE 방식: 탐정이 범죄의 논리를 배웁니다. 그들은 질문합니다: "이 이야기가 내가 알고 있는 세상의 사실과 모순되는가?"

CORE(Conflict-Oriented REasoning, 갈등 지향적 추론)는 똑똑한 컴퓨터 두뇌(멀티모달 거대 언어 모델)가 바로 그 논리 기반의 탐정이 되도록 가르칩니다. 특정 가짜를 암기하는 대신, CORE는 갈등을 포착하는 법을 배웁니다.

CORE의 작동 원리: 3단계 훈련 캠프

이 컴퓨터 두뇌를 가르치기 위해, 연구진은 세 부분으로 구성된 특별한 훈련 프로그램을 구축했습니다.

1. "갈등 도서관" (갈등 속성 코퍼스)
먼저, 교과서가 필요했습니다. 그들은 14,000개의 가짜 뉴스 이야기를 담은 거대한 도서관을 만들었습니다. 하지만 단순히 "가짜"라고 라벨을 붙인 것이 아니라, 법의학 전문가처럼 세밀하게 분석했습니다:

  • 갈등 요인 (The Conflict Factor): 무엇이 모순인가? (예: "텍스트는 '대통령'이라고 말하지만, 이미지는 축구 트로피를 보여준다.")
  • 갈등 근원 (The Conflict Source): 거짓은 어디에서 왔는가? (예: "텍스트가 거짓이다", 혹은 "이미지가 거짓이다", 혹은 "이것은 실제 세상의 사실과 모순된다.")
  • 비유: 이것은 학생에게 단순히 "틀렸다"라고 표시하게 하는 것이 아니라, 답이 틀렸는지, 그리고 질문의 어느 부분이 오류를 일으켰는지를 정확히 쓰도록 하는 시험을 주는 것과 같습니다.

2. "가교 구축" (모달리티 브리징 사전 훈련)
컴퓨터는 종종 자신이 "보는" 것(이미지)과 "읽는" 것(텍스트)을 연결하는 데 어려움을 겪습니다. 때때로 컴퓨터는 축구 경기장 사진을 보면서도 "대통령"이라는 텍스트를 제대로 "이해"하지 못할 수도 있습니다.

  • CORE는 이 두 세계 사이에 다리를 놓습니다. 컴퓨터가 사진을 보고 즉시 텍스트 설명을 이해하고, 그 반대의 경우도 마찬가지로 서로 같은 언어를 사용하도록 훈련합니다.

3. "논리 체육관" (갈등 인지 훈련)
이제 컴퓨터는 체육관에 갑니다. "갈등 도서관"을 사용하여 모순을 찾아내는 연습을 합니다.

  • 컴퓨터는 자신의 마음속에서 "충돌하는 아이디어"들을 멀리 밀어내는 법을 배웁니다. 만약 "대통령"과 "축구 트로피"를 함께 본다면, 컴퓨터는 "잠깐! 이 두 가지는 함께 있을 수 없어!"라고 외치는 법을 배웁니다.
  • 컴퓨터는 다음과 같이 말하는 법을 배웁니다: "이것은 가짜인데, 왜냐하면 텍스트는 X라고 주장하지만 이미지는 Y를 보여주고 있으며, 나의 지식에 따르면 X와 Y는 동시에 일어날 수 없기 때문이다."

이것이 왜 게임 체인저인가

이 논문은 이 새로운 접근 방식이 믿을 수 없을 정도로 빠르고 유연하다는 것을 보여줍니다.

  • "퓨샷(Few-Shot)" 초능력: 만약 당신이 보안 요원에게 새로운 유형의 가짜 뉴스(예: 특정 새로운 유명인의 딥페이크)를 식별하도록 가르치고 싶다고 가정해 봅시다.

    • 기존 방식: 해당 유명인의 사례를 수천 개 학습해야 합니다.
    • CORE: 단 몇 개의 사례(때로는 100개, 심지어 0개!)만 있으면 됩니다. 이미 갈등의 논리를 이해하고 있기 때문에, 새로운 유명인에게도 즉시 그 논리를 적용할 수 있습니다. 이는 마치 체스의 규칙을 설명함으로써 누군가에게 체스를 가르치는 것과 같습니다. 단순히 모든 가능한 게임을 암기하게 하는 것이 아니라 말이죠.
  • "제로샷(Zero-Shot)"의 기적: 일부 테스트에서 CORE는 이전에 본 적이 없는 완전히 새로운 유형의 가짜 뉴스를, 단지 뉴스를 읽고 "이것이 말이 되는가?"라고 질문함으로써 포착해 냈습니다.

핵심 요약

이 논문은 시각적 속임수(위조 기술)보다는 내재적 갈등(논리적 모순)에 집중함으로써, CORE가 견고하고 일반적이며 새로운 수법을 배우기 위해 방대한 양의 데이터 라이브러리가 필요하지 않은 탐지기를 만든다고 주장합니다. CORE는 컴퓨터를 단순히 "이 사진을 전에 본 적이 있는가?"라고 묻는 존재에서, "이 이야기가 논리적으로 성립하는가?"라고 묻는 비판적 사고자로 변화시킵니다.

연구진은 다른 이들이 이 "논리 기반의 탐정"을 사용하여 인터넷을 정직하게 유지할 수 있도록, 자신들의 "갈등 도서관"과 코드를 대중에게 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →