← 최신 논문
💻 computer science

Can MLLMs "Read" What is Missing?

이 논문은 지시 없이 시각적 맥락만으로 마스킹된 텍스트를 복원하는 MLLM 의 능력을 평가하기 위해 MMTR-Bench 라는 새로운 벤치마크와 평가 프로토콜을 제안합니다.

원저자: Jindi Guo, Xi Fang, Chaozheng Huang

게시일 2026-04-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jindi Guo, Xi Fang, Chaozheng Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 방식 vs 새로운 방식: "퀴즈"와 "숨은 그림 찾기"의 차이

기존 방식 (기존 벤치마크):
기존에는 AI에게 **"이 그림에서 '사과'가 어디에 있나요?"**라고 명확한 질문을 던졌습니다. AI는 질문만 들으면 "아, 사과를 찾아야구나"라고 생각하고 답을 냅니다.

  • 비유: 선생님이 **"3 번 문제 답은 뭐야?"**라고 물어보고, 학생이 답을 외워서 말하는 상황입니다.

새로운 방식 (이 논문, MMTR-Bench):
이 연구는 질문을 아예 안 합니다. 대신, 문서나 웹페이지의 일부 글자를 검은색 박스로 가려버립니다. 그리고 AI에게 **"이 검은 박스 안에 원래 뭐가 있었는지, 주변 그림과 문맥을 보고 맞춰봐"**라고만 시킵니다.

  • 비유: 숨은 그림 찾기를 하거나, 빈칸 채우기를 하는 상황입니다. "무슨 글자가 빠졌는지" 스스로 찾아내서, 주변 단서 (그림, 표, 다른 페이지의 내용) 를 이용해 추론해야 합니다.

2. 왜 이 테스트가 중요할까요?

지금까지의 AI 는 질문을 받으면 잘 대답하지만, 실제 생활에서는 질문 없이도 정보를 이해해야 합니다.

  • 실제 상황: 복잡한 보고서나 여러 페이지로 된 책을 볼 때, 우리는 "여기 뭐라고 써있지?"라고 질문을 하지 않습니다. 그냥 눈으로 훑어가며 빠진 정보를 자연스럽게 채워 넣습니다.
  • 이 연구의 목적: AI 가 정말로 문맥을 이해하고, 그림과 글자의 관계를 파악하며, 지식을 활용해 빠진 부분을 채울 수 있는지를 제대로 측정하고 싶었습니다.

3. 테스트는 어떻게 진행되었나요? (난이도별 등급)

이 테스트는 답의 길이에 따라 난이도를 4 단계로 나누었습니다.

  1. 레벨 1 (간단한 숫자/이름): "2024 년"이나 "서울" 같은 짧은 단어. (정확히 맞아야 함)
  2. 레벨 2~3 (문장/구): 문장 하나를 채워 넣는 것. (뜻이 비슷하면 점수 줌)
  3. 레벨 4 (긴 설명문): 여러 줄의 설명을 채우는 것. (사실 관계가 맞아야 함)

특이점: 단순히 글자만 맞추는 게 아니라, **사실 관계 (Factuality)**를 확인하는 심판 (LLM) 을 따로 두어, "뜻은 비슷하지만 날짜가 틀리면 0 점"으로 처리하는 엄격한 규칙을 적용했습니다.

4. 결과는 어땠나요? (현실적인 한계)

결과는 **"AI 는 아직 완벽하지 않다"**는 것이었습니다.

  • 성공한 경우: 짧은 숫자나 명확한 표 (Table) 같은 구조화된 정보는 잘 찾았습니다.
  • 실패한 경우:
    • 문맥이 복잡한 경우: 그림 속에 여러 글자가 섞여 있으면, AI 는 가려진 정확한 글자 대신 주변에 보이는 다른 글자를 가져오거나 (예: "농업 창고" 그림에서 'HATCH'라는 문구를 찾아야 하는데 'VENT'라고 추측함), 전체적인 분위기만 파악하고 엉뚱한 답을 내놓는 경우가 많았습니다.
    • 여러 페이지 연결: 한 장의 종이에서 넘어가서 다른 페이지의 정보를 연결해야 할 때는 훨씬 더 어려워했습니다.
    • 작은 모델 vs 큰 모델: 구글, 오픈AI 같은 거대 기업 모델은 잘했지만, 오픈소스 작은 모델들은 많이 뒤처졌습니다.

5. 핵심 교훈: "눈으로 보고, 머리로 생각하기"

이 연구는 AI 가 단순히 글자를 읽는 (OCR) 수준을 넘어, 그림과 글자가 어떻게 연결되는지 이해하고, 빠진 부분을 논리적으로 추론하는 능력이 아직 부족하다는 것을 보여줍니다.

  • 비유: AI 는 이제까지 **"질문만 받으면 잘 대답하는 똑똑한 학생"**이었습니다. 하지만 이 테스트는 **"질문 없이 스스로 공부해서 빈칸을 채우는 학생"**을 평가한 것입니다. 아직은 그 학생이 주변 단서를 제대로 활용하지 못하고, 헷갈려서 엉뚱한 답을 내는 경우가 많습니다.

6. 미래는 어떻게 될까요?

저자들은 이 테스트를 AI 를 훈련시키는 새로운 학습 방법으로 쓰려고 합니다.

  • 아이디어: 책이나 논문에서 일부 글자를 가리고 AI 가 스스로 채우게 훈련시키면, AI 는 그림과 글자의 관계, 그리고 세계 지식을 더 깊이 있게 배우게 될 것입니다. 마치 아이가 빈칸 채우기 공부를 통해 언어 감각을 키우는 것처럼요.

한 줄 요약:

"이 논문은 AI 에게 '질문'을 주지 않고, 그림과 문서 속 '빈칸'을 스스로 채우게 함으로써, AI 가 진짜로 문맥을 이해하고 추론할 수 있는지를 시험한 결과, 아직은 많이 부족하다는 것을 발견했습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →