← 최신 논문
💻 computer science

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

이 논문은 멀티모달 거대 언어 모델을 평가하기 위해 명확하고 표준화된 문장 단위의 갑골문 인스턴스를 합성한 새로운 벤치마크인 S-OBI를 소개하며, 현재의 모델들이 문자 수준 인식에 대한 과도한 의존과 시각적 인지 오류의 전파로 인해 구조화된 갑골문 이해에 어려움을 겪고 있음을 밝힌다.

원저자: Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

게시일 2026-07-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 고대 중국 역사를 읽는 법을 가르치고 있다고 상상해 보십시오. 오랫동안 연구자들은 로봇에게 개별적인 고대 기호를 인식하도록 가르쳐 왔습니다. 이는 마치 아이에게 글자 "A"나 숫자 "1"을 개별적으로 인식하도록 가르치는 것과 비슷합니다. 그들은 거북 등껍질에 새겨진 단일 기호를 가리키며 "저것은 '말'이다"라고 말할 수 있습니다.

하지만 실제 역사는 단순히 무작위적인 글자들의 더미가 아닙니다. 역사에는 이야기, 날짜, 그리고 특정한 의미가 담긴 문장들이 가득합니다. **"Beyond Single Character(단일 글자를 넘어)"**라는 제목의 이 논문은, 로봇이 글자를 인식할 수 있다고 해서 그 이야기를 읽을 수 있다는 뜻은 아니라고 주장합니다.

다음은 연구자들이 수행한 작업과 발견한 내용에 대한 간단한 요약입니다.

문제점: "레고" 대 "성(Castle)"

갑골문(고대 문자)을 레고 브릭으로 만든 성이라고 생각해 보십시오.

  • 기존 연구들은 로봇이 단일한 빨간색 브릭이나 파란색 브릭을 식별할 수 있는지만 테스트했습니다.
  • 이 논문은 다음과 같이 질문합니다: "로봇이 성 전체를 보고 누가 그것을 왜 만들었는지, 그리고 그 이야기가 무엇인지 말할 수 있는가?"

연구자들은 현재의 AI 모델들(멀티모달 거대 언어 모델, MLLM)이 개별 브릭을 찾아내는 데는 뛰어나지만, 성 전체를 이해하는 데는 서투르다는 것을 발견했습니다. AI는 "말"이라는 기호가 어떻게 생겼는지는 알 수 있지만, 이 문장이 왕이 말을 사냥하는 것에 관한 것인지, 아니면 말이 도망가는 것에 관한 것인지는 파악하지 못합니다.

해결책: "깨끗한" 테스트 구축 (S-OBI)

고대 기록들은 오래되고, 금이 가고, 지저나 있습니다(마치 진흙투성이에 찢어진 사진처럼 말이죠). AI를 공정하게 테스트하기 위해 연구자들은 S-OBI라는 새로운 벤치마크를 만들었습니다.

연구자들은 난잡한 원본 사진을 사용하는 대신, 디지털 복원가 역할을 수행했습니다:

  1. 전문가들이 이미 번역하고 이해한 95개의 고대 문장을 가져왔습니다.
  2. 고대 조각의 지저분하고 흐릿한 부분들을, 동일한 기호의 수정처럼 맑고 완벽한 디지털 버전으로 교체했습니다.
  3. 문장 구조는 그대로 유지하되, 시각적 입력값만 "깨끗하게" 만들었습니다.

이는 마치 1800년대의 진흙투성이에 찢어진 편지를 스캔한 뒤, AI가 먼지에 방해받지 않고 문장의 의미 자체에 집중할 수 있도록 완벽한 폰트를 사용하여 깨끗한 종이에 다시 타이핑하는 것과 같습니다.

테스트: 세 가지 난이도

그들은 AI가 실제로 얼마나 똑똑한지 알아보기 위해 세 가지 유형의 퍼즐을 설계했습니다:

  1. "요지" 테스트 (의미론적 매칭): "여기 고대 문장이 있습니다. 다음 네 가지 현대적 요약 중 이 문장을 가장 잘 설명하는 것은 무엇입니까?"
    • 결과: AI는 이 단계에서 괜찮은 모습을 보였습니다. 전반적인 분위기를 추측할 수 있었습니다.
  2. "구조" 테스트 (슬롯 추출): "여기 문장이 있습니다. 날짜, 인물, 행동, 목적어를 양식에 맞춰 채우십시오."
    • 결과: AI는 고전했습니다. 정보를 올바르게 조직하지 못했습니다.
  3. "탐정" 테스트 (맥락적 추론): "여기 한 단어가 지워진 문장이 있습니다. 주변 단어들을 바탕으로 사라진 단어는 무엇입니까?" 또는 "여기 단어 순서가 뒤섞인 문장이 있습니다. 올바른 순서로 다시 배치하십시오."
    • 결과: AI는 처참하게 실패했습니다. 주변의 단서들을 이용해 빠진 부분을 찾아내지 못했습니다.

주요 발견

가장 놀라운 발견은 AI가 여전히 "단일 글자" 수준에 머물러 있다는 점입니다.

연구자들은 AI가 작은 기호 하나를 인식하는 데 아주 작은 실수만 해도, 그 오류가 문장 전체로 퍼져나가 결국 문장 전체의 의미를 잘못 추측하게 된다는 것을 발견했습니다. 이는 문장에서 단어 하나를 잘못 읽으면 문단 전체를 오해할 수 있는 것과 같습니다.

테스트된 가장 똑똑한 AI 모델들(GPT-4o 및 Qwen 등)조차 전체적으로 매우 낮은 점수(정답률 약 33%)를 기록했습니다. 그들은 때때로 단어의 순서(예: 문장이 날짜로 시작한다는 것)를 맞출 수는 있었지만, 문장이 전달하는 이야기를 실제로 이해하지는 못했습니다.

결론

이 논문은 AI가 고대 기호를 인식하는 능력은 향상되고 있지만, 아직 그것들을 일관된 언어로 "읽는" 법은 배우지 못했다고 결론짓습니다. 이는 마치 사전은 가지고 있지만 시를 쓰는 법은 모르는 상태와 같습니다. 이 고대 기록들을 진정으로 이해하기 위해서, AI는 단순히 개별 브릭을 식별하는 수준을 넘어, 어떻게 성을 쌓고(그리고 이해하고) 이해하는지를 배워야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →