← 최신 논문
💻 computer science

OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

이 논문은 새로운 Stable Focal Preference Optimization(SFPO) 알고리즘과 새로운 데이터셋을 활용하여 전통적인 인식 작업을 넘어 갑골문의 암시적 의미 분석을 크게 진전시킨 30억 파라미터 규모의 사후 학습 프레임워크인 OracleAnalyser를 소개한다.

원저자: Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

게시일 2026-06-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거대한 고대 퍼즐 상자가 있다고 상상해 보세요. 이 상자는 거북이 등껍질과 동물의 뼈로 만들어져 있습니다. 이것들은 수천 년 전 새겨진 중국에서 가장 오래된 문자 체계인 **갑골문자(Oracle Bone Scripts)**입니다. 오랫동안 전문가들은 이 기묘한 그림들이 무엇을 의미하는지 알아내기 위해 노력해 왔습니다. 지금까지 그들은 4,500개 이상의 글자 중 약 1,600개를 번역하는 데 성공했지만, 나머지는 여전히 미스터리로 남아 있습니다.

지금까지 이 퍼즐을 풀기 위해 시도된 대부분의 컴퓨터 프로그램은 복사기와 같았습니다. 당신이 뼈에 새겨진 그림을 보여주면, 프로그램은 "이것이 'A'인가, 아니면 'B'인가?"라고 추측합니다. 이들은 이전에 보았던 패턴을 맞추는 데는 능숙하지만, 그림을 실제로 이해하지는 못합니다. 그저 정답을 암기할 뿐입니다.

이 논문은 OracleAnalyser라는 새로운 AI를 소개합니다. 단순히 복사기처럼 작동하는 대신, OracleAnalyser는 단서들을 실제로 살펴보고 왜 그 글자가 특정한 의미를 갖는지 설명하는 탐정 또는 번역가와 같습니다.

이 탐정을 어떻게 만들었는지, 쉬운 비유를 통해 설명해 드리겠습니다.

1. 문제점: "맹목적인 추측" vs "사고하기"

이전의 AI 모델들은 정답지를 외웠지만 수학 원리는 이해하지 못한 학생들과 같았습니다. 만약 본 적 없는 글자를 마주하면, 그들은 그냥 추측해 버립니다.

  • 과거의 방식: 머리에 무언가를 이고 있는 사람의 그림이 새겨진 뼈 사진을 보여줍니다. AI는 "이것은 '하늘'이라는 글자입니다"라고 추측합니다. 하지만 왜 그런지에 대해서는 설명하지 못합니다.
  • 새로운 방식 (OracleAnalyser): AI는 동일한 사진을 보고 이렇게 말합니다. "사람이 서 있는 모습이 보입니다. 머리 위에 둥근 모양이 있는데, 마치 무거운 것을 들고 있는 것 같습니다. 이것은 고대의 '하늘'을 나타내는 상징처럼 보입니다." 이 모델은 답을 내놓기 전에 이미지를 부분별로 분해하여 분석합니다.

2. 훈련: 탐정 가르치기

연구진은 단순히 AI에게 더 많은 사진을 먹인 것이 아닙니다. 그들은 AI가 세 단계를 거쳐 생각하는 법을 가르쳤습니다.

  • 1단계: 강의 (지도 미세 조정 - Supervised Fine-Tuning)
    그들은 똑똑한 AI(Qwen2.5-VL)를 가져와서, 전문가가 글자의 이름을 말하기 전에 그림을 설명하는 수천 개의 사례를 보여주었습니다. 이는 마치 선생님이 학생에게 "이 선들을 보세요, 지붕처럼 생겼죠. 이것은 '집'을 의미합니다"라고 보여주는 것과 같습니다. AI는 이러한 추론 과정을 모방하는 법을 배웠습니다.

  • 2단계: 연습 시험 (데이터 생성 - Generating Data)
    AI에게 시험을 치르게 했습니다. 때로는 정답을 맞히기도 하고, 때로는 틀리기도 했습니다. 연구진은 이러한 시도들을 수집했습니다.

    • 좋은 답변: "이것은 뿌리가 있는 나무처럼 보입니다." (정답)
    • 나쁜 답변: "이것은 막대기처럼 보입니다." (오답)
      그들은 이 쌍(pair)들을 사용하여 AI에게 좋은 설명과 나쁜 설명의 차이를 가르쳤습니다.
  • 3단계: 특별 코칭 (SFPO)
    이것이 이 논문의 가장 큰 혁신입니다. 표준적인 훈련 방식은 "나쁜" 답변이 사실 어느 정도 맞을 때(예: 나무를 막대기 같다고 말하는 것은 완전히 틀린 것은 아니지만, 충분히 구체적이지는 않은 경우) 가끔 혼란을 겪을 수 있습니다.
    연구진은 **SFPO(Stable Focal Preference Optimization)**라는 새로운 코칭 방법을 만들었습니다.

    • 비유: 이 코치는 모든 실수에 대해 단순히 "틀렸어!"라고 소리치는 코치가 아닙니다. 대신, 코치는 가장 중요한 실수에 집중하고, 너무 혼란스럽거나 사소한 실수들은 무시합니다. 또한, 학생이 첫 번째 강의(단계 1)에서 배운 것을 잊어버리지 않도록 관리합니다. 이를 통해 AI를 안정적이고 집중력 있게 유지합니다.

3. 결과: 큰 지능을 가진 작은 뇌

보통 어려운 문제를 해결하려면 거대한 컴퓨터 뇌(거대한 AI 모델)가 필요합니다. 하지만 OracleAnalyser는 놀라울 정도로 작습니다. 이 모델은 단 30억 개의 파라미터(경쟁 모델들의 거대한 700억 파라미터 뇌와 비교했을 때 작고 효율적인 뇌라고 생각하면 됩니다)만을 가지고 있습니다.

그럼에도 불구하고, 이 모델은 더 큰 모델들보다 더 뛰어난 성능을 보였습니다.

  • 알려진 글자에 대해: 의미를 설명하고 글자를 식별하는 능력이 훨씬 뛰어났습니다.
  • 알려지지 않은 글자에 대해: 한 번도 본 적 없는 뼈의 조각을 보여주었을 때도, 여전히 사진을 보고 형상(예: "연기처럼 보인다" 또는 "지붕처럼 보인다")을 묘사하며 영리한 추측을 해낼 수 있었습니다.

요약

이 논문은 AI에게 단순히 패턴을 인식하는 법(복사기처럼)이 아니라, 사진을 먼저 분석하는 법(탐정처럼)을 가르치고, 혼란을 피하기 위한 특별하고 안정적인 훈련 방법을 사용함으로써, 작지만 강력한 도구를 만들었다고 주장합니다. 이 도구는 단순히 글자의 이름을 맞히는 것이 아니라, 고대 그림 뒤에 숨겨진 "이야기"를 설명함으로써 연구자들이 중국의 고대 역사를 이해하는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →