← 최신 논문
💬 NLP

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

본 논문은 고대 그리스어 텍스트에 대한 광학 문자 인식 (OCR) 을 수행하는 비전 - 언어 모델 (VLMs) 이 유창하지만 시각적으로 근거 없는 오류를 생성할 때 종종 언어적 사전 지식에 의존하며, 이러한 실패 양상은 해독 시 개입을 통해 해결되지 않으며 전통적인 OCR 시스템의 노이즈 패턴과 현저히 다르다는 것을 보여줍니다.

원저자: Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보십시오. 고대 그리스어로 쓰인 아주 오래된 손글씨 편지를 읽으려 한다고 가정해 봅시다. 먹은 바래졌고, 글자는 낯설며, 페이지 여백에는 지저분한 메모가 가득합니다. 이를 대신 읽기 위해 두 명의 조수가 있습니다:

  1. "오래된 방식의 스캐너"(전통적 OCR): 이는 엄격하고 문자 그대로의 로봇과 같습니다. 페이지 위의 먹이를 보고 "A처럼 보이는 낙서가 있으니 A라고 적겠다"라고 말합니다. 먹이 너무 흐릿하면 무작위 기호나 오타를 적을 수도 있습니다. 추측하지 않고, 결과가 지저분해 보이더라도 자신이 보는 그대로를 보고할 뿐입니다.
  2. "스마트 AI 어시스턴트"(시각 - 언어 모델): 이는 고대 그리스어를 완벽하게 구사하지만 종이를 자세히 보기는 조금 게으른 천재 학생과 같습니다. 흐릿한 부분을 보면, "흠, 지금까지의 문장을 보면 다음 단어는 '왕'이어야 해"라고 생각합니다. 그래서 페이지 위의 먹이가 실제로는 '개'처럼 보였더라도 '왕'이라고 적습니다.

이 논문인 **"읽기인가 추측인가? 고대 그리스어 판본 OCR 을 위한 시각 - 언어 모델의 시각적 그라운딩 실패"**는 이러한 두 조수가 어렵고 자원이 부족한 고대 그리스어 텍스트를 읽을 때 어떤 일이 발생하는지 조사합니다.

연구자들이 간단한 비유를 통해 발견한 바는 다음과 같습니다:

1. "유창한 거짓말" 대 "지저분한 진실"

오래된 방식의 스캐너가 실수를 하면, 보통 오타나 글자 뭉개짐 (예: "kng") 처럼 보입니다. 무언가 잘못되었음이 명백합니다.

반면, 스마트 AI 어시스턴트가 실수를 하면, 페이지에 실제로 쓰인 것이 아닌 완벽하게 실제적이고 유창한 고대 그리스어 단어를 적는 경우가 많습니다.

  • 비유: AI 가 레시피를 읽고 있다고 상상해 보십시오. 재료 목록이 번져서 '밀가루'라고 쓰여 있지만, AI 는 이 레시피가 보통 '설탕'을 요구한다는 것을 알고 있다면, 자신 있게 '설탕'이라고 적을 수 있습니다. 빠르게 훑어보면 문장이 완벽해 보입니다. 하지만 사실은 거짓말입니다. AI 는 앞에 있는 특정 종이를 보는 대신, 레시피가 보통 어떻게 진행되는지에 대한 기억 (그의 "언어 사전") 에 의존하고 있는 것입니다.

2. "마법 먹이" 테스트

이를 증명하기 위해 연구자들은 장난을 쳤습니다. 텍스트를 가져와 단어 안의 글자들을 뒤섞어 (실제 단어를 의미 없는 잡음으로 바꿈) 이 잡음을 조수들에게 보여준 것입니다.

  • 오래된 방식의 스캐너: 잡음을 보고 잡음을 적었습니다. 결과가 쓰레기였음에도 불구하고 시각적 증거에 충실했습니다.
  • 스마트 AI 어시스턴트: 잡음을 보고 혼란스러워한 뒤 이를 "수정"했습니다. 잡음을 다시 실제적이고 유창한 그리스어 단어로 다시 썼습니다. 시각적 증거 (뒤섞인 글자들) 를 무시하고 언어에 대한 내부 지식에만 의존했습니다.

3. 모든 "스마트" AI 가 같은 것은 아님

연구자들은 놀라운 반전을 발견했습니다. 모든 AI 어시스턴트가 같은 방식으로 행동하지는 않습니다.

  • 일반 목적 AI: 여러 작업에 사용되는 크고 유명한 모델들입니다. 그들이 틀렸을지라도 여전히 이미지를 "보고" 있었습니다. 먹이를 읽으려 노력했지만, 올바른 단어를 추측하려는 그들의 뇌가 너무 성급했을 뿐입니다.
  • 전문가 AI: 문서 읽기를 위해 특별히 구축된 한 모델 (OlmOCR 라고 함) 이 있었습니다. 이 모델이 가장 심각한 오프ender 였습니다. 실수를 할 때, 마치 아예 이미지를 보지 않은 것과 같았습니다. 텍스트가 어떻게 되어야 한다고 생각했는지에 기반해 순수하게 추측만 했습니다. 마치 눈을 감고 실제 시험지를 무시한 채 교과서를 암송하는 학생과 같았습니다.

4. AI 를 고칠 수 있을까요?

연구자들은 AI 가 추측 대신 이미지를 보게 만들기 위해 여러 가지 "패치"를 시도했습니다:

  • "어휘 울타리": AI 에게 "그리스어 문자만 쓸 수 있다"고 말해 보았습니다. 결과: 상황이 훨씬 더 나빠졌습니다. AI 는 혼란을 겪고 평소의 트릭을 사용할 수 없게 되어 잡음을 쓰기 시작했습니다.
  • "대조 테스트": AI 에게 이미지와 그 이미지의 흐릿한 버전을 동시에 보여 주어 세부 사항에 집중하도록 강요했습니다. 결과: 일부 모델에게는 조금 도움이 되었지만, 전문가 모델에게는 도움이 되지 않았습니다.
  • "경기 후 편집": AI 에게 먼저 답을 쓰게 한 뒤, 두 번째 AI(텍스트 전용 편집기) 가 실수를 수정하게 했습니다. 결과: 이는 텍스트를 정리하는 데 잘 작동했지만, 근본적인 문제를 해결하지는 못했습니다. 첫 번째 AI 는 여전히 이미지를 무시했고, 두 번째 AI 는 거짓말이 된 뒤에 그것을 수정했을 뿐입니다.

핵심 교훈

주요 교훈은 AI 의 답변이 완벽하고 유창하게 들린다고 해서, 그것이 실제로 문서를 읽은 것은 아니다는 것입니다.

고대 역사와 희귀 문서의 세계에서 이는 위험합니다. 디지털 도서관이 이러한 AI 모델을 사용하여 오래된 그리스어 책을 스캔한다면, AI 는 드물고 obscure 한 단어를 흔하고 "타당한" 단어로 조용히 대체할 수 있습니다. 디지털 버전을 읽는 역사가는 문장이 여전히 문법적으로 완벽해 보이므로 그 변화가 일어났음을 결코 알지 못할 것입니다.

이 논문은 AI 가 최종 점수가 높은지 확인하는 것뿐만 아니라, AI 가 실제로 시각적 증거에 "그라운딩"되어 있는지, 아니면 단순히 그곳에 있어야 한다고 생각하는 것에 기반해 추측하고 있는지 확인하는 새로운 테스트 방법이 필요하다고 결론 내립니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →