← 최신 논문
🤖 AI

Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models

이 논문은 시각-언어 모델들이 불완전한 텍스트를 충실하게 전사하기보다는 그럴듯한 형태로 재작성한다는 점을 입증하기 위해 FaithC4 벤치마크를 소개하며, 이를 통해 모델 유형에 따른 뚜렷한 저하 패턴을 드러내고 이러한 재작성 동작을 유발하는 특정 레이어 표현과 단어 길이를 식별한다.

원저자: Gwang Gook Lee, Kenan Emir Ak, Jay Mohta, Yan Xu, Dimitrios Dimitriadis

게시일 2026-07-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gwang Gook Lee, Kenan Emir Ak, Jay Mohta, Yan Xu, Dimitrios Dimitriadis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

할머니의 손글씨 노트를 읽는 로봇을 가르치고 있다고 상상해 보세요. 당신은 로봇이 모든 꼬불꼬불한 글씨, 얼룩, 그리고 오타까지도 나타난 그대로 똑같이 포착해내는, 아주 정확한 복사기처럼 행동하기를 기대합니다. 이것이 바로 수십 년 동안 텍스트 이미지를 디지털 단어로 바꾸는 데 사용되어 온 기술인 광학 문자 인식(OCR)의 역할입니다. 하지만 최근에 새로운 종류의 로봇이 등장했습니다. 바로 시각-언어 모델(Vision-Language Model, VLM)입니다. 이들은 단순히 글자를 '보는' 것을 넘어, 문장이 무엇을 의미해야 하는지 '생각'하는 로봇이라고 생각하면 됩니다. 카메라와 함께 인터넷 전체를 학습한 매우 똑똑한 두뇌를 결합한 형태죠.

여기서 중요한 질문이 있습니다. 이 똑똑한 로봇들이 엉망이 된 단어를 보았을 때, 그것을 있는 그대로 충실하게 복사할까요, 아니면 그것을 "수정"하려고 할까요? 이는 우리가 문장 중간의 글자들이 뒤섞여 있어도 원래 의도된 단어를 추측하여 문장을 읽을 수 있는 '타이포글리세미아(typoglycemia)' 효과를 경험하는 것과 비슷합니다. 인간에게는 이것이 도움이 되지만, 법적 계약서나 역사적 서신처럼 완벽하고 글자 그대로의 복사본이 필요한 경우 로봇에게는 재앙이 될 수 있습니다. 만약 로봇이 실제 문서의 일부였던 오타를 "수정"해 버린다면, 그것은 기록이 아니라 역사를 새로 쓰는 것이 되기 때문입니다. 이 논문은 이 새로운 AI 로로봇들이 충실한 필사가인지, 아니면 지나치게 의욕적인 편집가인지 파헤칩니다.


VLM은 읽는 것인가, 다시 쓰는 것인가?

이 연구에서 아마존(Amazon)의 연구진은 이 시각-언어 모델(VLM)들의 특정 습관을 테스트하기 위해 실험을 진행했습니다. 즉, 이 모델들이 조금 이상해 보이는 단어를 보았을 때, 그것을 있는 그대로 읽을까요, 아니면 몰래 더 말이 되는 단어로 다시 쓸까요?

이를 알아내기 위해 연구팀은 FaithC4라는 특별한 놀이터를 만들었습니다. 영어, 중국어, 한국어로 된 수천 개의 깨끗하고 정상적인 텍스트 페이지를 가져왔다고 상상해 보세요. 그런 다음, 이미지를 만들기 전에 단어들을 가지고 '전화기 게임(telephone game)'을 했습니다. 적격 단어의 8%를 골라 세 가지 창의적인 방식으로 망가뜨렸습니다:

  1. 뒤섞기(Scramble): 내부 글자들을 섞었습니다 (예: "standard"를 "sdanartd"로 변경).
  2. 무작위(Random): 글자를 완전히 무작위인 다른 글자로 바꿨습니다 (예: "xkpmewqi").
  3. 시각적(Visual): 글자를 거의 비슷하게 생긴 다른 글자로 바꿨습니다 (예: 'a'를 'c'로, 또는 'o'를 '0'으로 변경).

그런 다음 이 "망가진" 이미지들을 15개의 서로 다른 시스템에 보여주었습니다. 이 시스템들은 세 그룹으로 나뉩니다:

  • 구세대(The Old Guard): 단순히 픽셀을 보고 "이것은 'a'처럼 보인다"라고 말하는 전통적인 OCR 도구들(Tesseract 등)입니다.
  • 전문가(The Specialists): 문서 읽기에 특화되어 훈련된 VLM들입니다.
  • 제너럴리스트(The Generalists): 수학부터 시까지 모든 것에 능숙한 강력하고 거대한 VLM들(Qwen, GPT-4V, Gemini 등)입니다.

결과: "똑똑한" 로봇들이 너무 똑똑하다

연구 결과는 놀라웠으며, 완벽한 복사본이 필요한 사람들에게는 다소 우려스러운 내용이었습니다. 연구진은 로봇이 "똑똑할수록" 텍-스트를 다시 쓸 가능성이 높다는 것을 발견했습니다.

  • 구세대 (전통적 OCR): 이들은 가장 충실했습니다. 텍스트가 망가졌을 때도 답변을 거의 바꾸지 않았습니다. 오류율이 0.6 퍼센트 포인트 미만으로 상승했습니다. 그들은 그저 엉망인 상태를 보고 그 엉망인 상태를 그대로 복사했습니다.
  • 전문가: 제너럴리스트보다는 나았지만 여전히 일부 변경을 가했습니다. 오류율이 0.2에서 2 퍼센트 포인트 사이로 상승했습니다.
  • 제너럴리스트: 충실함 측면에서 최악이었습니다. 텍스트가 뒤섞이거나 시각적으로 변형되었을 때, 이들의 오류율은 최대 4.5 퍼센트 포인트까지 치솟았습니다.

왜 그럴까요? 이러한 범용 모델들은 문장이 어떻게 보여야 하는지를 예측하는 능력이 너무 뛰어나서, 실제로 쓰여 있는 내용을 무시하는 경우가 많기 때문입니다. 만약 그들이 "prbolem"을 본다면, 이미지에 분명히 "prbolem"이라고 적혀 있더라도 자신 있게 "problem"이라고 출력합니다. 이는 마치 선생님이 칠판에 휘갈겨 쓴 실수에도 불구하고 정답을 너무 잘 알고 있어서, 실수를 무시하고 정답을 써 내려가는 학생과 같습니다.

숨겨진 메커니즘: 언제 다시 쓰기가 일어나는가?

이 현상이 왜 발생하는지 이해하기 위해, 연구진은 Qwen3-VL-4B라는 모델의 뇌 내부를 레이어별로 살펴보았습니다. 그들은 로봇이 오류에 대해 "눈이 먼" 것인지, 아니면 단순히 그것을 무시하기로 "선택"한 것인지 알고 싶었습니다.

그들은 흥미로운 규칙을 발견했습니다: 로봇은 단어가 여전히 익숙해 보인다고 "생각"할 때만 단어를 다시 씁니다.

  • 만약 로-봇의 내부 표현(internal representation)이 뒤섞인 단어가 원래 단어와 매우 가깝게 유지된다면 (마치 흐릿한 사진이 여전히 고양이처럼 보이는 것처럼), 로봇은 "오, 저건 확실히 '고양이'야!"라고 말하며 단어를 다시 씁니다.
  • 하지만 뒤섞임이 너무 심해서 내부 표현이 원래 단어로부터 멀리 벗어나 버린다면 (사진이 이제 그냥 덩어리로 보이는 것처럼), 로봇은 추측을 멈추고 마침내 보이는 대로 읽습니다.

이것이 왜 단어 길이가 그토록 중요한지를 설명해 줍니다. 짧은 단어(4~6글자)는 로봇이 원래 단어를 추측하기 쉽기 때문에 최대 **10%**의 확률로 다시 쓰여집니다. 하지만 단어가 8글자 이상이 되면, 다시 쓰기 비율은 **0%**로 떨어집니다. 뒤섞임이 너무 커서 로봇의 "추측하는 뇌"가 원래 단어를 회복할 수 없게 되므로, 로봇은 추측을 포기하고 충실하게 전사하게 됩니다.

파급 효과

가장 놀라운 부분은 이것입니다: 몇 개의 단어를 망가뜨리는 것은 단지 그 특정 단어들에만 영향을 주는 것이 아닙니다. 연구진은 문서 내의 단어 중 단 **5%**만을 망가뜨렸음에도 불구하고, 제너럴리스트 모델들의 경우 손대지 않은 완벽한 단어들의 오류가 5~10배나 급증했다는 사실을 발견했습니다.

이는 마치 로봇이 하나의 오타 때문에 혼란에 빠져 주변의 문단 전체를 잘못 읽기 시작하는 것과 같습니다. 전통적인 OCR 시스템은 이런 문제가 없었습니다. 혼돈 속에 둘러싸여 있어도 차분하고 정확한 상태를 유지했습니다.

이것이 의미하는 바

이 논문은 이 화려한 새로운 AI 모델들이 문서를 이해하고 질문에 답하는 데는 놀랍지만, 텍스트의 문자 그대로의 완벽한 복사가 필요한 작업에는 신뢰할 수 없다고 결론짓습니다. 역사적 원고를 디지털화하거나, 법적 계약서를 검토하거나, 모든 오타가 중요한 의료 기록을 분석하고 있다면, 전통적인 OCR이나 전문화된 도구를 사용하는 것이 좋습니다. 제너럴리스트 VLM들은 고쳐서는 안 될 것들을 고쳐줌으로써 "도움을 주려는" 의욕이 너무 앞서 있습니다.

연구진은 우리가 이 모델들을 사용하는 방식에 주의를 기울여야 한다고 제안합니다. 모델이 문서를 읽을 수 있다고 해서, 그것을 충실하게 읽는다는 뜻은 아닙니다. 현재로서는, 만약 당신이 쓰인 그대로의 진실을 원한다면, 구식 로봇들이 여전히 가장 정직한 필사가입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →