← 최신 논문
💬 NLP

Hermes the Polyglot: A Unified Framework to Enhance Expressiveness for Multimodal Interlingual Subtitling

이 논문은 언어 간 자막 제작의 핵심 과제들을 극복하고 일관되고 표현력이 풍부한 번역을 생성하여 최첨단 성능을 달야하기 위해 화자 분리, 용어 식별 및 표현력 향상을 통합한 LLM 기반의 통합 프레임워크인 Hermes를 소개한다.

원저자: Chaoqun Cui, Shijing Wang, Liangbin Huang, Qingqing Gu, Zhaolong Huang, Xiao Zeng, Wenji Mao

게시일 2026-02-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chaoqun Cui, Shijing Wang, Liangbin Huang, Qingqing Gu, Zhaolong Huang, Xiao Zeng, Wenji Mao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 자막과 함께 외국 영화를 보고 있다고 상상해 보세요. 보통 그런 자막은 단순히 단어 대 단어의 직역인 경우가 많습니다. 그 자막들은 무엇이 말해졌는지는 알려주지만, 어떻게 말해졌는지—즉, 비꼬는 말투, 감정, 특정한 속어, 혹은 캐릭터가 속삭이고 있는지 아니면 소리를 지르고 있는지와 같은 부분은 놓치곤 합니다.

"헤르메스 더 폴리글랏(Hermes the Polyglot)"이라는 논문은 이를 해결하기 위해 설계된 새로운 시스템을 소개합니다. 헤르메스를 단순한 번역기가 아니라, 영화를 관찰하고, 배우의 목소리를 듣고, 원어민이 쓴 것처럼 느껴지는 자막을 쓰는 매우 똑똑한 영화 감독의 조수라고 생각해보세요.

헤르메스가 어떻게 작동하는지, 일상적인 비유를 사용하여 세 가지 간단한 단계로 나누어 설명하겠습니다.

1. "누가 무엇을 말했나?" 탐정 (화자 분리 - Speaker Diarization)

문제점: 영화에서는 캐릭터들이 말을 가로채거나, 캐릭터의 얼굴이 화면 밖에 있는 상태에서 말하기도 합니다. 일반적인 컴퓨터는 누가 말하고 있는지 혼동하여, 실제로는 "그녀가 말했다"인데도 "그가 말했다"라고 표기하거나 대명사를 섞어서 사용하는 실수를 범하곤 합니다.
헤르메스의 해결책: 헤르메스는 두 쌍의 눈과 귀를 가진 탐정처럼 행동합니다.

  • 시각 정보: 영상 속에서 누구의 얼굴이 움직이는지 살핍니다.
  • 청각 정보: 목소리의 고유한 '음색'(소리의 지문과 같은 것)을 듣습니다.
  • 마법 같은 효과: 설령 캐릭터가 화면 밖에 있더라도, 헤르메스는 그 목소리를 이전에 보았던 인물과 매칭시킵니다. 이를 통해 캐릭터들의 '명단'을 만들어 번로가 정확히 누가 말하고 있는지 파악하게 함으로써, 대명사(예: '그'와 '그녀')가 항상 올바르게 유지되도록 합니다.

2. "특수 용어 사전" (용어 식별 - Terminology Identification)

문제점: 영화에는 특정 이름, 장소, 그리고 만들어진 단어들(예: 스타워즈의 '포스'나 특정 고대 중국의 정부 직함 등)이 가득합니다. 일반적인 번역기는 이를 문자 그대로 번역하여 어색하거나 틀린 표현을 만들 수 있습니다.
헤르메스의 해결책: 헤르메스는 전문 사서처럼 행동합니다. 전체 영화를 번역하기 전에, 스크립트를 스캔하여 모든 '고유 명사'(이름, 장소, 특별한 물건 등)를 찾아냅니다. 그리고 이 단어들에 대한 엄격한 규칙집을 만듭니다.

  • 비유: 요리 레시피를 번역한다고 상상해 보세요. 만약 레시피에 "웍을 사용하세요"라고 적혀 있다면, 서툰 번역가는 "프라이팬을 사용하세요"라고 할 수도 있습니다. 헤르메스는 '웍'이 특정한 도구임을 알고 그 단어를 유지하거나 완벽한 문화적 대응어를 찾아내어, 영화 전체에서 일관성을 유지합니다.

3. "스타일 코치" (표현력 강화 - Expressiveness Enhancement)

문제점: 이것이 가장 큰 도전 과제입니다. 로봇은 "나는 화가 났다"를 정확하게 번역할 수는 있지만, 캐릭터가 실제로 격노한 것인지, 비꼬는 것인지, 아니면 상심한 것인지는 놓칠 수 있습니다. 일반적인 AI는 로봇처럼 단조롭고 무미건조하게 들립니다.
헤르메스의 해결책: 헤르메스는 SAPO(Segment-wise Adaptive Preference Optimization, 구간별 적응형 선호 최적화)라는 기술을 사용합니다. 이것을 재능 오디션의 심사위원이라고 생각해보세요.

  • 과정: 모든 대사에 대해, 헤르메스는 해당 문장을 번역하는 15가지의 서로 다른 방식을 생성합니다.
  • 심사위원: 또 다른 강력한 AI(심사위원)가 이 15가지 버전을 점수 매깁니다. 심사위원은 다음과 같이 묻습니다. "어떤 버전이 가장 자연스러운가? 어떤 버전이 감정을 가장 잘 포착했는가?"
  • 결과: 헤르메스는 심사위원의 점수로부터 배웁니다. 단순히 '정확해지는' 법을 배우는 것이 아니라, 생생해지는 법을 배웁니다. 헤르메스는 단순히 사전적인 의미를 전달하는 것이 아니라, 인간 배우가 말하는 것처럼 들리는 번역을 선택하는 법을 배웁니다.

결과: 이것이 왜 중요한가

저자들은 다양한 언어(영어에서 중국어로, 한국어에서 중국어로 등)를 사용하여 실제 영화와 TV 쇼에서 헤르메스를 테스트했습니다.

  • 정확성: 헤르메스는 기존의 번역 도구들을 제치고 사실 관계와 이름을 정확하게 맞혔습니다.
  • 자연스러움: 마치 원어민이 쓴 것처럼 유창하게 들렸습니다.
  • 생생함: 이 부분이 헤르메스가 빛을 발한 지점입니다. 헤르메스는 표준 AI나 특정 저자원 언어에서의 일부 인간 번역가보다 훨씬 더 원본 장면의 분위기스타일을 잘 포착해 냈습니다.

요약하자면:
표준적인 번역이 영화에 대한 건조한 뉴스 보고서를 읽는 것과 같다면, 헤르메스는 농담, 감정, 그리고 문화적 참조를 실시간으로 설명해 주는 친구와 함께 영화를 보는 것과 같습니다. 헤르메스는 얼굴을 보고, 목소리를 듣고, '스타일 코치'로부터 배우는 과정을 결합하여 생동감 넘치는 자막을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →