← 최신 논문
💬 NLP

A Pocket Offline Model for Simultaneous Speech Translation as CUNI Submission to IWSLT 2026

본 논문은 체코어, 영어, 독일어, 이탈리아어에 대해 낮은 계산 요구 사항으로 고품질의 다국어 동시 번역을 달성하기 위해 AlignAtt 정책이 적용된 10억 파라미터 규모의 오프라인 Canary 모델을 적응시킨 IWSLT 2026 동시 음성 번역 공유 과제(Shared Task)에 대한 CUNI의 제출물을 제시한다.

원저자: Aziz Sharipov Ortega, Dominik Macháček

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aziz Sharipov Ortega, Dominik Macháček

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 Canary라는 매우 똑똑하고 다국어를 구사하는 번역가가 있다고 상상해 보세요. 이 번역가는 전체 연설을 듣고 나서 완벽하게 번역문을 작성하는 데 아주 뛰어난 재능을 가지고 있습니다. 하지만 여기에는 한 가지 함정이 있습니다. Canary는 화자가 문장을 완전히 끝낼 때까지 기다린 후에야 작업을 시작하는 습나다. 이것은 마치 웨이터가 당신이 커피 한 잔만 주문하고 싶더라도, 메뉴판 전체를 다 읽을 때까지 주문을 받지 않겠다고 거부하는 것과 같습니다.

Charles University (CUNI) 팀은 Canary에게 인간 통역사처럼 소리를 들으면서 동시에 단어 단위로 번き하는 동시 통역사가 되는 법을 가르치고 싶어 했습니다.

그들은 다음과 같은 간단한 비유를 사용하여 이 일을 해냈습니다.

1. "멈춤과 가기" 전략 (AlignAtt)

Canary가 실시간으로 작동하게 만들기 위해, 팀은 번역기 전체를 처음부터 다시 학습시키지 않았습니다. 대신, Canary에게 AlignAtt라고 불리는 새로운 규칙 세트를 부여했습니다.

Canary의 뇌를 "주의력 안경(attention glasses)"을 쓴 상태라고 생각해 보세요. 번역기가 새로운 오디오 덩어리를 들을 때, 그것은 자신이 만들고 있는 문장을 바라봅니다. AlignAtt 규칙은 다음과 같이 말합니다: "방금 들은 오디오의 특정 지점과 일치하는 소리가 들리는 즉시, 나머지 문장을 쓰는 것을 멈춰라."

이것은 마치 당신이 100% 확신하는 단어만을 전달하는 "전화기 게임(telephone)"과 같습니다. 만약 번역기가 아직 도착하지 않은 오디오를 바탕으로 단어를 추측하려고 하면, 시스템이 그 추측을 차단합니다. 이는 번역기가 "환각(hallucination)"을 일으키거나(말을 지어내거나) 말을 반복하는 것을 방지합니다.

2. "주머니 크기의" 강력한 모델

이 프로젝트에서 가장 멋진 것 중 하나는 번역기의 크기입니다. 대부분의 고품질 번역기는 데이터 센터 전체가 필요할 정도로 거대한 슈퍼컴퓨터와 같습니다. 하지만 Canary는 10억 개의 파라미터를 가진 모델입니다.

저자들은 이를 **"포켓 오프라인 모델(Pocket Offline Model)"**이라고 부릅니다. 스마트폰 앱 크기의 번역기를 당신의 주머니에 넣는다고 상상해 보세요. 이것은 클라우드의 거대한 서버로 데이터를 보낼 필요 없이 일반 스마트폰에서 실행될 수 있을 만큼 작습니다. 즉, 인터넷 연결이 없어도 사용할 수 있으며, 신호가 왔다 갔다 하는 것을 기다릴 필요가 없기 때문에 훨씬 더 빠를 것입니다.

3. "노이즈 캔슬링" 헤드폰

실제 오디오는 지저도합니다. 사람들이 기침을 하고, 자동차가 경적을 울리며, 방 안에 메아리가 울립니다. 이를 처리하기 위해 팀은 "노이즈 필터"(Silero VAD라고 불림)를 추가했습니다. 이것을 번역기를 위한 고성능 노이즈 캔슬링 헤드폰이라고 생각하세요. 이는 침묵과 배경 소음을 무시하고, 실제 사람의 목소리가 나올 때만 집중합니다. 이를 통해 번역기가 혼란을 겪거나 문 닫는 소리를 번역하려고 시도하는 것을 방지합니다.

4. 시간과의 싸움 (결과)

팀은 세 가지 언어 쌍(체코어-영어, 영어-독일어, 영어-이탈리아어)에 대해 다른 최고 수준의 번역기들(베이스라인)과 시뮬레이션된 경주를 통해 테스트했습니다.

  • 설정: 그들은 두 가지 시나리오를 테스트했습니다: "높은 지연 시간(High Latency)" 경주(정확도를 위해 조금 더 오래 기다릴 수 있는 경우)와 "낮은 지연 시간(Low Latacy)" 경주(속도가 가장 중요한 경우).
  • 결과:
    • 속도 vs 품질: 그들의 시스템은 두 카테고리 모두에서 챔피언이었습니다. "높은 지연 시간" 경주에서, 그들은 기존의 가장 우수한 시스템들보다 훨씬 더 나은 성능을 보였습니다(점수를 4~8점 향상시킴).
    • 경쟁자를 이기다: 속도가 매우 빨라야 하는 "낮은 지연 시간" 경주에서도, 그들은 기존의 최고 시스템들과 대등하게 맞섰으며 종종 그들을 앞질렀습니다.
    • 슬라이딩 윈도우(Sliding Window): 그들은 또한 오프라인 모델을 실시간으로 작동하게 만드는 다른 방식(실수를 수정하기 위해 끊임없이 단락을 다시 읽는 것과 같은 "슬라이딩 윈도우" 방식)과 비교했습니다. 그들의 "멈춤과 가기(Stop-and-Go, AlignAtt)" 방식은 훨씬 더 나았으며, 지연 시간은 줄이면서 더 높은 품질의 번역을 만들어냈습니다.

5. 배운 점 (그리고 배우지 못한 점)

팀은 강력한 오프라인 번역기를 가져와서 "실시간 규칙책"을 부여하는 것이 승리하는 전략이라는 결론을 내렸습니다. 이것은 단순하고 효과적이며 비싼 학습을 요구하지 않습니다.

하지만 작은 난관에 부딪히기도 했습니다. 그들은 번역기에게 "문맥 단서(context clues)"(예를 들어, "이것은 정치 회의이므로 격식 있는 단어를 사용하라"고 알려주는 것)를 제공하려고 시도했지만, 이 단서들을 새로운 "멈춤과 가기" 규칙과 결합했을 때 번역기가 혼란을 느껴 작동을 멈췄습니다. 그들은 이것이 번역기가 이 특정 조합에 대한 예시를 충분히 학습하지 못했기 때문이라고 추측합니다.

핵심 요약

CUI 팀은 "끝날 때까지 기다리는" 번역기를 "들으면서 동시에 번역하는" 주머니 속의 번역기로 성공적으로 탈바로 놓았습니다. 그들은 고품질의 동시 번역을 얻기 위해 거대한 슈퍼컴퓨터가 필요한 것이 아니라, 올바른 규칙을 가진 작고 똑똑한 모델이 거대 시스템만큼이나, 혹은 그보다 더 잘 해낼 수 있다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →