← 최신 논문
💬 NLP

Analysis of Numerical Localisation in LLM Translations

이 논문은 다섯 가지 범용 대규모 언어 모델을 평가함으로써 수치 번역에 관한 기존 연구를 확장하며, 임베딩 지역화 원칙을 프롬프트 컨텍스트에 직접 삽입하는 것이 직접 번역이나 다른 전략들과 비교했을 때 시간, 숫자, 날짜 번역의 정확도 측면에서 통계적으로 유의미한 개선을 가져온다는 것을 밝혀냈다.

원저자: Patrizia Kaye

게시일 2026-08-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Patrizia Kaye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 다른 나라에 있는 친구에게 엽서를 보내려고 한다고 상상해 보세요. 당신은 날짜를 "07/04/2024"라고 적었습니다. 당신에게 이것은 7월 4일입니다. 하지만 영국에 있는 당신의 친구에게 이것은 4월 7일입니다. 만약 당신이 레시피, 은행 송금, 또는 과학 공식을 보내는 중이라면, 숫자와 날짜를 틀리는 것은 단순한 오타가 아니라 재앙이 됩니다. 이것이 바로 **현지화(localisation)**의 세계입니다. **번역(translation)**이 단어를 바꾸는 것(예: "dog"을 "Hund"로 바꾸는 것)이라면, 현지화는 정보의 옷 전체를 현지 문화에 맞게 갈아입히는 것과 같습니다. 그것은 정장을 입을지 턱시도를 입을지, 혹은 이 경우처럼 소수점을 구분하기 위해 쉼표를 쓸지 점을 쓸지를 결정하는 일입니다.

여기에 **대규모 언어 모델(LLM)**이 등장합니다. 이들을 아주 똑똑하고 매우 빠른 로봇이라고 생각해 보세요. 이들은 인터넷에 있는 거의 모든 것을 읽었습니다. 이야기 쓰기나 문장 번역에는 뛰어나지만, 숫자와 날방식의 엄격한 규칙에 있어서는 가끔 비틀거리곤 합니다. 그들은 "1,000"이 천을 의미한다는 것은 알 수 있지만, 독일에서는 같은 숫자가 "1.000"으로 쓰인다는 사실을 잊어버릴 수도 있습니다. 이 논문은 AI 과학의 특정 영역을 파고듭니다. 과연 이 로봇 뇌들이 단순히 단어를 번역하는 것을 넘어, 새로운 국가를 위해 숫자와 날짜를 올바르게 "옷 입힐" 수 있을까요? AI가 현지화를 잘못하면 안전한 약 복용량이 위험한 양으로 변하거나, 작은 이익이 막대한 손실로 변할 수 있기 때문에 이는 매우 중요한 질문입니다.

위대한 숫자의 변신

이 연구에서 연구원 파트리치아 케이(Patrizia Kaye)는 다섯 가지 서로 다른 AI 모델을 테스트했습니다. 이들은 실행하는 데 수백만 달러가 드는 거대하고 슈퍼컴퓨터급인 모델들이 아니었습니다. 대신 그녀는 강력한 게이밍 노트북 같은 표준 하드웨어에서도 실행할 수 있는 더 작은 "범용(commodity)" 모델 다섯 개를 선택했습니다. 그녀는 이 모델들이 숫자를 현지 규칙에 따라 정확하게 처리하면서 영어 텍스트를 독일어로(또는 그 반대로) 번역할 수 있는지 확인하고 싶었습니다.

이를 위해 그녀는 작은 실험을 설계했습니다. 그녀는 유럽 의회 기록이나 의료 문서와 같은 실제 출처에서 가져온 날짜, 시간, 숫자가 포함된 700개의 문장을 준비했습니다. 그런 다음, 네 가지 다른 "전략" 또는 방법으로 AI 모델에게 번역하도록 요청했습니다:

  1. 직접 번역 (Direct Translation): AI에게 단순히 "이 문장을 번역해줘"라고 요청하는 것입니다.
  2. 인컨텍스트 러닝 (In-Context Learning, ICL): 프롬프트에 참조 정보를 제공하는 것입니다. 예를 들어, "독일에서는 천 단위에 점을 사용하고 소수점에 쉼표를 사용한다는 것을 기억해"라고 말하는 식입니다.
  3. 생각의 사슬 (Chain-of-Thought, CoT): AI에게 답을 내놓기 전에 단계별로 과정을 설명하며 "소리 내어 생각"하도록 요청하는 것입니다.
  4. 사후 편집 (Post-Editing): AI가 먼저 번역하게 한 다음, 별도의 컴퓨터 스크립트를 사용하여 숫자를 찾아내어 수동으로 수정하는 방식입니다.

놀라운 우승자

결과는 약간의 반전이 있었습니다. 영어와 중국어 사이의 숫자 번역에 관한 이전 연구에서는 "사후 편집"(나중에 숫자를 수정하는 방식)이 가장 좋은 방법이라는 결과가 나왔습니다. 하지만 파트리치아가 이를 영어와 독일어에 테스트했을 때, 사후 편집은 실제로 최악의 전략이었으며 종종 정확도가 30% 미만을 기록했습니다. AI가 혼란을 겪을 때, 나중에 숫자를 수정하려고 시도하는 것이 오히려 일을 망치는 것처럼 보입니다.

AI가 자신의 추론 과정을 설명하며 "생각의 사슬(CoT)" 방식을 사용하는 것도 큰 도움이 되지 않았습니다. 이 방식은 모델들이 어떻게 결론에 도달했는지에 대해 똑똑하게 들리려고 노력하는 과정에서 오히려 틀린 답을 내놓는 경우가 많았습니다.

진정한 챔피언은 **인컨텍스트 러닝(In-Context Learning)**이었습니다. 연구자가 프롬프트에 몇 가지 명확한 지침을 추가하여, AI에게 숫자의 형식을 어떻게 지정해야 하는지 정확히 알려주었을 때 모델들은 훨씬 더 나은 성능을 보였습니다. 가장 성능이 좋았던 모델(Qwen3-4B-Instruct-2507)의 경우, 이 간단한 "참조"를 통해 영어에서 독일어 방향의 숫자 정확도가 **91.7%**까지 상승했는데, 이는 직접 번역만 했을 때의 **92.2%**와 비교하여 (정확도 향상 측면에서 유의미한) 차이를 보여주었습니다. 연구 결과, 이러한 개선은 단순히 운이 좋았던 것이 아니라, 통계적 테스트를 통해 프롬프트에 이러한 규칙을 추가하는 것이 다른 전략들에 비해 실질적이고 측정 가능한 차이를 만든다는 것이 확인되었습니다.

더 큰 뇌는 어떨까?

더 큰 AI 모델(더 많은 파라미터/매개변수)이 항상 더 나은 작업을 수행할 것이라고 생각할 수도 있습니다. 그러나 이 논문은 크기가 항상 성공을 보장하는 것은 아니라는 점을 발견했습니다. 테스트된 모델들은 20억 개에서 70억 개의 파라미터를 가지고 있었습니다. 놀랍게도 40억 개의 파라미터를 가진 모델이 여러 경우에서 70억 개의 파라미터를 가진 모델보다 더 뛰어난 성능을 보였습니다. 이는 이 특정 작업의 경우, 가장 큰 뇌를 갖는 것보다 올바른 지침을 갖는 것이 더 중요하다는 것을 시사합니다.

또한 연구는 AI에게 어떤 버전의 영어 또는 독일어를 사용할지(예: "영국 영어" vs "독일의 독일어")를 정확히 알려주는 것이 도움이 되는지 테스트했습니다. 그것은 약간의 도움이 되었지만, 프롬프트에 포맷팅 규칙을 제공하는 것만큼 큰 효과는 없었습니다.

핵심 요약

이 논문은 만약 당신이 AI가 숫자와 날짜를 올바르게 처리하기를 원한다면, 단순히 "최선을 다해달라"고 요청하지 말라고 제안합니다. AI가 자신의 실수를 나중에 스스로 수정하도록 의존하지도 말고, 자신의 생각을 설명하도록 강요하지도 마십시오. 대신, 시작 단계에서 명확한 규칙 세트를 제공하십시오. 대화 속에 현지화 원칙을 직접 심어둠으로써, 혼란스러워하는 로봇을 정밀한 번역가로 바꿀 수 있습니다. 이 결과가 테스트된 모델과 언어 쌍에 국한된 것이긴 하지만, 이 방법은 국경을 넘어 돈, 과학, 또는 일정을 다루는 모든 이들에게 AI 번역을 더 안전하고 정확하게 만들 수 있는 재현 가능한 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →