← 최신 논문
💬 NLP

Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

이 논문은 거대언어모델을 사용하여 주석이 달린 데이터셋을 언어 간에 전이하는 파이프라인을 제안하며, 영어 DEFT 코퍼스를 러시아어로 번역하여 과학적 트렌드 분석 및 의사결정을 지원하는 희귀 용어-정의 마이닝 자원을 생성함으로써 그 효과를 입증한다.

원저자: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 방대하고 정교하게 상세한 영어 도서관이 있다고 상상해 보세요. 이 도서관에는 모든 중요한 단어(예: "photosynthesis"나 "inflation")가 강조 표시되어 있고, 그 바로 옆에는 정의가 적혀 있습니다. 이 도서관은 컴퓨터가 과학과 기술을 이해하는 법을 배우는 데 있어 노다지와 같습니다. 하지만 이 도서관은 오직 영어로만 존재합니다.

문제는 이렇습니다. 러시아어로는 이에 상응하는 도서관이 없다는 것입니다. 처음부터 이 도서관을 만드는 것은 수천 명의 팀을 고용하여 모든 책을 읽고, 단어를 찾아내고, 정의를 손으로 직접 쓰는 것과 같습니다. 이는 영원히 걸릴 것이며 엄청난 비용이 들 것입니다.

핵심 아이디어: "스마트 번역기"라는 지름길
이 논문의 저자들은 이렇게 질문했습니다. 우리가 초거대 AI(대규모 언어 모델 또는 LLM)를 사용하여, 단순히 단어만 번역하는 것이 아니라 강조 표시와 정의까지 함께 옮겨주는 스마트한 번역기로 사용할 수 있을까?

이렇게 생각해 보세요. 당신에게 유명한 랜드마크들이 빨간색으로 동그라미 쳐진 도시의 지도가 있다고 상상해 봅시다. 당신은 같은 도시의 지도이지만 다른 언어로 된 지도를 원합니다. 일반적인 번역기는 거리 이름만 새 언어로 바꿀 것이고, 그러면 빨간 동그라미들은 엉뚱한 곳에 둥둥 떠 있게 될 것입니다. 저자들은 AI가 다음과 같이 말할 수 있기를 원했습니다. "좋아, 영어로 'Eiffel Tower' 주변에 빨간 동그라미가 있는 것을 확인했어. 프랑스어로는 'Tour Eiffel'이야. 이제 'Tour Eiffel'을 감싸도록 빨간 동그라미를 옮길게."

테스트 방법
그들은 특정 영어 데이터셋인 DEFT(과학 용어와 그 정의가 가득한 데이터)를 가져와서 여러 가지 AI 모델(ChatGPT, Llama, DeepSeek, Qwen 등)을 사용하여 이를 러시아어로 "전이(transfer)"하려고 시도했습니다.

그들은 두 가지 주요 접근 방식을 시도했습니다:

  1. "수학적" 접근 방식: AI에게 이렇게 명령했습니다. "단어는 10번째 글자에서 시작해서 20번째 글자에서 끝납니다. 텍스트를 번역한 다음, 러시아어 단어에 대한 새로운 글자 위치를 알려주세요."
    • 결과: AI는 혼란에 빠졌습니다. 이것은 마치 누군가에게 벽을 다른 색으로 재건축하면서 동시에 벽돌의 개수를 세라고 요청하는 것과 같습니다. AI는 계속 숫자를 놓치거나 틀린 숫자를 말했습니다.
  2. "단어 찾기" 접근 방식: 그들은 지침을 변경했습니다. 숫자를 요구하는 대신, "여기에 강조된 단어가 포함된 영어 문장이 있습니다. 여기 러시아어 번격문이 있습니다. 영어 단어와 일치하는 러시아어 단어를 찾아 강조 표시해 주세요."라고 말했습니다.
    • 결과: 이 방식이 훨씬 더 잘 작동했습니다! 이는 AI에게 복잡한 수학을 하는 대신 단순히 일치하는 그림을 가리키라고 요청하는 것과 같았습니다.

결과

  • 최고의 번역기: AI 모델인 DeepSeek가 "강조 표시"(주석)를 정확하게 옮기는 데 가장 뛰어난 성과를 보였습니다. 이 모델은 94%의 확률로 정답을 맞혔습니다.
  • 품질: 결과물인 러시아어 데이터셋은 완벽하지 않습니다. 저자들은 이를 "골드 등급(gold grade)"이 아닌 "실버 등급(silver grade)"이라고 부릅니다. 100% 정확하지는 않지만, 견고한 시작점이 되기에는 충분합니다. 이는 책의 90%가 완성된 초안을 가진 것과 같습니다. 남은 10%의 오류를 수정하기 위해 인간 편집자가 필요하지만, 책 전체를 처음부터 쓰는 것보다는 훨씬 빠릅니다.
  • 새로운 모델 훈련: 그들은 이 새로운 AI 번역 러시아어 데이터셋을 사용하여 더 작고 단순한 AI(BERT 모델)를 훈련시켰습니다. 이 새로운 러시아어 AI는 용어와 정의를 식별하는 법을 꽤 잘 배웠으며, 이는 "실버" 데이터가 컴퓨터에게 새로운 것을 가르치기에 충분히 유용하다는 것을 증명했습니다.

이것이 중요한 이유
저자들은 이 방법이 "자원이 부족한(under-resourced)" 언어(디지털 데이터가 충분하지 않은 언어)에 있어 게임 체인저라고 설명합니다. 데이터셋을 제로에서부터 구축하기 위해 몇 년을 기다리는 대신, 연구자들은 이러한 "스마트 번역기"를 사용하여 빠르게 초안 데이터셋을 만들 수 있습니다. 이는 러시아(그리고 나중에 다른 언어들까지도)의 과학자와 의사 결정자들이 과학 및 기술 트렌드를 훨씬 더 빠르게 분석할 수 있도록 돕습니다.

한계점
이 논문은 자신의 한계에 대해 매우 구체적으로 명시하고 있습니다:

  • 그들은 영어-러시아어 번역만을 테스트했습니다.
  • AI가 인간 번역가보다 일을 더 잘할 수 있는지 테스트하지 않았습니다(인간 번역가가 여전히 더 낫다는 점을 인정합니다).
  • 그들은 원래 작업의 가장 어려운 부분(용어와 정의를 연결하는 작업)을 테스트하지 않았으며, 이는 향후 과제로 남겨두었습니다.

요약하자면, 이 논문은 AI가 아직 완벽하지는 않지만, 지식을 영어에서 러시아어로 "복사하여 붙여넣기"하는 강력한 도구로서 연구자들의 시간과 노력을 엄청나게 절약해 줄 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →