← 최신 논문
💬 NLP

Tokenizer Fertility and Zero-Shot Performance of Foundation Models on Ukrainian Legal Text: A Comparative Study

본 연구는 우크라이나어 법률 텍스트를 기준으로 일곱 개의 파운데이션 모델을 벤치마크하여 토크나이저 효율성이 API 비용에 상당한 영향을 미친다는 점, 1200 억 파라미터 규모의 NVIDIA Nemotron Super 3 이 더 큰 Mistral Large 3 보다 비용의 일부 수준에서 더 우수한 성능을 보인다는 점, 그리고 이 형태론적으로 풍부한 언어에서는 퓨샷 프롬프팅보다 제로샷 프롬프팅이 더 우월하다는 점을 밝혀냈다.

원저자: Volodymyr Ovcharov

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Volodymyr Ovcharov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우크라이나 법원 판결문 거대 도서관을 운영한다고 상상해 보세요. 이 문서들을 읽고 카테고리로 분류하며, 누가 승소했는지 결정하고 언급된 특정 법률을 추출해 내는 초지능 AI 사서들 (기초 모델) 팀을 고용하고 싶다고 가정해 봅시다.

이 논문은 우크라이나어 처리 시 어떤 AI 사서가 가장 잘 작동하고, 비용이 가장 적게 들며, 실수가 가장 적은지 비교하는 일곱 가지 AI 사서에 대한 성적표와 같습니다.

다음은 간단한 비유를 사용해 그들의 발견 사항을 정리한 내용입니다:

1. "단어-토큰" 세금 (토크나이저 비옥도)

AI 모델을 전체 단어를 읽지 않고 모든 단어를 "토큰"이라는 작은 퍼즐 조각으로 분해하는 번역기로 생각해 보세요.

  • 문제: 일부 AI 는 이 작업에 매우 서툴러 우크라이나어를 지나치게 많은 작은 조각으로 잘게 부숩니다. 논문은 이를 "비옥도"(단어 하나가 생성하는 조각 수) 라고 부릅니다.
  • 발견: 한 AI 계열 (Llama) 은 매우 효율적입니다. 단어를 약 2.4 조각으로 나눕니다. 반면 다른 계열 (Qwen) 은 낭비적이어서 같은 단어를 3.9 조각으로 나눕니다.
  • 비유: 걸음 수에 따라 택시 요금을 낸다고 상상해 보세요. "낭비적인" AI 는 같은 목적지에 도달하기 위해 60% 더 많은 걸음을 떼는 것입니다. 이는 같은 문서를 읽는 것만으로도 60% 더 많은 돈을 지불해야 한다는 뜻입니다.
  • 교훈: AI 를 선택하기 전에 우크라이나어를 읽는 데 몇 개의 "걸음"(토큰) 이 필요한지 확인하세요. 이는 직접적으로 지갑에 영향을 미칩니다.

2. 무조건 큰 것이 좋은 것은 아님

AI 세계에서는 "뇌력"(파라미터) 이 가장 많은 모델이 가장 똑똑하다고 종종 가정합니다.

  • 발견: 논문은 6,750 억 개의 파라미터를 가진 거대 모델 (Mistral Large 3) 과 1,200 억 개의 파라미터만 가진 작은 모델 (NVIDIA Nemotron Super 3) 을 테스트했습니다.
  • 결과: 작은 모델 (Nemotron) 이 실제로 승리했습니다. 세 가지 모든 작업에서 더 높은 점수를 받았으며, 실행 비용은 3 분의 1 수준이었습니다.
  • 비유: 이는 작은 쉘을 짓기 위해 675 명 규모의 건설 인력을 고용하는 것과 같습니다. 반면 더 나은 도구를 갖춘 숙련된 12 명 팀이 더 빠르고, 저렴하며, 더 높은 품질로 작업을 완료할 수 있습니다. 팀의 크기는 중요하지 않았습니다. 중요한 것은 훈련도구였습니다.

3. "예시" 함정 (퓨샷 vs 제로샷)

보통 인간에게 새로운 작업을 가르칠 때 몇 가지 예시를 먼저 보여줍니다. AI 에서는 이를 "퓨샷 프롬프팅"이라고 합니다.

  • 발견: 우크라이나어 법률 텍스트의 경우, AI 에게 예시를 제공하는 것이 종종 AI 를 더 멍청하게 만들었습니다. 어떤 경우에는 성능이 26 퍼센트 포인트나 떨어졌습니다!
  • 비유: 요리사에게 특정 우크라이나 요리를 가르친다고 상상해 보세요. 만약 약간 다른 버전의 요리 사진을 보여주면, 그들은 혼란을 느껴 원래 레시피를 잊어버릴 수 있습니다. AI 는 예시에 "고정"되어 언어에 대한 자신의 지식을 활용하는 것을 멈췄습니다.
  • 반전: 논문은 이것이 예시가 불균형했기 때문 (한 유형이 너무 많음) 이거나 프롬프트가 잘못 작성되었기 때문인지 테스트했습니다. 아니었습니다. 예시와 프롬프트를 수정했음에도 AI 의 성능은 여전히 떨어졌습니다.
  • 결론: 우크라이나어의 경우, 예시를 먼저 보여주기보다 "이 문서가 있습니다. 결과를 알려주세요"라고 말하는 것이 종종 더 좋습니다.

4. 최상의 전략: "전문가 팀"

어떤 단일 AI 도 모든 일에 완벽하지 않았기 때문에, 저자들은 병원 응급실 간호사처럼 "라우팅" 시스템을 제안했습니다.

  • 작업 1 (사건 분류): 가장 저렴하고 빠른 AI (Llama 4 Maverick) 를 사용하세요. 단순 분류에 탁월하며 비용이 거의 들지 않습니다.
  • 작업 2 (승자 결정): 가장 똑똑한 AI (NVIDIA Nemotron) 를 사용하세요. 이것이 어려운 부분이므로 최고의 두뇌를 위해 조금 더 비용을 지불합니다.
  • 작업 3 (법률 찾기): 텍스트 내 특정 패턴을 잘 찾아내는 다른 AI (Llama 3.3) 를 사용하세요.
  • 결과: 이를 혼합하고 매칭함으로써, 모든 일에 "최고"인 단일 AI 만을 사용하는 것보다 37% 더 적은 비용으로 최고 품질의 결과를 얻었습니다.

5. 실무자를 위한 결론

우크라이나를 위한 법률 기술 도구를 구축한다면:

  1. 먼저 "걸음 수"를 확인하세요: 모델의 크기만 보지 말고 우크라이나어 단어를 읽는 효율성을 확인하세요.
  2. "큰 것이 좋다"는 신화를 믿지 마세요: 작고 잘 훈련된 모델이 거대 모델을 이길 수 있습니다.
  3. 예시를 건너뛰세요: 우크라이나어 법률 텍스트의 경우, 예시를 제공하는 것보다 예시 없이 AI 에게 작업하도록 요청하는 것 (제로샷) 이 일반적으로 더 신뢰할 수 있습니다.
  4. 팀을 섞으세요: 다른 작업을 위해 다른 AI 를 사용하여 비용을 절감하고 더 나은 결과를 얻으세요.

비용: 일곱 가지 모델을 수백 개의 문서로 테스트한 전체 연구는 연구자들에게 총 60 달러 정도의 API 비용만 들었습니다. 이는 언어 모델에 대한 진지하고 고품질의 테스트를 위해 거대한 예산이 필요하지 않음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →