← 최신 논문
💬 NLP

Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models

이 논문은 태국 법률 추론과 같은 지역 특화 작업을 수행할 수 있는 고품질의 주권적 거대 언어 모델을 방대한 지시어 코퍼스나 복잡한 강화 학습 파이프라인에 의존하지 않고도 학술적 규모의 자원으로 개발할 수 있음을 입증하기 위해, 지도 미세 조정(SFT), 온-폴리시 증류(on-policy distillation), 그리고 InK-GRPO를 결합한 소규모 RFT를 결합한 최소한의 개방형 사후 학습 레시피인 Typhoon S를 소개한다.

원저자: Kunat Pipatanakul, Pittawat Taveekitworachai

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kunat Pipatanakul, Pittawat Taveekitworachai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 완벽한 영어와 중국어를 구사하지만, 특정 국가의 현지 방언, 문화, 그리고 법률에는 서툰 천재적인 세계적 수준의 학생(대규모 언어 모델)이 있다고 상상해 보십시오. 보통 빅테크 기업들은 이 문제를 해결하기 위해 엄청난 양의 자금, 슈퍼컴퓨터, 그리고 끝없는 데이터를 쏟아붓습니다. 하지만 만약 대학이나 국가 정부와 같은 더 작은 규모의 팀이, 수십억 달러의 예산 없이도 현지의 맥락을 이해하는 자신들만의 "주권적(sovereign)" AI를 만들고 싶어 한다면 어떨까요?

이 논문은 이러한 AI 모델이 범용적인 조수 역할을 수행하면서도, 동시에 현지의 고위험 작업(예: 태국 법률)에 대한 전문가가 될 수 있도록 가르치는 "최소한의 레시피"인 Typhoon-S를 소개합니다. 이들은 매우 제한된 자원을 사용하여 이를 구현했습니다.

그 방법은 크게 두 부분으로 나뉩니다.

파트 1: AI를 "채택 가능하게" 만들기 (범용 조수)

목표: 가공되지 않은 똑똑한 베이스 모델을, 지시사항을 따르고 코드를 작성하며 현지 언어로 자연스럽게 대화할 수 있는 예의 바르고 유능한 조수로 만드는 것입니다.

문제점: 단순히 모델에게 새로운 지시사항만을 가르치면(지도 미세 조정 또는 SFT), 모델이 "취약(brittle)"해질 수 있습니다. 이는 마치 교과서의 정답만 암기한 학생이, 선생님이 질문을 약간 다르게 하거나 언어를 섞어서 질문하면 당황하여 패닉에 빠지는 것과 같습니다.

해결책: "섀도잉(Shadowing)" 기법 (온-폴리시 증류, On-Policy Distillation)
저자들은 두 단계의 과정을 사용했습니다:

  1. 레슨 (SFT): 먼저 모델에게 영어와 태국어가 섞인 작지만 고품질인 지시 데이터 세트를 제공했습니다. 이는 학생에게 속성 과외를 해주는 것과 같았습니다.
  2. 섀도잉 (OPD): 모델이 단순히 정답을 암기하는 대신, 스스로 답변을 생성하게 하고 훨씬 더 똑똑한 AI인 "선생님" 모델이 실시간으로 이를 지켜보며 교정하도록 했습니다.
    • 비유: 음악 학생이 곡을 연주한다고 상상해 보십시오. 기존 방식에서는 녹음된 음악을 듣고 그대로 따라 하는 것이었습니다. 하지만 이 새로운 방식에서는 학생이 연주를 하면, 거장 음악가가 옆에 앉아 학생이 연주하는 동안 실시간으로 교정 사항을 속삭여 줍니다. 이는 학생이 자신의 실수를 어떻게 극복하고 회복할 수 있는지 배우게 하여, 훨씬 더 견고하고 유연하게 만들어 줍니다.

결과: 이들은 대학 연구실 수준의 작은 GPU 클러스터(약 몇 일간의 학습)만으로 이 작업을 완수했습니다. 그 결과 탄생한 Typhoon-S-8B는 대화, 코딩, 영어와 태국어 간의 매끄러운 전환 능력을 갖춘 강력한 범용 조수가 되었으며, 훨씬 더 큰 규모의 모델들과도 경쟁할 수 있는 수준에 도달했습니다.

파트 2: AI에게 "주권적 역량" 부여하기 (현지 전문가)

목표: 모델이 현지 법률을 이해하고 정보를 찾기 위해 도구를 사용하는 법을 배워야 하는, 복잡하고 위험도가 높은 현지 작업(특히 태국 법률 추론)을 처리할 수 있도록 가르치는 것입니다.

문제점: 표준적인 AI 학습은 모델이 이미 알고 있는 것을 강화하는 데 그치는 경우가 많습니다. 만약 모델이 특정 태국 법률을 모른다면, 표준적인 학습 방식으로는 그 새로운 사실을 마법처럼 가르칠 수 없습니다. 또한, 표준적인 학습은 AI에게 도구(예: 검색 엔진)를 사용하여 정보를 찾는 방법을 가르쳐주지 않습니다.

해결책: "두 개의 뇌" 학습 (InK-GRPO)
저자들은 **InK-GRPO(Injected Knowledge GRPO)**라고 불리는 새로운 학습 방법을 발명했습니다.

  • 두뇌 게임: AI가 법률 퍼즐을 풀고 있는 게임을 한다고 상상해 보십시오.
    • 뇌 A (플레이어): 추론 능력을 향상시키기 위해 보상 시스템(비디오 게임의 점수와 같은)을 사용하여 퍼즐을 풀려고 시도합니다.
    • 뇌 B (독자): 뇌 A가 게임을 하는 동안, 뇌 B는 조용히 태국 법률 문서 더미를 읽습니다.
    • 마법 같은 점: 시스템은 이 두 모드 사이를 무작위로 전환합니다. 때로는 AI가 게임을 플레이하고, 때로는 문서를 읽습니다. 이를 통해 AI는 새로운 사실(법률)을 배우는 동시에, 그 사실들을 사용하여 문제를 해결하는 방법까지 함께 배울 수 있습니다.

도구 사용자 (Agentic RFT):
또한 AI에게 도구를 사용하는 법을 가르쳤습니다.

  • 비유: 세상의 모든 법을 암기하려고 노력하는 대신, AI는 "그 특정 법률을 모르니, 데이터베이스를 검색해 보겠습니다"라고 말하고, 문서를 읽은 뒤, 답변하는 법을 배웁니다.
  • 이들은 AI가 [생각하기 -> 검색하기 -> 읽기 -> 생각하기 -> 답변하기]의 루프를 수행하도록 훈련했습니다.

결과: Typhoon-S-4B 법률 에이전트는 태국 법률 추론 분야에서 놀라운 성능을 보였습니다. 놀랍게도, 이 특정 방식으로 훈련된 작은 40억 파라미터 규모의 모델은, 두 모델 모두에게 검색 도구를 주었을 때 훨씬 더 큰 유명 모델인 GPT-5보다 더 뛰어난 성과를 냈습니다.

핵심 요약

이 논문은 강력한 주권적 AI를 구축하기 위해 반드시 거대한 슈퍼컴퓨터가 필요한 것은 아님을 증명합니다.

  • 범용 용도: 간단한 "레슨"과 "섀도잉"(SFT + OPD)의 조합만으로도 모델을 똑똑하고 유능하게 만들 수 있습니다.
  • 현지 전문성: "게임 플레이"와 "교과서 읽기"의 영리한 결합(InK-GRPO)을 통해, 작은 모델도 새로운 현지 사실을 배우고 도구를 효과적으로 사용할 수 있습니다.

비용: 이들은 일반적인 대학 연구실 수준의 자원(4~8개의 고성능 GPU로 며칠간의 학습)만으로 이 모든 것을 해냈으며, 이는 주권적이고 현지화된 AI를 만드는 데 있어 **브루트 포스(무차별 대입식 규모 확장)**보다 스마트한 설계가 더 중요하다는 것을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →