← 최신 논문
💬 NLP

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

이 논문은 신뢰할 수 있고 해석 가능한 사법적 추론을 가능하게 하기 위해 가소성 조정 샘플링(Plasticity-Adjusted Sampling), 법률 에이전트적 CoT 증류(Legal Agentic CoT Distillation), 그리고 커리큘럼 강화 학습(Curriculum Reinforcement Learning)으로 구성된 3단계 훈련 파이프라인을 통해 최첨단 성능을 달성하는 중국 법률 파운데이션 모델 제품군인 LegalOne을 소개한다.

원저자: Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 LegalOne 논문을 일상적인 언어로 번역하여, 복잡한 기술적 개념을 이해하기 쉽게 비유를 들어 설명한 내용입니다.

큰 그림: 왜 LegalOne가 필요한가요?

당신이 아주 똑똑하고 박학다식한 일반인 전문가를 변호사로 고용했다고 상상해 보세요. 이 사람(표준 대규모 언번 모델)은 도서관의 거의 모든 책을 읽었습니다. 시를 쓸 수도 있고, 수학 문제를 풀 수도 있으며, 날씨에 대해 수다를 떨 수도 있습니다. 하지만 특정 법정 사건을 다루라고 요청하면, 이 사람은 종종 실수를 합니다. 존재하지 않는 법을 지어내거나(환각 현상), 판사가 요구하는 엄격하고 단계적인 논리 과정을 놓치기도 합니다.

LegalOne은 바로 이 문제를 해결하기 위해 설계된 새로운 AI 모델 제품군입니다. 이를 단순히 모든 것을 조금씩 아는 '제너럴리스트'가 아니라, **법조인처럼 생각하도록 엄격하게 훈련받은 '법학 전문 대학원 졸업생'**이라고 생각하십시오. 논문은 이러한 모델들을 다르게 훈련시킴으로써, 훨씬 더 작고 효율적이면서도 거대한 일반 AI 모델보다 법률 작업에서 더 뛰어난 성능을 낼 수 있다고 주장합니다.


3단계 훈련 파이프라인

연구진은 단순히 AI에게 법률 서적을 더 많이 먹인 것이 아닙니다. 그들은 마치 로봇 변호사를 위한 전문 교육 프로그램과 같은 3단계 훈련 파이프라인을 구축했습니다.

1단계: "미드 트레이닝(Mid-Training)" 단계 (기초 다지기)

문제점: 일반적인 AI를 가져와서 갑자기 법률 문서만 읽게 하면, 일반적인 언어를 구사하는 능력을 잊어버리거나 현실 세계에 대해 추론하는 능력을 상실할 수 있습니다. 이를 "파괴적 망각(catastrophic forgetting)"이라고 합니다.

해결책: 가소성 조절 샘플링 (Plasticity-Adjusted Sampling, PAS)

  • 비유: 수학은 잘하지만 고급 물리학을 배워야 하는 학생을 상상해 보세요. 만약 이 학생에게 곧바로 복잡한 방정식이 가득한 교과서를 던져준다면, 학생은 패닉에 빠져 기초 수학을 잊어버릴 수도 있습니다.
  • LegalOne의 방식: 연구진은 PAS라는 스마트한 스케줄러를 사용합니다. 이것은 **학생의 현재 기분과 에너지 상태에 따라 숙제의 난이도를 조절하는 튜터(Tutor)**와 같습니다.
    • AI가 "재가열(re-warming up)"될 때(새로운 훈련을 시작할 때), 튜터는 AI가 안정성을 유지할 수 있도록 익숙하고 쉬운 법률 텍스트(낮은 퍼플렉시티/perplexity)를 주로 제공합니다.
    • AI가 강해짐에 따라, 튜터는 점차 더 어렵고 복잡한 법률 텍스트를 도입합니다.
    • 결정적으로, 튜터는 AI가 원래의 기술을 잊지 않도록 항상 약간의 "쉬운" 자료를 혼합하여 제공합니다.
  • 결과: AI는 일반적인 지능을 잃지 않으면서도 강력하고 안정적인 법률 지식의 토대를 구축합니다.

2단계: 지도 미세 조정 (법조인처럼 생각하는 법 배우기)

문제점: 실제 법률 문서(판결문 등)는 종종 요약된 형태로 작성됩니다. 판결문은 판사가 내린 결론을 말해주지만, 그 결론에 도달하기 위해 거친 복잡하고 단계적인 사고 과정은 생략하는 경우가 많습니다. 만약 AI에게 이 요약본들만 보여준다면, AI는 논리를 이해하는 대신 정답을 추측하는 법만 배우게 됩니다.

해결책: 법률 에이전트적 사고 사슬 증류 (Legal Agentic CoT Distillation, LEAD)

  • 비유: 요리 레시피 카드만 읽고 요리를 배우려고 한다고 상상해 보세요. 재료와 완성된 요리는 알 수 있지만, 양파를 어떻게 썰어야 하는지 또는 스테이크를 언제 뒤집어야 하는지는 알 수 없습니다.
  • LegalOne의 방식: 그들은 전문 셰프(에이전트) 팀이 협력하는 것과 같은 LEAD 시스템을 만들었습니다.
    • AI는 단순히 레시피를 읽는 대신, 셰프들이 과정을 세분화하는 "요리 쇼"를 시청합니다: "첫째, 사실 관계를 찾는다. 둘째, 규칙을 찾는다. 셋째, 규칙을 적용한다. 마지막으로, 결과를 결정한다."
    • AI는 단순히 최종 정답을 암기하는 것이 아니라, 이러한 **단계별 추론 경로(Chain-of-Thought)**를 스스로 생성하는 법을 배웁니다.
    • 또한, 학생 AI가 학습하기 전에 선임 판사(또한 하나의 AI)가 작업 내용을 검토하여 논리가 타당하고 사실이 정확한지 확인하는 "품질 관리" 단계를 거칩니다.
  • 결과: AI는 정답뿐만 아니라 법률적 추론의 과정을 배웁니다.

3단계: 강화 학습 ( "법조인 정신" 부트 캠프)

문제점: 훌륭한 추론 능력을 갖추더라도, AI는 너무 장황하거나 모호하거나 작은 논리적 비약을 범할 수 있습니다. 따라서 훈련이 필요합니다.

해결책: 다단계 커리큘럼 강화 학습 (Multi-Stage Curriculum RL)

  • 비유: 이것은 AI의 뇌를 위한 군대 부트 캠프와 같습니다. 훈련은 쉬운 단계에서 시작하여 점점 어려워지며, AI가 정밀하고 효율적이 되도록 가르칩니다.
    • 레벨 1 (암기): AI는 법률을 완벽하게 암송해야 합니다. 추측은 허용되지 않습니다.
    • 레벨 2 (적용): AI는 그 법률을 특정 사실 관계에 적용해야 합니다.
    • 레벨 3 (복잡한 추론): AI는 어렵고 다단계적인 사건을 해결해야 합니다.
  • 보상 시스템: AI가 정확하고 논리적일 때 "점수(보상)"를 받습니다. 만약 환각을 일으키거나 주제에서 벗어나면 점수를 잃습니다.
  • 결과: AI는 단순한 "패턴 매칭(유사한 단어를 바탕으로 추측하는 것)" 단계에서 벗어나, 간결하고 전문적이며 신뢰할 수 있는 법률적 논거를 생성하는 자율적 추론가로 진화합니다.

결과: 작지만 강력함

이 논문은 놀라운 발견을 제시합니다: 크기가 전부가 아닙니다.

  • 비유: 보통 AI 분야에서는 "클수록 좋다"(예: 거대한 도서관 vs 작은 책꽂이)고 생각합니다. 하지만 LegalOne은 고도로 전문화된 소형 법률 백과사전과 같습니다.
  • 주장: LegalOne-8B 모델(80억 개의 파라미터를 가진 모델)은 법률 테스트에서 거대한 범용 모델(GPT-4o나 수천억 개의 파라미터를 가진 모델들)과 대등하거나 오히려 더 나은 성능을 보입니다.
  • 효율성: 이 모델은 덩치를 키우는 것이 아니라, **높은 "지식 밀도"**를 통해 이러한 우수성을 달성합니다. 불필요한 정보 없이 법률에 꼭 필요한 것만을 정확히 알고 있습니다.

공개된 내용

팀은 다른 이들을 돕기 위해 비밀을 간직하지 않았습니다. 그들은 다음을 공개했습니다:

  1. LegalOne 가중치(Weights): 다른 사람들이 사용할 수 있도록 실제로 훈련된 모델들.
  2. LegalKit: 다른 AI 모델들이 법률 분야에서 얼마나 잘 수행하는지 측정할 수 있는 툴킷(표준화된 테스트와 같은 역할).

요약

LegalOne은 훌륭한 변호사가 되기 위해 반드시 "거대한" 뇌가 필요한 것은 아니라는 것을 증명하는 AI 모델 제품군입니다. 기초를 다지고(안정화), 단계별 논리를 가르치며(추론), 정밀함을 위한 훈련(강화 학습)을 하는 스마트한 3단계 훈련 과정을 통해, 이들은 법정에서 법률 전문가처럼 생각하고, 추론하고, 논쟁하는 모델을 만들어냈으며, 훨씬 더 큰 일반 AI 모델들을 능가했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →