← 최신 논문
💬 NLP

SteuerLLM: Local specialized large language model for German tax law analysis

이 논문은 특화된 28B 파라미터 규모의 독일 세법 모델인 SteuerLLM과 실제 대학 시험에서 유래한 최초의 오픈 벤치마크인 SteuerEx를 소개하며, 도메인 특화 적응과 합성 데이터 생성이 복잡한 법률 추론 작업에서 범용 모델보다 크게 앞선다는 것을 입증한다.

원저자: Sebastian Wind, Jeta Sopa, Laurin Schmid, Quirin Jackl, Sebastian Kiefer, Fei Wu, Martin Mayr, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sebastian Wind, Jeta Sopa, Laurin Schmid, Quirin Jackl, Sebastian Kiefer, Fei Wu, Martin Mayr, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하고 박식한 학생에게 독일 세법이라는 어려운 고난도 시험을 통과하는 법을 가르치려 한다고 상상해 보십시오. 문제는 일반적인 "똑똑한" 학생들(표준 대규모 언어 모델들)은 에세이를 쓰거나 대화를 나누는 데는 뛰어나지만, 규칙이 엄격하고 용어가 정밀하며 단 하나의 숫자만 틀려도 답안 전체를 망칠 수 있는 상황에서는 실패하곤 한다는 점입니다.

이 논문은 이 문제를 해결하기 위해 두 가지 핵심 요소를 소개합니다. 바로 새로운, 매우 까다로운 시험과 이 시험을 통과하기 위해 특별히 설계된 특화된 학생입니다.

1. 새로운 시험: "SteuerEx"

연구진은 SteuerEx라고 불리는 최초의 오픈 벤치마크를 만들었습니다. 이것을 AI를 위한 "기말고사"라고 생각하십시오. 하지만 가짜 질문이 아니라, 지난 10년간 실제 독일 대학교의 세법 시험에서 추출한 115개의 실제 문항을 사용했습니다.

  • 작동 방식: 일반적인 시험에서는 단순히 "맞음 또는 틀림"의 성적을 받을 수도 있습니다. 하지만 세법에서는 학생이 올바른 법적 개념은 맞혔더라도 특정 인용구를 놓쳤거나, 수학적 계산은 맞았으나 논리가 틀렸을 수도 있습니다.
  • 채점 시스템: 연구진은 모든 답변을 아주 작은 "구성 요소(statements)" 단위로 나누었습니다. 채점용 AI(두 번째 AI)가 각 블록을 개별적으로 검사합니다. 만약 논리의 절반을 맞혔다면 절반의 점수를 받습니다. 이는 실제 교수들이 채점하는 방식, 즉 최종 답안이 완벽하지 않더라도 올-바른 추론에 대해 부분 점수를 주는 방식을 모방한 것입니다.
  • 난이도: 이 시험은 기업 세법, 소득세, 부가가치세 등 6개 분야를 다룹니다. 이 시험은 매우 냉혹하게 설계되었습니다. 대부분의 일반 AI 모델들이 매우 낮은 점수를 기록했으며, 이는 세법이 공략하기 매우 어려운 난제임을 증명했습니다.

2. 특화된 학생: "SteuerLLM"

이 시험에 대처하기 위해 팀은 SteuerLLM을 구축했습니다. 일반적인 천재(240억 파라미터 규모의 AI)를 데려와서, 세법에 특화된 "뇌 이식"을 하거나 "보조 바퀴"를 달아주는 것을 상상해 보십시오.

  • 훈련 방법: 단순히 교과서를 읽힌 것이 아닙니다. 그들은 "워터 파운틴(Water Fountain)" 방식을 사용했습니다. 소수의 실제 시험 문제 세트를 가져온 뒤, 컴퓨터 프로그램을 사용하여 실제 독일 법률에 기반한 수천 개의 새롭고 현실적인 연습 문제와 답안을 자동으로 생성했습니다. 이는 마치 학생에게 실제 시험과 똑같이 생긴 거대하고 끝없는 연습 문제 도서관을 제공하는 것과 같습니다.
  • 아키텍처: 뇌 전체를 다시 훈련시키는 대신(이는 AI가 일반적인 언어를 구사하는 능력을 잊게 만들 수 있습니다), 세법 전용의 새로운 "뉴런" 층을 추가했습니다. 이는 학생이 걷거나 말하는 방식은 바꾸지 않으면서, 세법 전용 계산기와 법률 사전을 배낭에 넣어주는 것과 같습니다.
    এটি.
  • 결과: 280억 개의 파라미터를 가진 이 특화된 학생은 자신보다 20배나 더 큰(6,710억 파라미터 규모의) 모델들을 포함하여 거의 모든 다른 일반 AI 모델들을 이겼습니다. 이는 세법의 경우 모델의 크기보다 특화된 훈련이 더 중요하다는 것을 입증했습니다.

3. 비교: AI vs. 실제 학생

연구진은 자신들의 AI 학생을 이 시험을 치른 실제 인간 학생들과 비교했습니다.

  • 격차: 평균적인 인간 학생은 여전히 AI보다 훨씬 높은 점수를 기록했습니다. AI는 아직 세법 변호사나 우수한 학생을 대체할 준비가 되지 않았습니다.
  • 진전: 그러나 AI는 여러 카테고리에서 하위권 인간 학생들보다 더 나은 성적을 거두었습니다. 이는 AI가 단순히 허구의 내용을 지어내는 것이 아니라, 실제 시험에서 점수를 얻을 수 있는 "부분적으로 정확한" 법적 추론을 생성할 수 있음을 보여주었습니다.

4. "오픈" vs. "클로즈드"의 비밀

팀은 Open-SteuerLLM이라는 버전의 모델도 공개했습니다. 이 버전은 챔피언 모델과 동일하지만, 공개적으로 공유할 수 없는 소량의 비공개 훈련 데이터를 제거한 것입니다.

  • 발견: 오픈 버전은 클로즈드 버전과 거의 비슷하게 성능을 냈습니다. 이는 훈련 데이터를 생성하는 방식(워터 파운틴 파이프라인) 자체가 핵심적인 비결이었으며, 단순히 특정 비공개 문서들을 사용한 것이 아니라는 점을 시사합니다.

결론

이 논문은 세법처럼 구조화되고 규칙이 엄격한 분야에서는 더 크고 비싼 AI가 필요한 것이 아니라고 주장합니다. 대신, 적절한 종류의 데이터로 특화 훈련을 받은 더 작고 똑똑한 AI가 필요합니다. 그들은 다른 이들이 미래의 더 나은 법률 AI를 구축할 수 있도록 자신들의 시험, 훈련 데이터, 그리고 모델을 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →