← 최신 논문
🤖 AI

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

본 논문은 판사 수준의 법적 추론 및 작문 과제를 평가하기 위해 브라질 사법 시험에서 파생된 새로운 벤치마크인 Magis-Bench 를 소개하며, 최첨단 대규모 언어 모델 23 개를 평가한 결과 최상위 모델조차 논리적 근거를 갖춘 사법 결정을 산출하는 데 높은 점수를 얻는 데 어려움을 겪고 있음을 밝힙니다.

원저자: Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Thiago Laitz, Rodrigo Nogueira

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Thiago Laitz, Rodrigo Nogueira

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

치열한 요리 대회를 상상해 보세요. 보통 우리는 AI 를 테스트할 때, AI 에게 요리를 시킵니다 (법적 논거나 계약을 작성하게 하죠). 하지만 실제 사법 시스템에서 가장 중요한 일은 요리를 하는 것이 아니라, 그 요리를 맛보고 좋거나 나쁜지 판단하며 합격 또는 불합격의 이유를 설명하는 심판자가 되는 것입니다.

이 논문인 Magis-Bench는 바로 그 '심판자' 역할에 AI 를 테스트하는 것에 관한 것입니다.

문제: AI 가 심판자가 될 수 있을까?

법률 분야의 대부분의 AI 테스트는 컴퓨터에게 변호사가 되라고 요구합니다. "이 의뢰인을 위한 변론을 작성해 주세요." 하지만 실제 판사는 더 어려운 일을 해야 합니다. 양측의 주장을 듣고, 자신의 감정을 배제하며, 엄격한 규칙을 적용하고, 엄격한 검토를 견딜 수 있는 최종 판결문을 작성해야 합니다.

저자들은 다음과 같은 질문을 던졌습니다: 현재의 AI 모델들은 실제 판사처럼 행동할 수 있을까?

테스트: '마지스트레이트 (Magistrate)' 시험

이를 테스트하기 위해 연구자들은 가짜 질문을 만들지 않았습니다. 대신 2023 년부터 2025 년 사이에 실제 판사를 채용하기 위해 사용된 매우 경쟁적인 브라질 시험에서 74 개의 실제 질문을 가져왔습니다.

이러한 시험을 판사를 위한 '변호사 자격시험 (Bar Exam)'이라고 생각하세요. 여기에는 다음이 포함됩니다:

  • 에세이 질문: "이렇게 복잡한 법적 상황이 있습니다. 법률을 설명해 주세요."
  • 작성 과제: "이것이 사실 관계입니다. 완전한 공식 법원 판결문 (최종 선고) 을 작성해 주세요."

매우 중요한 점은 모든 질문에 **공식 정답 키 (채점 기준)**가 동반되었다는 것입니다. 이는 특정 법률을 언급하거나 특정 구조를 따를 때 정확히 몇 점씩 주어지는지 명시한 교사의 채점표와 같습니다.

방법: AI 대 AI

23 명의 인간 판사를 고용하여 23 개의 서로 다른 AI 모델에 대한 74 편의 에세이를 채점하는 것은 비용이 엄청나게 많이 들고 매우 느릴 것이기 때문에, 연구자들은 교묘한 수를 썼습니다: AI 가 AI 를 채점하게 했습니다.

  1. 참가자: 구글, 오픈AI, 앤트로픽 등 여러 회사에서 제공된 가장 똑똑한 23 개의 AI 모델을 선정했습니다.
  2. 심판자: 네 개의 다른 매우 강력한 AI 모델을 채점자로 활용했습니다.
  3. 규칙: '심판 AI'들은 누가 답안을 작성했는지 알 수 없었습니다 (맹검). 그들은 질문, 공식 정답 키, 그리고 AI 의 응답만 보고 0 점부터 10 점까지 점수를 매겼습니다.

결과: AI '심판자'들의 일치

다음과 같은 일이 발생했습니다:

  • 심판자들의 일치: 네 명의 AI 심판자는 서로 거의 완벽하게 일치했습니다 (98.4% 일치). 이는 정확히 어떤 식당이 가장 좋은지 모두 동의하는 네 명의 미식 비평가와 같습니다. 이로 인해 연구자들은 점수가 공정하고 단순히 무작위적인 것이 아니라는 확신을 가질 수 있었습니다.
  • 승자: 최상위 성적을 거둔 모델은 구글의 Gemini-3-Pro-Preview(점수: 10 점 만점에 6.97 점)였으며, 이어 Gemini-3-FlashClaude-4.5-Opus가 뒤를 이었습니다.
  • 현실 확인: 심지어 '승자'조차 10 점 만점에 6.97 점에 그쳤습니다. 이는 70% 미만입니다.

이것이 의미하는 바

이 논문은 결론적으로 AI 가 법률 업무에 있어서는 점점 나아지고 있지만, 심판자처럼 행동하는 것은 여전히 그들에게 매우 어렵다고 말합니다.

  • 격차: 현재의 AI 모델들은 교과서를 외울 수는 있지만, 인간 판사의 세심함과 권위를 갖추어 복잡하고 실제적인 상황에 규칙을 적용하는 데는 어려움을 겪는 학생들과 같습니다.
  • 벤치마크: 연구자들은 다른 과학자들이 이러한 모델들을 계속 테스트하고 개선할 수 있도록 모든 질문, 정답, 그리고 채점 코드를 공개했습니다.

간단히 말해: 우리는 AI 에게 실제 판사 시험을 치르게 했습니다. 가장 똑똑한 모델들도 'C'나 'B' 등급으로 합격했는데, 이는 그들이 점점 더 똑똑해지고 있지만 아직 법정에서 인간 판사를 대체할 준비가 되지 않았음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →