← 최신 논문
🤖 AI

When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning

이 논문은 시간적 적용 법률 결정에 대한 벤치마크를 소개하고, 거대 언어 모델이 강화 학습으로 유도된 추론 수렴으로 인해 가장 최근의 법을 적용하려는 강한 편향을 보이며, 이는 일반적인 추론 능력이 더 뛰어난 모델일수록 시간적 근거가 필요한 법률 작업에서 오히려 더 낮은 성능을 보이는 직관에 반하는 역관계로 이어진다는 점을 밝힌다.

원저자: Yiqian Huang, Shuyuan Zheng, Qianying Liu, Shaowen Peng, Yuntao Kong, Kotaro Funakoshi, Chuan Xiao, Manabu Okumura, Yang Cao

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yiqian Huang, Shuyuan Zheng, Qianying Liu, Shaowen Peng, Yuntao Kong, Kotaro Funakoshi, Chuan Xiao, Manabu Okumura, Yang Cao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

법은 정지된 기념비가 아니라, 시간이 흐름에 따라 변화하는 살아있는 풍경입니다. 새로운 규칙이 작성되고, 오래된 규칙은 다시 쓰이며, 특정 상황에 적용되는 법의 구체적인 버전은 전적으로 그 상황이 언제 발생했는지에 달려 있습니다. 오늘 체결된 계약은 한 세트의 규칙에 의해 규율될 수 있는 반면, 5년 전에 체결된 유사한 계약은 다른 세트의 규칙 아래 놓일 수 있습니다. '불소급 원칙'이라 알려진 이 원리은 법적 공정성의 초석입니다. 즉, 사람들은 나중에 만들어진 법이 아니라, 자신이 행동했을 당시에 존재했던 법에 의해 판단되어야 합니다. 인공지능이 법률 분야에서 유용해지기 위해서는 이러한 타임라인을 이해해야 합니다. 단순히 법이 무엇이라고 말할 수 있는 것을 넘어, 법적 사건이 발생한 바로 그 순간에 어떤 버전의 법이 효력을 발휘하고 있었는지 알아야 합니다. 만약 컴퓨터 시스템이 타이밍을 잘못 맞춘다면, 사실 관계에 대한 분석이 아무리 똑똑하더라도 잘못된 규칙을 적용하게 되어 근본적으로 틀린 결론에 도약하게 됩니다.

연구자들은 복잡한 질문에 답하고 텍스트를 작성할 수 있는 강력한 AI 시스템인 거대 언어 모델(LLM)이 이러한 법적 추론의 일부를 자동화할 수 있기를 오랫동안 희망해 왔습니다. 이 모델들은 법원의 판결을 예측하고 계약서를 분석하는 데 있어 가능성을 보여주었습니다. 그러나 핵심적인 질문이 해결되지 않은 채 남아 있었습니다. 과연 이 모델들이 특정 사례에 어떤 버전의 법이 적용되는지를 신뢰할 수 있게 파악할 수 있는가 하는 점입니다. 일본과 중국의 기관들로 구성된 연구팀의 새로운 연구는 바로 이 문제를 조사합니다. 그들은 이 첨단 AI 시스템들이 사례의 사건 날짜를 바탕으로 올바른 버전의 법을 정확히 식별할 수 있는지 확인하기 위해 특화된 테스트를 구축했습니다. 결과는 놀랍고도 체계적인 결함을 드러냈습니다. 가장 발전된 모델들은 복잡한 문제를 해결하는 능력에도 불구하고, 정답이 더 오래된 버전의 법일 때 일관되게 실패했습니다. 대신 그들은 사례의 사실관계가 명확히 과거를 가리키고 있음에도 불구하고, 압도적으로 가장 최근에 제정된 최신 버전을 선택했습니다.

문제의 깊이를 이해하기 위해, 연구진은 수천 건의 실제 중국 민사 재판 판결문을 사용하여 벤치마크를 구축했습니다. 그들은 관련 사건들이 주요 법적 업데이트, 구체적으로는 2021년 민법 시행 이전에 발생한 사례들을 선정했습니다. 이 사례들에서 올바른 법적 답변은 당시 효력이 있었던 구형 단독법(예를 들어 구 재산법 또는 계약법)을 인용하는 것을 요구했습니다. 연구팀은 다양한 최첨단 AI 모델들에게 각 사례에 대한 올바른 법의 버전을 식별하도록 요청했습니다. 결과는 극명하게 엇갈렸습니다. 사례가 현재의 법과 관련된 경우, 모델들은 종종 70% 이상의 정답률을 보이며 꽤 잘 수행했습니다. 하지만 사례가 구법을 적용해야 하는 경우, 그 성능은 무너졌습니다. 이러한 구형 사례들에 대해 대부분의 모델은 15% 미만의 점수를 기록했으며, 일부는 거의 0%에 가까운 수치를 보였습니다. 모델들은 무작위로 추측하고 있는 것이 아니라, 일관되게 동일한 특정 실수를 저지르고 있었습니다. 그들은 올바른 유형의 법은 식별했지만 잘못된 버전을 적용했으며, 항상 가장 최신의 것을 향해 손을 뻗었습니다.

연구진은 왜 이런 일이 발생하는지 진단하기 위해 나섰습니다. 그들은 먼저 모델들이 단순히 필요한 지식이 부족한 것인지 검토했습니다. 혹시 AI가 구법을 읽어본 적이 없거나, 법이 어떻게 변하는지에 대한 규칙을 이해하지 못하는 것인지 의심했습니다. 이를 테스트하기 위해, 연구진은 모델들에게 구법의 텍득을 읊도록 하고 법적 시기에 관한 객관식 질문에 답하게 했습니다. 모델들은 이 테스트에서 매우 뛰어난 성적을 거두었으며, 이는 모델들이 해당 사실과 규칙을 보유하고 있음을 입증했습니다. 그들은 구법이 존재한다는 것을 알고 있었고 불소급 원칙도 이해하고 있었습니다. 실패는 기억력의 부재나 지식의 공백 때문이 아니었습니다. 문제는 모델들이 실제 사례에 직면했을 때 그 지식을 사용하는 방식에 있었습니다.

추가 조사 결과, 문제는 이러한 모델들이 추론하도록 훈련받는 방식과 관련이 있다는 것이 밝혀졌습니다. 현대의 AI 시스템은 흔-히 단계별로 문제를 생각하며 답변을 내놓기 전 추론의 사슬을 생성하도록 하는 과정을 통해 미세 조정(fine-tuning)됩니다. 이 훈련은 모델이 어려운 논리 퍼즐이나 수학 문제를 더 잘 풀 수 있도록 설계되었습니다. 그러나 연구진은 바로 이 강점이 법률적 맥락에서는 약점이 된다는 것을 발견했습니다. 일반적인 추론 능력이 가장 강력한 모델들이 오히려 타이밍 과제에서는 가장 낮은 성적을 거두었습니다. 훈련 과정이 모델의 사고를 좁게 만들어, 하나의 지배적인 경로, 즉 현재의 법을 적용하는 경로로 수렴하게 만든 것으로 보였습니다. 마치 모델들이 가장 최근의 정보가 가장 중요하다는 것을 학습했고, 이 패턴에 너무 집중한 나머지 사례가 요구하는 상황에서도 다른 가능성을 탐색하는 것을 멈춰버린 것 같았습니다.

이 연구는 모델들이 타임라인을 이해할 만큼 멍청해서 실패한 것이 아니라, 학습된 특정 습관을 따르는 데 너무 효율적이었기 때문에 발생한 문제라고 시사합니다. 연구진이 모델들에게 사건의 날짜와 법적 타이밍의 특정 규칙을 고려하라는 간단한 힌트를 제공하자 성능이 극적으로 향상되었습니다. 이는 모델들이 정답을 맞힐 수 있는 능력을 갖추고 있지만, 그들의 기본 작동 모드가 법적 추론의 특정 요구 사항과 일치하지 않았음을 나타냅니다. 타임라인을 살펴보라는 자극이 없으면, 그들의 강력한 추론 엔진은 단순히 최신 법에 대한 편향을 강화할 뿐이었습니다.

이 발견은 현재 인공지능의 미묘하지만 위험한 한계를 부각합니다. 이는 모델을 일반적인 추론에 더 똑똑하게 만든다고 해서 모든 작업에 더 능숙해지는 것은 아님을 보여줍니다. 사실, 법의 시기와 같은 특정 제약 조건에 주의를 기울여야 하는 작업의 경우, 이 모델들을 강력하게 만드는 바로 그 메커니즘이 중요한 세부 사항을 무시하게 만들 수 있습니다. 연구진은 모델들이 기본 습관에 머무는 대신 다양한 추론 경로를 탐색하도록 강제했을 때, 올바른 구형 버전의 법을 성공적으로 식별할 수 있다는 것을 발견했습니다. 연구는 AI가 법률 분야에서 진정으로 신뢰받기 위해서는 단순히 추론을 잘하도록 훈련받는 것을 넘어, 최신 법이 항상 옳은 것은 아니라는 것과 같은 도메인의 구체적이고 때로는 직관에 반하는 규칙들을 존중하도록 훈련되어야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →