← 최신 논문
🤖 AI

When Rules Learn: A Self-Evolving Agent for Legal Case Retrieval

본 논문은 LLM 기반 에이전트를 활용하여 규칙 기반의 쿼리 재작성 전략을 반복적으로 생성, 검증 및 정교화함으로써 LeCaRD-v2 벤치마크 상의 중국 법률 판례 검색에 대한 BM25 성능을 크게 향상시키는 자기 진화형 파라미터 프리 프레임워크를 제안한다.

원저자: Mingxu Tao, Jiawei Hu, Xian Zhou, Wenpeng Hu, Jiajun Cheng, Yunbo Cao, Zhunchen Luo, Guotong Geng

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mingxu Tao, Jiawei Hu, Xian Zhou, Wenpeng Hu, Jiajun Cheng, Yunbo Cao, Zhunchen Luo, Guotong Geng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 문제: 법률이라는 건초더미 속에서 올바른 바늘 찾기

당신이 현재 의뢰인의 문제와 거의 똑같은 과거 판례를 찾으려는 변호사라고 상상해 보세요. 검색 엔진에 설명을 입력하지만, 결과는 엉망진창입니다.

이 논문은 놀라운 사실을 지적합니다. 전통적인 검색 방식(BM25라고 불리는)이 오히려 법률 사례를 찾는 데 있어 최첨단 AI 검색 방식보다 더 낫다는 점입니다. 왜 그럴까요? 법률 용어는 매우 구체적이기 때문입니다. 만약 당신이 "자동차 사고(car accident)"라고 말했을 때 과거 판례에 "차량 충돌(vehicle collision)"이라고 적혀 있다면, 화려한 AI는 그 연결 고리를 놓칠 수 있지만, 전통적인 방식은 정확한 단어를 매칭하는 데 매우 능숙합니다.

하지만 이 전통적인 방식에는 결함이 있습니다. 사용자의 검색어가 완벽해야 한다는 점입니다. 만약 잘못된 법률 용어를 사용한다면, 검색은 실패합니다.

해결책: "자기 진화형" 검색 코치

저자들은 AI를 다시 학습시키지 않고도 이 문제를 해결할 수 있는 시스템을 구축했습니다. 이것은 마치 검색 엔진 자체를 바꾸는 것이 아니라, 당신에게 더 나은 질문을 던지는 법을 가르쳐주는 검색 코치를 고용하는 것과 같습니다.

이 코치는 당신의 검색 쿼리(질문)를 재작성하기 위해 일련의 **규칙(rules)**을 따르는 AI 에이전트입니다.

  • 규칙 예시: "사용자가 '자동차 충돌'이라고 말하면, '차량 충돌'과 '교통사고'라는 단어를 검색에 추가하라."

문제는 이겁니다: 누가 이 규칙들을 작성할 것인가? 보통은 인간 전문가가 필요합니다. 하지만 전문가는 비용이 많이 들고, 좋은 아이디어를 놓칠 수도 있습니다.

혁신: 시행착오를 통해 배우는 에이전트

저자들은 **자기 진화형 프레임워크(Self-Evolving Framework)**를 만들었습니다. 인간이 규칙을 쓰는 대신, AI 에이전트가 스스로 규칙을 쓰고, 테스트하고, 개선합니다.

에이전트가 어떻게 작동하는지 정원사 비유를 통해 설명하겠습니다:

  1. 씨앗 심기 (규칙 생성): 에이전트는 하나의 기본적인 규칙(씨앗)에서 시작합니다. 그런 다음 새로운 규칙을 "심기" 위해 노력합니다. 예를 들어, "이 상황에 맞는 라틴어 법률 용어도 추가해 볼까?"라고 생각할 수 있습니다.
  2. 정원 테스트하기 (실험 계획): 에이전트는 함께 테스트할 몇 가지 규칙을 선택합니다. 시뮬레이션을 실행합니다: "만약 규칙 A와 규칙 B를 함께 사용한다면, 더 관련성 높은 사례를 더 많이 찾을 수 있을까?"
  3. 잡초 제거하기 (규칙 제거): 이 부분이 가장 중요합니다. 에이전트는 결과를 살펴봅니다. 만약 어떤 규칙이 도움이 되지 않았거나 상황을 악화시켰다면, 에이전트는 그것을 뽑아냅니다(제거합니다).
  4. 순환 구조: 에이전트는 이 과정을 수백 번 반복합니다. 새로운 아이디어를 만들고, 테스트하고, 나쁜 것들을 뽑아냅니다. 이 과정에서 자신의 뇌를 바꾸는 것(복잡한 수학적 학습)이 아니라, 실험 결과를 보고 배우는 방식으로 진행됩니다.

결과: 큰 뇌가 더 잘한다

연구팀은 이를 중국 법률 데이터베이스(LeCaRD-v2)로 테스트했습니다. 그들은 이 "자기 진화형 에이전트"를 다음 대상들과 비교했습니다:

  • 규칙을 작성하는 인간.
  • "탐욕적(Greedy)" 전략 (가장 좋은 규칙을 한 번 선택하고 그대로 유지하는 방식).
  • 다양한 크기의 AI "뇌" (핵심 LLM).

발견된 사실:

  • 작은 뇌는 고전한다: 코치 역할을 하는 작은 AI 모델을 사용했을 때, 모델은 혼란을 겪었습니다. 어떤 규칙들이 서로 잘 어울리는지 파악하지 못했습니다. 종종 단순한 "탐욕적" 전략보다 성능이 약간 떨어지기도 했습니다.
  • 큰 뇌는 성공한다: 매우 크고 강력한 AI(예: gpt-oss-120b)를 사용했을 때, 이 시스템은 모두를 이겼습니다. 인간 전문가나 탐욕적 전략보다 더 나은 규칙 조합을 찾아냈습니다.
  • 왜 그럴까요? 큰 AI는 두 가지를 잘했습니다:
    1. 계획하기: 과거의 실험을 살펴보고 "규칙 A가 작동했고, 규칙 B도 따로 보면 작동했으니, 둘을 함께 써보자"라고 판단할 수 있었습니다.
    2. 잡초 제거하기: 어떤 규칙이 쓸모없는지 식별하고, 검색을 깔끔하게 유지하기 위해 제거하는 능력이 뛰어났습니다.

한계점 (Limitations)

논문은 몇 가지 한계를 인정합니다:

  • 언어가 중요하다: AI는 특정 언어(이 경우 중국어)의 법률적 맥로서 이해하고 작성하는 능력이 매우 뛰어나야 합니다. 만약 AI의 언어 능력이 부족하다면, 말이 안 되는 "쓰레기" 규칙을 생성하게 됩니다.
  • 마법이 아니다: 이 시스템은 작은 AI 모델과는 잘 작동하지 않습니다. 정원을 효과적으로 관리하기 위해서는 "똑똑한" 코치가 필요합니다.

요약

이 논문은 어려운 문제를 해결하기 위해 항상 새롭고 초복잡한 AI를 만들 필요는 없다는 것을 보여줍니다. 때로는 스스로 지침을 작성하고, 테스트하고, 나쁜 지침은 해고할 수 있는 똑똑한 에이전트가 필요할 뿐입니다. 이는 마치 검색 엔진이 인간보다 더 잘 법률의 언어를 구사하는 법을 스스로 학습하는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →