← 최신 논문
🤖 machine learning

Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act

이 논문은 미세 조정된 Qwen2.5-7B 모델을 검색과 결합(SFT+RAG)한 방식이 전문적인 검색 모델이나 더 큰 데이터셋을 필요로 하지 않으면서도, 단독 미세 조정 방식 및 검색 전용 방식보다 성능이 뛰어나며, 온타리오주 주거 임대차법(Ontario Residential Tenancies Act)을 인용하는 데 있어 환각 현상을 제거하고 가장 높은 정확도를 달성함을 보여주는 4개 부문의 평가를 제시한다.

원저자: Ali Asaria, Tony Salomone, Deep Gandhi

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ali Asaria, Tony Salomone, Deep Gandhi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 300페이지 분량의 규칙서(온타리오주 주거 임대차법)에서 "집주인이 내 아파트에 들어오기 전에 얼마나 많은 통지를 해야 하는가?"와 같은 구체적인 질문에 답하는 정확한 규칙을 찾으려고 노력하고 있다고 상상해 보십시오.

목표는 아름다운 에세이를 쓰는 것이 아니라, 일반인도 직접 찾아볼 수 있도록 정확한 페이지와 단락 번호(인용)를 가리키는 것입니다.

이 논문은 컴퓨터에게 이 일을 어떻게 가르치는 것이 최선인지 알아내기 위한 "맛보기 테스트"입니다. 연구진은 어떤 방식이 거짓말을 하지 않고 올바른 규칙을 찾아내는지 확인하기 위해, 스마트한 AI 모델(디지털 두뇌)을 사용하여 네 가지 전략 간의 경주를 설정했습니다.

네 명의 주자가 경주에서 보여준 성적은 다음과 같습니다.

네 명의 주자

  1. "날것의 두뇌" (기본 모델):

    • 비유: 이는 규칙서를 한 번 읽었지만 암기하지는 못한 매우 똑똑한 학생과 같습니다. 그들은 기억에 의존해 페이지 번호를 추측하려고 합니다.
    • 결과: 그들은 완전히 실패했습니다. 올바른 페이지를 찾지 못했고, 81%의 경우 존재하지 않는 가짜 페이지 번호를 지어냈습니다. 이 일에는 너무 신뢰할 수 없습니다.
  2. "암기왕" (미세 조정 전용):

    • 비유: 이 학생은 동일한 학생이지만, "질문 → 페이지 번호" 형태의 플래시카드를 몇 주 동안 반복 학습했습니다. 그들은 형식을 알고 정답을 외우려고 노력합니다.
    • 결과: 가짜 페이지를 만들어내는 일은 멈췄지만, 여전히 구체적인 숫자는 틀렸습니다. 규칙의 '개념'은 기억했지만 정확한 섹션 번호는 헷갈려 했습니다. 마치 규칙이 "소음"에 관한 것임을 알면서도, 페이지 52가 아닌 50이라고 추측하는 것과 같습니다.
  3. "사서" (검색 전용):

    • 비유: 이 학생은 아무것도 외우려 하지 않습니다. 대신, 자신을 위해 책을 검색해 주는 매우 빠른 사서를 두고 있습니다. 학생은 오직 사서가 건네준 페이지들을 사용해서만 답변할 수 있습니다.
    • 결과: 이는 엄청난 발전이었습니다. 실제 텍스트를 반드시 확인해야 하므로 가짜 페이지 번호를 절대 만들지 않았습니다(환각 현상 0%). 하지만 때때로 사서가 10페이지 정도의 뭉치를 건네주면, 학생은 어떤 것이 '정확히' 맞는 것인지 몰라 혼란스러워했습니다.
  4. "슈퍼 팀" (하이브리드: 암기왕 + 사서):

    • 비유: 이 팀은 플래시카드 훈련을 받은 데다 사서까지 갖춘 학생입니다. 훈련을 통해 사서가 뒤섞인 페이지 뭉치를 건네주었을 때 더 잘 판단하는 법을 배웠습니다.
    • 결과: 이 팀이 경주에서 승리했습니다. 그들은 다른 누구보다 더 자주 정확한 페이지 번호를 찾아냈습니다. "훈련" 덕분에 사서가 준 페이지 뭉치가 커도 그중에서 올바른 페이지를 골라낼 수 있었습니다.

놀라운 사실들

  • 크다고 항상 좋은 것은 아니다: 연구진은 학생들을 돕기 위해 "슈퍼 사서"(더 복잡하고 비싼 검색 도구)를 사용하는 실험을 했습니다. 결과는 도움이 되지 않았습니다. 단순하고 저렴한 사서가 똑같이 잘 작동했습니다. 이는 이 문제를 해결하기 위해 비싸고 무거운 장비가 필요하지 않다는 기쁜 소식입니다.
  • 공부를 더 한다고 나아지지 않는다: 연구진은 "암기왕"에게 더 많은 플래시카드를 공부하게 했습니다. 하지만 더 나아지지는 않았습니다. 병목 현상은 공부량이 아니라, 우선 사서가 텍스트를 찾아내야 한다는 점에 있었습니다.
  • "환각 제로"의 비결: "사서"와 "슈퍼 팀"이 가짜 규칙을 만들지 않은 이유는 설계 단계부터 그렇습니다. 시스템에는 안전장치가 있습니다. 만약 페이지 번호가 사서가 들고 있는 책 안에 없다면, 시스템은 답변을 거부합니다. 이것은 학습된 기술이 아니라 엄격한 규칙입니다.

최종 성적표

"슈퍼 팀"(하이브리드)이 가장 좋은 점수를 받았지만, 아직 금메달을 딴 것은 아닙니다.

  • 목표: 연구진은 0.70(정답을 70% 확률로 맞히는 것)의 점수를 목표로 했습니다.
  • 현실: 그들은 0.48(약 절반의 확률로 맞히는 것)을 기록했습니다.

왜 100%를 달성하지 못했을까요?

  1. 사서가 책을 놓쳤습니다: 때때로 사서가 올바른 페이지를 전혀 찾지 못했습니다(약 11%의 경우). 올바른 페이지가 뭉치 안에 없다면 학생은 그것을 고를 수 없습니다.
  2. "작은 글씨" 문제: 학생은 종종 올바른 섹션(장)은 찾았지만, 구체적인 서브섹션(단락)은 놓쳤습니다. 이는 마치 맞는 장은 찾았지만 틀린 단락을 찾은 것과 같습니다. 이는 "절반만 맞은" 답으로 간주됩니다.
  3. 작은 테스트 그룹: 최종 테스트는 27개의 질문만 포함되었습니다. 이는 마치 시즌 전체를 단 한 경기만 보고 판단하는 것과 같습니다. 결과는 유망하지만, 표본 크기가 작아 100% 확신하기에는 무리가 있습니다.

결론

컴퓨터가 사람들에게 법을 안내하게 하고 싶다면:

  • 단순히 법을 외우게 하지 마십시오 (틀린 답을 추측할 것입니다).
  • 단순히 법을 읽게 하지 마십시오 (너무 많은 텍스트 때문에 혼란을 겪을 것입니다).
  • 형식을 이해하도록 훈련된 모델과 법을 검색해 주는 도구를 결합하십시오.

이 접근 방식이 가장 정확하며, 결코 위치에 대해 거짓말을 하지 않고, 비싸고 무거운 기술 없이도 잘 작동합니다. 하지만 "좋음"(정확도 48%)에서 "훌륭함"(70%)으로 가기 위해서는 여전히 개선이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →