Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh
이 논문은 문맥이 주입된 법률 사례를 바탕으로 소규모 이중 언어 언어 모델을 미세 조정하는 것이 검색된 방글라데시 법령 조항을 정확하게 적용하고 언어 일관성을 유지하는 능력을 유의미하게 향상시키지만, 이러한 이득은 모델 크기에 따라 달라지며 대형 모델에 반드시 균등한 혜택을 주는 것은 아님을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 도서관의 거의 모든 책을 읽은 믿기지 않을 정도로 빠르고 똑똑한 학생들과 같은 세상을 상상해 보세요. 이 학생들은 "대규모 언어 모델(Large Language Models)"이라고 불립니다. 이들은 대화하고, 이야기를 쓰고, 퍼즐을 푸는 데 뛰어나지만, 가끔 사실을 지어내거나 자신이 하고 있는 게임의 특정 규칙을 잊어버리는 까다로운 습관이 있습니다. 인공지능 분야에서 연구자들은 이 디지털 학생들에게 추측하는 것을 멈추고 규칙을 정확히 따르도록 가르치기 위해 끊임없이 노력하고 있습니다. 한 가지 인기 있는 방법은 "검색(retrieval)"인데, 이는 학생이 시험을 치르기 직전에 교과서의 특정 페이지를 건네주며 그 내용을 읽고 정보를 정확하게 사용하여 답하도록 기대하는 것과 같습니다. 하지만 여기서 큰 질문이 생깁니다. 만약 작고 덜 강력한 학생에게 그 교과서 페이지를 건네준다면, 그 학생은 정말로 그것을 읽고 사용할까요, 아니면 그냥 무시하고 계속 추측할까요? 이것이 방글라데시의 과학자들이 해결하려고 노력 중인 퍼즐입니다. 특히 그곳의 법률 시스템은 영어와 벵골어 모두로 작성된 특정 법률에 의존하고 있으며, 답을 틀리는 것은 심각한 현실 세계의 결과를 초라할 수 있기 때문입니다.
이 연구를 진행한 연구진은 영리한 아이디어를 테스트해 보기로 했습니다. 단순히 학생이 시험을 볼 때 책을 읽기를 바라는 대신, 처음부터 책을 펼쳐 놓은 상태로 그들을 훈련시키면 어떨까 하는 것이었습니다. 그들은 2,165개의 법률 질문과 답변으로 구성된 특별한 훈련 세트를 만들었는데, 모든 질문에는 문제를 해결하는 데 필요한 정확한 법률이 바로 옆에 함께 적혀 있었습니다. 그런 다음 그들은 Qwen3.5라는 작은 오픈 소스 컴퓨터 두뇌를 가져와서 아주 작은 0.8-빌리언(0.8B) 파라미터 버전, 중간 크기인 2-빌리언(2B) 버전, 그리고 약간 더 큰 4-빌리언(4B) 버전의 세 가지 크기로 나누었습니다. 그들은 법률이 항상 수업의 일부가 되는 "컨텍스트 주입(context-injected)" 방식으로 이 모델들을 가르쳤습니다.
훈련 후에 그들은 실제 변호사 시험을 주관하는 기관인 방글라데시 변호사 협회의 실제 시험 문제들을 사용하여 모델들을 테스트했습니다. 그들은 모델들에게 동일한 질문들을 다시 주었지만, 이번에는 단순히 모델이 추측하게 두는 것이 아니라, 모델이 제공된 정보를 실제로 사용할 수 있는지 확인하기 위해 두 가지 다른 검색 방식(BM25와 FAISS)을 사용하여 관련 법률을 함께 제공했습니다. 결과는 큰 성공과 놀라운 혼란이 뒤섞여 있었습니다. 가장 작은 모델(0.8B)의 경우, 훈련은 마법처럼 작용했습니다. 훈련 전에는 법률이 제공되었을 때 질문을 거의 맞히지 못해 100문제 중 단 2문제만을 맞혔습니다. 훈련 후에는 100문제 중 34문제를 맞히며 크게 향상되었습니다. 중간 크기 모델(2B) 또한 눈에 띄게 좋아졌으며, 이는 모델이 주어진 법률을 실제로 읽는 법을 배웠음을 보여주었습니다.
하지만 이야기는 가장 큰 모델(4B)에 이르러 달라졌습니다. 이 모델은 올바른 언어로 답하는 능력은 약간 향상되었지만, 법률이 제공되었을 때 영어 질문에 답하는 능력은 오히려 떨어졌습니다. 이는 이 크기의 모델에게는 훈련이 도움이 되기보다 오히려 혼란을 주었을 수 있음을 시사합니다. 훈련의 또 다른 큰 성과는 어처구로 된 실수를 바로잡은 것이었습니다. 훈련 전에는 벵골어로 질문을 받았을 때 모델들이 언어를 무시하고 영어로 답하는 경우가 44%에서 53%에 달했습니다. 훈련 후에는 이 실수가 거의 사라져 1% 미만으로 떨어졌습니다. 이 연구는 작은 모델들에게는 주어진 법률을 사용하도록 가르치는 것이 판도를 바꾸는 결정적인 역할을 하지만, 더 큰 모델들에게는 그것이 보장된 해결책이 아니며, 단순히 올바른 정보를 가지고 있는 것만으로는 모델이 그것을 어떻게 사용하는지 모른다면 충분하지 않다는 점을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.