DeonticBench: A Benchmark for Reasoning over Rules
이 논문은 복잡한 법적 및 정책 규칙에 대한 추론 능력을 평가하기 위해 미국 연방 세금, 항공 수하물 규정, 이민 행정, 주별 주택법 등 다양한 분야의 6,232 개 과제를 포함하는 'DeonticBench' 벤치마크를 제안하고, 언어적 추론과 Prolog 기반의 기호적 계산 워크플로우를 모두 지원하며 현재 최첨단 LLM 들이 이 과제를 해결하는 데 여전히 어려움을 겪고 있음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"LLM(거대 언어 모델) 이 복잡한 규칙을 얼마나 잘 이해하고 적용할 수 있는지"**를 테스트하는 새로운 시험지, **DEONTICBENCH(데온틱 벤치)**를 소개합니다.
쉽게 말해, **"인공지능이 변호사나 세무사처럼 복잡한 법규와 정책을 읽고, 구체적인 상황에 맞춰 '무엇이 허용되고, 무엇이 금지되며, 무엇을 해야 하는지'를 정확히 판단할 수 있을까?"**를 확인하는 실험입니다.
이 내용을 일상적인 비유로 설명해 드리겠습니다.
1. 왜 이 시험이 필요한가요? (배경)
지금까지 AI 는 수학 문제를 풀거나 짧은 글을 요약하는 데는 꽤 능숙했습니다. 하지만 실제 세상에서는 상황이 다릅니다.
- 비유: AI 가 "1+1=2"를 외우는 건 쉽지만, **"2024 년에 A 씨가 B 씨와 결혼하고, 아이를 낳고, 특정 항공사를 타고 짐을 3 개 보냈을 때, 세금과 수하물 요금이 얼마인지"**를 복잡한 법조문과 항공사 규정을 뒤져서 계산하는 건 완전히 다른 문제입니다.
- 문제점: AI 는 종종 **"환각 (Hallucination)"**이라고 불리는, 없는 사실을 있는 것처럼 말하거나, 아주 간단한 규칙도 놓치는 실수를 합니다. 의료나 법률 같은 중요한 분야에서는 이런 실수가 큰 재앙이 될 수 있습니다.
2. DEONTICBENCH란 무엇인가요? (시험지 소개)
이 연구팀은 AI 를 위한 **최고난도 '규칙 적용 시험지'**를 만들었습니다. 이 시험지는 4 가지 주요 영역으로 구성되어 있습니다.
- 미국 연방 세법 (SARA): "Alice 가 2017 년에 얼마의 세금을 내야 할까?" (복잡한 소득과 가족 관계 계산)
- 항공사 수하물 규정 (Airline): "비즈니스석 승객이 5 개의 가방을 들고 탈 때, 무게와 크기에 따른 추가 요금은?"
- 주별 주택 임대법 (Housing): "미시간 주의 특정 법규에 따라, 이 집주인은 임차인을 내쫓을 수 있을까?"
- 이민 심판 (USCIS-AAO): "이 이민자의 appeal(이의신청) 은 받아들여져야 할까, 거절되어야 할까?"
이 시험지는 총 6,232 개의 문제로 이루어져 있으며, 모두 실제 존재하는 법규와 사례를 바탕으로 만들어졌습니다.
3. 시험은 어떻게 치러지나요? (두 가지 방식)
이 벤치마크는 AI 에게 두 가지 방식으로 답을 내보라고 요구합니다.
- 방식 1: 직접 말하기 (Direct Reasoning)
- AI 가 법규와 상황을 읽고 "저는 이렇게 생각합니다. 답은 5,000 달러입니다"라고 자연어로 바로 답합니다.
- 비유: 시험지 보고 머릿속으로 계산해서 바로 답을 쓰는 것.
- 방식 2: 코드로 풀기 (Symbolic/Prolog)
- AI 가 법규를 **프로그래밍 언어 (Prolog)**로 번역한 뒤, 그 코드를 실행시켜 답을 얻습니다.
- 비유: AI 가 스스로 **계산기 (프로그램)**를 만들어서 문제를 풀게 하는 것. 이렇게 하면 "어떻게 그 답에 도달했는지" 그 과정을 투명하게 확인할 수 있습니다.
4. 결과는 어땠나요? (현실적인 평가)
연구팀은 최신 AI 모델들 (GPT-4, GPT-5, Claude, Kimi 등) 을 이 시험에 붙여보았습니다. 결과는 아직은 많이 부족했습니다.
- 성적표: 최상위 AI 모델들도 '어려운 문제 (Hard Subset)'에서는 40~50% 정도만 맞췄습니다. 즉, 반 이상을 틀린 것입니다.
- 실수 패턴:
- 규칙을 잘못 선택: "세금 문제인데 항공사 규정을 적용했다"거나, "어떤 조항을 봐야 할지 헷갈려서 엉뚱한 법을 적용"하는 경우가 많았습니다.
- 사실 파악 실패: "Alice 는 2017 년에 결혼했지만, AI 는 2016 년으로 잘못 기억했다"는 식의 단순한 사실 오류도 많았습니다.
- 계산 실수: 규칙은 맞는데, 숫자 계산에서 틀리는 경우.
- 학습의 한계: AI 를 추가로 학습시켜도 (SFT, 강화학습 등) 성능이 조금은 나아지지만, 여전히 완벽하게 규칙을 따르는 신뢰할 수 있는 수준에는 도달하지 못했습니다.
5. 이 연구의 핵심 메시지 (결론)
이 논문은 우리에게 중요한 메시지를 줍니다.
"AI 가 글을 잘 쓰고 논리적으로 말하는 것 (Chain-of-Thought) 과, 복잡한 규칙을 100% 정확히 따르는 것은 완전히 다른 능력입니다."
현재의 AI 는 **'규칙을 따르는 기계'**가 되기에는 아직 미숙합니다. 특히 법률, 세금, 의료 같은 실제 삶에 큰 영향을 미치는 분야에서는 AI 가 혼자 결정을 내리기보다는, AI 가 제안한 답을 인간이 반드시 검증해야 한다는 점을 강조합니다.
요약
이 논문은 **"AI 가 복잡한 법과 규칙을 제대로 이해하고 적용할 수 있는지"**를 테스트하는 새로운 시험지 DEONTICBENCH를 공개하고, **"아직 AI 는 이 시험에서 50 점도 못 받아서, 중요한 결정을 내릴 때는 여전히 인간의 감독이 필요하다"**는 사실을 증명했습니다.
이는 AI 개발자들에게 **"단순히 말을 잘하는 AI 가 아니라, 규칙을 정확히 지키는 AI 를 만드는 것"**이 앞으로의 핵심 과제임을 알려주는 중요한 연구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.