DAR: Deontic Reasoning with Agentic Harnesses
이 논문은 대규모 언어 모델이 복잡한 의무론적 추론 작업의 성능을 향상시키기 위해 필요에 따라 법령과 상호작용할 수 있게 하는 에이전트 프레임워크인 의무론적 에이전트 추론(Deontic Agentic Reasoning, DAR)을 소개하며, 다만 이러한 이점이 균일하게 나타나지는 않으며 약한 모델의 경우 수치적 성능 저하와 토큰 소비 증가를 초래할 수 있음을 언급한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 미스터리를 해결하려는 탐정이라고 상상해 보세요. 하지만 당신이 가진 유일한 단서는 난해한 법률 용어로 쓰인 방대한 1,000페이지 분량의 규칙서뿐입니다. 당신의 임무는 특정 인물의 상황에 적용되는 구체적인 규칙을 찾아내고 그 결과를 계산하는 것입니다.
이 논문은 서로 다른 "탐정들"(AI 모델)에게 특수한 도구 세트를 허용했을 때와, 단순히 전체 책을 한꺼번에 통째로 주었을 때가 어떻게 다른지 테스트하는 방법에 관한 것입니다.
두 가지 미스터리 해결 방식
연구진은 두 가지 접근 방 را 비교했습니다:
- "거대한 더미" 방식 (직접 추론): 탐정에게 1,000페이지짜리 책 전체와 사건의 사실 관계, 그리고 질문을 한꺼번에 건네주는 것을 상상해 보세요. 탐정은 머릿속으로 전체를 읽고, 적절한 페이지를 찾아낸 뒤 즉시 답을 써 내려가야 합니다.
- "검색 및 발굴" 방식 (의무적 에이전트 추론 또는 DAR): 책을 통째로 주는 대신, 책을 방 안의 선반 위에 올려두고 탐정에게 도구 세트(돋보기, 검색 엔진, 계산기 같은 것들)를 줍니다. 탐정은 선반으로 걸어가 도구를 사용하여 필요한 특정 페이지를 찾아내고, 그것을 읽은 뒤 다시 돌아와 답을 작성해야 합니다. 이 과정은 필요한 만큼 여러 번 반복할 수 있습니다.
큰 발견: 누구에게 묻느냐에 따라 달라진다
연구진은 두 유형의 탐정을 테스트했습니다: 천재들(최상위 수준의 고가 AI 모델)과 견습생들(규모가 작은 오픈 소스 AI 모델).
1. 천재들은 번창했다
천재들에게 "검색 및 발굴" 도구를 사용할 수 있게 해주었을 때, 그들은 퍼즐을 푸는 데 훨씬 더 뛰어난 성과를 보였습니다.
- 이유: 그들은 충분히 똑똑해서 무엇을 찾아야 하는지 알고 있었습니다. 그들은 "세금 공제 섹션을 찾아야 해"라고 말한 뒤,
grep도구를 사용하여 곧바로 그곳으로 점프하고 나머지 부분은 무시할 수 있었습니다. - 결과: 그들의 정확도는 크게 향상되었습니다(때로는 15~30%). 그들은 올바른 규칙을 찾기 위해 도구를 효율적으로 사용했으며, 계산 결과도 정확하게 도출했습니다.
2. 견습생들은 고전했다 (그리고 더 나빠졌다)
견습생들에게도 동일한 도구를 주었을 때, 그들은 오히려 책 전체를 통째로 받았을 때보다 성적이 더 나빠졌습니다.
- 이유: 그들은 자유로움 때문에 혼란을 느꼈습니다. 단서를 찾았다고 해서 멈추는 대신, 계속해서 파헤치고, 관련 없는 페이지들을 읽으며, 루프(loop)에 빠져 헤맸습니다. 그들은 엄청난 양의 컴퓨터 "에너지"를 소비하며 자신만만하게 길고 틀린 답을 써 내려갔습니다.
- 결과: 그들의 정확도는 급격히 떨어졌습니다(때로는 거의 0에 가깝게). 그들은 더 나쁜 답을 얻으면서도 무려 4배나 많은 컴퓨터 자원을 소비했습니다.
"확신 증폭기" 비유
이 논문은 약한 모델들에게 도구가 확신 증폭기 역할을 했다고 제안합니다.
- 수학 문제를 풀지 못하는 학생을 상상해 보세요. 만약 그저 답을 적어야 한다면, 아마 대충 추측하고 넘어갈 것입니다.
- 하지만 계산기와 교과서를 주며 "가서 답을 찾아오라"고 말한다면, 학생은 미친 듯이 페이지를 넘기고, 무작위로 계산을 수행하며, 비록 틀렸을지라도 스스로가 맞다고 확신하기 시작할 수도 있습니다. 도구들이 그들이 열심히 일하고 있다고 믿게 만들었지만, 실제로는 제자리걸음만 하고 있었던 것입니다.
틀리는 것의 비용
이 논문은 주요한 비용 문제를 강조합니다.
- 천재들은 효율적이었습니다. 그들은 도구를 사용하여 빠르게 정답을 얻어냈습니다.
- 견습생들은 낭비적이었습니다. 그들은 도구를 사용하여 엄청난 양의 텍스트를 생성하며, 정확도를 높이지 못한 채 컴퓨터 자원(토큰)을 태워버렸습니다. 어떤 경우에는 생각을 다 마치기도 전에 시간이 다 되어버리기도 했습니다.
결론
논문은 AI에게 규칙을 찾아볼 수 있는 "도구 상자"를 주는 것이 모두에게 마법 같은 해결책은 아니라고 결론짓습니다.
- AI가 이미 매우 똑똑하다면, 도구 상자는 그들이 빛을 발하도록 도와줍니다.
- 만약 AI가 아직 배우는 단계라면, 도구 상자는 오히려 그들을 과신하게 만들고, 낭비하게 하며, 정확도를 떨어뜨릴 수 있습니다.
연구진은 세금법이나 이민 규칙과 같은 복잡한 작업에서 AI에게 더 많은 도구를 준다고 해서 그것이 자동으로 더 나아질 것이라고 가정해서는 안 된다고 경고합니다. 약한 모델들에게 있어, 그것은 단지 더 비싸고 더 자신만만한 실수를 유발하는 도구가 될 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.