Alignment as Jurisprudence
본 논문은 법학과 AI 정렬이 언어를 통해 강력한 행위자들의 결정을 예측하고 형성한다는 점에서 근본적인 구조를 공유한다고 주장하며, 드워킨의 해석주의와 선스타인의 유추적 추론과 같은 법적 이론에서 도출된 학제 간 통찰이 AI 정렬 전략을 정교화할 수 있고, 동시에 AI의 발전이 법 이론을 개선하기 위한 새로운 관점을 제공할 수 있음을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
니콜라스 A. 카푸토 (Nicholas A. Caputo) 의 논문 "법리로서의 정렬 (Alignment as Jurisprudence)"에 대한 설명을 창의적인 비유와 함께 간단한 개념으로 분해하여 제시합니다.
핵심 아이디어: 두 세계, 하나의 문제
두 가지 매우 다른 직업을 상상해 보십시오:
- 판사: 과거의 사례 (선례) 와 법률을 검토하여 완전히 새로운 상황을 어떻게 처리할지 결정하는 사람.
- AI 트레이너: 과거 데이터와 규칙을 사용하여 인간이 선호하는 방식으로 초지능 로봇 (AI) 이 행동하도록 가르치려는 사람.
저자는 이 두 직업이 실제로 쌍둥이라고 주장합니다. 두 직업 모두 정확히 같은 퍼즐에 직면해 있습니다: 과거의 예시와 규칙 집합을 어떻게 활용하여, 아직 발생한 적 없는 것에 대해 공정한 결정을 내릴 수 있을까요?
이 논문은 변호사들과 AI 연구자들이 서로의 정보를 교환해야 한다고 제안합니다. 변호사들은 수세기 동안 이 "미래 예측" 문제를 해결해 왔지만, AI 연구자들은 이제 막 이를 파악하기 시작했을 뿐입니다.
제 1 부: AI 의 교육 방식 ( "훈련" 단계)
현재 AI 모델은 인터넷 전체를 읽은 학생과 같습니다. 그들은 문장에서 다음 단어를 예측하는 방법은 알지만, 무엇을 말하는 것이 "좋고" "나쁜지"는 모릅니다. 이를 해결하기 위해 연구자들은 정렬 (Alignment) 기술을 사용합니다.
구식 방식 (RLHF): 교사가 학생에게 시험을 치르게 하는 상황을 상상해 보십시오. 교사는 모든 답변에 대해 점수를 매깁니다. "잘했어!" 또는 "다시 해봐." 학생은 수천 개의 이런 점수를 받으며 학습합니다. 이를 인간 피드백을 통한 강화 학습 (Reinforcement Learning from Human Feedback, RLHF) 이라고 합니다.
- 문제점: 비용이 많이 들고 느리며, 소수의 교사 (크라우드워커) 의 특정 의견에 의존합니다. 만약 교사들이 편향되어 있다면, 학생도 편향을 학습하게 됩니다.
신식 방식 (헌법적 AI): 교사가 모든 답변을 일일이 채점하는 대신, 학생에게 헌법—"도움이 되라", "나쁘게 행동하지 마라", "인권 존중"과 같은 짧은 규칙 목록—을 부여합니다. 그런 다음 AI 는 이러한 규칙을 기반으로 스스로를 채점하도록 가르칩니다.
- 문제점: 규칙이 모호합니다. "도움이 되라"는 것이 기이하고 새로운 상황에서 실제로 무엇을 의미할까요?
사례 기반 방식: 이는 도서관에 있는 구체적인 이야기 (사례) 들을 보여주며 "이 일이 발생하면 어떻게 하겠는가?"라고 묻는 방식으로 학생을 가르치는 것과 같습니다. 학생은 새로운 상황을 이러한 구체적인 이야기들과 비교하며 학습합니다.
제 2 부: 법 이론 (논문의 "두뇌")
저자는 AI 의 문제를 해결하기 위해 두 명의 유명한 법학자를 끌어들입니다.
1. 로널드 드워킨 (Ronald Dworkin): "원칙" 판사
드워킨은 판사가 새로운 사건에 직면했을 때 단순히 규칙만 보지 않고 근본적인 가치 (정의와 공정성 등) 를 보아야 한다고 믿습니다.
- 비유: 요리사에게 레시피 책 (법률) 이 있다고 상상해 보십시오. 고객이 책에 없는 요리를 주문할 때, 요리사는 단순히 추측하지 않습니다. 대신 "이 요리의 정신은 무엇인가? 이 문화에서 '맛있다'는 것은 무엇을 의미하는가?"라고 묻습니다. 그들은 높은 수준의 원칙을 사용하여 요리를 안내합니다.
- AI 에 대한 교훈: AI 는 단순히 "하지 말아야 할 것" 목록을 따르는 것만으로는 부족합니다. 규칙의 정신 (예: "인권") 을 이해해야 하므로, 규칙이 모호할 때에도 좋은 결정을 내릴 수 있어야 합니다.
2. 캐스 선스타인 (Cass Sunstein): "유추" 판사
선스타인은 판사들이 거대하고 추상적인 이론이 필요하지 않다고 믿습니다. 그들은 단지 비슷한 과거 사례를 살펴보면 됩니다.
- 비유: 새로운 과일이 사과인지 결정해야 한다고 상상해 보십시오. 식물학 박사 학위가 필요하지 않습니다. 빨간 사과로 알려진 과일의 사진을 보고 "이건 저것과 비슷해"라고 말하기만 하면 됩니다. 그것이 왜 사과인지에 동의할 필요는 없고, 그것이 사과 라는 사실에 동의하기만 하면 됩니다. 이를 "불완전하게 이론화된 합의 (Incompletely Theorized Agreement)" 라고 합니다.
- AI 에 대한 교훈: AI 는 "정의"의 깊은 의미에 동의할 필요가 없습니다. 단지 구체적이고 실제적인 예시를 어떻게 처리할지에 대해 동의하기만 하면 됩니다. 우리가 AI 에게 "공정한"과 "불공정한" 상황의 예시를 충분히 보여주면, 철학 학위가 없어도 패턴을 학습할 수 있습니다.
제 3 부: 제안된 해결책 (두 가지의 혼합)
이 논문은 AI 를 훈련시키는 최선의 방법은 드워킨의 "원칙"과 선스타인의 "예시"를 혼합하는 것이라고 주장합니다.
- 하이브리드 접근법:
- AI 에게 헌법 (드워킨의 원칙) 을 부여하여 고수준의 목표 (예: "인권 보호") 를 알립니다.
- AI 에게 사례 도서관 (선스타인의 예시) 을 부여하여 이러한 원칙이 현실에서 어떻게 작동하는지 보여줍니다.
- 마법 같은 단계: 인간들이 구체적인 예시들에 대해 토론하고 결정합니다. 예를 들어, "12 세 어린이가 비디오 게임을 구매하는 것이 공정한가?"와 같은 질문입니다. AI 는 이러한 토론들로부터 학습합니다.
- 결과: AI 는 단순히 규칙이 무엇인지만 배우는 것이 아니라, 과거 결정들의 "형태"를 살펴봄으로써 새롭고 기이한 상황에 그 규칙을 어떻게 적용할지 배우게 됩니다.
이는 민주적인 (왜냐하면 인간이 예시를 결정하기 때문) 이고 유연한 (왜냐하면 AI 는 논리를 새로운 상황에 적용할 수 있기 때문) 시스템을 만들어냅니다.
제 4 부: AI 가 법을 도울 수 있는 방법
이 논문은 AI 가 변호사를 돕는 것뿐만 아니라 그 반대로도 도움이 될 수 있다고 제안합니다.
- "제 2 의 의견" 기계: 판사가 결정을 내린다고 상상해 보십시오. 수천 건의 과거 사례로 훈련된 AI 는 즉시 "이 결정은 당신이 이전에 내린 50 건의 유사한 사례들과 매우 다르게 보입니다. 정말 이 방향으로 가고 싶으신가요?"라고 말할 수 있습니다. 이는 판사들이 자신의 개인적인 편향만 따르지 않도록 점검하는 역할을 합니다.
- "시간 여행" 번역기: AI 는 과거의 법률을 분석하여 과거의 단어 의미 (원래 의미) 와 현재의 의미를 비교하여 알려줌으로써, 변호사들이 오래된 법률의 진정한 의도를 이해하는 데 도움을 줄 수 있습니다.
- "슈퍼 에이전트": 미래에는 AI 가 모든 사람을 위한 개인 변호사 역할을 할 수 있습니다. 집을 구매하거나 계약을 체결하고 싶을 때, 당신의 AI 에이전트가 대신 협상하여 거래가 공정한지 확인함으로써 법을 부유한 사람들뿐만 아니라 일반인들에게도 접근 가능하게 만들 것입니다.
결론
이 논문은 법과 AI 정렬이 서로 다른 조각으로 플레이되는 동일한 게임이라고 주장합니다.
- 변호사는 수세기 동안 이 게임을 플레이해 왔으며, 규칙과 이야기를 사용하여 미래를 결정하는 방법을 터득해 왔습니다.
- AI 연구자는 로봇에게 동일한 게임을 플레이하도록 가르치려 노력하고 있습니다.
AI 연구자들에게 판사처럼 (원칙과 예시를 사용하여) 생각하도록 가르침으로써, 우리는 더 안전하고, 지능적이며, 공정한 AI 를 구축할 수 있습니다. 그리고 AI 가 변호사를 돕도록 허용함으로써, 우리는 모든 사람을 위해 더 투명하고 공정한 법 체계를 만들 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.