← 최신 논문
🤖 AI

Reasoning and Planning with Dynamically Changing Norms

본 논문은 사회적 대화 에이전트인 SocialBot 을 통한 형식적 증명과 실증적 검증을 거친, 계획 과정에서 갈등을 해결하고 동적으로 변화하는 규범을 가드레일로서 활용하기 위해 비결정적 계산을 적용함으로써 인간과 AI 간의 상호작용에서 AI 에이전트를 안내하는 새로운 접근법을 제시한다.

원저자: Taylor Olson, Roberto Salas-Damian, Kenneth D. Forbus

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Taylor Olson, Roberto Salas-Damian, Kenneth D. Forbus

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 인간의 집에 사는 매우 도움이 되는 로봇 비서라고 상상해 보세요. 당신의 일은 정보를 공유하거나 계획을 세우는 등 인간을 위해 일을 수행하는 것입니다. 하지만 여기에는 함정이 있습니다. 인간은 마음을 바꾸며, 당신에 대한 규칙도 그 변화에 따라 달라집니다.

이 논문은 AI 가 혼란에 빠지거나 신뢰를 깨뜨리지 않고도 이러한 변화하는 규칙을 어떻게 처리할 수 있는지 가르치는 것에 관한 것입니다.

문제: 계속 변하는 "규칙집"

인간의 규칙을 고정된 목록이 아니라 살아있는 규칙집으로 생각하세요.

  • 1 일: 카를리는 당신에게 "절대 누구에게도 내 진료 기록을 보여주지 마라"고 말합니다.
  • 2 일: 그녀는 결혼하고 "좋아, 이제 내 남편에게 내 처방전을 보여줘도 돼"라고 말합니다.
  • 3 일: 그녀는 아이를 낳고 "이제 당신은 내 건강 상태에 대해 내 아이들에게 반드시 알려야 해"라고 말합니다.

만약 당신이 일반적인 컴퓨터 프로그램이었다면, 멈춰 버렸을지도 모릅니다. 만약 첫 번째 규칙만 따랐다면 2 일과 3 일에 그녀의 신뢰를 저버리게 되었을 것입니다. 만약 마지막 규칙만 따랐다면 첫 번째 규칙을 위반했을지도 모릅니다. 이 논문은 묻습니다: AI 는 어떻게 움직이는 표적을 따라갈 수 있을까요?

해결책: "가드 레일"과 "결함 가능 계산기"

저자들은 이 문제를 해결하기 위해 SocialBot이라는 AI 를 개발했습니다. 그들은 봇에게 단순한 규칙 목록을 주는 대신, **"결함 가능 계산기 (defeasible calculus)"**라는 특별한 사고 방식을 부여했습니다.

간단한 비유를 통해 이것이 어떻게 작동하는지 살펴보겠습니다.

1. "가드 레일" 개념

AI 가 자동차를 운전한다고 상상해 보세요. "계획"은 운전자가 가고자 하는 경로이고, "규범 (규칙)"은 도로 옆에 있는 가드 레일입니다.

  • AI 는 규칙에 의해 운전하도록 동기를 부여받을 필요가 없습니다. 움직이기 전에 가드 레일을 확인하기만 하면 됩니다.
  • 가드 레일에 "건너지 마라"고 적혀 있다면, 차는 멈춥니다.
  • 가드 레일에 "건너도 된다"고 적혀 있다면, 차는 진행합니다.
  • 중요한 점은, 인간이 그렇게 말하면 이러한 가드 레일이 즉시 이동하거나 제거될 수 있다는 것입니다.

2. "결함 가능 계산기" (두뇌)

이것은 규칙을 작동하게 만드는 수학적인 부분입니다. "결함 가능 (Defeasible)"은 **"무효화될 수 있는"**이라는 고급 단어입니다.

로봇의 뇌 안에 있는 법정처럼 생각하세요.

  • 기본 가정: 논문은 민감한 사항 (예: 진료 기록) 에 대해 로봇은 기본적으로 **"아니오"**라고 가정해야 한다고 말합니다. 이는 "금지적 폐쇄 (Prohibitive Closure)"와 같습니다. 명시적으로 "예"라고 말하지 않았다면, 로봇은 안전을 위해 "아니오"라고 가정합니다.
  • 증거: 인간이 "내 남편에게는 말해도 돼"라고 말할 때, 그것은 새로운 증거입니다.
  • 갈등 해결: 인간이 "아무에게도 말하지 마라" (규칙 A) 고 말한 후 나중에 "내 남편에게는 말해라" (규칙 B) 고 말하면 어떻게 될까요?
    • 로봇의 "계산기"는 날짜를 확인합니다. 규칙 B 가 더 최신입니다.
    • 범위를 확인합니다. 규칙 B 가 규칙 A 와 동일한 영역을 다루나요? 네.
    • 판결: 규칙 B 는 남편에 대해 구체적으로 규칙 A 를 "무효화 (overrules)"합니다. 로봇은 이제 "남편을 제외하고는 누구에게도 말하지 마라"고 알게 됩니다.

이 논문은 수학적으로 이 시스템이 로봇이 동시에 두 가지 모순된 사실이 참이라고 생각하지 않도록 방지한다는 것을 증명합니다 (예: 공유가 동시에 "허용"되고 "금지"된다고 생각하지 않음).

실험: SocialBot 의 실제 작동

연구자들은 Microsoft Teams 에서 사람들과 대화하는 챗봇인 SocialBot을 통해 이를 테스트했습니다.

  • 설정: 그들은 1,536 가지 다른 시나리오가 포함된 가상의 세계를 만들었습니다. 이러한 시나리오에서 사용자는 "나는 피자를 좋아해"라고 말한 후, "내 음식 선호도를 아무에게도 말하지 마라"고 말한 다음, "사실, 피자에 대해 밥에게 말해도 돼"라고 말합니다.
  • 테스트: 제 3 자 (소크라테스 같은 사람) 가 봇에게 "플라톤은 무엇을 좋아해?"라고 묻습니다.
  • 결과: 봇은 100% 정확했습니다.
    • 규칙이 "말하지 마라"였을 때, 봇은 "말할 수 없습니다"라고 답했습니다.
    • 규칙이 "밥에게 말해라"로 업데이트되었을 때, 봇은 밥에게 말했습니다.
    • 규칙이 "밥에게는 말하되 소크라테스에게는 말하지 마라"였을 때, 봇은 밥에게 말하고 소크라테스에게는 침묵했습니다.

왜 이것이 중요한가 (논문에 따르면)

오늘날의 대부분의 AI(대형 챗봇 등) 는 대화를 나눌 수 있지만, 규칙을 위반하도록 속이거나 조작당할 수 있습니다. 그들은 규칙이 왜 존재하는지, 또는 인간이 마음을 바꿀 때 규칙을 어떻게 업데이트해야 하는지에 대한 견고한 수학적 기반을 가지고 있지 않습니다.

이 논문은 다음과 같은 AI 를 위한 청사진을 제공합니다:

  1. 인간의 규칙을 경청합니다.
  2. 규칙이 다른 규칙의 예외가 될 수 있음을 이해합니다.
  3. 규칙을 "가드 레일"로 사용하여, 하고 싶더라도 하지 말아야 할 일을 스스로 멈추게 합니다.

이것이 하지 않는 것 (한계)

저자들은 로봇이 아직 할 수 없는 것에 대해 매우 솔직합니다:

  • 그것은 한 번에 한 사람의 규칙만 처리합니다. A 사람의 규칙과 B 사람의 규칙을 저울질할 수 없습니다 (예: "엄마는 말하라고 하고, 아빠는 말하지 말라고 함").
  • 합성 데이터셋(가상 대화) 에서 테스트되었으며, 실제 세계의 복잡한 인간 드라마에서는 테스트되지 않았습니다.
  • 규칙을 이해하기 위해 로봇이 이미 기본 사실 (누가 누구와 결혼했는지 등) 을 알고 있다고 가정합니다.

요약하자면, 이 논문은 AI 가 당신의 변화하는 사생활 보호 요구를 존중하는 충실하지만 유연한 비서가 되는 법을 가르칩니다. 이는 당신이 지시하는 대로 정확히 움직이는 똑똑한 가드 레일처럼 행동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →