Autoformalization of Agent Instructions into Policy-as-Code
이 논문은 자연어 에이전트 지침과 정책을 정형 검증이 가능한 Cedar 정책 언어 코드로 변환하는 LLM 기반 자동 정형화 파이프라인을 소개하며, 이는 확률적 가드레일과 수동으로 코딩된 기호적 강제 실행 모두를 능가하는 확장 가능하고 엄격한 안전 보장을 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 의료 기록을 처리하기 위해 매우 똑똑하고 매우 빠른 로봇 비서를 고용했다고 상상해 보십시오. 이 로봇은 강력합니다. 파일을 읽고, 새로운 노트를 작성하며, 정보를 얻기 위해 다른 도구들을 호출할 수 있습니다. 하지만 이 로봇은 매우 강력하기 때문에, 만약 혼란에 빠지거나 속임을 당하게 되면 실수로 환자의 병력을 삭제하거나 엉뚱한 사람에게 처방전을 작성할 수도 있습니다.
현재의 안전 조치들이 가진 문제는 마치 아이에게 "조심해!"라고 말하거나 선생님이 아이가 잘못된 행동을 하는 것을 알아차리기를 바라는 것과 같습니다. 때때로 로봇은 경고를 무시하기도 하고, 선생님은 그것을 놓치기도 합니다.
이 논문은 로봇을 안전하게 유지하기 위한 새로운 방법인 **정책 기반 코드(Policy-as-Code)**를 제시합니다. 로봇에게 단순히 영어로 무엇을 해야 할지 말해주는 대신, 저자들은 그 규칙들을 로봇이 논쟁할 수 없는 엄격한 수학적 "법전"으로 변환합니다.
저자들은 이 과정을 창의적인 비유를 사용하여 다음과 같이 설명했습니다.
"검증 샌드위치" (The Verification Sandwich)
저자들은 인간의 모호한 지침을 엄격한 로봇 법률로 바꾸기 위해 세 층으로 구성된 시스템을 구축했습니다. 이를 검증 샌드위치라고 부릅니다.
하단 빵 (그라운딩 레이어 - The Grounding Layer):
로봇이 규칙을 따르기 전에, 먼저 "재료"가 무엇인지 알아야 합니다. 이 레이어는 로봇의 도구와 실제 세계의 객체들(예: "환자", "의사", 또는 "처방전")을 살펴보고 엄격한 사전(dictionary)을 만듭니다. 이는 로봇이 "환자"라고 말할 때, 그것이 데이터베이스에 있는 실제 사람이 아니라 가상의 이름을 의미하는 것이 아님을 보장합니다.패티 (모델 레이어 - The Model Layer):
여기가 "지능"이 작동하는 곳입니다. 거대 AI 모델(로봇의 두뇌)이 인간의 지침(예: "알레르기를 확인하지 않고는 절대 처방전을 작성하지 마시오")을 읽고, 이를 엄격한 법전 언어(Cedar)로 번역하려고 시도합니다. 이것은 시를 법적 계약서로 바꾸려는 번역가와 같습니다.상단 빵 (안전 레이어 - The Safety Layer):
이 부분이 가장 중요합니다. 번역된 법전은 단순히 받아들여지는 것이 아니라, 두 명의 비평가로부터 **고문 테스트(torture test)**를 거칩니다.- 강한 비평가 (로봇 변호사): 구문 오류를 체크하는 컴퓨터 프로그램입니다. 이 프로그램은 "이 문장이 문법적으로 올바른가? 서로 모순되지는 않는가? 따르는 것이 불가능한 규칙인가?"라고 묻습니다. 만약 법전에 오타가 있다면, 이 비평가는 즉시 거부합니다.
- 부드러온 비평가 (인간 판사): 원래의 인간 지침과 새로운 법전을 함께 읽으며 두 내용이 "느낌상" 일치하는지 확인하는 또 다른 AI입니다. 이 AI는 "이 엄격한 규칙이 실제로 인간이 의도한 바를 의미하는가, 아니면 번역가가 규칙의 정신을 잘못 이해했는가?"라고 묻습니다.
만약 법전이 두 비평가를 모두 통과하면 승인됩니다. 그렇지 않으면, 시스템은 다시 루프를 돌아 오류를 수정하고 다시 시도합니다.
결과: 디지털 가드 (A Digital Bouncer)
규칙이 승인되면, 이 규칙들은 "정책 엔진"에 로드됩니다. 이 엔진을 클럽의 **가드(Bouncer)**라고 생각하십시오.
- 로봇 비서가 어떤 행동(예: "처방전 작성")을 하려고 할 때마다, 반드시 가드에게 물어봐야 합니다.
- 가드는 로봇이 무엇을 말하는지 혹은 로봇이 무엇을 좋은 생각이라고 여기는지에는 관심이 없습니다. 가드는 오직 엄격한 법전만을 봅니다.
- 만약 어떤 행동이 규칙을 위반한다면, 가드는 즉시 "안 돼"라고 말합니다. 해커에게 속임을 당하더라도 로봇은 말을 통해 규칙을 빠져나갈 수 없습니다.
테스트 내용
저자들은 이 시스템을 MedAgentBench라는 의료 벤치마크로 테스트했습니다. 그들은 자신들의 자동화된 "가드" 시스템을 인간이 수동으로 안전 규칙을 작성했던 이전 방식과 비교했습니다.
- 이전 방식: 인간이 23개의 특정 시나리오에 대해 규칙을 작성했습니다. 로봇은 그 23개 시나리오에서는 안전했지만, 나머지 65개의 규칙은 어길 수 있었습니다.
- 새로운 방식: 그들의 시스템은 88개 시나리오 전체에 대해 자동으로 규칙을 생성했습니다.
- 결과: 로봇이 실수(예: 알레르기를 확인하지 않고 처방전 작성)를 하도록 유도했을 때, 그들의 시스템은 기존의 수동 방식보다 훨씬 더 자주 나쁜 행동을 차단했습니다. 실제로 로봇이 권한 없이 데이터를 작성하려고 했을 때, 그들의 시스템은 해당 시도들에 대해 100% 차단율을 보였습니다.
이것이 왜 중요한가
이 논문은 이 접근 방식이 더 안전하다고 주장하는데, 그 이유는 다음과 같습니다:
- 추측이 아닙니다: 확률(예: "이것은 90% 정도 안전하다고 생각한다")에 의존하는 다른 안전 도구들과 달리, 이 시스템은 수학에 의존합니다. 동작을 허용하거나, 허용하지 않거나 둘 중 하나입니다.
- 속이기 어렵습니다: 규칙이 로봇의 "두뇌" 외부에 있기 때문에, 해커가 로봇을 속여 규칙을 무시하게 만들 수 없습니다. 가드는 로봇과 분리되어 있습니다.
- 확장 가능합니다: 인간은 모든 가능한 상황에 대해 수천 개의 규칙을 직접 쓸 수 없습니다. 이 시스템은 자연어 규칙 수천 개를 자동으로 코드로 번역할 수 있습니다.
요약하자면, 이 논문은 "조심해 주세요"를 "안전하기 위한 정확한 수학적 공식은 이것입니다"로 바꿈으로써, 의료와 같이 위험도가 높은 환경에서 훨씬 더 속이기 어렵고 훨씬 더 신뢰할 수 있는 AI 에이전트를 구축할 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.