JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety
이 논문은 미래 위험 예측과 안전 판정의 공동 최적화를 통해 안전하지 않은 장기 에이전트 행동을 예측하고 차단하도록 훈련된 가드 모델인 Vanguard를 사용하는 선견지명 지향적 프레임워크인 Janus를 소개하며, 이를 통해 여러 벤치마크에서 안전 보호와 양호한 작업 완료 모두에서 상당한 개선을 달성하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 매우 똑똑하고 의욕 넘치는 로봇 비서가 당신의 컴퓨터를 고치려고 노력하는 모습을 지켜보고 있다고 상상해 보세요. 당신이 "파일을 정리해 줘"라고 요청하자, 로봇은 파일들을 옮기기 시작합니다. 인공지능의 세계에서 이것을 '에이전트(agent)'라고 부릅니다. 오랫동안 우리는 이러한 에이전트들이 못된 말을 하거나 나쁜 아이디어를 생성하는 것을 걱정해 왔습니다. 하지만 이제 에이전트가 파일을 삭제하거나, 이메일을 보내거나, 설정을 변경하는 것과 같이 실제로 무언가를 '수행'할 수 있는 권한을 갖게 되면서, 위험은 단순히 그들이 무엇을 말하느냐가 아니라 그들이 무엇을 '하느냐'로 옮겨갔습니다. 문제는 때때로 나쁜 행동이 즉각적으로 발생하지 않는다는 점입니다. 에이전트는 열 단계 동안 무해한 일들을 수행하다가, 단 한 번의 작은 실수로 열한 번째 단계에서 당신의 하드 드라이브 전체를 삭제할 수도 있습니다. 만약 당신이 에이전트가 "삭제" 버튼을 누른 후에야 안전성을 확인한다면, 이미 너무 늦은 것입니다. 로봇이 버튼에 손을 뻗기도 전에 재앙이 닥칠 것을 미리 볼 수 있는 방법이 필요합니다. 이것이 바로 '장기적 관점의 안전성(long-horizon safety)'이라는 과제, 즉 해로운 일이 실제로 일어나기 전의 초기 단계에서 위험을 포착하는 문제입니다.
여기에 AI 안전성을 위한 '수정구슬' 역할을 하도록 설계된 새로운 프레임워크인 Janus가 등장했습니다. Janus를 단순히 당신이 쿠키를 훔치려 할 때만 막아서는 보안 요원이 아니라, 당신의 계획을 보고 "이봐, 이 길로 계속 가면 3분 안에 쿠키 병을 쓰러뜨리게 될 거야. 지금 경로를 바꾸자"라고 말해주는 현명한 멘토라고 생각해보세요. Janus의 연구진들은 장기적인 재앙을 막기 위해 AI 가드가 두 가지 일을 동시에 수행해야 한다는 점을 깨달았습니다. 즉, 에이전트가 '지금 당장' 무엇을 하고 있는지 살펴보고, 동시에 에이전트가 '다음에' 무엇을 할 가능성이 높은지를 상상해야 한다는 것입니다.
이 수정구슬에 미래를 보는 법을 가르치기 위해, 연구팀은 단순히 실제 로봇이 실수를 저지르기를 기다리지 않았습니다(이는 위험할 수 있기 때문입니다). 대신, 그들은 수천 가지의 "만약에" 시나리오를 만들 수 있는 거대한 시뮬레이션 놀이터를 구축했습니다. 그들은 다양한 역할을 수행하기 위해 AI 에이전트 팀을 활용했습니다. 한 명은 사용자가 되고, 다른 한 명은 환경이 되며, 세 번째는 에이전트 자신을 연기했습니다. 그들은 단순한 작업부터 서서히 문제로 치닫는 복잡한 다단계 계획에 이르기까지 75,000개 이상의 훈련 사례를 생성했습니다. 어떤 위험은 까다로운 사용자 지시사항에서 왔고, 어떤 것은 파일 속에 숨겨진 교묘한 데이터에서 왔으며, 또 어떤 것은 에이전트가 혼란에 빠져 스스로 나쁜 계획을 세우는 과정에서 발생했습니다.
그 마법은 저자들이 CoAA-RL이라고 부르는 훈련 방식에서 일어납니다. 학생이 체스를 배우는 과정을 상상해 보세요. 보통 학생은 이기거나 지는 법만을 배웁니다. 하지만 Janus를 통한 학생에게는 두 가지 임무가 주어집니다. 첫째, 다음 몇 수의 게임을 **예측(Anticipation)**해야 합니다. 둘째, 예측된 움직임을 바탕으로 게임이 안전한지 위험한지를 **판단(Adjudication)**해야 합니다. 영리한 점은 이 두 가지 업무가 서로 연결되어 있다는 것입니다. 학생은 자신의 미래 예측이 올바른 안전 판단을 내리는 데 실제로 도움이 되었을 때만 좋은 점수를 받습니다. 만약 틀리거나 쓸모없는 미래를 예측한다면 보상을 받지 못합니다. 이는 AI가 오직 안전에 중요한 미래의 세부 사항만을 예측하도록 강제합니다.
이 훈련의 결과로 탄생한 모델이 바로 Vanguard입니다. Vanguard는 에이전트가 작업하는 것을 지켜볼 때, 단순히 에이전트가 나쁜 행동을 할 때까지 기다리지 않습니다. 대신, 잠시 멈추어 에이전트의 이력을 살펴보고 빠르게 몇 단계 앞을 시뮬레이션합니다. 그리고 "에이전트가 이대로 계속 간다면, 다음에 어떤 일이 벌어질까?"라고 자문합니다. 만약 시뮬레이션 결과가 경로 끝에 재앙이 기다리고 있음을 보여준다면, Vanguard는 나쁜 행동이 일어나기 전에 개입하여 에이전트를 멈춰 세웁니다.
연구진은 Vanguard를 네 가지 안전 벤치마크(AI 안전성을 위한 표준화된 시험과 같은 것)로 테스트했습니다. 결과는 유망했습니다. Vanguard는 기존의 안전 가드들보다 훨씬 더 잘 나쁜 행동을 차단했습니다. 구체적으로, 다른 방법들과 비교했을 때 평균 보호율을 15.9 퍼센트 포인트 향상시켰습니다. 더욱 고무적인 것은, Vanguard가 선한 작업에 방해가 되지 않았다는 점입니다. 오히려 Vanguard는 기존의 가드들보다 안전하고 도움이 되는 작업을 완료하는 비율을 5.1 퍼센트 포인트 더 높였습니다. 이는 앞을 내다봄으로써, Vanguard가 다른 가드들이 놓치는 교묘하고 지연된 위험을 잡아내는 동시에, 안전할 때는 로봇이 본연의 업무를 수행할 수 있도록 해준다는 것을 시사합니다.
하지만 저자들은 이것이 시뮬레이션 기반의 돌파구라는 점을 주의 깊게 언급했습니다. 훈련 데이터는 실제 세상의 로봇을 관찰한 것이 아니라 통제된 시뮬레이션 환경에서 생성되었습니다. 결과는 강력하지만, 이 접근 방식이 그들이 테스트한 특정 유형의 위험에는 매우 잘 작동한다는 것을 보여줄 뿐, 에이전트가 실제 세상에서 마주칠 수 있는 모든 새로운 속임수를 어떻게 처리할지는 아직 알 수 없습니다. 그럼에도 불구하고, Janus는 안전에 대한 새로운 사고방식을 제시합니다. 즉, 실수를 반응적으로 대응하는 것이 아니라, 예견하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.