← 최신 논문
🤖 AI

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

이 논문은 StepGen 데이터 엔진과 Balance-GRPO 알고리즘을 통해 학습되어, LLM 에이전트가 실행하기 전 단계별로 안전하지 않은 도구 동작을 효과적으로 모니터링하고 차단함으로써 유틸리티 손실을 최소화하면서도 최첨단 보안 성능을 달성하는 단계 수준의 가드 모델인 StepGuard를 소개한다.

원저자: Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단순히 질문에 답하는 것을 넘어 실제로 당신을 위해 일을 할 수 있는 디지털 비서를 상상해 보십시오. 이 비서는 당신의 일정을 확인하고, 이메일을 보내고, 파일을 관리하거나, 심지어 당신을 대신해 복잡한 거래를 실행할 수도 있습니다. 이것이 바로 현대적 AI 에이전트가 약속하는 바입니다. 즉, 소프트웨어를 통해 현실 세계와 상호작용함으로써 인간의 능력을 확장하는 도구입니다. 하지만 이 강력한 능력에는 뚜렷한 위험이 따릅니다. 만약 에이전트가 무해해 보이는 이메일 속에 숨겨진 악의적인 지시를 따라 속거나, 명령을 오해하게 된다면, 중요한 문서를 삭제하거나, 개인 정보를 유출하거나, 돈을 잘못된 사람에게 송금할 수도 있습니다. 과학자들의 핵심 과제는 단순히 유능한 비서를 만드는 것이 아니라, 에이전트가 실수를 저지르기 전에 이를 감시하고 방지하면서도, 그들의 유용한 업무를 방해하지 않는 신뢰할 수 있는 안전 시스템을 구축하는 것입니다.

상하이 인공지능 실험실(Shanghai Artificial Intelligence Laboratory)의 연구진은 이 문제를 해결하기 위해 '스텝가드(StepGuard)'라고 불리는 새로운 안전 시스템을 개발했습니다. 기존의 안전 검사기들은 대개 에이전트가 일련의 긴 행동을 모두 마친 후에 무엇이 일어났는지 검토하곤 합니다. 하지만 그 시점에는 이미 실수가 발생하여 피해가 발생한 후일 수 있습니다. 스텝가드는 이와 다르게, 에이전트가 취하는 모든 단계를 실행하기 전에 검사하는 빈틈없는 감독관 역할을 수행합니다. 이 시스템은 에이전트의 계획, 사용하려는 도구, 그리고 상황적 맥의를 살펴보고 해당 동작이 안전한지 결정합니다. 만약 단계가 위험해 보이면 시스템은 즉시 이를 차단합니다. 안전하다면 에이전트는 계속 진행합니다. 이러한 '단계별(step-level)' 모니터링은 위험이 긴 사건의 사슬 속 단 하나의 동작의 세부 사항 속에 숨어 있을 수 있기 때문에 매우 중요합니다.

이 시스템이 훌륭한 감독관이 되는 법을 가르치기 위해, 연구진은 매우 어려운 난관에 봉착했습니다. 바로 AI 에이전트가 위험한 실수를 저지르는 실제 사례가 매우 적다는 점입니다. 이를 극복하기 위해 그들은 '스텝젠(StepGen)'이라는 자동 데이터 엔진을 구축했습니다. 사고가 발생하기를 기다리는 대신, 스텝젠은 에이전트가 실수를 저지르기 직전의 상황을 담은 수천 개의 시뮬레이션 시나리오를 생성합니다. 이 엔진은 에이전트가 작업을 수행 중인 이야기를 구성한 뒤, 숨겨진 악의적 지시나 손상된 데이터 파일과 같은 특정한 위험한 순간을 도입합니다. 그런 다음 엔진은 다음에 일어날 일에 대해 두 가지 버전을 생성합니다. 하나는 에이전트가 함정에 빠져 해로운 행동을 수행하는 버전이고, 다른 하나는 에이전트가 위험을 인식하고 안전한 대안을 선택하는 버전입니다. 결정적으로, 두 버전은 정확히 동일한 이력에서 시작하며, 오직 그 하나의 결정적인 지점에서만 차이가 납니다. 이를 통해 안전 시스템은 단순히 특정 도구가 항상 나쁘다고 암기하는 것이 아니라, 무엇이 특정 단계를 위험하게 만드는지를 정확히 학습할 수 있습니다.

연구진은 또한 안전 시스템이 특정한 유형의 편향을 겪을 수 있다는 것을 발견했습니다. 어떤 시스템은 실수를 저지르는 것을 너무 두려워한 나머지, 의심스러운 맥락에서 '긴급'이라는 단어가 등장했다는 이유만으로 무해한 이메일 전송을 차단하기도 합니다. 반대로 어떤 시스템은 너무 신뢰하여 위험한 행동을 놓치기도 합니다. 이를 해결하기 위해 팀은 '밸런스-GRPO(Balance-GRPO)'라고 불리는 훈련 방법을 도입했습니다. 이 기술은 시스템이 안전한 동작과 안전하지 않은 동작을 얼마나 잘 포착하는지를 지속적으로 모니터링합니다. 만약 시스템이 너무 많은 유익한 작업을 차단하기 시작하면, 훈련은 더 관대해지도록 조정됩니다. 만약 시스템이 너무 많은 나쁜 동작을 놓치기 시작하면, 훈련은 더 엄격해집니다. 이러한 역동적인 균형 잡기는 시스템이 지나치게 조심스러워지지 않으면서도 예리함을 유지하도록 보장합니다.

이러한 접근 방식의 결과는 상당합니다. 다른 안전 모델들과 비교했을 때, 스텝가드는 오픈 소스 모델들 중 가장 높은 평균 정확도를 달 기록했으며, 훨씬 더 큰 규모의 폐쇄형 시스템들과 대등한 성능을 보여주었습니다. 에이전트 도조(AgentDojo)나 에이전트다인(AgentDyn) 같은 플랫폼에서 에이전트가 작업을 수행하는 환경에서 실시한 실제 테스트 결과, 스텝가드는 성공적인 공격 발생률을 77.3% 감소시키는 데 성공했습니다. 무엇보다 중요한 점은, 이 시스템이 에이전트의 유용한 작업 완료 능력을 단 2.8포인트라는 아주 미미한 수준으로만 감소시키면서 이 성과를 달성했다는 것입니다. 이는 해를 막는 데 매우 효과적이면서도 에이전트가 업무를 수행하는 능력을 존중하는 안전 가드를 만드는 것이 가능하다는 것을 입증합니다.

이러한 성공에도 불구하고, 연구진은 자신들의 작업이 완벽하지는 않다고 인정합니다. 이 시스템은 합성 데이터로 훈련되었기 때문에, 아직 시뮬레이션되지 않은 매우 드물거나 복잡한 유형의 공격은 놓칠 수도 있습니다. 안전 시스템을 무너뜨리기 위해 특별히 설계된 고도의 적대적 시나리오 테스트에서는, 잠재적 위해를 방지하기 위해 정당한 작업을 차단하게 되면서 안전과 유용성 사이의 절충이 더 어려워졌습니다. 또한, 이 시스템은 가드레일이지 보증은 아닙니다. 따라서 안전한 동작을 차단하거나 미묘한 위협을 놓치는 실수를 할 수 있습니다. 연구진은 이 기술이 완전한 해결책이라기보다는 강력한 방어 계층으로서, 인간의 감독 및 다른 보안 조치와 함께 배치되어야 한다고 강조합니다.

궁극적으로 스텝가드는 우리가 AI 안전을 생각하는 방식의 변화를 나타냅니다. 완벽하고 깨뜨릴 수 없는 에이전트를 만드는 대신, 에이전트의 모든 움직임을 지켜보는 똑똑하고 적응력 있는 감독관을 구축하는 데 초점을 맞추고 있습니다. 정교하게 구성된 사례로부터 학습하고, 너무 엄격하거나 너무 느슨해지는 것을 피하기 위해 스스로의 행동을 끊임없이 조정함으로써, 이 시스템은 현실 세계에서 AI 에이전트를 배포할 수 있는 실질적인 경로를 제시합니다. 이는 적절한 훈련 데이터와 균형 잡힌 접근 방식이 있다면, 우리가 위험에 빠지지 않고 복잡한 과업을 수행할 수 있도록 돕는 강력하면서도 안전한 디지털 비서를 만들 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →