Runtime Continuation after Faults in Partially Executed Agent Workflows
본 논문은 신뢰할 수 있는 프런티어를 재구성하고, 정형 계약으로부터 잔여 의무를 도출하며, 유효하고 신선하며 고유하게 일치하는 증거에 의해 뒷받침되는 승인된 효과를 통해서만 상태를 전진시킴으로써, 부분적으로 실행된 언어 모델 에이전트 워크플로의 결함으로부터 안전한 복구를 보장하는 런타임 지속 메커니즘을 제안한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 디지털 환경에서 인공지능은 단순히 텍스트를 작성하는 시스템을 넘어 능동적으로 과업을 수행하는 단계로 진화했습니다. 이러한 지능형 에이전트들은 웹을 검색하고, 파일을 편집하며, 메시지를 보내고, 사용자를 대신해 데이터베이스를 업데이트할 수 있습니다. 이들은 흔히 '워크플로'라고 불리는 일련의 단계를 따라 작동하며, 각 동작은 현실 세계의 상태를 변화시킵니다. 그러나 이러한 실행 능력은 독특한 취약점을 만들어냅니다. 만약 에이전트가 실수를 하거나, 속임수에 넘어가거나, 파일을 변경하거나 메시지를 보낸 직후에 시스템 오류를 겪게 된다면, 단순히 다시 시도하거나 처음부터 다시 시작하는 것만으로는 위험할 수 있습니다. 실패한 시퀀스를 다시 재생하면 해로운 동작이 반복될 수 있고, 혼란스러운 상태에서 계속 진행하면 잘못된 가정 위에 작업을 쌓아 올릴 수 있기 때문입니다. 핵심 과제는 역사의 어느 부분이 신뢰할 수 있는지, 어떤 작업이 아직 완료되지 않았는지, 그리고 오류를 반복하거나 기만에 빠지지 않고 안전하게 앞으로 나아가기 위해 어떤 증거가 필요한지를 정확히 결정하는 것입니다.
연구자 리 젱(Li Zeng)과 그의 팀은 국가이민관리국 정보기술연구소 및 홍콩과학기술대학교 소속으로서 이 문제를 해결하기 위한 새로운 방법론을 개발했습니다. 그들은 이 시스템을 '에이전트미러(AgentMirror)'라고 부릅니다. 에이전트미러는 끊어진 워크플로를 단순히 새로운 추측으로 해결해야 할 오류로 취급하는 대신, 회복 과정을 현실에 대한 엄격하고 단계적인 검증 과정으로 취급합니다. 이 시스템은 에이전트가 한 번 동작을 수행하면, 그 동작의 이력은 고정된 진실의 지점이 된다는 원칙에 따라 작동합니다. 만약 에이전트가 그 지점 이후에 충돌하거나 속임을 당하더라도, 시스템은 인공지능에게 무슨 일이 일어났는지 결정하라고 묻지 않습니다. 대신, 실제로 발생한 일에 대한 검증된 기록을 살펴보고, 어떤 작업이 여전히 남아 있는지를 정확히 식별하며, 다시 세계의 상태를 변화시키는 새로운 동작을 허용하기 전에 구체적인 증거를 요구합니다.
연구진은 '신뢰할 수 있는 전선(trusted frontier)'이라는 개념을 중심으로 이 시스템을 구축했습니다. 에이전트의 이력이 안전하고 정확하다고 확인된 정확한 순간을 표시하는 모래 위의 선을 상상해 보십시오. 이 선 이전의 모든 것은 참으로 받아들여지며, 이 선 이후의 모든 것은 미검증 상태입니다. 결함이 발생했을 때, 시스템은 인공지능이 이 선을 다시 쓰거나 실수가 없었던 것처럼 가장하도록 내버려 두지 않습니다. 시스템은 이 선까지의 검증된 이력을 바탕으로 에이전트의 상태를 재구성합니다. 이 지점에서 시스템은 에이전트가 작업을 완료하기 위해 반드시 수행해야 하는 구체적이고 의무적인 과업 목록인 '잔여 의무(residual obligations)'를 계산합니다. 그런 다음 이 목록을 인공지능에게 가이드로 제시하며, 무엇이 남은 작업인지 알려주되, 인공지능에게 그것을 직접 수행할 권한은 주지 않습니다.
핵적인 혁신은 시스템이 다음 단계를 처리하는 방식에 있습니다. 인공지능이 새로운 동작을 제안하면, 그 제안은 신뢰할 수 없는 것으로 취급됩니다. 시스템은 해당 동작이 실행될 수 있도록 '통상적 승인(ordinary admission)'이라 불리는 표준 보안 검사를 거치도록 강제합니다. 동작이 실행되더라도 시스템은 즉시 해당 과업이 완료되었다고 받아들이지 않습니다. 대신, 동작이 실제로 발생했고 올바르게 관찰되었음을 확인하는 신뢰할 수 있는 기관에서 발행한 디지털 인증서인 '런타임 영수증(runtime receipt)'을 기다립니다. 이 영수증은 방금 생성된 '신선한(fresh)' 것이어야 하며, 현재의 신뢰할 수 있는 전선에 결합되어 있어야 합니다. 즉, 과거 동작의 재현이거나 다른 세션의 가짜가 아니어야 합니다. 이 영수증이 검증되고 남은 과업 중 정확히 하나와 일치할 때만, 시스템은 에이전트 진행의 공식 기록을 앞으로 진행하도록 허용합니다.
아이디어를 테스트하기 위해 연구진은 다양한 과업을 시뮬레이션하고 의도적으로 결함과 공격을 도입하여 에이전트의 행동을 관찰하는 벤치마크인 '에이전트도조(AgentDojo)'를 사용했습니다. 그들은 에이전트미러를 마지막 단계를 단순히 재시도하거나 에이전트가 스스로 문제를 헤쳐 나가도록 내버려 두는 방식과 같은 다른 회복 방법들과 비교했습니다. 결과는 에이전트미러가 훨씬 더 안전하게 과업을 완수한다는 것을 보여주었습니다. 이 시스템은 허가되지 않은 동작이 새어 들어가는 것을 막으면서 결함으로부터 성공적으로 회복했으며, 해로운 동작을 반복하도록 유도하는 속임수 지침에 에이전트가 빠지는 것을 방지했습니다. 이 연구는 인공지능에게 주어지는 가이드와 동작을 실행하는 권한을 분리함으로써, 그리고 매 단계마다 신선한 증거를 요구함으로써, 에이전트 자체가 침해된 상황에서도 시스템이 안전한 경로를 유지할 수 있음을 입증했습니다.
연구진은 또한 특정 안전 규칙을 제거했을 때 어떤 일이 발생하는지도 탐구했습니다. 만약 영수증 검증 단계를 건너뛰면 시스템이 가짜 또는 오래된 증거를 수용하여 잘못된 진행으로 이어진다는 것을 발견했습니다. 만약 회복 가이드가 허가증 역할을 하도록 허용한다면, 시스템은 신뢰할 수 없는 동작을 실행하게 됩니다. 만약 동작이 특정 과업 하나와 정확히 일치하는지 확인하지 않는다면, 시스템은 잘못된 과업을 종료하거나 작업을 미완성 상태로 남겨둘 수 있습니다. 이러한 테스트는 그들의 프로세스 중 모든 부분이 필수적임을 확인시켜 주었습니다. 어떤 단일 검사도 다른 검사를 대체할 수 없습니다. 시스템이 작동하는 이유는 인공지능이 제안할 수는 있지만 시스템이 결정하며, 오직 검증된 현실만이 기록을 바꿀 수 있도록 하여 신뢰의 사슬을 강제하기 때문입니다.
이 연구는 인공지능을 완벽하게 만들거나 모든 가능한 실패를 해결한다고 주장하지 않습니다. 이 시스템은 초기 계약이나 규칙 세트가 올바르다는 것에 의존합니다. 만약 규칙 자체가 틀렸다면, 시스템은 잘못된 경로를 충실히 따를 것입니다. 또한, 행위의 증거가 유실된 경우 이미 현실 세계에서 수행된 동작을 되돌릴 수 없습니다. 그러나 이 시스템은 상황이 잘못되었을 때를 관리하기 위한 견고한 프레임워크를 제공합니다. 회복 과정을 알려진 안전한 상태에서 새로운 검증된 상태로 가는 엄격한 전이로 취급함으로써, 에이전트미러는 지능형 에이전트가 오류나 악의적인 간섭을 겪을 때도 안전하게 계속 작업할 수 있는 방법을 제시합니다. 연구는 안전한 지속의 핵심은 더 나은 추측이 아니라 더 나은 검증이라는 결론을 내립니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.