Testing and Evaluation of Agentic AI Systems In Military Command and Control
이 논문은 에이전트형 AI 시스템의 내재적 속성이 현재의 군사 시험 및 평가 방법론의 여덟 가지 근본적인 가정을 약화시키며, 이로 인해 시험 증거와 실전 운용 행동 사이의 논리적 연결 고리가 깨지게 된다고 주장하며, 따라서 더 좁고 회복 가능한 보증 주장과 배치를 지속적인 위험 관리 행위로 취급하는 거버넌스 모델로의 전환이 필요하다고 논한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
군사 지휘라는 고도의 긴장감이 흐르는 세계에서, 지도자들은 정보를 수집하고, 이를 이해하며, 행동 방안을 제안하기 위한 체계에 의존합니다. 지휘 통제(command and control)라고 알려진 이 체계는 작전의 신경계와 같아서, 지상과 하늘의 센서를 병력을 어디로 보낼지 결정해야 하는 지휘관들에게 연결해 줍니다. 수십 년 동안 이러한 시스템에 사용된 도구들은 예측 가능한 기계들이었습니다. 그것들은 엄격한 규칙을 따르며, 만약 같은 정보를 두 번 입력한다면 동일한 답을 내놓습니다. 하지만 이제 새로운 종류의 기술이 이 공간에 들어오고 있습니다. 이것들은 단순히 명령을 따르는 도구가 아니라, '에이전트(agent)'입니다. 단순한 계산기와 달리, 에이전트는 상황을 살펴보고, 어떤 정보가 필요한지 결정하여 직접 찾아낸 뒤, 그 새로운 정보를 사용하여 자신의 계획을 스스로 변경할 수 있습니다. 에이전트는 과거의 사건을 기억하고, 다른 유사한 시스템과 대화하며, 인간이 다음에 무엇을 할지 정확히 알려주지 않아도 변화에 적응할 수 있습니다. 이러한 유연성은 에이전트를 믿기 힘들 정도로 강력하게 만들지만, 동시에 이해하기 어렵게 만듭니다. 군대의 핵심 질문은 이제 이 에이전트들이 제대로 작동하느냐를 넘어, 어떻게 하면 가장 중요한 순간에 이들이 안전하게 작동할 것이라고 확신할 수 있느냐로 바뀌었습니다.
한 연구팀은 우리가 현재 이러한 새롭고 유연한 시스템을 테스트하는 방식을 조사함으로써 이 질문에 답하고자 했습니다. 그들은 군사와 산업 전문가들이 소프트웨어와 자율 시스템을 테스트하기 위해 사용하는 240가지의 서로 다른 방법들을 살펴보았습니다. 그들의 목표는 기존의 방식들이 학습하고, 기억하며, 즉석에서 변화하는 에이전트라는 새로운 현실을 감당할 수 있는지 확인하는 것이었습니다. 그들은 근본적인 문제를 발견했습니다. 우리가 현재 이 시스템들을 테스트하는 방식은 에이전트에게는 전혀 적용되지 않는 가정들에 기반하고 있다는 점입니다. 전통적인 테스트는 시스템을 자동차와 같이 고정된 객체로 가정합니다. 즉, 부품이 변하지 않으며 그 동작 방식이 예측 가능하다는 가정입니다. 자동차를 오늘 테스트했다면 그 결과가 내일도 유효할 것이며, 자동차의 각 부품을 따로 테스트함으로써 전체 자동차가 어떻게 작동할지 알 수 있다고 가정합니다.
연구진은 에이전트 시스템이 이러한 모든 가정을 깨뜨린다는 것을 발견했습니다. 첫째, 이 시스템들은 고정되어 있지 않습니다. 에이전트는 어떤 도구를 사용할지, 어떤 정보를 수집할지를 선택함으로써 자신만의 경로를 구축합니다. 에이전트는 작업 중에 이러한 선택을 내리기 때문에, 테스트 중인 시스템은 설계되었던 원래의 시스템과는 다른 모습이 됩니다. 이는 운전자가 동시에 엔진과 타이어를 교체하고 있는 자동차를 테스트하려는 것과 같습니다. 둘째, 이 시스템은 안정적이지 않습니다. 에이전트는 이전 과업에서 일어난 일을 기억하며, 그 기억은 다음 과업에서 어떻게 행동할지를 변화시킵 sleep다. 소프트웨어 코드가 전혀 변하지 않더라도, 에이전트의 내부 상태가 변화했기 때문에 행동은 달라집니다. 이는 지난주의 테스트 결과가 오늘 적용되지 않을 수 있음을 의미합니다. 셋째, 이 시스템들은 종종 함께 작동하는 여러 개의 작은 에이전트들로 구성됩니다. 이들이 모이면 개별 부분에는 존재하지 않았던 새로운 행동이 나타날 수 있습니다. 에이전트 집단은 개별적으로는 예측할 수 없었던 방식으로 문제를 해결할 수 있으며, 이는 각 부분을 분리해서 테스트해서는 결코 예측할 수 없는 결과를 만들어냅니다.
이러한 변화 때문에, 연구진은 현재의 테스트 방법들이 서류상으로는 완벽해 보이고 모든 공식적인 규칙을 충족하는 보고서를 만들어낼 수 있지만, 여착 실생활에서 시스템이 안전할 것이라는 점을 입증하는 데는 실패할 수 있다는 것을 발견했습니다. 테스트는 특정되고 통제된 조건 하에서 시스템이 작동함을 보여줄 수는 있지만, 혼란스럽고 변화무쌍한 환경에 직면했을 때 시스템이 동일하게 행동할 것이라는 보장은 해주지 못합니다. 테스트 결과와 실제 현장에서의 성능 사이의 연결 고리가 끊어진 것입니다. 증거는 존재하지만, 그 증거를 안전에 대한 약속으로 연결하는 논거는 더 이상 강력하지 않습니다.
이 논문은 우리가 이러한 시스템 사용을 중단해야 한다거나 테스트가 불가능하다고 말하는 것이 아닙니다. 대신, 우리가 안전에 대한 근거를 구축하는 방식을 바꾸어야 한다고 제안합니다. 우리는 시스템이 모든 상황에서 안전하다는 광범위한 약속에 의존할 수 없습니다. 대신 훨씬 더 좁고 구체적인 주장을 해야 합니다. 예를 들어, 시스템이 특정하고 제한된 행동 범위 내에 머무는지, 혹은 최종 답이 달라지더라도 올바른 단계의 경로를 따르는지 테스트할 수 있습니다. 또한, 일부 증거는 시스템이 실제로 사용되는 동안에만 수집될 수 있다는 점을 받아들여야 합니다. 이는 에이전트를 실전에 투입하기로 하는 결정이 단 한 번의 이벤트가 아님을 의미합니다. 그것은 시스템을 지속적으로 모니터링하고, 기억을 점검하며, 여전히 예상대로 작동하고 있는지 검증하는 연속적인 과정입니다. 만약 시스템이 예측하지 못한 방식으로 표류하거나 변화한다면, 우리는 그것을 중단시키거나 조정할 준비가 되어 있어야 합니다.
연구진은 또한 인간이 이러한 에이전트들을 어떻게 감독할 수 있는지도 살펴보았습니다. 그들은 단순히 인간이 같은 공간에 있는 것만으로는 충분하지 않다는 것을 발견했습니다. 만약 에이전트가 너무 빠르거나, 너무 복잡하거나, 혹은 내부가 너무 불투명하다면, 인간은 개입하기 위해 충분히 빠르게 상황을 이해할 수 없습니다. 시스템은 인간이 에이전트가 무엇을 하고 있는지, 왜 그렇게 하는지를 알고, 상황이 잘못되었을 때 멈출 수 있는 충분한 시간을 가질 수 있도록 설계되어야 합니다. 그렇지 않다면 인간은 감독자가 아닌 방관자가 될 뿐입니다.
궁극적으로, 이 연구는 우리가 이 복잡하고 변화하는 시스템이 가능한 모든 시나리오에서 완벽하게 안전하다는 것을 아직 증명할 수는 없지만, 위험을 관리할 수는 있다고 결론짓습니다. 우리는 우리가 모르는 것에 대해 정직해짐으로써 이를 수행합니다. 우리는 시스템이 허용되는 행동의 한계를 정의하고, 작동하는 동안 밀착 모니터링하며, 우리의 신뢰가 언제나 잠정적이라는 사실을 받아들입니다. 에이전트를 사용하는 결정은 더 이상 최종적인 승인이 아닙니다. 그것은 증거를 끊임없이 검토하고, 불확실성을 관리하며, 인간의 판단이 통제권을 유지하도록 보장하는 지속적인 거버버넌스(governance)의 행위입니다. 나아갈 길은 안전을 단번에 증명하는 완벽한 테스트를 찾는 것이 아니라, 이 강력한 도구들을 사용하면서도 위험을 우리가 관리할 수 있는 범위 내에 두는 체크 앤 밸런스(checks and balances, 견제와 균형) 체계를 구축하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.