← 최신 논문
🤖 AI

Towards Risk-free AI Agent Deployment

이 논문은 LLM 기반 에이전트의 위험 없는 배포를 달성하기 위해서는 비결정론 및 오라클 문제와 같은 과제를 해결하기 위해 그들의 실행 궤적을 테스트하고 디버깅하는 데 체계적으로 집중해야 한다고 주장하며, 궁극적으로 실용적인 체크리스트를 제공하고 신뢰할 수 있는 에이전트 통합을 위한 주요 미해결 과제들을 식별한다.

원저자: Yintong Huo, Rangeet Pan, Abhik Roychoudhury

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yintong Huo, Rangeet Pan, Abhik Roychoudhury

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단순히 엄격한 지시 목록을 따르는 것이 아니라 스스로 생각하고, 계획하고, 행동하는 새로운 종류의 노동자를 상상해 보십시오. 이 디지털 노동자들은 흔-히 '에이전트(agent)'라고 불리며, 요청을 읽고, 어떤 도구를 사용할지 결정한 다음, 문제를 해결하기 위해 일련의 행동을 수행할 수 있는 강력한 언어 모델을 기반으로 구축됩니다. 이들은 이미 코드를 작성하고, 대출을 승인하며, 은행의 복잡한 워크플로우를 관리하는 데 사용되고 있습니다. 동일한 입력에 대해 항상 정확한 답을 내놓는 계산기처럼 작동하는 전통적인 컴퓨터 프로그램과 달리, 이 에이전트들은 반응형입니다. 이들은 주변 환경을 관찰하고, 본 것을 바탕으로 결정을 내린 뒤 행동하며, 수십 단계 또는 수백 단계까지 이어질 수 있는 사건의 사슬을 만들어냅니다. 이러한 유연성은 이들을 매우 유용하게 만들지만, 동시에 예측 불가능하게 만들기도 합니다. 표준 프로그램이 고장 나면 보통 명확한 오류 메시지와 함께 즉시 멈추지만, 에이전트가 실패할 때는 잘못된 길을 따라 한참 동안 조용히 헤매다가 결국 틀리거나, 안전하지 않거나, 해로운 결과를 내놓을 수 있습니다. 이러한 실수는 긴 결정의 사슬 깊숙이 숨겨져 있을 수 있기 때문에, 조직들은 이 에이전트들이 문제를 일으키지 않을 것이라는 보장 방법 없이는 가장 중요한 비즈니스 프로세스를 이들에게 맡기기를 주저합니다.

싱가포르와 미국의 연구진은 이 에이전트들을 실제 환경에서 안전하게 사용할 수 있도록 만드는 새로운 방법을 제안했습니다. 그들은 이 디지털 노동자를 이해하고 수정하는 핵심은 그들의 사고 과정을 단계별로 기록하는 데 있다고 주장합니다. 그들은 이 기록을 '궤적(trajectory)'이라고 부릅니다. 사람이 자신의 실수를 이해하기 위해 하루의 일기를 쓰는 것처럼, 에이전트의 궤적은 그것이 생각한 모든 것, 시도한 모든 도구, 그리고 외부 세계로부터 관찰한 모든 내용을 담은 완전한 로그입니다. 연구진은 최종 결과만을 본다면 많은 실패가 보이지 않는다는 사실을 발견했습니다. 작업의 아주 첫 단계에서 발생한 실수는 50번째 단계에 이르러서야 나타날 수 있으며, 그때는 이미 피해가 발생한 후일 수 있습니다. 이처럼 사건의 전체 기록에 집중함으로써, 연구팀은 궤적을 '진실의 근원(primary source of truth)'으로 취급하는 체계적인 테스트 및 디버깅 접근 방식을 개발했습니다.

연구진은 에이전트의 안전한 배치를 가로막는 몇 가지 주요 장애물을 식별했습니다. 가장 큰 문제 중 하나는 에이전트의 답변이 실제로 정확한지 알기 어렵다는 점입니다. 일반적인 소프트웨어에서는 출력이 특정 예상 결과와 일치하는지 확인할 수 있습니다. 하지만 이러한 에이전트의 경우, 문제를 해결하는 다양한 방법이 존재할 수 있으며, "정답"은 맥락이나 질문자에 따라 달라질 수 있습니다. 이는 "이것은 통과, 저것은 실패"라고 규정하는 테스트를 설정하기 어렵게 만듭니다. 게다가 에이전트는 약간의 무작위성을 가지고 답변을 생성하는 모델을 사용하기 때문에, 동일한 테스트를 두 번 실행하더라도 서로 다른 두 가지 결과가 나올 수 있습니다. 이러한 예측 불가능성은 오류를 재현하고 수정하는 것을 어렵게 만듭니다. 또한 연구진은 기존의 테스트 도구들이 단순한 프로그램을 위해 설계되어, 에이전트가 거치는 복잡한 다단계 여정을 쉽게 검증할 수 없다고 지적했습니다. 그들은 대부분의 기존 테스트가 최종 결과에만 집중하여, 에이전트가 그곳에 도달하기 위해 거쳤을지도 모를 위험한 우회 경로를 간과한다는 점을 발견했습니다.

이러한 문제를 해결하기 위해 연구팀은 에이전트의 여정을 주요 연구 대상으로 삼는 새로운 프레임워크를 제시했습니다. 그들은 개발자들이 단순히 최종 결과만을 확인하는 대신, 에이전트가 거친 전체 경로를 살펴보는 테스트를 구축해야 한다고 제안합니다. 여기에는 에이전트가 적절한 도구를 선택했는지, 각 단계에서의 추론이 타당했는지, 그리고 환경에 올바르게 반응했는지 등을 확인하는 과정이 포함됩니다. 또한 그들은 이 시스템을 디버깅하는 방법, 즉 실패를 긴 사건의 사슬 속에서 그 근본 원인까지 추적하는 방법을 설명했습니다. 만약 에서 에이전트가 실패한다면, 시스템은 기록된 궤적을 살펴보고 결정이 잘못된 정확한 순간을 찾아내어, 현재의 시도를 수정하거나 실수를 통해 다시는 같은 일이 발생하지 않도록 학습할 수 있어야 합니다. 연구진은 이러한 접근 방식이 에이전트가 실시간으로 오류에서 회복하고, 무엇이 효과적이었고 무엇이 그렇지 않았는지를 기억함으로써 스스로의 기술을 향상시킬 수 있음을 보여주었습니다.

논문은 이러한 에이전트를 사용하고자 하는 조직을 위한 실무적인 체크리스트로 결론을 맺습니다. 에이전트가 실제 비즈니스 업무를 수행하도록 허용하기 전에, 조직은 에이전트가 취하는 모든 단계를 기록하는 시스템을 갖추어야 합니다. 그들은 단순히 성공적인 최종 답변뿐만 아니라, 성공적인 '여정'이 무엇인지에 대한 명확한 규칙을 정의해야 합니다. 또한 현실 세계를 모사한 안전한 환경에서 에이전트를 테스트하며, 과정 중간에 발생하는 숨겨진 실패를 감시해야 합니다. 에이전트가 실행되는 동안에는 지속적으로 모니터링되어야 하며, 에이전트가 경로를 벗어나기 시작하면 인간이 개입할 준비가 되어 있어야 합니다. 마지막으로, 조직은 모든 실패로부터 얻은 교훈을 사용하여 에이전트의 메모리를 업데이트함으로써, 매 작업을 마칠 때마다 에이전트를 더 똑똑하고 안전하게 만들어야 합니다. 연구진은 이러한 에이전트들이 큰 잠재력을 가지고 있지만, 아직 맹목적으로 신뢰할 수 있는 단계는 아니라고 강조합니다. 행동의 전체 기록에 집중함으로써, 우리는 이 강력한 도구들이 우리의 중요한 시스템의 안전과 안정성을 위협하지 않고 우리와 함께 작동할 수 있는 신뢰의 토대를 구축할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →