Poisoning Agentic Alpha: Adversarial Vulnerabilities Across Roles and Architectures in Multi-Agent Trading Systems
본 논문은 LLM 기반 멀티 에이전트 트레이딩 시스템이 소스 데이터와 프롬프트를 겨냥한 진입 장벽이 낮은 역할 특화형 적대적 공격에 본질적으로 취약함을 입증하는 최초의 체계적인 실증 연구를 제시하며, 어떠한 통신 아키텍처도 최종 금융 결정으로 이어지는 오염된 신호의 전파에 대해 견고하지 못함을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 금융의 활기찬 세계에서 새로운 종류의 노동자가 등장했습니다: 바로 인공지능 에이전트입니다. 단순히 정해진 지시 목록을 따르는 단순한 컴퓨터 프로그램과 달리, 이 에이전트들은 고급 챗봇을 구동하는 것과 동일한 기술인 거대 언어 모델을 기반으로 구축되었습니다. 이들은 뉴스를 읽고, 시장 트rend를 분석하며, 심지어 서로 대화를 나눌 수도 있습니다. 다중 에이전트 트레이딩 시스템에서, 이 디지털 노동자들은 마치 인간 투자 회사처럼 특정 직무를 부여받습니다. 한 에이전트는 헤드라인에서 단서를 찾는 분석가 역할을 할 수 있습니다. 다른 에이전트는 동료와 주식의 장단점을 토론하는 연구원 역할을 할 수 있습니다. 세 번째는 매수 또는 매도를 준비하는 트레이더 역할을 하며, 네 번째는 위험한 움직임을 저지하는 임무를 맡은 리스크 매니저 역할을 합니다. 이 아이디어는 전문화된 에이전트들이 협업함으로써, 단일 프로그램이 도달할 수 있는 수준보다 더 똑똑하고 미묘한 결정을 내릴 수 있다는 것입니다.
하지만, 바로 이 협업이 새로운 종류의 약점을 만들어냅니다. 마치 소문이 인간 사무실을 통해 퍼져나가 최종 결정에 영향을 미칠 수 있는 것처럼, 단 하나의 오염된 정보가 이 디지털 팀을 통해 전달되어 결과를 망칠 수 있습니다. 만약 공격자가 분석가가 읽는 데이터를 오염시키거나, 연구자가 나쁜 아이디어에 대해 논쟁하도록 속이는 데 성공한다면, 그 오류는 전체 그룹으로 연쇄적으로 퍼져나가 실제 금융 손실로 이어질 수 있습니다. 이러한 시스템들이 연구실을 벗어나 실제 돈을 통제하는 라이브 시장으로 이동함에 따라, 이들을 어떻게 속일 수 있는지 이해하는 것은 긴급한 실무적 중요성이 되었습니다.
한 연구팀은 이 디지털 팀들이 정확히 어떻게 실패하는지 지도화하기 위해 나섰습니다. 그들은 애플(Apple)이나 마이크로소프트(Microsoft) 같은 주식과 암호화폐를 포함한 다섯 가지 주요 자산을 사용하는 시뮬레이션 트레이딩 환경을 구축했습니다. 그들은 에이전트들이 네 가지 뚜렷한 역할로 소통하는 파이프라인을 구성했습니다: 뉴스 및 소셜 미디어 감성을 수집하는 분석가 팀, 시장 상황을 토론하는 연구 팀, 최종 결정을 내리는 트레이더, 그리고 안전망 역할을 하는 리스크 매니저입니다. 그 후 연구자들은 보이지 않는 사보타주 요원이 되어, 프로세스의 서로 다른 부분을 공격함으로써 시스템의 최종 결정을 얼마나 쉽게 조작할 수 있는지 테스트했습니다. 그들은 에이전트들의 내부 코드에 접근하지 않았습니다; 대신, 뉴스 기사, 소셜 미디어 게시물, 그리고 에이전트들에게 주어진 프롬프트와 같이 에이전트들이 소비하도록 설계된 정보만을 사용했습니다. 이 접근 방식은 공격자가 시스템 외부에 있지만 시스템으로 흘러 들어가는 데이터에 영향을 미칠 수 있는 현실적인 위협을 모방합니다.
연구 결과, 팀의 모든 부분이 똑같이 취약한 것은 아니라는 점이 밝혀졌습니다. 연구자들이 가짜 뉴스를 제공하거나 소셜 미디어 게시물에 숨겨진 지침을 심어 분석가를 표적으로 삼았을 때, 시스템이 속기도 했지만 종종 다른 에이전트들이 그 오류를 잡아냈습니다. 연구자들이 낙관론자(bull)와 비관론자(bear) 사이의 논쟁을 벌이는 연구자들을 표적으로 삼았을 때, 특히 공격자가 공포나 흥분을 이용하는 설득력 있는 언어를 사용했을 때 시스템은 더 쉽게 흔들렸습니다. 그러나 가장 위험한 취약점은 리스크 매니저에서 발견되었습니다. 이 에이전트는 위험한 거래가 이루어지지 않도록 확인하는 최종 문지기 역할을 해야 합니다. 연구자들의 시뮬레이션에서, 그들이 리스크 매니저가 스스로의 안전 규칙을 무시하도록 속이는 데 성공했을 때, 공격은 거의 매번 성공했습니다. 실제로 리스크 매니저는 조작이 가능한 날 중 98퍼센트 이상에서 무력화되었습니다. 이는 리스크 매니저가 또한 최종 의사결정자였기 때문인데, 일단 리스크 매니저가 속으면 나쁜 거래를 막을 사람이 아무도 남지 않게 됩니다.
연구자들은 또한 에이전트들이 서로 대화하는 방식이 안전성에 어떤 영향을 미치는지 테스트했습니다. 그들은 네 가지 다른 팀 구조를 시험했습니다: 모두가 투표하는 분산형 그룹, 한 명의 에이전트가 모두의 의견을 듣고 결정하는 중앙 집중형 그룹, 정보가 다음 단계로 전달되는 선형 체인, 그리고 타인의 의견에 따라 자신의 생각을 수정하는 하이브리드 모델입니다. 그들은 단 하나의 구조도 완벽한 방패가 될 수 없다는 것을 발견했습니다. 분산 투표 시스템이 일반적으로 더 견고했지만, 공격자가 충분한 투표자에게 영향을 미쳐 과반수를 형성할 수 있다면 여전히 무너질 수 있었습니다. 반대로, 중앙 집중형 시스템은 단 하나의 오염된 에이전트가 최종 결정에 지배적인 영향을 미칠 수 있기 때문에 종종 가장 취약했습니다. 연구자들은 "나쁜 신호"가 최종 결정까지 이동하는 과정에서 얼마나 살아남는지 측정하는 방법을 개발했으며, 대화의 구조가 중요하지만 그것만으로는 안전을 보장할 수 없음을 발견했습니다.
이 연구의 핵심적인 발견은 단순히 에이전트를 추가하거나 팀 구조를 변경하는 것이 자동으로 시스템을 안전하게 만들지는 않는다는 것입니다. 시뮬레이션은 적대적 신호가 논의 과정을 거쳐 최종 결정에 도ال히 도달하는 경우가 구조와 관계없이 빈번하다는 것을 보여주었습니다. 공격의 성공 여부는 거래되는 특정 자산, 공격자가 시스템을 움직이고자 하는 방향, 그리고 표적이 된 특정 에이전트에 크게 좌우되었습니다. 예를 들어, "매도(sell)" 결정을 강요하려는 공격은 "매수(buy)"를 강요하려는 공격보다 더 성공적인 경우가 많았는데, 이는 시스템의 자연스러운 성향이 이미 매수 쪽이었기 때문입니다. 이는 시스템 자체의 편향이 때로는 공격자를 도울 수도 있고, 때로는 보호할 수도 있는 예측 불가능한 방식으로 작용할 수 있음을 시사합니다.
이러한 공격의 금융적 영향 또한 측정되었으며, 공격이 성공하는 빈도와 실제 발생하는 손실액 사이에 놀라운 괴리가 있음이 드러났습니다. 어떤 공격들은 거의 매번 거래 결정을 뒤집었지만, 당시 시스템이 포지션을 보유하고 있지 않았기 때문에 금융 손실은 미미했습니다. 반면, 어떤 공격들은 성공 횟수는 적었지만, 성공했을 때 특히 시스템이 피했을 법한 포지션을 취하게 함으로써 상당한 피해를 입혔습니다. 이는 시스템이 속는 횟수를 세는 것만으로는 실제 위험을 이해하기에 충분하지 않으며, 거래의 구체적인 맥항과 포지션의 규모를 반드시 살펴봐야 함을 나타냅니다.
궁극적으로, 이 연구는 이러한 다중 에이전트 트레이딩 시스템에 본질적으로 견고한 설계란 존재하지 않는다고 결론짓습니다. 시스템의 안전성은 에이전트의 수나 통신 구조의 복잡성보다는 의도적인 체크 앤 밸런스(견제와 균형)에 달려 있습니다. 연구자들은 보안이 검증 프로세스 자체에 내장되어야 하며, 리스크 매니저를 포함한 그 어떤 단일 에이전트도 집단의 지혜를 우회하여 두 번째 검증 단계 없이 결정을 내릴 수 없도록 보장해야 한다는 것을 발견했습니다. 이러한 시스템들이 실험실을 떠나 라이브 시장으로 이동함에 따라, 연구 결과는 설계자들이 조작으로부터 보호받기 위해 아키텍처에만 의존해서는 안 된다는 점을 시사합니다. 대신, 정보의 흐름이 끊임없이 조사되어야 하며, 최종 결정이 결코 단일 실패 지점(single point of failure)의 독점적 책임이 되지 않는 시스템을 구축해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.