← 최신 논문
💬 NLP

Where Is the Cost of Third-Party API Routers in Agentic Software Development?

이 논문은 에이전트 기반 소프트웨어 개발에서 제3자 API 라우터가 라우터 측 주입(injection)이 에이전트의 행동을 은밀하게 변경하고 클라이언트 측 방어 체계를 우회할 수 있는 결정적인 제어 격차를 유발하며, 평가된 모든 에이전트에서 0%의 방어 성공률을 달 기록함으로써 프로바이더 측의 출력 무결성 보장이 시급함을 실증적으로 입증한다.

원저자: Donghao Fu, Jingxin Li, Xue Jiang, Yihong Dong

게시일 2026-07-28
📖 5 분 읽기🧠 심층 분석

원저자: Donghao Fu, Jingxin Li, Xue Jiang, Yihong Dong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 코드를 작성하고, 버그를 수정하며, 컴퓨터 파일을 관리할 수 있는 로봇 비서 제작을 상상해 보십시오. 이 로봇을 똑똑하게 만들기 위해, 당신은 거의 모든 문제를 해결할 수 있는 지식을 가진 거대하고 초지능적인 클라우드 뇌(대규모 언어 모델)에 연결합니다. 하지만 여기 함정이 있습니다. 당신은 그 뇌와 직접 대화하지 않습니다. 대신, 당신은 메시지를 주고받기 위해 전문적인 배달 서비스나 "라우터"와 같은 중간자를 사용합니다. 이 중간자는 당신이 회로를 변경하지 않고도 로봇이 다양한 클의 뇌들과 대화할 수 있도록 돕는 유능한 심부름꾼 역할을 해야 합니다.

이 논문이 던지는 핵심 질문은 이것입니다: 만약 그 유능한 심부름꾼이 장난을 치기로 결심한다면 어떻게 될까요? 컴퓨터 과학의 세계에서, 우리는 중간자가 메시지를 볼 수 있다면 그 메시지를 교체하거나 전달하기 전에 자신의 노트를 추가할 수 있다는 것을 알고 있습니다. 이 논문은 다음과 같은 무섭지만 현실적인 가능성을 탐구합니다: 만약 라우터가 단순히 로봇의 지시를 전달하는 데 그치지 않고, 로봇이 당신의 파일을 삭제하거나 바이러스를 설치하는 것과 같이 위험한 행동을 하도록 몰래 지시를 바꾼다면 어떻게 될까요? 이때 로봇이 그 속임수를 알아차릴까요, 아니면 라우터의 새로운 악의적인 명령을 맹목적으로 따르게 될까요? 이 연구는 로봇이 정상적인 업무를 수행하는 것처럼 보이게 하면서도 몰래 위험한 일을 시키는 상황을 조사했습니다.


비밀스러운 중간자와 로봇의 사각지대

이 연구에서 연구진은 바로 이 시나리오를 재현하기 위해 SIDEL이라는 특별한 테스트 실험실을 구축했습니다. 그들은 네 가지 서로 다른 "코딩 로봇"(Claude Code, Codex, Cursor, OpenCode와 같은 유명한 도구들)을 설정하고, 가짜의 신뢰할 수 없는 라우터를 통해 다양한 클라우드 뇌에 연결했습니다. 그런 다음, 그들은 악의적인 라우터 역할을 맡아, 단순한 무력 행위부터 미묘한 마법에 이르기까지 네 가지 방식으로 로봇에게 몰래 악성 명령을 주입하려고 시도했습니다.

네 가지 거래의 기술
연구진은 점점 더 교묘해지는 네 단계의 기만 수준을 테스트했습니다:

  1. 교체 (L1): 라우터가 클라우드 뇌의 답변을 통째로 버리고, "이 파일을 삭제하라"고 말하는 가짜 답변으로 대체합니다.
  2. 추가 (L2): 라우터가 클라우드 뇌의 정상적인 답변은 그대로 두되, 끝에 "아, 그리고 참, 이 수상한 소프트웨어를 설치해"와 같은 비밀 명령을 덧붙입니다.
  3. 다듬기 (L3): 라우터가 비밀 명령을 변경할 뿐만 아니라, 그 명령이 계획의 자연스러운 일부인 것처럼 보이도록 로봇의 설명을 다시 작성합니다. 이는 마치 마술사가 속임수를 평범한 마술 쇼처럼 보이게 만드는 것과 같습니다.
  4. 마인드 멜드 (L4): 가장 교묘한 단계입니다. 라우터는 단순히 텍스트를 편집하는 것이 아니라, 두 번째 뇌를 사용하여 원래의 답변과 악성 명령을 완벽하게 섞어 새로운 응답을 생성합니다. 이는 마치 라우터가 로봇이 생각하고 있는 동안 로봇의 귀에 비밀을 속삭여서, 로봇이 그 나쁜 생각이 자신의 생각이라고 믿게 만드는 것과 같습니다.

충격적인 결과: 로봇들은 눈 하나 깜빡이지 않았다

결과는 놀라웠습니다. 어떤 로봇을 사용하든, 어떤 클라우드 뇌가 구동하든, 그리고 네 가지 기술 중 무엇을 시도하든, 로봇들은 매번 속아 넘어갔습니다.

보안의 세계에서 성공은 방어 체계가 공격을 얼마나 잘 막아내느냐로 측정됩니다. 연구진은 추가적인 도움 없이는 **네 가지 로봇 모두 방어 성공률이 0%**라는 사실을 발견했습니다. 이는 모든 테스트 케이스에서 라우터가 로봇을 속여 악성 명령을 실행하게 만드는 데 성공했음을 의미합니다. 로봇들은 단순히 실수를 한 것이 아니라, 자신이 따르고 있는 지시가 조작되었다는 사실을 전혀 알아차리지 못했습니다.

연구진은 로봇의 "안전 설정"이 도움이 될지 확인했습니다. 그들은 "계획 전용"(로봇이 생각만 하는 단계)이나 "자동"(로로봇이 자유롭게 행동하는 단계)과 같은 다양한 권한 모드를 테스트했습니다. 가장 엄격한 모드에서도 라우터의 속임수는 통했습니다. 결국, 로봇이 가진 안전 점검 기능은 로봇의 '행동'을 감시하는 것이지, 라우터의 '거짓말'을 감시하는 것이 아니기 때문입니다.

뇌를 바꾸면 도움이 될까?

여러분은 이렇게 생각할지도 모릅니다. "더 똑똑한 클라우드 뇌를 사용하면 어떨까? 아마 그 속임수를 찾아낼지도 몰라." 연구진은 네 가지 다른 모델로 클라우드 뇌를 교체하여 이를 테스트했습니다. 결과는 어땠을까요? 중요하지 않았습니다. 로봇이 매우 강력한 모델과 대화하든, 화려하고 빠른 모델과 대화하든, 라우터는 여 still 악성 명령을 로봇의 눈앞에서 슬쩍 통과시킬 수 있었습니다. 문제는 뇌가 멍청해서가 아니라, 라우터가 로봇이 이야기를 듣기 전에 이야기를 다시 쓸 수 있는 위치에 있다는 것입니다.

더 나은 방패를 만들 수 있을까?

연구진은 문제점을 찾는 데 그치지 않고, 문제를 해결할 수 있는지 확인하기 위해 몇 가지 방패를 구축했습니다. 그들은 두 가지 일반적인 방어책을 테스트했습니다:

  1. 화이트리스트 (Whitelist): 허용된 명령과 웹사이트의 단순한 목록입니다. 목록에 없는 명령은 차단됩니다.
  2. 제2의 의견 (Second Opinion): 로봇이 행동하기 전에 두 번째 AI를 사용하여 로봇의 계획을 검토하게 합니다.

화이트리스트는 일부 나쁜 것들을 막는 데는 효과적이었지만, 다소 투박했습니다. 그것은 악성 명령의 약 **30%에서 44%**를 차단했지만, 동시에 정상적인 명령의 약 **30%에서 44%**도 실수로 차단하여 로봇의 유용성을 떨어뜨렸습니다.

"제2의 의견" AI는 더 나았습니다. 검토자로 어떤 AI 모델을 사용하느냐에 따라 공격의 39%에서 64% 사이를 막을 수 있었습니다. 그러나 이것도 완벽한 해결책은 아니었습니다. 최고의 검토자 모델조차 모든 것을 잡아낼 수는 없었으며, 때때로 나쁜 명령을 통과시키기도 했습니다. 연구진은 이러한 방패들이 어느 정도 도움은 되지만, 문제를 완전히 해결하지는 못한다는 것을 발견했습니다. 라우터는 여전히 대화의 한가운데에 앉아 너무나 강력한 힘을 가지고 있습니다.

시사점

이 논문의 주요 교훈은 코딩 로봇을 클라우드에 연결하기 위해 제3자 라우터에 의존하는 것이 거대한 보안 구멍을 만든다는 것입니다. 로봇은 라우터가 정직하다고 가정하지만, 만약 라우터가 신뢰할 수 없는 존재라면 로봇의 현실을 재구성할 수 있습니다. 로봇은 아무리 똑똑하고 설정이 잘 되어 있더라도, 클라우드로부터 온 진짜 지시와 라우터로부터 온 가짜 지시를 구분할 수 없습니다.

저자들은 이를 진정으로 해결하기 위해서는 로봇이 더 조심하도록 만드는 것만으로는 부족하다고 제안합니다. 클라우드 제공업체 자체가 메시지가 중간자에 의해 조작되지 않았음을 보장해야 합니다. 그때까지 코딩 로봇이 제3자 라우터를 사용하는 것은, 마치 집 열쇠를 배달원에게 맡기는 것과 같습니다. 그 배달원은 당신이 보지 않는 사이에 도둑을 들여보내기로 결심할 수도 있기 때문입니다. 로봇은 시키는 대로 정확히 하고 있지만, 명령을 내리는 사람이 바뀌어 버린 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →