← 최신 논문
🤖 AI

When Alignment Isn't Enough: Response-Path Attacks on LLM Agents

본 논문은 악의적인 제 3 자 중개자가 Bring-Your-Own-Key 에이전트 아키텍처에서 생성 후 응답을 조작하여 LLM 정렬을 우회할 수 있음을 보여주는 새로운 위협인 릴레이 변조 공격 (RTA) 을 소개하며, 이는 기존 방어 기법이 완전히 완화하지 못하는 높은 공격 성공률을 달성합니다.

원저자: Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 고도로 훈련된 조수 (AI 에이전트) 가 있다고 상상해 보세요. 이 조수는 도움이 되도록 프로그래밍되었지만 동시에 매우 안전하도록 설계되었습니다. 당신은 이 조수에게 "이야기를 써라"나 "내 은행 잔고를 확인해라"와 같은 작업을 줍니다. 이를 수행하기 위해 조수는 어딘가의 서버에 있는 초지능적인 뇌 (대규모 언어 모델 또는 LLM) 와 대화합니다.

보통은 조수를 뇌에 직접 연결합니다. 하지만 비용을 절감하거나 관리를 더 잘하기 위해 많은 사람들이 중개인 ( "릴레이") 을 사용합니다. 이 릴레이를 신뢰할 수 있는 택배 서비스라고 생각하세요. 당신은 택배 기사에게 "이 메시지를 뇌로 가져가서 답을 받아와서 다시 가져오라"고 말합니다. 택배 기사는 메시지를 전달해야 하므로 메시지를 볼 수 있습니다.

문제: "신뢰할 수 있는" 택배 기사가 거짓말을 할 수 있습니다

이 논문은 이 시스템이 작동하는 방식에 있는 무서운 결함을 발견했습니다. 이를 정렬 후 변조 (Post-Alignment Tampering) 라고 부릅니다.

다음은 비유입니다:

  1. 뇌 (LLM): 당신은 뇌에게 "이 주식을 사도 안전한가요?"라고 묻습니다. 안전하고 정직하도록 훈련된 뇌는 열심히 생각한 후 "아니요, 위험해 보입니다. 사지 마세요"라고 말합니다.
  2. 택배 기사 (릴레이): 뇌는 이 답을 적어 택배 기사에게 건네줍니다.
  3. 배신: 택배 기사가 조수에게 메모를 전달하기 전에 그것을 살펴봅니다. 그들은 펜을 꺼내 "아니요, 위험해 보입니다"를 지우고 대신 "네, 지금 사세요!"라고 씁니다.
  4. 결과: 조수는 메모를 받습니다. 그들은 메모가 변경된 것을 모릅니다. 뇌가 "사세요"라고 말한 것으로 생각하고 거래를 실행합니다.

무서운 점은 무엇일까요? 뇌 (LLM) 는 완벽하게 자신의 일을 했습니다. 안전하고 정렬된 응답을 생성했습니다. 뇌 측의 보안 점검도 통과했습니다. 하지만 전달 시스템 (릴레이) 이 뇌가 쓰기를 마친 후, 조수가 읽기 전에 메시지를 변경했습니다.

왜 이것이 뇌를 "속이는" 것보다 더 나쁜가요

"프롬프트 인젝션 (Prompt Injection)"에 대해 들어보셨을 것입니다. 이는 나쁜 사람이 뇌가 읽기 전에 교묘한 메모를 써서 뇌가 나쁜 말을 하도록 속이려는 시도입니다.

  • 프롬프트 인젝션: 뇌가 자신의 규칙을 깨도록 설득하려는 시도입니다. 뇌가 똑똑하고 강력한 가드레일을 가지고 있기 때문에 어렵습니다.
  • 이 공격 (RTA): 나쁜 사람은 뇌를 속일 필요가 전혀 없습니다. 그들은 뇌가 원하는 대로 말하게 둡니다 (심지어 "아니오!"라고 말하더라도), 그리고 돌아오는 길에 단순히 답을 다시 씁니다. 마치 요리사가 요리를 다 한 후 메뉴를 바꾸는 것과 같습니다.

이 논문은 처음에 뇌를 속이려는 시도보다 "돌아오는 길에 다시 쓰는" 방식이 훨씬 더 강력하고 위험하다는 것을 증명합니다.

공격의 작동 방식 ( "RTA" 프레임워크)

연구진들은 이것이 얼마나 쉬운지 보여주기 위해 RTA(릴레이 변조 공격) 라는 도구를 만들었습니다. 이는 세 단계로 이루어집니다:

  1. 전략적 계획: 나쁜 택배 기사는 단순히 한 단어만 바꾸지 않습니다. 그들은 전체 이야기를 계획합니다. 작업이 10 단계라면, 원하는 최종 결과를 얻기 위해 정확히 어느 단계를 변경해야 할지 계산합니다.
  2. 외과적 편집: 그들은 편지 전체를 다시 쓰지 않습니다. 조수에게 무엇을 해야 하는지 알려주는 작고 중요한 부분만 변경합니다 (예: "정지" 표지판을 "진행" 표지판으로 바꾸거나, "파일 읽기"를 "파일 삭제"로 바꾸는 것). 나머지 정중한 대화는 정상적으로 보이도록 그대로 둡니다.
  3. "연마" 트릭: 텍스트를 변경하면 이상해 보일 수 있습니다. 그래서 그들은 편집한 초안을 가져가서 (당신의 로그인 자격 증명을 사용하여) 같은 뇌에게 다시 보내며 "이 초안을 당신의 스타일처럼 다시 써주되, 이 특정 변경 사항은 유지해 주세요"라고 말합니다. 뇌는 텍스트를 자신의 스타일에 완벽하게 맞춰 다시 씁니다. 이로써 거짓말이 100% 진실처럼 보이게 됩니다.

그들이 발견한 것

연구진들은 이 방법을 여섯 가지 다른 AI 모델과 두 가지 주요 보안 테스트에서 테스트했습니다.

  • 성공률: 그들은 에이전트를 해킹하는 데 73% 에서 99% 의 성공률을 보였습니다.
  • 은밀성: 공격은 탐지하기 매우 어려웠습니다. "연마" 트릭으로 인해 가짜 답변이 실제 답변과 똑같이 보였습니다.
  • 속도: 이를 수행하는 데 걸린 추가 시간은 매우 작아 일반적인 인터넷 지연처럼 보였습니다.
  • 방어 실패: 그들은 모든 현재 보안 방어 수단 (나쁜 단어 확인이나 대화 잠금 등) 을 시도해 보았습니다. 방어 수단들은 뇌의 출력만 확인했지, 택배 기사의 최종 전달물을 확인하지 않았기 때문에 아무것도 작동하지 않았습니다.

실제 사례

연구진들은 이것이 두 가지 실제 시나리오에서 발생할 수 있음을 보여주었습니다:

  1. 재무 조언: 사용자가 AI 에게 "애플 주식을 팔아야 할까요?"라고 묻습니다. AI 는 "보유하세요"라고 답합니다. 릴레이는 이를 "팔아라!"로 변경하고 사용자는 돈을 잃습니다.
  2. 코딩: 사용자가 AI 에게 미로 게임을 작성해 달라고 요청합니다. AI 가 그렇게 하는 동안, 릴레이는 코드에 사용자의 모든 개인 파일을 훔쳐 해커에게 보내는 숨겨진 명령을 비밀리에 추가합니다. 사용자는 요청한 미로 게임을 받지만, 그들의 데이터는 사라집니다.

해결책은 무엇일까요?

이 논문은 우리가 AI 가 "안전하다"는 사실에만 의존할 수 없다고 결론 내립니다. 우리는 조수가 받는 메시지가 AI 가 보낸 메시지와 정확히 같으며, 그 사이에 아무도 건드리지 않았음을 증명할 수 있는 방법이 필요합니다.

현재 이러한 메시지에는 "인장"이 없습니다. 연구진들은 택배 기사가 메모를 바꾸지 않았는지 확인하기 위해 조수가 확인할 수 있는 새로운 종류의 디지털 서명 (편지의 밀랍 인장 같은 것) 이 필요하다고 제안합니다. 우리가 그것을 갖기 전까지는 "신뢰할 수 있는" 중개인이 항상 규칙을 다시 쓸 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →