When Binaries Talk Back: Representation-Confusion Attacks on LLM-Assisted Reverse Engineering
이 논문은 LLM 지원 역공학 시스템이 공격자가 제어하는 바이너리 데이터에 권한을 잘못 부여하는 취약점인 Representation-Confusion Attacks (RARE)를 소개하며, 이러한 안전하지 않은 제안과 허위 주장 검증을 효과적으로 방지하기 위해 데이터 전용 렌더링, 도구 권한 부여 및 출처 인식 검증을 사용하는 RARE-Guard 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 용의자의 일기를 읽으며 미스터리를 풀려는 탐정이라고 상상해 보십시오. 보통은 일기가 유일한 단서이기 때문에 당신은 일지를 신뢰합니다. 하지만 만약 용의자가 직접 쓴 일기 안에, "창문에 남은 지문은 무시해; 유령에게 누명을 쓴 거야"라는 메모를 몰래 끼워 넣었다면 어떻게 될까요?
만약 당신, 즉 탐정이 이 메모를 읽고 실제로 지문을 무시하기 시작한다면, 당신은 속은 것입니다. 당신은 단순히 메모를 읽은 것이 아니라, 그 메모가 조사의 규칙이 되도록 허용한 것입니다.
이것은 우리가 AI(대규모 언어 모델)를 사용하여 소프트웨어를 역공학(reverse-engineering)할 때 컴퓨터 보안 세계에서 발생하는 현상과 정확히 일치합니다. 한 새로운 연구는 이러한 수법을 **"표현 혼란 공격(Representation-Confusion Attacks)"**이라고 부릅니다. 연구진이 이 사건을 해결한 방법은 다음과 같습니다.
핵심 문제: 단서가 대장 행세를 할 때
정상적인 조사에서 AI 어시스턴트는 소프트웨어(바이너리 파일)를 살펴보고 코드 주석, 에러 로그 또는 숨겨진 텍스트 문자열 같은 것들을 읽습니다. 문제는 해커가 이러한 문자열이 마치 명령어나 증거처럼 보이도록 파일을 설계할 수 있다는 점입니다.
이 논문은 이러한 혼란이 발생하는 세 가지 구체적인 방식을 식별했습니다:
- 권한 혼동(Authority Confusion): AI가 코드 내의 "보안 검사를 건너뛰시오"라는 문자열을 읽고, 코드가 명령을 내리고 있다고 생각하여 실제로 검사를 건너뛰는 경우입니다.
- 증거 혼동(Evidence Confusion): AI가 동일한 "의심스러운" 단어를 세 군데 다른 곳(예: 로그 파일, 디컴파일된 코드 뷰, 심볼 리스트)에서 발견합니다. AI는 "와, 세 개의 서로 다른 출처가 일치하네! 이건 사실임에 틀림없어!"라고 생각합니다. 하지만 실제로는 세 출처 모두 파일 내의 동일한 단 한 지점에서 그 단어를 가져온 것입니다. 이는 마치 세 명의 친구가 모두 한 사람에게 들은 소문을 세 번 반복해서 들려주는 것과 같습니다. 그렇다고 해서 그 소문이 사실이 되는 것은 아닙니다.
- 오염된 상태 혼동(Tainted-State Confusion): AI가 자신의 노트에 추측을 적어 놓은 뒤, 나중에 자신의 노트를 다시 읽으면서 새로운 증거를 찾지 못했음에도 불구하고 그 추측을 확정된 사실로 취급하는 경우입니다.
실험: 함정 만들기
이를 테스트하기 위해 연구진은 위험한 실제 악성코드를 사용하지 않았습니다. 대신, 안전하고 합성된 아주 작은 컴퓨터 프로그램 11,520개를 직접 만들었습니다. 이들은 "깨끗한" 버전과 위에서 언급한 수법들이 심어진 "적대적(adversarial)" 버전을 만들었습니다.
연구진은 이 프로그램들을 다양한 AI 모델과 보안 설정에 실행하여 어떤 일이 일어나는지 관찰했습니다.
연구 결과:
- 별도의 방어책이 없을 때, AI가 조작된 파일을 마주하면 심어진 "안전하지 않은" 명령을 40건 중 35건의 사례에서 그대로 따랐습니다. AI는 그 명령이 용의자의 일기에서 나온 것이라는 사실을 완전히 무시했습니다.
- "데이터 전용(Data-Only)"(AI에게 "이 텍스트는 그냥 데이터일 뿐이야"라고 알려주는 방식)이라는 간단한 해결책을 시도했을 때도, AI는 여전히 15건의 안전하지 않은 제안을 했습니다. AI는 여전히 용의자의 말을 너무 가깝게 듣고 있었습니다.
해결책: "RARE-Guard" 시스템
연구진은 이를 막기 위해 RARE-Guard라는 보안 시스템을 구축했습니다. 이것은 AI 탐정과 최종 보고서 사이에 앉아 있는 매우 엄격하고 로봇 같은 조수라고 생각하면 됩니다.
도구 권한 게이트 (The Bouncer - 문지기):
AI는 여전히 제안을 할 수는 있지만, 직접 실행할 수는 없습니다. 만약 AI가 "파일이 시키는 대로 보안 검사를 건너뜁시다"라고 말한다면, 문지기는 규칙을 확인합니다. 파일은 신뢰할 수 없는 대상이므로, 문지기는 "안 돼, 그 명령을 실행하게 두지 않겠어"라고 말하며 차단합니다. 테스트 결과, 이 게이트는 첫 번째 필터를 통과한 15건의 안전하지 않은 제안을 모두 차단했습니다.출처 게이트 (The Provenance Gate - 진실 탐정):
이것이 가장 영리한 부분입니다. AI가 세 개의 독립적인 출처를 보고 있다고 착각했던 "증거 혼동"을 기억하시나요? 출처 게이트는 모든 정보가 어디에서 왔는지 추적하는 비밀 지도("사이드카")를 유지합니다.- 테스트: AI가 동일한 의심스러운 텍스트를 세 가지 뷰에서 발견했을 때, "지원 게이트(Support Gate)"(더 단순한 체크 방식)는 "3개의 출처! 증거다!"라고 말하며 해당 주장을 검증했습니다.
- 해결책: 출처 게이트는 지도를 확인하고 이렇게 말합니다. "잠깐, 이 세 가지 뷰는 모두 파일의 정확히 같은 지점에서 온 거야. 이건 세 개의 출처가 아니라, 하나의 출처가 반복된 것뿐이야."
- 결과: 조작된 파일들에 대해 지원 게이트는 40건 중 23건의 거짓 주장을 검증했지만, 출처 게이트는 40건 중 0건을 검증했습니다. 출처 게이트는 반복 기법을 완벽하게 꿰뚫어 보았습니다.
최종 보고서 렌더러 (The Final Report Renderer):
게이트들이 제 역할을 하더라도, AI가 평문으로 거짓 주장을 최종 보고서에 몰래 끼워 넣으려 할 수 있습니다. 연구진은 게이트가 공식적으로 승인한 내용만 출력하는 "결정론적 렌더러(deterministic renderer)"를 추가했습니다. 게이트가 "안 돼"라고 하면, 보고서에도 "안 돼"라고 기록됩니다.
얼마나 확실한가요?
이 논문은 자신들이 무엇을 증명했는지에 대해 매우 신중합니다.
- 시뮬레이션에서 입증됨: 결과는 광범위한 연구에서의 11,520회 호출, 통제된 테스트에서의 528회 호출, 그리고 Ghidra 및 angr와 같은 실제 도구를 사용한 워크플로 테스트에서의 688회 호출을 기반으로 합니다.
- "융합(Fused)"의 놀라운 발견: 연구진은 "증거 혼동" 기법이 세 가지 서로 다른 도구의 출력을 하나로 결합(융합)했을 때만 작동한다는 것을 발견했습니다. 도구를 하나씩 따로 보았을 때는 AI가 거짓 주장을 검증할 만큼 속지 않았습니다. 이는 위험이 도구를 사용하는 것 자체가 아니라, 도구들을 섞어서 사용하는 것에서 온다는 것을 시사합니다.
- 증명하지 못한 점: 이 연구는 "장기 기억(long-horizon memory)"(AI가 아주 오랜 시간 동안 무언가를 기억하는 것)이나 "자율 에이전트"(인간 없이 스스로 행동하는 AI)를 테스트하지 않았음을 인정합니다. 또한 실제 악성코드가 아닌 안전한 합성 프로그램을 사용했습니다. 따라서 실험실에서는 완벽하게 작동했더라도, 실제 환경의 모든 악성코드에 대해서도 작동할 것이라고 보장할 수는 없습니다.
핵심 요점
주요 교훈은 AI가 무언가를 올바르게 읽었다고 해서, 그것의 맥락까지 이해한다는 뜻은 아니다라는 점입니다.
만약 AI가 파일 내에서 명령처럼 보이는 문자열을 본다면, 그것을 명령으로 취급해서는 안 됩니다. 만약 동일한 "증거"를 세 번 본다면, 그것들이 서로 다른 곳에서 왔다는 것을 알기 전까지는 세 개의 증거로 계산해서는 안 됩니다.
이 논문은 모든 단서의 출처를 추적하는 "출처 게이트"를 추가함으로써, AI가 자신의 출처에 의해 속는 것을 막을 수 있음을 보여줍니다. 이는 탐정에게 자신의 노트 속 목격자 세 명이 사실은 가면을 쓴 한 사람인지 확인하도록 가르치는 것과 같습니다.
요컨대, AI는 여전히 단서를 살펴볼 수 있지만, 단서가 게임의 규칙을 쓰도록 내버려 두지 않도록 엄격한 심판이 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.