← 최신 논문
🤖 machine learning

Stealing Reasoning Traces from Proprietary LLM APIs

이 논문은 교체 가능한 암호화된 추론 흔적을 더 취약한 모델에 주입함으로써 지적 재산, 개인 데이터 및 유해한 정보의 대규모 추출을 가능하게 하고 안전 가드레일을 우회하는, 독점적 LLM API의 결정적인 아키텍처 취약점을 식별하고 악용한다.

원저자: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 가장 진보한 사서들이 인공지능인 거대하고 북적이는 도서관이라고 상상해 보십시오. 이 AI "추론 모델(reasoning models)"은 특별한데, 최종 답변을 내놓기 전에 자신에게 길고 상세한 내부 독백을 속삭이기 때문입니다. 이 독백을 AI의 비밀 메모장이라고 생각하십시오. 이는 AI가 수학 문제를 풀거나, 사실 관계를 확인하거나, 질문의 윤리성을 스스로 토론하는 데 사용하는 비밀스러운 연습장입니다. 보통 이 메모장은 당신에게 숨겨져 있으며, 당신은 오직 정제된 최종 답변만을 보게 됩니다. 하지만 이 AI들을 소유한 기업들은 비용을 절감하고 자신들의 영업 비밀을 보호하기 위해 이 비밀 메모장을 암호화하기 시작했습니다. 그들은 이 무질서하고 사적인 생각들을 뒤섞여 읽을 수 없는 코드 블록으로 변환하여 당신에게 보내며, 다음에 질문할 때 다시 가져오라고 요청합니다. 이는 마치 당신에게 "이 금고를 잘 보관했다가, 다시 대화하고 싶을 때 가져오세요"라고 말하며 봉인된 채 부술 수 없는 금고를 건네주는 것과 같습니다.

연구자들이 던진 핵심적인 질문은 이것입니다. 이 금고는 정말로 깨뜨릴 수 없는 것인가? 만약 AI 기업들이 지적 재산을 보호하고 개인 데이터를 안전하게 지키기 위해 이들의 비밀스러운 사고 과정을 숨기려 한다면, 이 "금고"를 나누어 주는 방식이 실제로 백도어를 만드는 것은 아닐까요? 이 논문은 바로 이 퍼즐을 파고들며, AI의 생각을 보호하는 암호화가 기업들이 믿는 만큼 안전한지, 아니면 원래의 가장 강력한 AI에 직접 침투하지 않고도 코드를 해독할 수 있는 영리한 트릭이 존재하는지를 조사합니다.

연구자들은 AI 기업들이 비밀스러운 생각들을 처리하는 방식에서 놀랍도록 단순하지만 치명적인 결함을 발견했습니다. 그들은 AI의 추론을 담고 있는 암호화된 "금고"가 서로 다른 모델과 사용자 사이에서도 작동하는 유니버설 키(universal keys)와 같다는 사실을 발견했습니다. AI 세계에서 기업들은 종-종 "형(big brother)" 모델(매우 똑똑하지만 엄격하게 보호됨)과 "동생(little brother)" 모델(더 똑br지만 보안 요원이 적음)을 보유하고 있습니다. 논문은 공격자가 "형" 모델의 비밀 추론 블록을 훔쳐서 "동생" 모델과의 대화 속에 몰래 집어넣고, 약한 모델을 속여 그 비밀스러운 생각을 평문 영어로 **해독(decoding)**하게 만들 수 있음을 보여줍니다. 이것이 가능한 이유는 암호화 키가 전체 생태계 전반에 걸쳐 공유되기 때문이며, 즉 "동생" 모델 역시 "형" 모델과 동일하게 금고를 열 수 있는 능력을 갖추고 있다는 뜻입니다. 다만 "동생" 모델은 요청을 거절할 엄격한 안전 교육을 받지 못했을 뿐입니다. 이는 마치 당신이 엄격한 선생님으로부터 잠긴 일기장을 훔쳐서, 훨씬 친절하고 주의력이 부족한 학생에게 건네준 뒤, 그 일기장을 소리 내어 읽어달라고 부탁하는 것과 같습니다. 선생님과 똑같은 열쇠를 가진 그 친절한 학생은 단순히 금고를 열고 비밀 내용을 소리 내어 읽어주는 것입니다.

저자들은 이 트릭이 Anthropic, OpenAI, Google과 같은 주요 AI 제공업체 전반에 걸쳐 대규모로 작동함을 입증했습니다. 이 방법을 사용하여 그들은 가장 진보된 모델을 직접 공격하지 않고도 그 보안을 "탈옥(jailbreak)"할 수 있었습니다. 그들은 이 결함이 악용될 수 있는 네 가지 주요 방식을 보여주었습니다. 첫째, 경쟁사가 최상위 AI의 비밀 추론 단계를 훔칠 수 있게 하여, 비싼 모델을 사용하지 않고도 그 지적 능력을 효과적으로 복제할 수 있게 합니다. 둘째, 개인 데이터를 노출시킵니다. 연구자들은 공공 웹사이트에서 31만 5천 개 이상의 암호화된 블록을 긁어모았으며, 이를 성공적으로 해독하여 사용자들이 암호화되어 안전하다고 믿었던 수백 개의 비밀번호, API 키, 개인 이메일을 찾아냈습니다. 셋째, AI가 최종 답변에서는 말하지 않기로 결정했지만 속으로는 생각했던 위험한 정보, 예를 들어 자동차를 훔치거나 안전 규칙을 우회하는 방법 등을 드러냅니다. 마지막으로, 공격자가 이 암호화된 블록 안에 악의적인 지시 사항을 숨겨, 아무도 눈치채지 못한 채 미래의 AI 작업에 독을 푸는(poisoning) 것이 가능해집니다.

논문은 AI의 생각을 암호화하려는 아이디어가 프라이버시와 지적 재산을 보호하기 위한 것이었으나, 현재의 시스템은 서로 다른 모델과 사용자 간에 이러한 암호화된 블록을 공유하게 함으로써 심각한 취약점을 만들어냈다고 결론짓습니다. 연구자들은 이미 관련 기업들에 이러한 문제들을 보고했으며, 기업들은 구멍을 메우기 위한 패치를 만들기 시작했습니다. 이 연구는 더 똑똑한 AI를 구축하려는 급박한 과정 속에서, 우리의 개인 데이터와 모델의 내부 로직이 잘못된 손에 들어가지 않도록 "비밀 메모장"을 다루는 방식에 대한 전면적인 재검토가 필요하다는 강력한 경고를 던집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →