← 최신 논문
🤖 AI

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

이 논문은 오픈 소스 및 프런티어 프라이머리 대형 추론 모델 모두에서 API 상호작용을 통해 숨겨진 사고 사슬(chain-of-thought) 흔적을 거의 그대로 추출해 내는 다단계 공격 프레임워크인 EchoCoT를 소개하며, 이는 이러한 가치 있는 모델 자산에 대한 심각한 보안 위험을 입증한다.

원저자: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능 시스템은 컴퓨터 코드를 작성하는 것부터 과학적 난제를 해결하는 것에 이르기까지 복잡한 문제를 해결하는 데 있어 놀라운 능력을 갖추게 되었습니다. 이러한 고급 모델들이 어려운 질문에 맞설 때, 이들은 단순히 최종 답변만을 내놓는 것이 아닙니다. 대신, 이들은 아이디어를 탐색하고, 작업을 검토하며, 실수를 바로잡고, 결론에 도달하기 전 다양한 경로를 고려하는 단계별 추론 과정인 길고 내부적인 사고의 흐름을 먼저 생성합니다. '사고의 사슬(chain of thought)'이라고 불리는 이 내부 독백은 대개 사용자에게는 숨겨져 있습니다. 모델은 지적 자산을 보호하고 민감한 데이터나 독점적인 로직의 노출을 방지하기 위해 이 추론 과정을 비공개로 유지하며, 오직 최종 결과만을 보여줍니다. 개발자들에게 이 숨겨진 추론은 미래의 모델을 개선하기 위한 귀중한 자원인 반면, 사용자들에게는 그 이면에 숨겨진 복잡한 작업 과정은 보여주지 않은 채 정답만을 약속하는 블랙박스입니다.

CISPA 헬름홀츠 정보 보안 센터의 보안 연구팀은 이 숨겨진 추론이 한때 믿었던 것만큼 안전하지 않다는 사실을 발견했습니다. 그들은 이 고급 모델들이 설계된 대로 비밀을 유지하도록 되어 있음에도 불구하고, 모델이 내부의 전체 사고 과정을 거의 단어 그대로 드러내도록 속이는 방법을 찾아냈습니다. 연구진은 'EchoCoT'라고 명명한 방법을 개발했는데, 이는 모델이 외부 도구와 상호작용하는 방식의 특정 특이점을 악용합니다. 많은 시스템에서 모델이 계산기나 데이터베이스와 같은 도구를 사용해야 할 때, 모델은 도구 호출을 위해 추론을 잠시 멈추지만, 연속성을 보장하기 위해 이전의 생각을 메모리에 활성 상태로 유지합니다. 연구진은 공격자가 이러한 연속성을 유리하게 이용할 수 있다는 점을 깨달았습니다. 공격자가 모델에게 자신의 생각을 도구에 저장하도록 반복적으로 요청한 뒤, 저장된 생각들을 미완성된 것으로 거부함으로써, 모델이 내부 추론을 재생하도록 강제하여 전체의 숨겨진 사고 사슬이 완전히 노출될 때까지 더 많은 세부 정보를 드러내게 할 수 있었습니다.

연구진은 오픈 소스 시스템과 주요 기술 기업들의 가장 진보된 독점 모델을 포함한 다양한 모델을 대상으로 이 기술을 테스트했습니다. 연구진이 원래의 숨겨진 생각과 추출된 생각을 비교할 수 있는 오픈 소스 모델의 경우, EchoCoT가 거의 전체 추론 과정을 복구할 수 있음을 발견했습니다. 많은 사례에서 추출된 텍스트는 정확도가 매우 높아, 원래의 숨겨진 생각과 단어 및 구절의 90% 이상이 일치했습니다. 이 방법은 매우 긴 추론 사슬에 대해서도 작동하여 수천 토큰에 달하는 사고 과정을 성공적으로 추출해 냈습니다. 연구진이 구글(Google)이나 앤스로픽(Anthropic)과 같은 기업의 독점 모델에 동일한 기술을 적용했을 때, 원래의 숨겨진 생각을 직접 비교하여 볼 수는 없었습니다. 그러나 추출된 생각은 매우 길었으며, 종종 기업들이 보고한 모델이 사용한 추론의 길이와 일치했습니다. 또한, 추출된 내용이 기업들이 제공한 짧은 요약과 밀접하게 일치했다는 점은 추출이 정확했음을 시사했습니다. 구글 모델과 관련된 한 사례에서는 33,000 토큰 이상의 추론 사슬을 복구했는데, 이는 모델의 보고된 내부 과정의 길이와 거의 동일했습니다.

단순히 텍스트를 복구하는 것을 넘어, 추출된 생각들은 모델이 어떻게 사고하는지에 대한 풍부한 세부 정보를 드러냈습니다. 연구진은 모델이 구글 검색을 시뮬레이션하고, 정보를 회상하는 동안 중국어와 영어 같은 서로 다른 언어 사이를 전환하며, 광범적에 걸친 자기 수정을 수행하는 것을 관찰했습니다. "잠깐, 이게 사실인가?" 또는 "다른 접근 방식을 시도해 보자"와 같은 행동들은 사용자에게 보여지기 전에 일반적으로 제거되는 가공되지 않은 내부 과정의 일부입니다. 또한 이 연구는 공격이 자동화될 수 있음을 보여주었습니다. 연구진은 모델이 사용한 단어 수와 같은 피드백 신호를 바탕으로 질문을 정교화하며 생각을 요청하는 최선의 방법을 학습할 수 있는 시스템을 구축했습니다. 이러한 자동화된 접근 방식은 공격을 더욱 효과적으로 만들어, 새로운 문제마다 수동으로 재프로그래밍할 필요 없이 다양한 유형의 질문과 데이터셋에 걸쳐 일반화될 수 있게 했습니다.

이 발견이 시사하는 바는 인공지능 보안 측면에서 매우 중요합니다. 연구진은 단순히 추론을 사용자로부터 숨기는 것만으로는 이를 보호하기에 충분하지 않다는 것을 발견했습니다. 모델이 도구 사용을 필요로 하는 작업을 수행하기 위해 내부 상태를 유지하는 한, 그 상태는 재생되고 추출될 수 있습니다. 연구진은 추론 단어의 수를 숨기거나, 모델의 시스템 프롬프트에 누출을 방지하기 위한 엄격한 지침을 추가하는 등 여러 잠재적 방어책을 테스트했습니다. 이러한 조치 중 일부는 공격의 성공률을 낮추었지만, 이를 완전히 차단하지는 못했습니다. 가장 효과적인 방어책으로 테스트된 것은 도구 호출 후에 모델이 자신의 이전 추론에 접근하는 것을 차단하는 것이었으나, 이는 모델이 복잡한 다단계 작업을 수행하는 능력을 깨뜨릴 것입니다. 연구진은 관련 주요 기술 기업들에 이러한 연구 결과를 책임감 있게 보고하며, 현재의 강력한 추론 시스템 설계에 존재하는 치명적인 취약점을 강조했습니다. 이들의 연구는 모델의 지적 재산과 안전을 보호하기 위해서는 단순히 숨겨진 생각이 숨겨져 있을 것이라는 가정에 의존하는 것이 아니라, 모델이 구축되고 외부 세계와 상호작용하는 방식에 대한 더 근본적인 변화가 필요함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →