Synchronized Logit Steering: Real-world Steganography
이 논문은 생성된 출력 자체로부터 공유된 로짓 분포를 도출함으로써, 송신자와 수신자가 원래의 프롬프트 문맥을 공유할 필요 없이 높은 정보 밀도와 통계적 은닉성을 달성하며, 대규모 언어 모델을 위한 결정론적 스테가노그래피 기법인 동기화된 로짓 스티어링(Synchronized Logit Steering, SLS)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 대화의 고요한 웅성거림 속에서, 인공지능이 생성하는 단어들 속에 숨어 있는 새로운 종류의 비밀 언어가 등장했습니다. 스테가노그래피(steganography)라고 알려진 이 분야는 메시지의 존재 자체를 은폐하여, 오직 평범한 의사소통의 모습만을 남기는 고대의 예술입니다. 암호화(cryptography)가 키가 없는 사람에게 읽을 수 없도록 메시지를 뒤섞는 것이라면, 스테가노그래피는 메시지를 눈에 보이지 않게 하여 완전히 자연스럽게 보이고 들리는 텍스트 안에 내장하는 것을 목표로 합니다. 에세이를 쓰고, 수학 문제를 풀며, 대화를 나누는 강력한 컴퓨터 프로그램인 거대 언语言 모델(LLM)은 이 관행의 새로운 개척지가 되었습니다. 이러한 모델들은 단순히 사실을 검색하는 것이 아니라, 확률에 기반하여 문장의 다음 단어를 예측하며, 가능한 다양한 선택지 중에서 하나를 선택합니다. 이러한 본질적인 가변성은 글을 쓰는 거의 모든 단계에서 모델이 의미가 통하는 여러 단어 사이에서 선택권을 갖게 된다는 것을 의미합니다. 연구자들은 이러한 선택들이 독자가 그 존재를 전혀 알지 못하는 사이에 숨겨진 정보를 전달하는 데 사용될 수 있는지 오랫동안 궁금해해 왔습니다.
수년 동안, 이러한 AI 생성 텍스트에 메시지를 숨기려는 시도들은 중대한 장애물에 직면해 왔습니다. 바로 '공유된 비밀 맥락'의 필요성입니다. 두 사람이 책을 키(key)로 사용하여 암호화된 메시지를 보내려고 한다고 상상해 보십시오. 만약 그들이 정확히 같은 판본을 가지고 있지 않거나 서로 다른 페이지를 보고 있다면, 코드는 실패합니다. 이와 유사하게, AI 텍스트에 데이터를 숨기는 이전 방식들은 송신자와 수신자가 동일한 시작 지침, 즉 프롬프트를 공유하여 동일한 확률적 단어 목록을 계산해야 했습니다. AI 시스템이 종종 개인 데이터를 가져오거나 매 순간 변하는 숨겨진 내부 지침을 사용하는 실제 환경에서, 이러한 요구 사항은 기술을 취약하고 비실용적으로 만들었습니다. 만약 송신자와 수신자가 동일한 맥락에서 시작하지 않는다면, 숨겨진 메시지는 유실되거나 손상될 것입니다. 이제 Algoverse AI의 연구팀은 이 의존성을 완전히 제거하여, 두 당사자가 동일한 시작점을 보지 못하더라도 숨겨진 메시지를 교환할 수 있는 솔루션을 개발했습니다.
연구진은 이 방법을 '동기화된 로짓 스티어링(Synchronized Logit Steering)'이라고 부릅니다. 공유된 시작 프롬프트에 의존하는 대신, 이 시스템은 이미 작성된 텍스트를 바탕으로 공유된 이해를 생성합니다. 과정은 표준적인 단어 교환으로 시작됩니다. 합의된 일정 수의 단어, 구체적으로는 모델이 처리하는 텍스트의 기본 단위인 40개의 토큰이 생성되면, 송신자와 수신자는 그 기존 텍스트를 새로운 공유 참조점으로 사용합니다. 이 "대리 프롬프트(proxy prompt)"는 공통의 토대가 됩니다. 양측 모두 이미 나타난 동일한 단어들을 볼 수 있기 때문에, 설령 원래의 시작 지침이 완전히 다르더라도 독립적으로 동일한 차순위 단어 목록을 계산할 수 있습니다. 이러한 동기화를 통해 그들은 비밀스러운 초기 맥락을 공유할 필요 없이도 숨겨진 코드에 합의할 수 있습니다.
메시지를 보내기 위해, 송신자는 이 공유된 참조로부터 생성된 확률적인 다음 단어 목록을 살펴봅니다. 그런 다음 송신자는 단순히 문장에 적합한 단어를 선택하는 것이 아니라, 그 단어의 위치가 숨겨진 데이터의 조각에 대응하기 때문에 특정 단어를 선택합니다. 예를 들어, 숨겨진 메시지에 숫자 5가 필요하다면, 송신자는 목록에서 다섯 번째로 확률이 높은 단어를 선택합니다. 수신자는 동일한 단어를 보고 동일한 확률 목록을 알고 있으므로, 단순히 그 단어의 위치를 세어 숫자 5를 추출할 수 있습니다. 이 과정은 반복되며, 시스템은 단어의 선택이 자연스럽고 기계적이지 않게 유지되는지 확인하기 위해 텍스트의 "엔트로피(entropy)", 즉 불확실성의 정도를 체크합니다. 시스템은 모델이 충분히 불확실하여 덜 흔한 단어를 선택하더라도 이상하거나 로봇처럼 들리지 않을 때만 데이터를 숨깁니다.
연구팀은 일반적인 대화, 복잡한 수학적 추론, 소프트웨어 엔지니어링 문제를 포함한 매우 다양한 작업에 걸쳐 이 방법을 테스트했습니다. 그들은 초기 40단어가 확립되면, 숨겨진 메시지가 포함된 텍스트와 일반 텍스트 사이의 통계적 차이가 무시할 수 있는 수준이 된다는 것을 발견했습니다. 기술적인 용어로, 두 유형의 텍스트 간의 발산(divergence)이 임계값 미만으로 떨어졌으며, 이는 숨겨진 메시지가 일반적인 글쓰기와 통계적으로 구별할 수 없음을 의미합니다. 또한 연구진은 이 과정을 폭발적으로 반복함으로써 숨겨진 정보량을 크게 늘릴 수 있다는 것을 발견했습니다. 그들의 가장 효과적인 구성인 "주기적 버스트(periodic burst)"는 이전의 단일 메시지 시도보다 약 10배 더 많은 데이터를 삽 {수, 토큰당 0.20 비트의 밀도를 달성했습니다. 이는 AI가 단어를 쓸 때마다, 대화의 흐름을 바꾸지 않고도 성공적으로 소량의 비밀 정보 비트를 내장했음을 의미합니다.
이 방법의 성공에도 불구하고, 연구진은 숨겨진 메시지가 복잡한 작업에 담길 때 발생하는 트레이드오프(trade-off)를 언급했습니다. 시스템이 수학적 추론이나 소프트웨어 코드 내에 데이터를 숨기려 할 때, AI 답변의 정확도가 약간 떨어졌습니다. 이는 메시지를 운반하기 위해 특정 단어를 선택하도록 강제하는 것이 때때로 어려운 문제에 필요한 논리의 좁은 경로에서 모델을 벗어나게 할 수 있음을 시사합니다. 연구진은 실제 응용 분야에서 시스템이 기술적인 모드에 있는지 인식하고 메시지 숨기기를 중단하여, 더 안전한 맥락에서 텍스트의 기술적인 부분에만 이 기술을 사용할 수 있도록 똑똑하게 작동해야 한다고 제안합니다. 이러한 적응형 접근 방식은 AI의 추론 품질을 보존하면서도 은밀한 통신을 가능하게 할 것입니다.
이 연구의 함의는 두 가지 측면이 있습니다. 한편으로는, 공유된 비밀 키 없이도 AI 콘텐츠에 워터마크를 찍거나 텍스트의 출처를 검증할 수 있는 견고한 방법을 보여주며, 이는 지적 재산을 보호하는 데 유용할 수 있습니다. 다른 한편으로는, AI 시스템이 어떻게 소통하는지에 대한 취약성을 강조하며, 에이전트들이 인간의 감독 없이 데이터를 탈취하거나 협력할 수 있음을 보여줍니다. 연구진은 이러한 숨겨진 채널이 구축되는 방식을 이해하는 것이 이를 방어하기 위한 첫걸음이라고 강조합니다. 그들은 미래의 보안 시스템이 특이한 단어 선택 패턴을 모니터링하거나, 이러한 동기화를 가능하게 하는 통계적 서명을 방해할 수 있다고 제안합니다. 궁극적으로, 이 연구는 AI 텍스트에 메시지를 숨기는 능력이 단순한 이론적 가능성이 아니라, 자연스러운 언어의 흐름 속에서 조용히 작동하며 아는 사람만이 발견할 수 있는 실질적인 현실임을 확인시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.