← 최신 논문
🤖 AI

HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails

HoloAegis는 동결된 의미론적 표현을 순수 기하학적 위상 추론으로부터 분리함으로써 미세 조정을 위한 필요성을 제거하는 동시에 밀리초 미만의 지연 시간과 강력한 교차 언어 전이를 보장하며, 최첨단 제로샷 LLM 가드레일을 달성하는 최소 매개변수 기반의 훈련 불필요 안전 프레임워크이다.

원저자: Tak Ho Alex Li, Kaijie Liu, Lik-Hang Lee, Kin Chung Ho, Ping Shum, Michael K. Ng

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tak Ho Alex Li, Kaijie Liu, Lik-Hang Lee, Kin Chung Ho, Ping Shum, Michael K. Ng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 아주 똑똑한 로봇에게 예의 바르고 안전하게 행동하는 법을 가르치려 한다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)로, 세상에 쓰인 거의 모든 것을 읽은 거대한 도서관과 같습니다. 이 로봇은 이야기를 쓰고, 수학 문제를 풀고, 인간처럼 대화할 수 있습니다. 하지만 너무 많은 것을 읽었기 때문에, 때때로 실수로 못된 말을 하거나, 거짓말을 하거나, 나쁜 일을 하도록 속임수에 빠지기도 합니다. 이를 막기 위해, 우리는 메시지를 보내기 전 모든 메시지를 검사하는 '가드레일', 즉 안전 가드가 필요합니다.

현재 이 가드를 만드는 데는 두 가지 주요 방법이 있습니다. 첫 번째 방법은 똑같이 거대한 두 번째 로봇을 고용하여 판사 역할을 맡기는 것입니다. 이 판사는 메시지를 읽고 그것이 안전한지 결정합니다. 매우 정확하지만, 느리고 비용이 많이 들며, 이를 실행하기 위해 거대하고 강력한 컴퓨터가 필요합니다. 두 번째 방법은 아주 작고 단순한 체크리스트를 사용하는 것입니다. 이것은 매우 빠르고 저렴하지만, 자주 혼동을 일으켜 좋은 메시지를 실수로 차단하거나 나쁜 메시지를 놓치기도 합니다. 과학자들은 그 중간 지점에서 헤매 왔습니다. 즉, 느리고 무거운 가드를 쓸 것인지, 아니면 빠르지만 서툰 가드를 쓸 것인지의 문제였습니다. 질문은 이것입니다. 두 번째 거대 로봇 없이도 번개처럼 빠르면서도 믿을 수 없을 정도로 똑똑한 가드를 만들 수 있을까요?

여기서 HoloAegis라는 새로운 아이디어가 등장합니다. Tak Ho Alex Li와 Michael K. Ng가 이끄는 연구진은 영리한 비틀기를 제안합니다. 무엇이 "나쁜 것"인지 학습하기 위해 새로운 로봇을 훈련시키는 대신(이는 원래 로봇의 뇌를 망가뜨릴 수 있습니다), 그들은 순수 기하학을 사용하기로 했습니다. 이렇게 생각해 보세요. 만약 가능한 모든 문장이 거대한 보이지 않는 3차원 공간 속에 떠 있는 점들이라고 가정해 봅시다. 안전한 문장들은 한 동네에 모여 있고, 위험한 문장들은 다른 동네에 모여 있습니다.

HoloAegis 팀은 로봇의 뇌를 얼려두고(변하지 않도록 하고) 단순히 자를 사용하여 점들 사이의 거리를 측정하기만 하면, 안전 결정을 즉각적으로 내릴 수 있다는 사실을 깨달았습니다. 그들은 몇 개의 핵심 랜드마크인 "앵커(anchors)"를 사용하여 안전한 지점과 안전하지 않은 지점의 "지도"를 만들었습니다. 새로운 메시지가 들어오면, 시스템은 거대 로봇에게 그것을 생각하라고 묻는 것이 아니라, 그 메시지가 "안전한" 랜드마크들에 비해 "위험한" 랜드마크들에 얼마나 가까운지를 확인합니다. 만약 메시지가 나쁜 동네에 너무 가깝다면, 가드는 그것을 차단합니다.

이 논문은 이 방식이 놀라울 정도로 강력하다고 제안합니다. 안전을 복잡한 학습 문제가 아닌 구체(sphere) 위에서 거리를 측정하는 수학 문제로 다룸으로써, 그들은 거대하고 느린 로봇들과 대등한 결과를 얻으면서도 1밀리초 미만 안에 실행할 수 있었습니다. 테스트에서 그들의 시스템은 위험한 메시지를 거의 완벽한 정확도로 잡아냈으며(일부 테스트에서는 1.0000, 다른 테스트에서는 0.9802를 기록), 컴퓨터 메모리는 3.5MB 미만으로 거의 사용하지 않았습니다. 이는 마치 군중 속에서 도둑을 즉시 찾아낼 수 있는 보안 요원을 고용하면서도, 전체 경찰력을 고용할 필요는 없는 것과 같습니다.

하지만 저자들은 이것이 모든 것을 영원히 해결해 줄 마법의 지팡이는 아니라는 점을 주의 깊게 언급합니다. 그들은 이 기하학적 접근 방식이 까다로운 속임수(예: 나쁜 단어를 숨기기 위해 철자를 바꾸는 행위)에는 매우 안정적이지만, 여전히 초기 지도의 품질에 의존한다는 것을 발견했습니다. 만약 지도가 잘못되었다면, 가드도 잘못될 것입니다. 또한 그들은 누군가가 시스템의 랜드마크가 정확히 어디에 있는지 알아내어 공격하려 할 경우, 시스템이 취약해질 수 있음을 인정합니다. 하지만 현재로서는, HoloAegis는 우리가 AI를 안전하게 유지하기 위해 거대하고 에너지를 많이 소비하는 모델을 훈련시킬 필요는 없을 수도 있음을 시사합니다. 때로는 약간의 똑똑한 기하학만으로도 충분할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →