← 최신 논문
💬 NLP

Trust The Typical

이 논문은 보호를 유해한 학습 데이터 없이 안전한 프롬프트의 분포를 학습함으로써 이상치 탐지(out-of-distribution detection) 문제로 다루는 새로운 LLM 안전 프레임워크인 Trust The Typical (T3)을 소개하며, 이를 통해 다양한 위협과 언어에 걸쳐 최첨단 성능을 달성하는 동시에 낮은 추론 오버헤드를 유지한다.

원저자: Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 그림자를 쫓지 말고, 빛을 이해하라

당신이 파티의 안전을 지키는 일을 맡았다고 상상해 보세요. 기존 방식은 특정 문신이 있거나, 특정 모자를 쓰고 있거나, 특정 문구를 말하는 사람처럼 '나쁜 놈'들의 목록을 거대하고 끊임없이 늘려가는 보안 요원을 고용하는 것입니다. 보안 요원이 본 적 없는 모자를 쓴 새로운 나쁜 놈이 나타날 때마다 그들은 몰래 잠입합니다. 보안 요원은 목록을 계속 업데이트해야 하지만, 나쁜 놈들은 항상 새로운 변장을 만들어내며 한 발 앞서 나갑니다.

이 논문의 저자들은 이러한 '쫓고 쫓기는' 게임이 실패했다고 주장합니다. 누군가가 나쁘게 행동할 수 있는 모든 방법을 암기하려고 노력하는 대신, 그들은 더 똑똑한 접근 방식을 제안합니다. 바로 '정상'이 어떤 모습인지 완벽하게 학습하여, 조금이라도 이상한 것이 보이면 즉시 눈에 띄게 만드는 것입니다.

그들은 이 새로운 시스템을 **T3 (Trust The Typical, 전형적인 것을 믿어라)**라고 부릅니다.

T3의 작동 원리: "군중" 비유

수백만 명의 사람들이 가득 찬 거대하고 투명한 방을 상상해 보세요.

  • 안전한 사람들: 정상적이고 도움이 되는 사람들이 AI와 대화할 때, 그들의 단어들은 방 안의 특정하고 편안한 구석에 모여듭니다. 그들은 서로 가까이 서 있으며, 조밀하고 예측 가능한 군중을 형성합니다. 수학적으로 이것은 **"전형적 집합(Typical Set)"**이라고 불립니다.
  • 나쁜 행위자들: 누군가 AI를 속이려고 할 때(탈옥 또는 유해한 프롬프트), 그들은 규칙을 우회하기 위해 특이한 말을 해야만 합니다. 몰래 침입하려 하기 때문에, 그들은 결국 군중에서 멀리 떨어진, 텅 비고 이상한 구석에 서 있게 됩니다.

T3는 나쁜 사람이 '무엇'을 말하는지에 관심을 두지 않습니다. 그저 그들이 어디에 서 있는지를 봅니다. 만약 당신이 안전한 군중 속에 서 있다면 괜찮습니다. 하지만 당신이 어두운 구석에 홀로 서 있다면, T3는 당신을 잠재적 위협으로 분류합니다.

이것이 왜 중요한가

이 논문은 T3가 다른 안전 도구들이 가진 세 가지 주요 문제를 해결한다고 주장합니다.

1. "현상 수배 포스터" 목록이 필요 없습니다

  • 기존 방식: 지금까지 만들어진 모든 나쁜 문구의 목록이 필요합니다. 만약 나쁜 놈이 새로운 문구를 발명하면, 당신은 놓치게 됩니다.
  • T3 방식: 오직 '좋은' 문구의 목록만 있으면 됩니다. T3는 '좋음'이 무엇인지를 학습합니다. 만약 어떤 것이 '좋음'의 패턴에 맞지 않는다면, 그것은 차단됩니다. 이는 재학습 없이도 이전에 본 적 없는 새로운 유형의 공격을 잡아낼 수 있음을 의미합니다.

2. 선량한 사람을 범인으로 몰지 않습니다 (오탐지 방지)

  • 문제점: 기존의 안전 도구들은 나쁜 놈을 놓칠까 봐 너무 겁을 먹은 나머지, 무고한 사람들을 차단하기도 합니다. 예를 들어, 당신이 약간 복잡한 의학적 질문을 하면, 기존 도구는 "이것은 위험한 요청처럼 들린다!"라고 판단하여 답변을 거부할 수 있습니다. 이를 '과잉 거부(over-refusal)'라고 합니다.
  • T3의 결과: 논문에 따르면 T3는 훨씬 더 정밀합니다. T3는 다른 도구들에 비해 오보(false alarms)를 최대 40배까지 줄였습니다. T3는 복잡하지만 안전한 질문과 정말로 위험한 질문의 차이를 이해합니다. 왜냐하면 안전한 언어의 '형태'를 이해하고 있기 때문입니다.

3. 어디서나 작동합니다 (번역이 필요 없음)

  • 문제점: 보통 AI를 스페인어, 프랑스어, 또는 일본어로 안전하게 만들고 싶다면, 각 언어에 맞는 새로운 안전 시스템을 통째로 훈련시켜야 합니다.
  • T3의 결과: 저자들은 T3를 영어의 안전한 텍스트로만 훈련시켰습니다. 놀랍게도, 추가 훈련 없이도 일본어나 아랍어를 포함한 14개 이상의 언어에서 완벽하게 작동했습니다. "나쁜" 언어는 어떤 언어로 말하든 비슷한 방식으로 이상하게 보인다는 점을 시사합니다.

"속도 테스트": 속도를 늦추지 않습니다

안전 도구에 대한 가장 큰 우려 중 하나는 그것이 AI를 느리게 만든다는 것입니다. 자동차의 보안 요원이 승객 한 명 한 명을 모두 검사한 후에야 차를 출발시키는 상황을 상상해 보세요.

저자들은 T3를 많은 AI 시스템의 엔진 역할을 하는 vLLM에 직접 통합했습니다. 그들은 T3가 AI가 단어를 타이핑하는 동안에도 안전성을 확인할 수 있다는 것을 발견했습니다.

  • 결과: 이 과정에 추가되는 시간은 6% 미만입니다.
  • 비유: 이는 운전자가 차를 멈추거나 크게 느려지게 하지 않도록, 운전자 옆에서 실시간으로 도로 상황을 체크하며 함께 달리는 보안 요원과 같습니다.

이 논문이 말하지 않는 것 (중요한 한계점)

논문은 T3가 어려움을 겪을 수 있는 부분에 대해서도 솔직하게 밝히고 있습니다:

  • "회색 지대" 문제: 만약 "안전한" 훈련 데이터 자체에 일부 나쁜 단어가 포함되어 있다면 (예: 욕설이 포함되어 있지만 맥락상 여전히 "안전한" 논쟁 데이터), T3는 혼란을 느낄 수 있습니다. T3는 훈련 데이터가 진정으로 "안전"하다는 것에 의존합니다. 훈련 데이터가 지저도 시스템도 지저분해집니다.
  • 마법이 아닙니다: T3는 "안전함"과 "안전하지 않음" 사이에 명확한 경계가 있을 때 가장 잘 작동합니다. 만약 차이가 매우 미묘하다면 (예: 단어 하나가 문장을 도움되는 것에서 해로운 것으로 바꾸는 경우), 탐지가 더 어려울 수 있지만, 여전히 까다로운 "탈옥" 테스트에서 매우 좋은 성능을 보여주었습니다.

요약

**Trust The Typical (T3)**은 AI를 안전하게 지키는 새로운 방법입니다. AI가 할 수 있는 모든 나쁜 행동을 암기하는 대신, '좋음'이 무엇인지를 깊이 학습하여 무엇이 "이상하거나" "교활한" 것인지 즉시 알아차립니다. 이 시스템은 더 빠르고, 새로운 유형의 공격을 더 잘 잡아내며, 무고한 사용자에게 실수를 덜 저지르고, 추가 훈련 없이도 여러 언어에서 작동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →