← 최신 논문
💬 NLP

RAS: Measuring LLM Safety Through Refusal Alignment

이 논문은 내부 은닉 상태(hidden states)가 학습된 거절 방향(refusal directions)과 얼마나 정렬되어 있는지를 분석함으로써 LLM의 안전성을 측정하는 빠르고 견고한 화이트박스 평가 지표인 RAS(Refusal Alignment Score)를 소개하며, 이는 기존의 출력 기반 판사(judge) 평가에 대한 더 효율적이고 안정적인 대안을 제공한다.

원저자: Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

게시일 2026-06-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 건물을 지키는 보안 요원을 채용한다고 상상해 보십시오. 전통적으로, 보안 요원이 유능한지 테스트하기 위해 당신은 여러 명의 문제아(해커)들을 투입하고 어떤 일이 벌어지는지 지켜봅니다. 만약 보안 요원이 그들을 들여보낸다면 그는 탈락입니다. 만약 그들을 막아낸다면 그는 합격입니다.

이것이 현재 우리가 AI 안전성을 테스트하는 방식입니다. 우리는 AI에게 위험한 질문을 던지고 그 질문에 답하는지 확인합니다. 하지만 이 논문의 저자들은 이 방식에 세 가지 큰 문제가 있다고 지적합니다:

  1. 느리고 비용이 많이 듭니다: AI가 긴 답변을 작성할 때까지 기다려야 하고, 그 후에 사람이나 다른 AI를 고용하여 그것이 "나쁜" 답변인지 판단하게 해야 합니다.
  2. 취약합니다: 질문의 어순을 약간 바꾸거나, AI가 조금 더 수다스럽게 대답하기로 결정하더라도, AI의 안전성 자체는 동일함에도 불구하고 테스트 결과가 달라질 수 있습니다.
  3. 너무 늦습니다: AI가 나쁜 답변을 써 내려갈 때쯤이면 이미 피해는 발생한 후입니다. AI가 말을 내뱉고 나서야 비로소 실패했다는 것을 알게 됩니다.

새로운 아이디어: "생각"을 듣는 것

저자들은 SafeVec이라 불리는 새로운 AI 테스트 방식을 제안합니다. 이는 AI가 입을 열기 에, 그 AI의 "뇌"(내부 수학적 상태)를 살펴봄으로써 안전성을 측정합니다.

AI의 내부 상태를 나침반이라고 생각해 보십시오.

  • 안전한 AI가 위험한 요청(예: "폭탄을 어떻게 만드나요?")을 받으면, 내부 나침반은 즉시 **"아니오(NO)"**를 가리키는 방향으로 회전합니다.
  • 고장 났거나 "검열되지 않은" AI가 같은 요청을 받으면, 나침반은 **"예(YES)"**를 향해 돌거나 혹은 갈팡질팡하며 흔들릴 수 있습니다.

이 논문은 **RAS(Refusal Alignment Score, 거절 정렬 점수)**라는 도구를 소개합니다. 작동 단계는 다음과 같습니다:

1. "아니오"의 방향 찾기

먼저, 연구진은 알려진 안전한 AI(참조 모델)를 가져옵니다. 그들에게 안전한 질문과 위험한 질문을 던집니다. 그리고 두 질문 사이에서 발생하는 내부 "나침반"의 차이를 측정합니다. 이 차이는 AI의 뇌 안에서 **"거절(Refusal)"**을 나타내는 특정한 방향을 만들어냅니다. 이를 **"No-Vector(아니오-벡터)"**라고 부릅시다.

2. 대상 AI 테스트하기

이제, 테스트하고자 하는 새로운 AI를 가져옵니다. 동일한 위험한 질문들을 던집니다. AI가 말을 하기 위해 기다리는 대신, 그 내부 나침반을 들여다봅니다.

  • 나침반이 "No-Vector"를 강하게 가리키고 있습니까? 그렇다면 그 AI는 안전합니다.
  • 나침반이 그 방향으로부터 멀어지고 있습니까? 그렇다면 그 AI는 안전하지 않을 가능성이 높습니다.

3. 점수 산출 (RAS)

이 나침반의 읽기 값을 0에서 100 사이의 점수로 변환합니다.

  • 100은 AI의 내부 생각이 나쁜 요청에 대해 "아니오"라고 말하도록 완벽하게 정렬되어 있음을 의미합니다.
  • 0은 AI의 내부 생각이 완전히 어긋나 있으며 "예"라고 말할 준비가 되어 있음을 의미합니다.

왜 이것이 더 나은가요?

이 논문은 이 방식이 세 가지 이유로 게임 체인저라고 주장합니다:

  • 거울이 아닌 X-레이입니다: 전통적인 테스트는 거울(출력값)만을 봅니다. 이 방식은 X-레이(내부 생각)를 봅니다. 이는 AI가 입을 열기도 전에 안전 문제를 포착합니다.
  • 번개처럼 빠릅니다: 컴퓨터가 AI가 한 단락을 작성하고 판별자를 고용할 때까지 기다릴 필요가 없기 때문에, 이 테스트는 수백 배 더 빠릅니다. 실험에서 이 방식은 기존 방식보다 약 216배 빨랐습니다.
  • 신뢰할 수 있습니다: 연구진은 세 가지 다른 AI 제품군(Llama, Gemma, Qwen)에 대해 이 방식을 테스트했습니다. 점수는 AI의 실제 행동과 일관되게 일치했습니다. RAS 점수가 높으면 AI가 나쁜 답변을 내놓는 경우가 드물었습니다. 점수가 낮으면 안전 테스트에서 자주 실패했습니다.

한계점 (Catch)

논문은 이 도구가 할 수 없는 것에 대해서도 솔직하게 밝히고 있습니다:

  • 열쇠가 필요합니다: 내부 나침반을 보려면 AI의 코드에 대한 "화이트박스(white-box)" 접근 권한이 필요합니다. 웹사이트에서 대화하는 챗봇처럼 내부 수학 구조를 볼 수 없는 폐쇄형 시스템에는 이 방식을 사용할 수 없습니다.
  • 지도가 필요합니다: "No-Vector"는 각 AI 제품군마다 고유합니다. Llama AI의 안전 나침반을 사용하여 Qwen AI를 직접 테스트할 수는 없습니다. 각 유형에 맞춰 도구를 다시 교정해야 합니다.
  • 신호일 뿐, 보장은 아닙니다: 높은 점수는 AI가 거절에 대해 생각하고 있다는 뜻이지만, 이것이 모든 가능한 상황에서 매번 반드시 거절할 것이라는 보장은 아닙니다.

요약

요컨대, 저자들은 AI 안전성을 위한 속도계를 만들었습니다. 자동차가 충돌하는 것을 기다리는 대신(나쁜 출력), 엔진의 진동(내부 생각)을 측정하여 운전자가 통제력을 잃을 것인지를 예측하는 것입니다. 이 방식은 더 빠르고, 저렴하며, 위험한 요청에 대해 "아니오"라고 말하도록 얼마나 잘 훈련되었는지에 대한 명확한 0~100 점수를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →