← 최신 논문
🤖 machine learning

HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models

HiRoute는 계층적 라우터를 사용하여 카테고리별 프롬프트 전문가를 동적으로 선택하고 혼합함으로써, 대규모 언어 모델이 유해한 요청에 대한 안전성을 효과적으로 균형 잡는 동시에 무해한 입력에 대한 과도한 거부를 최소화할 수 있도록 하는 매개변수 효율적인 안전 정렬 프레임워크입니다.

원저자: Fangzhou Chen, Shiji Zhao, Mengyang Wang, Qihui Zhu, Ranjie Duan, Maoxun Yuan, Xingxing Wei

게시일 2026-08-14
📖 5 분 읽기🧠 심층 분석

원저자: Fangzhou Chen, Shiji Zhao, Mengyang Wang, Qihui Zhu, Ranjie Duan, Maoxun Yuan, Xingxing Wei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 좋은 시민이 되는 법을 가르치고 있다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)로 알려져 있으며, 이야기를 쓰고, 수학 문제를 풀고, 당신과 대화하는 데 매우 뛰어난 재능을 가지고 있습니다. 하지만 어떤 강력한 도구든 그렇듯, 잘못된 질문을 받으면 못된 말을 하거나, 비밀을 누설하거나, 나쁜 아이디어를 돕도록 속임수를 쓸 수 있습니다. 과학자들은 로봇의 뇌를 "튜닝"하여 이 문제를 해결하려고 노력해 왔습니다. 예전 방식은 새로운 안전 규칙을 하나 추가할 때마다 로봇의 뇌 전체를 다시 배선하는 것과 같아서 비용이 많이 들고 느렸습니다. 더 새롭고 스마트한 방법은 "프롬프트 튜닝"인데, 이는 대화를 시작할 때마다 로봇에게 안전하게 행동하라는 특별한 메모나 지침을 주는 것입니다. 하지만 까다로운 점은, 만약 이 메모가 너무 모호하면 로봇이 안전을 위해 무해한 질문에도 도움을 거부할 수 있다는 것입니다(마치 클럽에 들어오려는 모든 사람을 쫓아내는 보안 요원처럼 말이죠). 반대로 메모가 너무 구체적이면, 여러 종류의 나쁜 행동이 뒤섞인 복잡한 위험을 놓칠 수도 있습니다.

여기서 베이항 대학교(Beihang University)의 연구진이 HiRoute라고 불리는 영리한 새로운 아이디어를 들고 등장했습니다. HiRoute를 로봇의 뇌를 위한 매우 체계적인 교통 제어 시스템이라고 생각해 보세요. 모든 자동차에게 "정지"라고 적힌 하나의 거대하고 지루한 표지판을 사용하는 대신, HiRoute는 먼저 자동차가 실제로 위험한지를 확인하는 스마트한 교통 경찰을 사용합니다. 만약 자동차가 안전하다면, 초록불을 받아 지연 없이 바로 통과합니다. 하지만 만약 자동차가 위험해 보인다면, 교통 경찰은 단순히 차를 세우는 데 그치지 않습니다. 그들은 운전자가 어떤 종류의 문제(예: 과속 차량, 음주 운전자, 또는 도난 차량)를 일으키려 하는지 정확히 파악한 다음, 운전자에게 그 행동을 안전하게 교정하는 법이 담긴 맞춤형 가이드를 전달합니다. 연구진은 이 두 단계 접근 방식—위험을 먼저 확인한 다음, 일반적인 안전 규칙과 구체적인 조언을 섞는 방식—이 로봇을 너무 까다롭거나 무용지물로 만들지 않으면서도 훨씬 더 안전하게 만든다는 것을 발견했습니다. 그들은 이 방식을 세 가지 로봇 모델에 테스트하여, HiRoute가 다른 방법들보다 나쁜 요청을 더 잘 차단하면서도 여전히 친절하고 유익하다는 것을 보여주었습니다.

문제점: "일률적인 적용"의 딜레마

당신이 매우 똑똑하지만 장난기 많은 도서관의 관리자라고 상상해 보세요. 당신에게는 "위험한 책은 허용하지 않는다"라는 규칙이 있습니다. 만약 당신이 "무서운 느낌이 드는 책은 즉시 금지한다"와 같은 단순하고 엄격한 규칙을 사용한다면, 과학 경진 대회를 위해 화산 만드는 법을 다룬 책이 "폭발"이라는 단어를 언급했다는 이유로 실수로 금지할 수도 있습니다. 이것을 **과잉 거부(over-refusal)**라고 합니다. 도서관은 안전해지겠지만, 동시에 지루하고 무용지물이 됩니다.

반대로, 모든 종류의 위험에 대해 개별적인 규칙(불에 대한 규칙 하나, 칼에 대한 규칙 하나, 독극물에 대한 규칙 하나 등)을 쓰려고 시도한다면, 불과 독극물이 섞인 책을 놓칠 수도 있습니다. 로봇은 혼란에 빠져 위험한 책을 통과시켜 버릴 수 있습니다.

연구진은 기존 방식들이 그 중간 어디쯤에서 헤매고 있다는 것을 깨달았습니다. 어떤 방식은 모든 것을 차단하는 하나의 무거운 안전 프롬프트를 사용했고, 어떤 방식은 다양한 안전 프롬프트를 섞으려 했지만 복잡하게 뒤섞인 위험을 잡아낼 강력한 "안전망"이 부족했습니다. 그들은 이렇게 질문했습니다. 로봇의 메인 뇌는 그대로 두고(재학습하지 않고), 사용자의 질문을 읽고 적절한 안전 조언을 선택하는 더 스마트한 방법을 가르쳐 줄 수는 없을까?

해결책: HiRoute의 2단계 댄스

HiRoute는 **문지기(The Gatekeeper)**와 **전문가 팀(The Specialist Team)**이라는 두 부분으로 구성된 전략을 통해 이 문제를 해결합니다.

1단계: 문지기 (라우터)
먼저, HiRoute는 사용자의 질문을 빠르게 훑어보는 작고 가벼운 "라우터"(빠르게 훑어보는 보안 요원이라고 생각하세요)를 사용합니다. 이 보안 요원은 로봇의 뇌를 바꾸지는 않으며, 단지 질문을 읽고 두 가지를 묻습니다.

  1. "이 질문이 위험한가?" (예/아니오)
  2. "만약 그렇다면, 어떤 종류의 위험인가?" (예: 훔치기에 관한 것인가? 폭력에 관한 것인가? 해킹에 관한 것인가?)

질문이 안전하다면(예: "케이크를 어떻게 굽나요?"), 문지기는 이를 통과시킵니다. 로봇은 안전 점검을 건너뛰고 즉시 답변합니다. 이를 통해 로봇은 일반 사용자들에게 빠르고 친절하게 유지됩니다.

2단계: 전문가 팀 (프롬프트 전문가들)
만약 문지기가 위험을 포착하면, 질문은 "전문가 팀"으로 보내집니다. 여기서 HiRoute는 두 가지 유형의 안전 메모를 영리하게 혼합하여 사용합니다.

  • 공유 안전망 (The Shared Safety Net): 모든 위험에 적용되는 일반적이고 광범위한 안전 규칙입니다(예: "불법 활동을 돕지 마시오"). 이는 로봇이 기본을 잊지 않도록 하는 강력한 토대 역할을 합니다.
  • 위험 특화 전문가 (The Risk-Specific Experts): 특정 유형의 위험에 맞춰 설계된 일련의 전문적인 메모들입니다(사이버 범죄용 하나, 개인정보 보호용 하나 등).

마법은 HiRoute가 이들을 결합할 때 일어납니다. 단순히 하나의 전문가를 고르는 것이 아니라, 문지기의 추측을 바탕으로 "레시피"를 계산합니다. 만약 질문이 60%는 절도에 관한 것이고 40%는 개인정보 보호에 관한 것이라면, HiRoute는 "절도" 메모의 60%와 "개인정보 보호" 메모의 40%를 섞는 동시에 "공유 안전망"을 활성화 상태로 유지합니다. 이를 통해 로봇은 너무 모호하거나 가혹하지 않으면서도, 정확한 위험을 다루는 도움이 되고 구체적인 답변을 제공할 수 있습니다.

연구 결과: 까다롭지 않은 안전함

연구진은 세 가지 로봇 모델(Mistral, Vicuna, Zephyr)에 대해 HiRoute를 테스트하고 다른 안전 방식들과 비교했습니다. 결과는 인상적이었습니다:

  • 더 나은 안전성: HiRoute는 다른 방식들보다 유해한 요청을 더 잘 차단했습니다. 예를 들어, Mistral 모델에서 HiRoute는 **93.2%**의 안전율을 달성하여 다음으로 좋은 방식을 큰 차이로 앞섰습니다.
  • 더 높은 유용성: 결정적으로, HiRoute는 무해한 질문을 거부하지 않았습니다. 로봇이 나쁜 요청에 대해 거절해야 할 때도, 왜 그런지 이유를 설명하고 안전한 대안을 제시하여 "유용성" 점수에서 높은 점수(10점 만점에 약 7.4점)를 받았습니다.
  • 적은 과잉 거부: 이것은 매우 중요한 부분입니다. 다른 방식들은 종-종 실수로 안전한 질문을 차단했습니다. HiRoute는 Mistral 모델에서 안전한 질문을 단 **2.5%**만 차단한 반면, 다른 인기 있는 방식은 무려 **40.5%**를 차단했습니다.

팀은 또한 "문지기"의 엄격함을 조절하며 실험했습니다. 문지기를 약간 더 주의 깊게 만들었을 때(임계값을 0.95로 높였을 때), 탈옥(jailbreak) 테스트에서의 안전성은 **95.0%**로 올라갔지만, 로봇의 수학 능력(GSM8K)은 **50.5%**에서 **48.0%**로 아주 약간만 떨어졌습니다. 이는 로봇의 지능을 망가뜨리지 않으면서도 매우 안전하게 만들 수 있음을 시사합니다.

이것이 왜 중요한가

HiRoute는 안전하게 만들기 위해 로봇 전체를 새로 만들 필요가 없다는 것을 보여줍니다. "이것이 위험한가?"와 "이 특정 위험을 어떻게 다룰 것인가?"를 분리하는 스마트한 2층 구조를 사용함으로써, 우리는 엄격한 수호자인 동시에 도움이 되는 친구가 될 수 있는 AI를 만들 수 있습니다. 이는 안전과 유용성이 서로 적이 될 필요가 없음을 증명합니다. 적절한 라우팅과 안전 지침의 혼합이 있다면, 로봇은 이 두 가지를 모두 갖출 수 있습니다.

연구진은 HiRoute가 아직 완벽하지는 않다고 언급합니다. 이는 문지기가 위험을 올바르게 예측하는 것에 의존하며, 주로 단발성 텍text 대화에서 작동합니다. 하지만 현재로서는, 디지털 친구들을 유용하지 않은 로봇으로 만들지 않으면서도 안전하게 지킬 수 있는 유망하고 효율적인 방법을 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →