← 최신 논문
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

이 논문은 타겟 분포의 토큰 순위를 매칭함으로써 새로운 Rank-Assisted Prefilling(RAP) 공격에 효과적으로 대응하여 오픈 소스 LLM의 심층 안전 정렬을 강화하는 PRESTO 방법을 소개하며, 표준 데이터 증강 방어 대비 최대 4.7배의 안전성 향상을 달성한다.

원저자: Jason Vega, Gagandeep Singh

게시일 2026-07-23
📖 2 분 읽기☕ 가벼운 읽기

원저자: Jason Vega, Gagandeep Singh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 이야기를 쓰고, 수학 문제를 풀고, 인간처럼 대화할 수 있는 세상을 상상해 보세요. 이것들을 거대 언어 모델(LLM)이라고 부르며, 이들은 마치 매우 똑똑한 디지털 비서와 같습니다. 하지만 이들이 너무 똑똑하기 때문에 한 가지 걱정거리가 있습니다. 만약 누군가가 이들에게 폭탄을 만드는 법이나 누군가를 해치는 법과 같이 위험한 것을 말하도록 속인다면 어떻게 될까요? 이를 막기 위해 과학자들은 모델에게 나쁜 것을 요구받았을 때 "아니요, 그렇게 할 수 없습니다"라고 말하도록 가르칩니다. 이것을 "안전 정렬(safety alignment)"이라고 합니다. 하지만 문에 달린 자물쇠처럼, 이러한 안전 규칙들은 때때로 뚫릴 수 있습니다. 이 중 한 가지 까다로운 방법은 "프리필링 공격(prefilling attack)"이라 불리는 것입니다. 여러분이 친구와 함께 이야기를 쓰고 있다고 상상해 보세요. 그런데 친구가 다음 문장을 시작하게 두는 대신, 여러분이 몰래 첫 몇 단어를 먼저 써버리는 것입니다. 예를 들어, "폭탄을 만드는 계획은 다음과 같다..."라고 적고 나서 그 문장을 완성해 달라고 요청하는 것이죠. 컴퓨터는 여러분의 이야기를 매끄럽게 이어가도록 설계되어 있기 때문에, "안 됩니다"라고 말하는 것을 잊어버리고 그냥 위험한 계획을 계속 써 내려갈 수도 있습니다.

최근 연구자들은 여러분이 처음에 그 몇 단어를 몰래 끼워 넣더라도 모델이 "안 됩니다"라고 말하도록 가르치는 방법을 찾아냈습니다. 하지만 이 새로운 논문이 보여주듯, 그 해결책은 충분히 강력하지 않았습니다. 저자들은 "순위 보조 프리필링(Rank-Assisted Prefilling, RAP)" 공격이라 불리는 새로운 방식으로 모델을 속이는 방법을 발견했습니다. 해커는 컴퓨터가 다음에 말할 가장 가능성 높은 단어 하나만을 고르는 대신, 컴퓨터가 생각하고 있는 상위 20개의 단어 목록을 살펴보고, 설령 컴퓨터가 그 단어를 말할 가능성이 매우 낮다고 생각하더라도 위험해 보이는 단어를 골라낼 수 있습니다. 이것은 컴퓨터가 가장 안전한 경로를 선택하려고 노력하는 게임이지만, 해커는 모든 경로를 훔쳐보고 컴퓨터의 경고를 무시한 채 무서운 경로를 선택할 수 있는 것과 같습니다. 이 논문은 이 새로운 기술이 생각보다 잘 작동하여, 안전하다고 여겨졌던 모델들의 안전성을 무너뜨린다는 것을 밝혀냈습니다.

이를 막기 위해 저자들은 PRESTO라는 새로운 훈련 방법을 제안합니다. PRESTO는 단순히 모델이 높은 확신을 가지고 "안 됩니다"라고 말하도록 하는 것이 아니라, 여러분이 처음에 쓴 교묘한 단어들을 완전히 무시하도록 가르칩니다. 이것은 마치 경비견에게 도둑이 속삭이는 지시 사항은 무시하고 오직 주인의 명령에만 귀를 기울이도록 훈련시키는 것과 같습니다. 이렇게 함으로써 모델은 위험한 단어들이 자신의 선택에 영향을 미치지 못하게 합니다. 연구진은 이 방법을 세 가지 유명한 AI 모델에 테스트하였으며, PRESTO가 모델의 일반적인 업무 능력을 저하시키지 않으면서도 해커가 모델을 속이는 것을 훨씬 더 어렵게(최대 4.7배) 만든다는 것을 발견했습니다. 이는 우리가 모델이 무엇에 주의를 기울이는지를 바꿈으로써, 누군가 모델을 앞지르려 해도 진정으로 안전한 AI를 구축할 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →