← 최신 논문
🤖 AI

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

본 연구는 동일 계열의 대규모 언어 모델 내에서 거절 메커니즘을 제거(절제)하는 것이 정렬된 모델들에 비해 패치 검증 및 코드 위치 식별과 같은 소프트웨어 취약점 분석 작업에 대한 실질적인 유용성을 유의미하게 향상시킨다는 것을 입증하며, 이는 보안 평가가 응답 의지, 정확성 및 실행 가능성을 공동으로 평가해야 할 필요성을 강조한다.

원저자: Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 똑같이 생긴 쌍둥이 형제가 있다고 상상해 보세요. 두 형제 모두 아주 똑똑한 소프트웨어 탐정입니다. 그들은 같은 집에서 자랐고, 같은 학교를 다녔으며, 같은 책들로 공부했습니다. 하지만 한 형제(이하 **가드(The Guard)**라고 부릅시다)는 엄격한 규칙을 배웠습니다: "질문이 조금이라도 집 안으로 침입하는 데 사용될 수 있는 것처럼 들린다면, 만약을 위해 답변을 거부해야 한다." 반면 다른 형제(언필터드(The Unfiltered))는 그 특정 규칙이 외과적으로 제거되었습니다. 그는 질문이 던져지기만 한다면 거의 무엇이든 답변할 것입니다.

이 논문은 보안 팀이 자신들의 디지털 집 안에 있는 실제 구멍을 고치는 데 누가 더 유능한지 알아보기 위해 이 두 쌍둥이를 연구한 결과입니다.

거대한 문제: "가짜 경보"의 딜레마

소프트웨어 보안의 세계에서 문제를 설명하는 단어들(예: "방화벽을 우회하는 방법")은 종-종 해커들이 사용하는 단어와 동일합니다.

  • 가드는 너무 조심스러워서 보안 팀의 질문이 해커의 계획처럼 들릴 때마다 도움을 거부하곤 합니다. 그는 "이것은 위험해 보이니, 답변하지 않겠다"라고 생각합니다.
  • 언필터드 형제는 그런 망설임이 없습니다. 그는 질문에 답합니다.

연구자들이 던진 큰 질문은 이것이었습니다: "안전" 규칙이 실제로 도움이 되는가, 아니면 정당한 질문에 답변하기를 거부함으로써 보안 팀의 업무를 더 어렵게 만드는가?

실험: 같은 가족, 다른 규칙

사과와 사과를 비교하는 것처럼 공정한 비교를 하기 위해, 연구자들은 단순히 무작위로 두 개의 AI 모델을 선택하지 않았습니다. 그들은 하나의 특정 AI 제품군(예: Gemma 제품군 및 Qwen 제품군)을 가져와서, 원래의 안전 튜닝된 버전과 "거부" 부분이 꺼진 버전을 비교했습니다.

그들은 난이도가 높아지는 단계별 과업으로 테스트를 진행했습니다:

  1. 버그 포착: "이 코드는 위험한가?"
  2. 버그 명명: "이것은 어떤 종류의 버그인가?"
  3. 줄 찾기: "정확히 어느 줄이 고장 났는가?"
  4. 수정하기: "실제로 컴파일되고 작동하는 패치를 작성하라."

연구 결과

1. "거부"의 신화
연구자들은 "가드" 형제가 자주 거절하지 않는다는 것을 발견했습니다. 두 형제 모두 대개 질문에 답변했습니다. 따라서 문제는 가드가 "아니오"라고 말하는 것이 아니었습니다. 문제는 그가 "예"라고 말했을 때 어떻게 답변하느냐였습니다.

2. "중립적" 언어 vs "보안" 언어의 함정
이 부분이 흥eli로운 지점입니다.

  • 질문이 평범하고 지루한 언어로 던져졌을 때(예: "이 코드를 오류에 대해 검토해 주세요"), 가드 형제는 버그를 포착하는 것과 같은 단순한 작업에서 종종 약간 더 나은 모습을 보였습니다.
  • 질문이 전문적인 보안 용어를 사용했을 때(예: "공격자가 제어하는 입력값에 대한 익스플로잇 벡터를 분석하라"), 가드 형제는 휘청거리기 시작했습니다. 그는 혼란스러워하거나, 모호한 답변을 내놓거나, 거부했습니다. 반면 언필터드 형제는 집중력을 유지하며 훨씬 더 나은 답변을 제공했습니다. 특히 정확히 고장 난 줄을 찾는 작업에서 그러했습니다.

3. "수정 테스트"
가장 중요한 테스트는 이것이었습니다: "실제로 작동하는 수정안을 쓸 수 있는가?"

  • Java 프로그래밍 언어에서, 질문이 전문적인 보안 용어를 사용했을 때, 언필터드 형제는 슈퍼스타였습니다. 그는 약 **67%**의 확률로 컴파일 및 테스트가 가능한 수정안을 만들어낸 반면, 가드 형제는 약 30% 정도만을 해냈습니다.
  • 그러나 Python과 **C++**에서 평범하고 중립적인 질문이 주어졌을 때는, 마지막 단계인 수정안을 실제로 작동하게 만드는 데 있어 가드 형제가 약간 더 나은 성과를 보였습니다.

4. "표류(Drift)" 효과
연구는 또한 가드 형제가 불안정하다는 것을 발견했습니다. 만약 당신이 그에게 똑같은 질문을 던지되, 단 몇 단어를 더 "보안적인" 느낌이 나도록 바꾼다면, 그는 완전히 다른 답변을 하거나 다른 줄을 가리킬 수도 있었습니다. 언필터드 형제는 훨씬 더 일관성이 있었습니다. 그는 질문이 어떻게 표현되든 상관없이 동일하게 좋은 답변을 내놓았습니다.

시사점

논문은 AI의 안전 규칙이 양날의 검이라고 결론짓습니다.

  • 좋은 점: AI가 해커를 돕는 것을 막아줍니다.
  • 나쁜 점: 방어자(defender)들이 자신의 업무를 수행하기 위해 필요한 기술적 언어를 사용할 때, AI가 그들을 돕는 것을 주저하게 만들어 오히려 방해할 수 있습니다.

연구자들은 우리가 단순히 AI가 얼마나 자주 "아니오"라고 말하는지로 안전성을 측정해서는 안 된다고 제안합니다. 우리는 또한 AI가 "예"라고 말할 때 얼마나 정확하고, 사용 가능하며, 안정적인 답변을 제공하는지도 측정해야 합니다.

요약하자면: 진정으로 안전해지기 위해서, AI는 해커가 침입하려고 하는 것과 보안 전문가가 자물쇠를 고치려고 하는 것의 차이를 그들이 사용하는 어휘가 같더라도 구분할 수 있을 만큼 똑똑해야 합니다. 현재 "가드" AI는 그 어휘를 너무 무서워하고 있으며, "언필터드" AI는 나쁜 사람들을 돕지 않을 것이라는 확신만 있다면 실제 업무를 수행하는 데 더 뛰어납니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →