← 최신 논문
💬 NLP

LBA: Textual Hard-Label Adversarial Attack under Low Query Budgets

본 논문은 사전 지식과 사후 지식을 반복적으로 통합하여 고품질 적대적 예제의 근사 분포를 구축함으로써, 낮은 쿼리 예산 하에서 의미론적으로 보존된 하드 라벨 적대적 텍스트를 생성하는 데 있어 기존의 탐욕적 접근 방식들을 크게 능가하는 샘플링 기반 방법인 LBA를 제안한다.

원저자: Shixin Guo, Ming Zhong, Xuhong Zhang, Dandan Zhao, Zhe Wang, Bo Zhang, Shouling Ji, Hao Peng

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shixin Guo, Ming Zhong, Xuhong Zhang, Dandan Zhao, Zhe Wang, Bo Zhang, Shouling Ji, Hao Peng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거의 모든 책을 읽은 초지능형 로봇과 함께 '전화기 게임(Telephone)'을 하고 있다고 상상해 보세요. 당신이 문장 하나를 속삭이면, 로봇은 그 문장이 무엇을 의미하는지 정확하게 말해줍니다. 그것이 행복한 영화 리뷰인지, 아니면 슬픈 뉴스 기사인지 말이죠. 이 로봇은 '심층 신경망(Deep Neural Network)'이라 불리는 인공지능의 한 종류이며, 언어를 이해하는 데 매우 능숙합니다. 하지만 똑똑한 생명체에게도 비밀스러운 약점이 있습니다. 바로 속임수에 빠질 수 있다는 점입니다. 문장의 단어 몇 개만 바꾸어도, 로봇은 갑자기 행복한 영화를 비극이라고 생각할 수도 있습니다. 이것을 '적대적 공격(adversarial attack)'이라고 부릅니다.

까다로운 점은, 현실 세계에서 당신은 로봇에게 "얼마나 확신하니?"라고 물을 수 없다는 것입니다. 당신은 오직 "이것이 무엇이라고 생각하니?"라고 묻고, "예" 또는 "아니요"라는 단순한 답변만을 받을 수 있습니다. 이를 '하드 라벨(hard-label)' 시나리오라고 합니다. 질문을 너무 많이 해서 들키거나 비용이 많이 드는 상황을 피하면서 로봇을 속이려면, 매우 영리해져야 합니다. 대부분의 사람들은 마치 정원사가 나무의 가지를 하나씩 치듯, 문장을 한 단어씩 수정하며 시도합니다. 하지만 이 방식은 로봇을 속이기 위해 필요한 완벽한 변화의 조합을 놓치는 경우가 많으며, 많은 시간과 질문을 낭비하게 됩니다.

이 논문은 문제를 완전히 다른 방식으로 해결하는 LBA(Low-query Budget hard-label Attack)라는 새로운 방법을 소개합니다. 이 방법은 나무의 가지를 하나씩 치는 대신, 문제를 '마법의 지도'를 이용한 보물 찾기처럼 다룹니다.

기존 방식: 눈먼 정원사

당신이 특정 맛이 나는 케이크를 만들기 위해 완벽한 재료의 조합을 찾으려 하는데, 결과물은 오직 다 구운 후에만 맛볼 수 있다고 상상해 보세요. 기존의 방법들은 꽃을 하나 고르고, 그것을 꺾은 뒤, 정원이 더 좋아졌는지 확인하는 '눈먼 정원사'처럼 행동합니다. 만약 좋아졌다면 그 꺾은 것을 유지하고, 그렇지 않다면 다시 제자리에 두고 다음 꽃을 시도합니다. 그들은 전체 정원을 한꺼번에 보지 못합니다. 이러한 '탐욕적(greedy)' 접근 방식은 하나의 국소적인 구역에 갇히기 쉬우며, 여러 개의 꽃을 동시에 바꿔야 하는 완벽한 배치를 놓치게 됩니다. 이는 많은 시간(또는 '질문 횟수')을 낭비하게 만듭니다.

새로운 방식: 마법의 지도 (LBA)

저자들은 꽃을 하나씩 추측하는 대신, 어디에서 '최선의' 변화가 일어날 가능성이 높은지 보여주는 지도를 구축할 수 있다는 것을 깨달았습니다. 그들은 이를 '샘플링 기반 방법(sampling-based method)'이라고 부릅니다.

이 지도가 작동하는 방식은 다음과 같습니다:

  1. 사전 지식 (초기 지도): 시작하기 전, 그들은 "너무 많은 단어를 바꾸지 말 것"이나 "문장이 자연스럽게 유지될 것"과 같은 이미 알고 있는 규칙들을 바탕으로 대략적인 지도를 그립니다.
  2. 사후 지식 (지도 업데이트): 그들은 다양한 문장을 테스트하고 로봇에게 답을 구하면서 학습합니다. 만약 특정 단어를 바꾸는 것이 로봇을 자주 속인다면, 그 지점을 지도상에 "가치가 높은 곳"으로 표시합니다. 만약 어떤 변화가 문장을 이상하게 만든다면, 그곳을 "가치가 낮은 곳"으로 표시합니다.
  3. 샘플링 (보물 찾기): 그들은 단계별로 걷는 대신, 이 지도를 사용하여 유망한 단어 변화의 조합을 "샘플링"하거나 선택합니다. 이는 마치 승리할 가능성이 가장 높은 곳인 과녁의 중심을 향해 다트를 던지는 것과 같습니다. 다트를 더 많이 던질수록 지도는 더 정교해지며, 더 빠르게 더 나은 지점으로 안내합니다.

연구 결과

연구진은 이 새로운 방법을 작은 모델부터 GPT-4o와 같은 거대한 모델에 이르기까지 여섯 가지 유형의 언어 로봇을 대상으로 테스트했습니다. 또한 영화 리뷰와 뉴스 기사를 포함한 네 가지 데이터 세트를 사용했습니다.

결과는 인상적이었습니다. 질문할 수 있는 횟수가 제한된 환경(‘낮은 쿼리 예산’)에서, LBA는 기존 방식들보다 더 나은 속임수를 일관되게 찾아냈습니다.

  • 더 나은 품질: LBA가 만들어낸 문장들은 훨씬 더 자연스러웠습니다. 다른 방법들에 비해 단어를 더 적게 바꾸면서도 원래 문장의 의미를 더 잘 유지했습니다.
  • 더 똑똑한 효율성: 긴 텍스트(예: 긴 영화 리뷰)의 경우, 기존 방식들은 적절한 변화의 조합을 찾는 데 어려움을 겪었습니다. 그러나 LBA는 이러한 복잡한 시나리오에서도 완벽한 단어 교체 조합을 찾아내는 데 탁-월했습니다.
  • 인간의 승인: 연구진이 인간에게 속임수가 적용된 문장을 읽게 했을 때, 인간들은 원래 문장과 속임수가 적용된 문장 사이의 차이를 구분하지 못했습니다. 또한, 초고성능 AI인 GPT-4o에게 문장을 판단하게 했을 때도, GPT-4o는 LBA의 속임수가 가장 정교하고 덜 드러난다고 동의했습니다.

이것이 중요한 이유

이 논문은 이러한 '지도 기반' 샘플링 접근 방식을 사용함으로써, AI 모델을 훨씬 더 효율적으로 속일 수 있음을 시사합니다. 이것은 AI가 고장 났다는 뜻이 아니라, 기존의 방식(한 번에 한 단어씩 시도하는 방식)이 비효율적이라는 것을 보여줍니다. 최선의 속임수는 단일한 변화가 아니라 특정한 변화의 조합을 포함한다는 것을 이해함으로써, LBA는 AI 시스템의 견고함을 테스트하는 새로운 문을 열었습니다. 이는 더 똑똑한 전략을 사용하면, 로봇에게 수백만 번의 질문을 던지지 않고도 높은 품질의 결과를 얻을 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →