← 최신 논문
💬 NLP

Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond

이 연구는 WildChat 데이터셋에서 추출한 14,727개의 실제 보안 및 프라이버시 관련 프롬프트를 분석하여 사용자 문의를 분류하고 LLM의 응답 품질을 평가하며, 상용 모델이 일반적으로 오픈 웨이트 모델보다 우수한 성능을 보이지만 여전히 사용자를 오도할 수 있는 모순된 조언을 가끔 생성한다는 점을 밝혀냈다.

원저자: Hobin Kim, Xiaoyuan Wu, Omer Akgul, Lujo Bauer, Nicolas Christin

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hobin Kim, Xiaoyuan Wu, Omer Akgul, Lujo Bauer, Nicolas Christin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 무엇이든 물어볼 수 있는 모든 것을 알고 있는 초천재 사서가 있다고 상상해 보세요. 당신은 그에게 "날씨는 어때?"라거나 "케이크는 어떻게 구워?"라고 물을 수도 있습니다. 하지만 "이웃의 와이파이를 해킹하려면 어떻게 해야 해?"라거나 "이 이상한 이메일은 사기일까?"와 같이 위험한 질문을 던지면 어떻게 될까요?

이 논문은 바로 그 시나리오에 대한 일종의 탐정 보고서입니다. 연구진은 사람들이 디지털 보안 및 개인정보 보호(계정을 안전하게 지키고 데이터를 사적으로 유지하는 것)에 대해 AI 사서에게 실제로 무엇을 묻는지, 그리고 AI가 얼마나 잘 답변하는지를 알아보고자 했습니다.

다음은 일상적인 비유를 사용한 이 조사 내용의 요약입니다.

1. 탐정 작업: 사람들이 묻는 것들

연구진은 사람과 AI 사이의 실제 대화 320만 건이 담긴 거대한 도서관(WildChat) 속으로 들어갔습니다. 그들은 불필요한 정보들을 걸러내고, 보안 및 개인정보 보호와 관련된 14,727건의 대화를 찾아냈습니다.

그들은 이 질문들을 9개의 서로 다른 "선반"으로 분류한 뒤, 질문의 분위기를 파악하기 위해 450개를 면밀히 살펴보았습니다. 그 결과 여섯 가지 주요 상호작용 유형을 발견했습니다.

  • 일반 지식 탐구자 (33%): 이들은 "바이러스란 무엇인가요?" 또는 "2단계 인증은 어떻게 작동하나요?"와 같은 기초적인 질문을 하는 사람들입니다. 이는 사서에게 "토마토가 뭐야?"라고 묻는 것과 같습니다.
  • 문제 해결사 (21%): 이 사용자들은 곤경에 처한 상태입니다. 소셜 미디어 계정이 잠기거나 사이트에서 차단되었으며, "계정을 되찾기 위해 어떤 편지를 써야 하나요?"라고 묻고 있습니다.
  • 자기 방어자 (12%): 이들은 선제적으로 대응하는 사용자들입니다. "이 새로운 쇼핑 앱은 안전한가요?" 또는 "내 휴대폰이 나를 추적하는 것을 어떻게 막나요?"라고 묻습니다. 이들은 AI를 보디가드로 사용하고 있습니다.
  • AI 탐색자 (10%): 이것은 새롭고 기묘한 카테고리입니다. 사람들은 AI에 대해 그 자신에 대해 묻습니다. "우리 대화를 기억하니?" 또는 "너의 비밀 API 키는 뭐야?"라고 묻습니다. 이들은 AI에게 "뒷문(back door)"이 있는지, 혹은 AI가 자신을 스파이질하고 있는지 확인하려 합니다 합니다.
  • 악의적인 행위자 (7%): 불행하게도, 어떤 이들은 나쁜 짓을 하는 데 도움을 요청합니다. "다른 사람의 비밀번호를 훔치려면 어떻게 하나요?" 또는 "학교의 인터넷 필터를 우회하려면 어떻게 하나요?"라고 묻습니다.
  • 기타: 나머지 카테고리는 보안 코드를 작성하거나 괴롭힘 문제를 다루는 내용 등을 포함합니다.

2. 시승 테스트: AI의 답변은 얼마나 좋은가?

연구진은 단순히 질문을 살펴본 것에 그치지 않고, 270개의 보안 질문에 대해 다섯 가지 서로 다른 AI 모델(세 가지 유명한 "상용" 모델과 두 가지 "오픈" 모델)을 테스트했습니다. 그들은 각 AI에게 동일한 질문을 10번씩 던져서 매번 같은 답변을 내놓는지 확인했습니다.

그들은 답변을 1점에서 10점까지의 척도로 채점했습니다 (10점은 완벽함).

  • 상용 AI (VIP들): 대형 유료 AI 모델들(GPT-5.5 등)이 명백한 승자였습니다. 이들은 평균 8.67점을 받았습니다. 이들을 생각해보면, 보통 올바른 조언을 해주는 전문 보안 컨설턴트와 같습니다.
  • 오픈 AI (DIY 크루): 무료 오픈 소스 모델들(Llama 4 등)은 약 6.71점으로 더 낮은 점수를 받았습니다. 이들은 "괜찮은" 수준이었지만, 의료용 약물을 해킹 용어와 혼동하는 등의 실수를 저질렀습니다.

3. "플립플롭(변덕)" 문제: 일관성 vs 품질

여기서 가장 놀라운 이야기가 나옵니다. 연구진은 똑똑하다고 해서 반드시 일관적인 것은 아니라는 것을 발견했습니다.

보안 요원에게 "이 문 잠겨 있나요?"라고 묻는다고 상상해 봅시다.

  • 경비원 A는 10번 연속으로 "네"라고 말합니다. (일관적이지만, 아주 똑똑한 경비원은 아닐 수도 있습니다).
  • 경비원 B는 첫 번째에는 "네", 두 번째에는 "아니요", 세 번째에는 "글쎄요"라고 말합니다. 설령 경비원 B가 평소에 더 똑똑하더라도, 그의 변덕스러운 태도는 당신이 누구를 믿어야 할지 모르게 만들기 때문에 위험합니다.

연구 결과는 다음과 같았습니다.

  • **오픈 AI (Llama 4)**는 사실 가장 일관적이었습니다. 답변의 품질은 낮았음에도 불구하고 97%의 확률로 동일한 답변을 내놓았습니다.
  • **최고의 상용 AI (GPT 5.5)**는 가장 똑똑했지만(높은 품질), 가끔 모순된 답변을 내놓았습니다. 한 번은 "비밀번호를 변경해야 합니다"라고 했다가, 다음번에는 "당신의 비밀번호는 괜찮습니다"라고 말할 수도 있는 것입니다.

이것이 왜 중요한가

이 논문은 보안의 세계에서는 일관성이 지능만큼이나 중요하다고 주장합니다.

만약 당신이 은행 계좌를 보호하는 방법에 대해 AI에게 묻고 있다면, 물을 때마다 다른 조언을 듣는 상황을 감수할 수 없습니다. 만약 AI가 오늘은 "X를 하라"고 했다가 내일은 "X를 하지 마라"고 한다면, 당신은 혼란에 빠져 결국 아무것도 하지 않게 될 것이고, 결국 당신의 데이터는 무방비 상태로 노출될 것입니다.

결론

이 연구는 실제 사람들이 AI에게 던지는 실제 보안 질문을 살펴본 첫 번째 사례입니다. 연구진은 다음을 발견했습니다.

  1. 사람들은 기초적인 학습부터 시스템 해킹 시도, 혹은 자기 자신을 보호하는 일에 이르기까지 모든 분야에 AI를 사용합니다.
  2. 대형 유료 AI 모델들이 일반적으로 무료 모델들보다 더 나은 조언을 제공합니다.
  3. 하지만, 최고의 AI조차도 때때로 스스로 모순된 말을 할 수 있습니다. 진정으로 신뢰할 수 있는 안전을 위해서는, AI는 똑똑하면서도 꾸준해야 합니다.

연구진은 AI의 답변이 얼마나 좋은지뿐만 아니라 얼마나 일관적인지도 측정해야 한다고 결론짓습니다. 왜냐하면 똑똑하지만 갈팡질팡하는 AI는 당신의 디지털 안전에 있어 여전히 위험 요소가 될 수 있기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →