← 최신 논문
🤖 AI

A Framework for Using and Evaluating LLMs as Surrogate Experts in Security Surveys: Reliability, Bias, and Implications

이 논문은 거대언어모델(LLM)이 보안 설문조사를 위한 일관된 합성 응답을 생성할 수는 있지만, 실제 전문가의 엘리시테이션(elicitation)을 대체하기에는 불충분하며 파일럿 테스트 및 가설 생성에는 적합한 체계적 편향과 균질성을 보인다는 점을 입증하는 프레임워크를 제시한다.

원저자: Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사이버 보안의 고위험 세계에서 인간 전문가가 어떻게 생각하는지를 이해하는 것은 매우 중요합니다. 보안 사고가 발생했을 때, 보안 운영 센터(SOC) 분석가들이 내리는 결정은 위협이 차단될지 아니면 네트워크 전체로 확산될지를 결정할 수 있습니다. 이러한 의사결정 과정을 이해하기 위해 연구자들은 종-종 전문가들을 대상으로 설문조사와 인터뷰에 의존합니다. 하지만 전문가들이 설문에 응답하도록 유도하는 것은 매우 어려운 일입니다. 이 전문가들은 끊임나는 경고와 번아웃의 위협을 다루며 과중한 업무에 시달리고 있으며, 많은 이들이 일상적인 업무에 대한 세부 사항을 공유하는 것을 제한하는 엄격한 비밀 유지 규정 아래에서 근무하고 있습니다. 그 결과, 연구들은 작은 표본 크기로 인해 어려움을 겪으며, 이는 연구자들에게 산업에 대한 불완전한 그림만을 남기게 됩니다.

최근, 이러한 부족 문제를 해결할 수 있다고 약속하는 새로운 도구가 등장했습니다. 바로 거대 언어 모델(LLM)입니다. 이들은 방대한 양의 인간 저술 데이터를 학습하여 사람처럼 들리는 텍스트를 생성할 수 있는 고급 컴퓨터 프로그램입니다. 일부 연구자들은 이 인공지능이 실제 전문가의 대역 역할을 수행하여, 수천 개의 합성 응답을 생성함으로써 설문 데이터의 공백을 메울 수 있을지 궁금해하기 시작했습니다. 이 아이디어는 매력적입니다. 만약 컴퓨터가 전문가를 모방할 수 있다면, 과학자들은 바쁜 인간을 추적할 필요 없이 질문을 테스트하고, 다양한 시나리오를 탐색하며, 데이터를 수집할 수 있기 때문입니다. 그러나 결정적인 질문이 남아 있습니다. 기계가 진정으로 보안 전문가처럼 생각할 수 있을까요, 아니면 단지 실제 인간 경험의 미묘한 차이를 놓친 채 그럴듯한 흉내만을 내는 것일까요?

한 연구팀은 이러한 모델들이 보안 설문조사에서 인간 전문가를 신뢰할 수 있는 대체제로 기능할 수 있는지 테스트하기 위한 엄격한 프레임워크를 구축함으로써 이 질문에 답하고자 했습니다. 그들은 단순히 모델에게 몇 가지 질문을 던지고 결과를 지켜본 것이 아닙니다. 대신, 컴퓨터가 생성한 답변이 정밀한 검토를 견뎌낼 수 있는지 확인하기 위해 종합적인 실험을 설계했습니다. 연구진은 의료에서 금융에 이르기까지 다양한 분야에서 근무하는 6명의 사이버 보안 전문가로부터 실제 설문 데이터를 수収集했습니다. 이 전문가들은 다양한 수준의 경험을 가지고 있었으며, 관리자, 분석가, 전문가 등 서로 다른 역할을 맡고 있었습니다. 그런 다음 연구진은 6개의 서로 다른 거대 언어 모델에게 이 특정 전문가들을 시뮬레이션하도록 요청하여, 실제 인물의 배경과 직함에 부합하는 디지털 페르소나를 생성했습니다.

실험은 모델을 모든 각도에서 테스트하기 위해 세 가지 뚜렷한 방식으로 진행되었습니다. 첫째, 연구진은 모델에게 개별 전문가로서 행동하도록 요청하여 실제 인간의 구체적인 의견을 복제하려고 시도했습니다. 둘째, 모델에게 전체 집단의 전반적인 패턴을 생성하도록 요청하여 대규모 설문의 집계된 결과를 시뮬레이션했습니다. 마지막으로, 연구진은 모델이 수년간의 실제 데이터에 따라 전문가의 의견이 어떻게 변화했는지 예측하도록 하여 시간의 흐름에 따른 테스트를 수행했습니다. 이 과정 전반에 걸쳐 연구진은 각 시뮬레이션을 여러 번 실행하여, 동일한 질문을 반복해서 물었을 때 모델이 동일한 답변을 내놓는지 확인하며 일관성과 안정성을 점검했습니다.

결과는 인공 시뮬레이션과 인간의 현실 사이에 명확하고 유의미한 격차가 있음을 드러냈습니다. 거대 언어 모델은 스스로에게는 매우 일관적이었지만—동일한 질문을 여러 번 했을 때 종종 같은 답변을 내놓았지만—인간 사고의 진정한 다양성을 포착하는 데는 실패했습니다. 실제 보안 전문가들은 폭넓은 의견을 보여주었습니다. 어떤 이들은 자신의 선택에 확신을 가졌고, 어떤 이들은 불확로를 느꼈으며, 그들의 답변은 각자의 구체적인 경험과 직업 현장의 독특한 압박에 따라 달라졌습니다. 반면, 모델들은 하나의 안전한 중간 지점으로 수렴하는 경향을 보였습니다. 모델들은 인간 전문가들에게 자연스러운 의견 차이와 불확실성을 매끄럽게 다듬어 버렸으며, 너무 획일적이고 지나치게 예의 바른 응답을 만들어냈습니다.

연구진이 모델의 답변 분포를 실제 데이터와 비교했을 때, 모델은 데이터의 일반적인 형태는 제대로 파악하는 것처럼 보였으나 세부 사항은 놓치고 있었습니다. 모델은 극단적이거나 드문 의견을 피하는 경향이 있었으며, 응답을 평균 주변으로 밀집시켰습니다. 이러한 "중심 경향성 편향(central tendency bias)"은 모델이 그럴듯해 보이는 설문 결과를 생성할 수는 있지만, 실질적으로 인간 전문가를 가치 있게 만드는 바로 그 변동성을 지워버린다는 것을 의미했습니다. 예를 들어, 새로운 도구 도입의 어려움에 대해 질문했을 때, 실제 전문가들은 구체적이고 거친 운영상의 장애물을 강조한 반면, 모델은 실제 현장의 질감이 결여된 일반적이고 교과서적인 어려움을 제시했습니다.

연구는 또한 이 모델들이 산업의 변화를 추적할 수 있는지 조사했습니다. 연구진은 모델들이 시간에 따른 변화에 무감각하다는 사실을 발견했습니다. 서로 다른 연도의 응답을 시뮬레이션하도록 요청했음에도 불구하고, 모델은 변화하는 사이버 보안 위협과 관행을 반영하지 못한 채 동일하고 정적인 패턴을 생성했습니다. 이는 모델이 인간 전문가처럼 새로운 정보에 따라 실제로 "학습"하거나 적응하는 것이 아니라, 고정된 개념의 집합을 회상하고 있음을 시사합니다. 이러한 시간적 인식의 결여는 모델이 미래에 전문가의 의견이 어떻게 변할지 예측하거나 과거의 트렌드를 정확하게 반영하는 데 신뢰할 수 없음을 의미합니다.

궁극적으로 연구진은 거대 언어 모델이 강력한 도구이기는 하지만, 보안 연구에서 인간 전문가를 대체할 준비가 되지 않았다고 결론지었습니다. 모델은 연구의 초기 단계, 즉 연구자가 설문 질문을 초안하거나 질문이 명확한지 테스트하거나, 탐색할 가상의 시나리오를 생성하는 데 도움을 주는 용도로는 매우 훌륭합니다. 모델은 아이디어를 위한 유용한 조언자 역할을 할 수 있습니다. 그러나 실제 전문가의 의견 수집을 대체하는 데 사용되어서는 안 됩니다. 인간 판단의 독특하고 다양하며 때로는 모순적인 본질은 알고리즘에 의해 합성될 수 없는 것입니다. 사이버 보안의 실제 세계를 이해하기 위해서, 연구자들은 여로 여전히 그 안에서 살아가고 일하는 인간의 복잡하고 가치 있는 통찰력에 의존해야 합니다. 이 연구는 기술을 수용하는 과정에서 보안의 토대인 인간의 전문성을 놓치지 않도록 돕는 중요한 지침이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →