← 최신 논문
🤖 AI

Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities

이 논문은 11개의 오픈 웨이트 거대 언어 모델(LLM)이 비정형 연결 자율주행 자동차(CAV) 취약점 설명을 구조화된 STIX 위협 인텔리전스로 자동 변환하는 데 있어 얼마나 효과적인지를 평가하며, 자산과 약점을 식별하는 데 높은 정확도를 입증하는 동시에 복잡한 공격 기법을 매핑하는 과정에서의 과제를 강조한다.

원저자: Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman

게시일 2026-07-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자동차의 세계가 더 이상 금속 바퀴와 가솔린 엔진에 국한되지 않고, 거대한 움직이는 컴퓨터 네트워크가 된 세상을 상상해 보십시오. 현대의 차량들은 센서, 와이파이(Wi-Fi), 그리고 서로 소통하며 외부 세계와 연결되는 복잡한 소프트웨어로 가득 차 있습니다. 하지만 여러분의 스마트폰이나 노트북처럼, 이 소프트웨어에도 버그가 존재합니다. 때때로 이러한 버그는 해커가 자동차를 제어하거나 데이터를 훔치는 데 사용할 수 있는 심각한 보안 구멍이 되기도 합니다. 모두의 안전을 지키기 위해 보안 전문가들은 이러한 구멍을 빠르게 이해해야 합니다. 그러나 이 버그에 관한 정보는 종종 훑어보기 어려운 지저분한 평문 영어 문단으로 작성되어 있습니다. 이를 해결하기 위해 전문가들은 STIX라고 불리는 위협을 위한 특별한 "만능 번역기"를 사용합니다. STIX를 복잡한 이야기를 깔끔한 재료로 나누는 정교한 레시피 카드라고 생각해보십시오. 즉, 누가 공격받았는지, 무엇이 고장 났는지, 어떻게 고장 났는지, 그리고 누가 그것을 고장 냈는지를 정리해 주는 것입니다. 이 논문은 차세대 스마트 AI 컴퓨터로 알려진 **대규모 언어 모델(LLM)**이 이 '번역기' 역할을 수행하여, 지저분한 버그 보고서를 완벽하고 구조화된 위협 레시피로 자동 변환할 수 있는지 탐구합니다.

이 연구를 진행한 연구진인 앨라배마 대학교 팀은 이러한 AI 모델들을 커넥티드 및 자율주행 차량(CAV) 분야에 특화하여 테스트하기로 했습니다. 그들은 오픈 소스 AI 모델(거대 기업의 문 뒤에 갇혀 있는 것이 아니라 누구나 다운로드하여 실행할 수 있는 종류의 모델)이 취약점 보고서를 읽고 즉각적으로 올바른 STIX "레시피 카드"를 생성할 수 있는지 확인하고자 했습니다. 이를 위해 그들은 먼저 자체적인 훈련장을 구축해야 했습니다. 그들은 183개의 실제 자동차 취약점 보고서를 포함하는 CAV-STIXGen이라는 새로운 데이터셋을 만들었습니다. 각 보고서에 대해, 그들은 영향을 받는 특정 자동차 부품, 약점의 유형, 그리고 정확한 해킹 기법을 포함하여 완벽한 STIX 레시피를 수동으로 작성했습니다. 이 데이터셋은 AI 모델을 채점하기 위한 "정답지"가 되었습니다.

연구팀은 작은 규모의 민첩한 모델부터 거대하고 강력한 모델에 이르기까지 11개의 서로 다른 오픈 웨이트(open-weight) AI 모델들을 초대했습니다. 그들은 세 가지 다른 "교육 스타일"(또는 프롬프팅 전략)을 사용하여 이 모델들을 테스트했습니다. 첫 번째 스타일은 컨텍스트가 없는(Contextless) 방식으로, AI에게 버그 보고서만 제공하고 나머지는 추측하게 하는 방식입니다. 두 번째는 **STIX 가이드형(STIX-guided)**으로, AI에게 찾아야 할 항목의 체크리스트를 제공하는 방식입니다. 세 번째는 가장 도움이 되는 접근법인 **다이내믹 퓨샷(Dynamic Few-Shot)**으로, AI가 새로운 문제를 시도하기 전에 다섯 개의 완벽한 정답 예시를 보여주는 방식입니다. 또한 그들은 두 개의 서로 다른 AI 모델이 탐정 팀처럼 협력하여, 한 모델은 부품을 찾는 데 집중하고 다른 모델은 점들을 연결하는 데 집중하는 "멀티 에이전트" 설정도 테스트했습니다.

결과는 "놀라움"과 "아직은 미흡함"이 섞여 있었습니다. 단순히 객체(특정 자동차 부품이나 취약점 유형을 명명하는 것)를 식별하는 데 있어서, AI 모델들은 놀라울 정도로 뛰어났습니다. 가장 좋은 교육 스타일(Dynamic Few-Shot) 하에서 상위 모델들은 1.0 만점에 0.94의 점수를 기록했는데, 이는 모델들이 재료를 포착하는 데 거의 완벽했다는 것을 의미합니다. 그들은 또한 약점 유형(특정 코딩 오류 등)을 식별하는 데에도 탁월하여 0.99의 점수를 받았습니다. 그러나 AI는 관계(relationships), 즉 하나의 부품이 논리적 사슬 속에서 다른 부품과 정확히 어떻게 연결되는지를 파악하는 데 어려움을 겪었습니다. 이 작업에서 가장 우수한 모델조차 겨우 0.63의 점수를 기록했습니다. 이는 마치 AI가 케이크의 재료 목록은 완벽하게 나열할 수 있지만, 달걀이 반죽 위에 놓이는 것이 아니라 반죽 안에 들어가야 한다는 사실은 가끔 잊어버리는 것과 같습니다.

가장 복복잡한 작업은 알려진 해커의 움직임 라이브러리인 MITRE ATT&CK 기법에 취약점을 매핑하는 것이었습니다. 이 작업은 여전히 가장 어려운 과제로 남았습니다. 모델들이 종종 적어도 하나 이상의 올바른 해킹 기법을 찾아낼 수는 있었지만(하나를 찾는 데 최대 0.68 점), 단일 버그가 여러 공격 방법을 포함하는 경우 전체적인 그림을 놓치는 경우가 빈번했습니다. 연구진은 두 명의 AI 에이전트가 업무를 분담하는 것이 객체를 찾는 데는 도움이 되었지만, 관계 문제를 일관되게 해결하지는 못했다는 것을 발견했습니다.

수집된 데이터를 분석함으로써, 연구팀은 자동차 해커들이 작동하는 방식에 있어 반복되는 패턴을 발견했습니다. 그들은 자동차의 가장 흔한 약점이 메모리 안전 문제(데이터를 있어서는 안 될 곳에 쓰는 것 등)와 부적절한 접근 제어(들어오면 안 되는 사람을 허용하는 것)와 관련이 있다는 것을 발견했습니다. 가장 빈번한 해킹 기법은 서비스 거부(denial of service)(시스템 과부하 유발)와 클라이언트 측 소프트웨어 악용이었습니다. 데이터는 이러한 공격이 클라이언트 프로그램을 악용하고 나서 시스템 충돌을 일으키는 것과 같이 쌍으로 발생하는 경우가 많음을 시사합니다.

요약하자면, 이 논문은 AI가 자동차 보안 분석을 자동화하는 강력한 도구가 되고 있지만, 아직 "설치하고 잊어버려도 되는(set it and forget it)" 솔루션은 아니라는 점을 시사합니다. AI는 퍼즐 조각을 찾아내는 데는 환상적인 일을 할 수 있지만, 그 조각들이 완벽하게 맞물리도록 하기 위해서는 여전히 인간의 지도와 더 나은 예시가 필요합니다. 연구진은 이 새로운 데이터셋을 제공하고 AI가 성공하는 부분과 실패하는 부분을 보여줌으로써, 보안 팀이 미래의 자율주행 차량을 디지털 위협으로부터 안전하게 지킬 수 있는 더 나은 도구를 구축할 수 있기를 희망합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →