← 최신 논문
💻 computer science

Detection of the Malicious URL Using the Language Models

이 논문은 악성 URL 내 구절의 의미론적 의미를 포착하기 위해 언어 모델, 특히 BERT를 사용하는 것을 제안하며, 이는 어휘 및 통계적 특징에만 의존하는 전통적인 방식과 비교하여 다중 클래스 분류 정확도를 최대 99.7%까지 크게 향상시켰습니다.

원저자: Samira Shirmohammadi, Amir Jalaly Bidgoly, Sanaz Allami Farsi, Faezeh Alizadeh

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Samira Shirmohammadi, Amir Jalaly Bidgoly, Sanaz Allami Farsi, Faezeh Alizadeh

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷은 현대 생활의 중추 신경계가 되었으며, 조직이 서비스를 제공하고 사람들이 정보를 공유하는 거대한 네트워크입니다. 이러한 주소들은 URL이라고 불리며, 웹상의 특정 페이지를 여는 열쇠와 같습니다. 하지만 물리적인 열쇠가 열려서는 안 될 문을 열기 위해 위조될 수 있는 것처럼, 디지털 링크 또한 속임수를 쓰기 위해 제작될 수 있습니다. 악성 URL은 바로 이러한 위조된 열쇠들입니다. 즉, 사용자를 속여 돈을 훔치거나, 개인 정보를 수집하거나, 기기에 해로운 소프트웨어를 설치하도록 설계된 링크들입니다. 어떤 위협은 명백하지만, 많은 위협은 미묘하며, 안전한 링크와 위험한 링크를 구별하는 것은 일반인에게 종종 어려운 일입니다. 이러한 디지털 함정에 맞서기 위해 보안 전문가들은 오랫동안 알려진 나쁜 링크 목록에 의존해 왔지만, 이 목록들은 이미 목격한 것들만을 막을 수 있습니다. 새로운, 보이지 않는 위협이 나타나면 기존의 목록들은 실패합니다. 이러한 한계는 연구자들이 단순한 체크리스트를 넘어 웹 주소 뒤에 숨겨진 의미를 실제로 이해할 수 있는 시스템으로 나아가, 더 똑똑한 방식으로 위험을 식별하는 방법을 찾도록 이끌었습니다.

최근 한 연구에서 콤(Qom) 대학교와 이슬람 아자드(Islamic Azad) 대학교의 연구진은 컴퓨터에게 단순히 문자의 개수를 세는 것이 아니라 웹 주소 내부의 단어들의 의미를 읽는 법을 가르침으로써 이 과제에 도전했습니다. 수년 동안 자동화된 시스템들은 주소의 형태와 구조를 살피는 방식, 즉 주소의 길이를 측정하거나, 기호의 개수를 세거나, 의심스러운 문자열이 포함되어 있는지 확인하는 방식으로 악성 링크를 포착하려고 시도해 왔습니다. 이러한 방법들은 많은 경우에 잘 작동하지만, 언어의 뉘앙스를 놓칩니다. 악성 링크는 마치 비밀번호를 요구하기 위해 정중한 언어를 사용하는 피싱 이메일처럼, 사기를 암시하는 방식으로 배치된 무해해 보이는 단어들을 사용할 수 있습니다. 연구진은 이러한 정교한 속임수를 잡아내기 위해서 시스템이 단어들 사이의 의미론적 관계, 즉 단어들이 특정 의미를 형성하기 위해 어떻게 결합하는지를 이해해야 한다는 점을 깨달았습니다. 이를 위해 그들은 방대한 양의 텍스트를 학습하여 인간의 언어에서 단어들이 서로 어떻게 연관되는지 이해하도록 훈련된 고급 컴퓨터 프로그램인 언어 모델을 활용했습니다.

연구팀은 어떤 모델이 URL의 의도를 가장 잘 식별할 수 있는지 알아보기 위해 네 가지 유형의 언어 모델을 테스트했습니다. 첫 번째와 두 번째 모델인 Word2vec과 GloVe는 텍스트 내에서 단어가 얼마나 자주 근처에 나타나는지에 따라 단어를 수학적 공간으로 매핑하는 시스템입니다. 이들은 "왕"과 "여왕" 같은 단어가 서로 관련되어 있다는 것을 이해하는 데는 뛰어나지만, 전체 문장의 맥락을 고려하지 않고 각 단어를 고립된 상태로 취급합니다. 세 번째 모델인 LASER는 여러 다른 언어를 동시에 처리하도록 설계되었으며, 문장을 공유 공간으로 매핑하지만, 개별 단어의 세밀한 디테일보다는 문장 전체에 집중합니다. 마지막 모델인 BERT는 더 최근에 등장한 강력한 도구로, 단어의 앞과 뒤에 있는 모든 단어의 맥락 속에서 해당 단어를 살펴봅니다. 이를 통해 문장의 특정 배치에 따라 달라지는 미묘한 의미 차이를 파악할 수 있습니다. 연구진은 이 모델들을 스팸, 피싱, 멀웨어 및 웹사이트 변조용으로 설계된 링크를 포함하여 114,000개가 넘는 웹 주소가 포함된 데이터셋에 적용했습니다.

언어 모델들이 읽을 수 있도록 웹 주소를 만들기 위해, 연구진은 먼저 주소를 더 작은 조각들로 나누는 과정인 토큰화(tokenization)를 수행해야 했습니다. 처음 세 가지 모델의 경우, 슬래시(/)나 물음표(?)와 같은 기호들을 수동으로 제거하여 남은 단어들을 핵심 데이터로 취급했습니다. BERT 모델의 경우, BERT가 기호가 맥락을 어떻게 변화시키는지 이해하도록 설계되었기 때문에, 기호를 의미의 일부로 유지하면서 주소를 하위 단어와 기호로 자동 분할하는 특수 도구를 사용했습니다. 주소가 처리된 후, 모델들은 각 주소에 대한 고유한 수치적 표현을 생성하여 그 의미론적 본질을 포착했습니다. 이러한 표현들은 이후 인간의 뇌에서 영감을 받은 유형의 컴퓨터 프로그램인 신경망으로 전달되어, 패턴을 인식하고 각 URL에 "안전", "스팸" 또는 "피싱"과 같은 레이블을 할당하는 법을 학습했습니다.

실험 결과는 명확한 승자를 보여주었습니다. 모든 언어 모델이 통계적 특징에만 의존했던 기존의 많은 방법보다 우수한 성능을 보였지만, BERT 모델은 눈에 띄게 두드러졌습니다. BERT는 99.71%의 정확도를 달성하며 거의 모든 경우에서 웹 주소의 성격을 정확히 식별해 냈습니다. 다른 모델들도 우수한 성능을 보였는데, GloVe 모델은 98.94%, Word2vec 모델은 98.62%에 도달했지만 BERT의 정밀도에는 미치지 못했습니다. 연구진은 이번 연구에서 가장 낮은 성능을 보인 모델인 LASER조차도 97.46%의 정확도를 달성하며 해당 분야의 기존 기술들을 능가했다고 언급했습니다. 이는 URL의 물리적 구조에서 단어의 의미로 초점을 전환하는 것만으로도 보안 측면에서 상당한 향상을 제공한다는 것을 시사합니다. 이 연구는 단어의 맥락과 관계를 이해하는 모델을 사용함으로써, 컴퓨터가 악성 링크를 나타내는 미묘한 언어적 단서들을 훨씬 더 효과적으로 포착할 수 있음을 입증합니다.

연구진은 자신들의 접근 방식이 컴퓨터 보안의 지속적인 문제에 대한 강력한 해결책을 제공한다고 결론지었습니다. 웹 주소에서 발견되는 단어들의 의미론적 공간을 모델링함으로써, 전통적인 방식으로는 할 수 없었던 방식으로 링크 뒤의 의도를 포착할 수 있었습니다. 특히 BERT 모델의 성공은 깊고 맥락을 인식하는 언어 이해를 사용하는 것의 가치를 강조합니다. 이것이 기존의 방법들이 쓸모없다는 뜻은 아니며, 오히려 그 방법들과 URL의 "의미"를 읽는 능력을 결합하는 것이 훨씬 더 강력한 방어 체계를 만든다는 것입니다. 사이버 범죄자들이 전술을 계속 진화시켜 그들의 악성 링크를 점점 더 합법적인 것처럼 보이게 만듦에 따라, 그들이 사용하는 단어의 맥락을 이해하는 능력은 인터넷을 안전하게 지키기 위한 필수적인 도구가 될 것입니다. 이 연구는 기계에게 행간을 읽는 법을 가르치는 것이 URL 탐지의 미래라는 점을 보여주며 명확한 경로를 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →