← 최신 논문
💻 computer science

Leveraging Large Language Models for Trustworthiness Assessment of Web Applications

이 논문은 대규모 언어 모델 (LLM) 을 활용하여 웹 애플리케이션의 보안 코딩 관행 준수를 자동화하고, 이를 계층적 품질 모델에 통합하여 확장 가능한 신뢰성 평가 점수를 산출하는 실증적 방법론을 제시합니다.

원저자: Oleksandr Yarotskyi, José D'Abruzzo Pereira, João R. Campos

게시일 2026-03-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Oleksandr Yarotskyi, José D'Abruzzo Pereira, João R. Campos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"웹사이트가 정말 안전한지, 우리가 믿고 사용해도 좋은지 (신뢰성)"**를 인공지능 (LLM) 을 이용해 자동으로 검사하는 방법에 대한 연구입니다.

기존의 보안 검사 방식은 마치 **"도둑이 이미 들어온 흔적 (취약점) 만 찾는 것"**에 비유할 수 있습니다. 하지만 도둑이 아직 들어오지 않았더라도, 집의 문이 제대로 잠겨 있지 않다면 (보안 코딩 관행 미준수) 언제든 위험할 수 있습니다. 이 연구는 **"문이 제대로 잠겨 있는지, 창문은 잘 닫혀 있는지"**를 인공지능이 대신 확인해 주는 시스템을 제안합니다.

이 논문의 핵심 내용을 일상적인 비유로 설명해 드리겠습니다.


1. 문제: 왜 사람이 직접 확인하기 어려운가?

웹사이트를 만드는 것은 거대한 건물을 짓는 것과 같습니다. 건물이 안전한지 확인하려면 모든 문, 창문, 잠금장치를 전문가가 하나하나 직접 확인해야 합니다.

  • 현실: 전문가 (보안 전문가) 는 몇 명 안 되고, 건물이 너무 크고 복잡합니다. 사람이 일일이 확인하는 것은 시간이 너무 오래 걸리고, 비용이 많이 들며, 실수할 수도 있습니다.
  • 해결책: 그래서 연구자들은 **"지식과 경험을 가진 똑똑한 AI(대형 언어 모델, LLM)"**를 고용해서 코드를 대신 읽어보게 하기로 했습니다.

2. 실험: AI 에게 어떻게 질문해야 잘 할까? (프롬프트 공학)

연구진은 AI 에게 코드를 분석하게 할 때, 질문하는 방식 (프롬프트) 에 따라 결과가 천차만별임을 발견했습니다. 마치 학생에게 시험을 보게 할 때, 문제지 설명을 어떻게 하느냐에 따라 성적이 달라지는 것과 같습니다.

연구진은 5 가지 다른 AI 모델에게 4 가지 다른 방식으로 질문했습니다.

  • 방법 1 (기본 질문): "이 코드가 안전한가?"라고만 물었습니다.
    • 결과: AI 가 아는 지식만으로는 부족해서, 복잡한 상황에서는 헷갈려 했습니다.
  • 방법 2 (나쁜 예시 보여주기): "이런 나쁜 코드는 해킹당할 수 있어. 이걸 참고해서 봐."라고 나쁜 예시를 보여주었습니다.
    • 결과: 아주 똑똑한 AI 는 잘 따라했지만, 덜 똑똑한 AI 는 오히려 정보 과부하로 혼란스러워졌습니다.
  • 방법 3 (주변 코드까지 보여주기): "이 함수가 다른 함수를 부르는 코드까지 다 보여줄게."라고 주변 맥락까지 모두 주었습니다.
    • 결과: 가장 안 좋은 방법 중 하나였습니다. 정보가 너무 많아서 AI 가 핵심을 놓치고 소음 (Noise) 에 휩쓸렸습니다. (너무 많은 정보를 주면 오히려 집중력이 떨어지는 것과 같습니다.)
  • 방법 4 (명확한 규칙 제시): "문제가 있으면 '아니오', 없으면 '예'라고 답해. 그리고 이런 조건이 충족되면 '안전'이라고 해."라고 **명확한 규칙 (If-Then)**을 정해주었습니다.
    • 결과: 가장 성공적이었습니다. 특히 덜 똑똑한 AI 들도 규칙만 명확하면 아주 잘 따라했습니다.

3. 결론: 신뢰점수 (Trustworthiness Score) 는 어떻게 매길까?

AI 가 "이 코드는 안전해"라고 말한다고 해서 바로 믿을 수는 없습니다. 그래서 연구진은 **"점수판 (Quality Model)"**을 만들었습니다.

  • 비유: 건물의 안전도를 점수화할 때, "문 하나만 잠겨 있어도 100 점"이 아니라, "모든 문, 창문, 소화기가 다 있어야 100 점"이라는 엄격한 규칙을 적용했습니다.
  • 결과:
    • AI 가 직접 "이건 80 점이야"라고 점수를 매기게 하면, AI 가 망상 (Hallucination) 을 일으켜 점수가 들쑥날쑥했습니다.
    • 하지만 **AI 가 "문은 잠겼음 (O), 창문은 안 잠김 (X)" 같은 사실만 보고, 사람이 만든 점수 계산 공식 (LSP)**에 넣으면, 매우 정확하고 일관된 점수가 나왔습니다.

4. 핵심 교훈 (Takeaway)

이 연구는 우리에게 다음과 같은 중요한 교훈을 줍니다.

  1. AI 는 만능이 아니다: AI 에게 모든 것을 맡기면 (특히 복잡한 맥락까지 주면) 오히려 엉뚱한 답을 할 수 있습니다.
  2. 규칙이 중요하다: AI 에게는 "자유롭게 생각하라"기보다 **"명확한 규칙을 따라라"**라고 지시하는 것이 훨씬 효과적입니다.
  3. AI 는 보조 도구일 뿐: AI 가 코드를 읽고 "여기에 문제가 있다"고 찾아내는 역할은 훌륭하지만, 최종적인 안전 점수는 사람이 만든 논리적인 공식을 통해 계산해야 신뢰할 수 있습니다.

요약

이 논문은 **"AI 를 고용해서 웹사이트 보안 점검을 자동화하자"**는 아이디어를 검증했습니다. 그 결과, **"AI 에게는 명확한 규칙을 주고, 사람이 만든 점수 계산기에 그 결과를 넣으면, 기존에 사람이 하던 수천 시간의 작업을 몇 초 만에 정확하게 대체할 수 있다"**는 것을 증명했습니다.

이는 앞으로 소프트웨어 개발 과정에서 보안 점검이 훨씬 빠르고 저렴해지며, 우리가 사용하는 웹사이트들이 더 안전해질 수 있음을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →