← 최신 논문
💬 NLP

LaMSUM: Amplifying Voices Against Harassment through LLM Guided Extractive Summarization of User Incident Reports

이 논문은 대규모 언어 모델 (LLM) 의 제한된 컨텍스트 창과 추상적 요약의 한계를 극복하고, 다양한 코드혼합 언어로 작성된 성희롱 신고 건에 대한 효과적인 추출형 요약을 제공하기 위해 다중 투표 방식을 결합한 새로운 프레임워크 'LaMSUM'을 제안하고 검증합니다.

원저자: Garima Chhikara, Anurag Sharma, V. Gurucharan, Kripabandhu Ghosh, Abhijnan Chakraborty

게시일 2026-04-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Garima Chhikara, Anurag Sharma, V. Gurucharan, Kripabandhu Ghosh, Abhijnan Chakraborty

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제 상황: "소금밭에서 진주 찾기"

상상해 보세요. 성희롱 신고 플랫폼에는 매일 수천, 수만 개의 글이 올라옵니다.

  • 상황: 한 도시의 경찰서나 관련 기관이 이 모든 글을 하나하나 다 읽어서 "어떤 문제가 가장 심각한가?"를 파악하려고 합니다.
  • 문제: 글의 양이 너무 많고, 언어도 섞여 있어 (한글과 영어가 섞인 힝글리시 등) 사람이 다 읽는 건 불가능합니다. 마치 거대한 소금밭에서 진주 몇 알을 찾아야 하는 상황과 같습니다.

기존의 요약 프로그램들은 이 글을 읽어서 내용을 재구성 (예: "어떤 사건이 발생했습니다"라고 새로 씀) 하는 경우가 많았습니다. 하지만 피해자들의 원문 그대로의 말이 가장 중요하기 때문에, 내용을 바꾸지 않고 가장 중요한 문장들을 뽑아내는 (추출형 요약) 기술이 필요했습니다.

2. 해결책: "LaMSUM"이라는 새로운 팀

저자들은 **LLM(거대 언어 모델)**이라는 똑똑한 AI 를 사용하려고 했지만, 두 가지 큰 걸림돌이 있었습니다.

  1. AI 의 버릇: AI 는 원래 내용을 바꾸어 말하길 좋아합니다. (재구성) 하지만 우리는 원문을 그대로 뽑아내야 합니다.
  2. 기억력 부족: AI 는 한 번에 읽을 수 있는 글의 양 (컨텍스트 윈도우) 이 정해져 있습니다. 수만 개의 글을 한 번에 넣으면 기억을 못 합니다.

이를 해결하기 위해 LaMSUM을 만들었습니다.

3. LaMSUM 의 작동 원리: "투표로 진주 고르기"

LaMSUM 은 세 가지 단계로 작동합니다.

① 조각 내기 (다단계 요약)

수만 개의 글을 한 번에 읽을 수 없으니, **조각조각 (Chunk)**으로 나눕니다.

  • 비유: 거대한 책상을 청소할 때, 한 번에 다 치우지 않고 작은 구역을 나누어 청소하는 것과 같습니다.

② 뒤섞기 (위치 편향 해결)

AI 는 글의 맨 앞이나 맨 뒤에 있는 문장을 더 중요하게 생각하는 버릇 (위치 편향) 이 있습니다.

  • 해결: LaMSUM 은 각 조각 안의 글들을 무작위로 섞어서 (Shuffle) AI 에게 여러 번 읽힙니다.
  • 비유: 시험 문제를 풀 때, "정답이 항상 1 번에 있나?"라고 의심하며 문제를 뒤집어서 여러 번 보는 것과 같습니다. 이렇게 하면 AI 가 글의 위치가 아닌 실제 내용의 중요성을 더 잘 파악하게 됩니다.

③ 투표하기 (소셜 선택 이론)

AI 가 섞인 글들을 여러 번 읽어서 "이 문장이 중요해!"라고 추천한 목록을 모읍니다. 이제 이 추천 목록을 바탕으로 투표를 합니다.

  • 방법: 여러 AI 가 추천한 문장들을 모아, 비례 대표 투표 (Proportional Approval Voting) 방식을 씁니다.
  • 비유:
    • 단순히 "가장 많이 추천된 글"만 고르면, 비슷한 내용이 반복될 수 있습니다. (예: "A 라는 사람이 괴롭힘을 당했다"는 글이 100 번 추천되면, 그 100 개만 뽑히게 됨)
    • LaMSUM 의 투표 방식은 **"다양성"**을 중요하게 여깁니다. "A 라는 사건"도 중요하지만, "B 라는 다른 유형의 사건"도 적당히 뽑아서 한눈에 전체 상황을 볼 수 있는 균형 잡힌 요약을 만듭니다.
    • 마치 편집장이 여러 기자들의 취재 기사를 받아, "이건 너무 반복되네, 저건 중요한데 아직 안 나왔네"라고 생각하며 최고의 뉴스 기사 50 개를 골라내는 것과 같습니다.

4. 왜 이 기술이 특별한가요?

  • 원문 보존: AI 가 내용을 임의로 바꾸지 않고, 피해자가 쓴 원래 말을 그대로 뽑아냅니다. 이는 사건의 진실을 왜곡하지 않기 위해 매우 중요합니다.
  • 대량 처리: 수천 개의 글도 AI 의 기억력 한계를 우회하며 처리할 수 있습니다.
  • 성공적인 결과: 실험 결과, LaMSUM 은 기존 최고의 요약 기술들보다 더 정확하고, 더 다양하며, 더 상세한 내용을 뽑아냈습니다.

5. 결론: "안전한 도시를 위한 나침반"

이 기술은 단순히 글을 줄이는 것을 넘어, 성희롱 신고 플랫폼에서 발생하는 수많은 사건들을 한눈에 파악할 수 있게 해줍니다.

  • 시민과 기관에게: "어디서 어떤 일이 자주 일어나는지"를 빠르게 파악하여, 예방 정책을 세우거나 안전 조치를 취하는 데 도움을 줍니다.
  • 핵심 메시지: LaMSUM 은 AI 의 약점 (기억력 부족, 버릇) 을 투표 시스템다단계 처리로 보완하여, 피해자들의 목소리를 가장 정확하게 전달하는 나침반 역할을 합니다.

이 기술이 널리 쓰인다면, Authorities(당국) 는 방대한 데이터에 압도되지 않고, 실제로 도움이 필요한 사건들에 집중하여 더 안전하고 공정한 사회를 만드는 데 기여할 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →