← 최신 논문
💬 NLP

Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse

본 연구는 LLM 기반의 공적 담론 입지 분석에서 집계된 감성 비율은 서로 다른 전처리 파이프라인에 걸쳐 안정적으로 유지되지만, 정서적 가치와 인식적 양태 사이의 결합에 관한 구체적인 결론은 저표본 화자에게 발생하는 파이프라인 변동에 매우 민감하며, 더욱 중요하게는 LLM과 키워드-어휘 사전 측정 방식 간의 체계적 불일치에 매우 민감하다는 것을 입증한다.

원저자: Bo Chen

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bo Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 유명한 인물의 실제 감정과 그들이 자신의 말에 대해 얼마나 확신을 가지고 있는지를 파악하려는 탐정이라고 상상해 보십시오. 당신 앞에는 거대한 유튜브 인터뷰 영상 더미가 쌓여 있습니다. 하지만 조사를 시작하기 전에, 당신은 원본 영상을 세 가지 작업을 수행하는 기계에 통과시켜야 합니다. 바로 오디오를 듣고, 누가 말하고 있는지(게스트인지 인터뷰어인지)를 파악하며, 대화를 문장 단위로 자르는 일입니다.

이 논문은 단순하지만 까다로운 질문을 던집니다. "기계를 어떻게 설정하느냐에 따라 최종 판결이 달라지는가?"

연구진은 Bo Chen의 주도하에 금융, 정치, 미디어 분야의 유명인 41명을 다룬 256개의 유튜브 인터뷰를 대상으로 대규모 실험을 설계했습니다. 그들은 이 영상들을 두 가지 서로 다른 "기계"(전처리 파이프라인)에 통과시켰고, 그 후 텍스트를 분석하기 위해 두 가지 서로 다른 "탐정"(측정 방법)을 사용했습니다.

두 가지 기계: "복사해서 붙여넣기" vs "오디오 귀"

첫 번째 기계를 **텍est-Only 탐정(텍스트 전용 탐정)**이라고 생각해 보십시오. 이 기계는 유튜브의 자동 생성 자막을 가져와서 정리하고, 단어를 바탕으로 누가 말하고 있는지 추측합니다. 빠르긴 하지만, 유튜브 자막의 지저분한 방식 때문에 혼란을 겪기도 합니다.

두 번째 기계는 **Audio-Only 탐정(오디오 전용 탐정)**입니다. 이 기계는 실제 음파를 듣고, 목소리를 식별하며, 무엇이 말해졌는지를 받아 적습니다. 이는 더 비용이 많이 들고 고도의 기술이 필요한 접근 방식입니다.

연구진은 텍스트 전용 탐정에서 오디오 전용 탐정으로 교체했을 때, 화자에 대해 들려주는 이야기가 바뀌는지 확인하고 싶었습니다.

두 가지 탐정: "AI 뇌" vs "단어 목록"

텍스트가 준비되면, 두 가지를 측정해야 했습니다.

  1. 가치(Valence): 화자가 행복한가(긍정적) 아니면 슬프거나 화가 났는가(부정적)?
  2. 양식(Modality): 화자가 매우 자신만만한가(강조) 아니면 불확실한가(망설임)?

이를 측정하기 위해 두 가지 도구를 사용했습니다.

  • AI 뇌 (LLM): 텍스트를 읽고 화자의 감정과 자신감에 대한 보고서를 작성하는 강력한 인공지능입니다.
  • 단어 목록 (키워드 사전): 특정 "화난" 단어나 "자신감 있는" 단어가 몇 번 등장하는지를 단순히 세는 엄격한 규칙 책입니다.

거대한 반전: 기계는 생각보다 중요하지 않다 (어떤 경우에는)

여기 첫 번째 반전이 있습니다. 연구진은 영상을 어떻게 자르느냐가 매우 중요하지만, 이는 처음에 가진 영상의 양이 충분하지 않을 때만 그렇다는 것을 발견했습니다.

만약 어떤 유명인의 영상이 아주 적다면(5개 이하), 결과는 완전히 엉망이 됩니다. 텍스트 전용 탐정에서 오디오 전용 탐정으로 바꾸는 것만으로도 결과가 완전히 뒤집힐 수 있으며, "자신감 있는" 화자를 "망설이는" 화자로 바꿀 수도 있습니다. 이는 마치 구름 한 점을 보고 날씨를 예측하려는 것과 같습니다. 그저 너무 많은 노이즈일 뿐입니다.

하지만 화자의 영상이 많다면(16개 이상), 기계의 선택은 거의 중요하지 않습니다. 연구에서 가장 잘 샘플링된 4명의 스타의 경우, 기계를 바꾸더라도 결과의 변화는 미미했습니다(평균 변화량 0.13). 어떤 기계를 사용하든 이야기는 동일하게 유지되었습니다.

진짜 악당: 탐정의 선택

여기서 플롯이 더욱 복잡해집니다. 기계(전처리)는 잘 샘플링된 스타들에게 큰 영향을 미치지 않았지만, 탐정(측정 방법)은 결정적인 영향을 미쳤습니다.

연구진은 AI 뇌단어 목록이 정확히 같은 텍스트를 읽고 있음에도 불구하고, 종종 동일한 인물에 대해 완전히 상반된 이야기를 한다는 것을 발견했습니다.

  • 거의 **49%**의 사례에서, 두 탐정은 화자가 자신감이 있는지 아니면 망설이고 있는지에 대해 의견이 일치하지 않았습니다.
  • 경제학자 켄 로고프(Ken Rogoff)처럼 영상이 많은 매우 유명한 화자의 경우에도, AI는 한 가지를 말하고 단어 목록은 정반대의 말을 했습니다.

이는 불안정성의 가장 큰 원인이 데이터를 어떻게 정제하느냐가 아니라, 어떤 도구를 사용하여 분석하느냐에 있다는 것을 시사합니다. 한 도구는 화자를 "화나 있고 확신에 찬" 상태로 보는 반면, 다른 도구는 "차분하고 불확실한" 상태로 볼 수 있습니다.

안전의 환상

당신은 이렇게 생각할지도 모릅니다. "음, 아마 모든 사람의 평균을 보면 다 균형이 맞지 않을까?" 연구진은 이를 확인했고, 대답은 단호하게 "아니오"였습니다.

그들은 만약 모든 영상에 걸친 부정적인 단어의 총 비율을 본다면, 수치가 매우 안정적으로 보인다는 것을 발견했습니다. 어떤 기계나 어떤 탐정을 사용하더라도, "나쁜 단어"의 총 개수는 거의 변하지 않았습니다(변화 폭 6 퍼센트 포인트 미만).

하지만 이 안정성은 함정입니다. 이것은 개별 화자에 대해서는 결과가 완전히 다르다는 사실을 숨깁니다. 마치 수학 천재와 시험을 망친 학생이 서로 상쇄되어 학급 전체가 "평균적"이라고 말하는 것과 같습니다. 한 학생은 고군분투하고 있고 다른 학생은 번창하고 있다는 사실을 놓치게 되는 것입니다.

시사점

이 논문은 공적 담론을 연구하는 모든 이들에게 경고를 남기며 결론을 맺습니다. 단 하나의 설정만을 신뢰하지 마십시오.

  1. 표본 크기를 확인하십시오: 영상이 몇 개 없다면, 당신의 결과는 무엇을 하든 신뢰할 수 없을 가능성이 높습니다.
  2. 단 하나의 탐정에만 의존하지 마십시오: 만약 당신의 AI 도구와 단어 세기 도구가 서로 의견이 다르다면, 아직 진실을 찾은 것이 아닙니다. 당신의 조사 결과를 발표하기 전에 그들이 일치하는지 반드시 확인해야 합니다.
  3. 노이즈를 분리하십시오: 당신의 결과가 변하는 이유가 기계(전처리) 때문인지, 아니면 도구(측정) 때문인지 파악해야 합니다.

요약하자면, 데이터를 준비하는 방식도 중요하지만, 그것을 측정하는 도구가 훨씬 더 중요합니다. 그리고 만약 큰 평균값만을 보고 있다면, 당신은 전체 이야기를 놓치고 있는 것일지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →