정치 캠페인에서 중요한 것은 '누가' 사진에 나오느냐입니다. 당 (Party) 전체를 보여주는 것보다, 당의 대표 주자 (후보) 가 혼자 나오거나 소수만 나오는 사진이 더 많은 관심을 받습니다. 이를 **'집중된 가시성 (Concentrated Visibility)'**이라고 합니다.
하지만 인스타그램에는 수백만 장의 사진과 24 시간 후 사라지는 '스토리 (Stories)'가 넘쳐납니다. 사람이 일일이 "이건 아민 라슈체트야, 저건 3 명이네"라고 세는 건 불가능에 가깝죠. 그래서 연구진은 컴퓨터가 대신 세어주게 하려고 했습니다.
2. AI 대결: "전문가 vs 만능 천재"
연구진은 두 가지 종류의 AI 를 시켜서 누가 더 잘하는지 경기를 시켰습니다.
선수 A (전통적 컴퓨터 비전 모델):
역할: 오직 '얼굴'만 보는 전문 감시관입니다.
특징: 얼굴의 눈, 코, 입 위치를 수학적으로 계산해서 "이건 아민 라슈체트다"라고 맞춥니다.
약점: 마스크를 쓰거나, 멀리서 찍히거나, 배경에 다른 얼굴이 많으면 헷갈려서 실수를 많이 합니다. 마치 눈이 나쁜 감시관이 복잡한 장면을 보며 혼란을 겪는 것과 같습니다.
선수 B (GPT-4o, 멀티모달 LLM):
역할: 사진 전체를 보고 문맥을 이해하는 만능 천재입니다.
특징: "이 사진에 아민 라슈체트가 명확하게 보이나요?"라고 질문 (프롬프트) 을 던지면, 배경의 잡동사니를 무시하고 핵심 인물을 파악합니다.
결과:압도적인 승리! GPT-4o 는 마스크를 쓴 얼굴도, 멀리서 찍힌 얼굴도 잘 알아냈고, 배경에 있는 사람까지 세는 실수를 하지 않았습니다.
🏆 비유하자면:
선수 A는 '얼굴 인식 카메라'처럼 작동해서, 카메라에 찍힌 모든 얼굴을 기계적으로 세다가 실수합니다.
선수 B는 '현명한 사진 비평가'처럼 작동해서, "이 사진의 주인공은 누구고, 주변에 몇 명이 있겠지?"라고 생각하며 답을 냅니다.
3. 발견된 진실: "스토리 vs 게시물"의 다른 전략
AI 가 분석한 결과, 독일 정치인들은 인스타그램의 두 가지 기능 (영구 게시물 vs 24 시간 스토리) 을 다르게 사용했습니다.
후보 개인 계정 (스타의 무대):
스토리: 마치 일기장처럼, 후보가 혼자 있거나 친근한 모습으로 등장하는 경우가 많았습니다. "나를 봐줘!"라는 개인 브랜딩 전략을 썼습니다.
게시물: 조금 더 공식적인 모습도 보였지만, 여전히 후보 개인이 주인공이었습니다.
정당 계정 (당사의 무대):
스토리: 의외로 후보가 거의 안 나왔습니다. 당의 행사나 단체 사진 위주였습니다. 마치 회사의 공식 뉴스레터처럼 당 전체를 강조했습니다.
게시물: 후보가 나오는 비율이 스토리보다 훨씬 높았습니다.
💡 핵심 교훈: 정치인들은 스토리에서는 "친근한 나"를 보여주고, 게시물에서는 "공식적인 나"를 보여주려 노력합니다. 하지만 정당 계정은 스토리에서 후보를 잘 활용하지 못해, 젊은 유권자들의 기대 (친근한 뒷이야기 등) 를 충족시키지 못했다는 점이 드러났습니다.
📝 한 줄 요약
"이 연구는 최신 AI(GPT-4o) 가 기존 AI 보다 훨씬 똑똑하게 정치인의 사진을 분석해냈으며, 정치인들은 인스타그램의 '스토리'와 '게시물'을 서로 다른 무대로 활용해 자신들을 홍보하고 있다는 사실을 밝혀냈습니다."
이 연구는 앞으로 정치 분석이나 마케팅에서 사람이 일일이 사진 세는 수고를 덜어주는 'AI 비서'가 얼마나 유용한지를 보여준 좋은 사례입니다.
이 논문은 2021 년 독일 연방 선거 캠페인 기간 중 인스타그램 (Instagram) 의 시각적 정치 커뮤니케이션 (Visual Political Communication, VPC) 을 분석하기 위해 특수화된 기계 학습 모델과 새로운 멀티모달 대규모 언어 모델 (Multimodal LLM) 의 성능을 비교 평가한 계산적 사례 연구입니다.
다음은 논문의 기술적 요약입니다.
1. 연구 문제 (Problem)
배경: 시각적 콘텐츠는 텍스트보다 빠르게 처리되고 강한 감정적 반응을 유발하여 유권자 행동에 더 큰 영향을 미칩니다. 특히 인스타그램 스토리 (24 시간 후 사라지는 일시적 콘텐츠) 와 게시물은 정치인의 자기 표현과 유권자 참여에 중요한 역할을 합니다.
도전 과제: 인스타그램의 방대한 시각적 데이터를 수동으로 코딩하는 것은 시간 소모적이며 분석 규모에 제한이 있습니다. 기존의 컴퓨터 비전 모델 (FaceNet, RetinaFace 등) 은 얼굴 인식이나 객체 감지에 특화되어 있으나, 정치적 맥락에서의 '집중된 가시성 (Concentrated Visibility)' 분석이나 복잡한 이미지 내 인물 수 세기에는 한계가 있을 수 있습니다.
연구 질문:
인스타그램 스토리와 게시물의 정치인을 식별하고 인물을 세는 데 있어 전통적인 컴퓨터 비전 모델과 멀티모달 LLM(GPT-4o) 의 성능은 어떻게 비교되는가?
당 (Party) 계정과 주요 후보 (Front-runner) 계정 간, 그리고 스토리와 게시물 간에 '집중된 가시성' (주요 후보에 대한 시각적 집중) 패턴은 어떻게 다른가?
2. 방법론 (Methodology)
데이터 수집: 2021 년 9 월 12 일부터 25 일까지 독일 주요 5 개 정당 (CDU, CSU, SPD, Grüne, FDP) 과 각 당의 주요 후보 5 명 (Armin Laschet, Annalena Baerbock, Olaf Scholz, Christian Lindner, Markus Söder) 의 인스타그램 계정에서 수집된 1,424 개의 스토리와 547 개의 게시물을 분석 대상으로 삼았습니다. 비디오는 첫 프레임을 정지 이미지로 추출하여 분석에 포함시켰습니다.
모델 비교:
전통적 컴퓨터 비전 모델:
Face Detection & Recognition:RetinaFace(얼굴 감지) 와 FaceNet512(얼굴 인식) 의 조합을 사용.
Object Detection:Google Cloud Vision API를 사용하여 'Person' 객체 감지.
멀티모달 LLM:
GPT-4o (gpt-4o-2024-05-13): 프롬프트 엔지니어링을 통해 특정 정치인의 존재 여부 확인 및 이미지 내 인물 수 계산을 수행.
평가 지표 (Ground Truth):
인간 어노테이터 13 명이 스토리와 게시물의 얼굴 라벨링을 수행 (Krippendorff's α = 0.86~0.94).
인물 수 계산을 위해 5 명의 어노테이터가 주요 후보가 등장하는 이미지의 인물 수 (0, 1, 2, 3+) 를 3 회 반복 어노테이션하여 골든 스탠다드 (다수결) 를 생성.
측정 항목:
얼굴 인식 (Face Verification): 특정 후보의 얼굴이 이미지에 존재하는지 여부 (True/False/Unsure).
인물 수 세기 (Person Counting): 이미지에 초점을 맞춘 인물의 수를 4 가지 범주 (0, 1, 2, 3+) 로 분류.
3. 주요 결과 (Key Results)
A. 모델 성능 평가 (RQ1)
얼굴 인식 (Face Recognition):
GPT-4o가 FaceNet512를 압도적으로 능가했습니다.
스토리 기준 GPT-4o 의 Macro F1 점수는 0.89였으며, FaceNet512는 0.74였습니다.
특히 여성 후보인 Annalena Baerbock 의 경우 FaceNet의 재현율 (Recall) 이 0.50 에 그친 반면, GPT-4o 는 0.90 으로 매우 높은 성능을 보였습니다 (성별 편향 가능성 시사).
GPT-4o 는 마스크 착용, 거리감, 측면 촬영 등 복잡한 상황에서도 인간 어노테이터와 더 높은 일치도 (Krippendorff's α = 0.85) 를 보였습니다.
인물 수 세기 (Person Counting):
GPT-4o가 RetinaFace와 Google Cloud Vision보다 월등히 우수했습니다.
스토리 기준 GPT-4o 의 Macro F1 점수는 0.86이었으며, RetinaFace(0.48) 와 GCV(0.58) 는 성능이 낮았습니다.
기존 모델들은 배경의 얼굴이나 포스터 등을 감지하여 인물을 과다 계수 (Overcounting) 하는 경향이 있었으나, GPT-4o 는 프롬프트를 통해 이미지의 '주요 주제 (Main Subjects)'에 집중하여 인간과 유사한 결과를 도출했습니다.
B. 집중된 가시성 패턴 분석 (RQ2)
계정 유형별 차이:
후보 계정은 당 계정보다 주요 후보를 단독으로 (Candidate Only) 또는 다른 사람과 함께 (Candidate + Others) 등장시키는 비율이 훨씬 높았습니다.
예를 들어, Markus Söder(CSU) 의 개인 스토리에서는 56.0% 가 단독 등장했으나, 당 계정의 스토리에서는 13.7% 에 불과했습니다.
포맷별 차이 (스토리 vs 게시물):
스토리와 게시물 간 시각적 전략에 유의미한 차이가 있었습니다.
스토리: 더 개인적이고 즉흥적인 콘텐츠가 많았으며, 후보 계정에서 집중된 가시성이 두드러졌습니다.
게시물: 당 계정에서도 후보가 등장하는 비율이 스토리보다 높았으나, 여전히 후보 계정과 당 계정 간 전략적 차이가 존재했습니다.
당 계정의 스토리는 주요 후보에 대한 집중적 가시성이 상대적으로 낮아, 플랫폼의 특성 (일시성, 친밀감) 을 활용한 유권자 참여 전략이 미흡함을 시사했습니다.
4. 주요 기여 (Key Contributions)
멀티모달 LLM 의 정치적 커뮤니케이션 분석 적용: GPT-4o 와 같은 멀티모달 LLM 이 전통적인 컴퓨터 비전 모델보다 시각적 정치 콘텐츠 분석 (특히 얼굴 인식과 인물 수 세기) 에서 더 정확하고 인간과 유사한 성능을 보임을 실증했습니다.
프롬프트 엔지니어링의 유효성: 복잡한 프롬프트를 통해 모델이 "명확하게 보이는 (clearly visible)" 인물에 집중하도록 유도함으로써, 배경 잡음이나 마스크 등 노이즈를 효과적으로 필터링할 수 있음을 보였습니다.
인스타그램 스토리에 대한 새로운 통찰: 기존 연구가 주로 영구 게시물에 집중했던 것과 달리, 일시적인 스토리 형식에서의 정치 커뮤니케이션 전략 (후보 vs 당, 개인화 전략) 을 대규모로 분석하여 플랫폼별 차이를 규명했습니다.
계산적 방법론의 확장: 대규모 시각 데이터 분석을 위한 재현 가능한 방법론을 제시하며, 향후 시각적 프레임 (Visual Framing) 이나 자기 표현 (Self-presentation) 연구의 기초를 마련했습니다.
5. 의의 및 한계 (Significance & Limitations)
의의:
정치적 커뮤니케이션 연구에서 대규모 시각 데이터 분석을 위한 접근성을 높였습니다. GPT-4o 는 별도의 하드웨어 설정 없이도 비교적 저렴한 비용으로 고품질 분석을 가능하게 합니다.
성별 편향 (여성 후보 인식률 저하) 과 같은 기존 컴퓨터 비전 모델의 한계를 LLM 을 통해 부분적으로 해결할 수 있음을 시사합니다.
한계:
투명성 및 재현성: GPT-4o 는 폐쇄형 모델 (Proprietary) 이며, 학습 데이터에 연구 데이터가 포함되었을 가능성 (데이터 누출) 이 있어 편향이 발생할 수 있습니다.
데이터 범위: 분석 대상이 주요 후보 5 명으로 제한되어 있어, 모든 정치인의 개인화 전략을 포괄하지는 못합니다.
상황적 요인: 2021 년 코로나 팬데믹으로 인한 마스크 착용이 얼굴 인식 모델의 성능에 영향을 미쳤습니다.
결론적으로, 이 연구는 멀티모달 LLM 이 인스타그램과 같은 소셜 미디어 플랫폼에서의 시각적 정치 커뮤니케이션을 대규모로 분석하는 데 있어 기존 컴퓨터 비전 기술을 능가하는 강력한 도구임을 입증했습니다. 또한, 정치인들이 플랫폼의 특성 (스토리 vs 게시물) 과 계정 유형 (후보 vs 당) 에 따라 차별화된 시각적 전략을 사용함을 보여주었습니다.