← 최신 논문
💻 computer science

Modeling Engagement with Brand and Organizational TikTok Videos Using Machine-Assisted Theory-Ensemble Annotation

이 논문은 멀티모달 거대 언어 모델이 숏폼 영상의 복잡한 시청각 및 이론적 변수를 수동으로 주석 처리할 때 발생하는 확장성 문제를 어떻게 극복할 수 있는지 입증하며, 이를 통해 10,000개의 틱톡 영상을 분석하여 어떤 서사적 및 구조적 요인이 참여를 유도하는지 식별하고 콘텐츠 제작자에게 실행 가능한 통찰력을 제공합니다.

원저자: Sander Paekivi, Andres Karjus

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sander Paekivi, Andres Karjus

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 왜 어떤 짧은 틱톡 영상은 바이럴이 되고 어떤 영상은 무시되는지 이해하려고 노력 중이라고 상상해 보세요. 보통 연구자들은 "계정의 팔로워 수가 얼마나 되는가?" 또는 "영상이 올라온 지 얼마나 되었는가?"와 같이 세기 쉬운 것들만 살펴봅니다. 하지만 이것은 책의 내용(이야기)은 무시한 채 표지의 크기와 출판 날짜만 보고 책을 판단하는 것과 같습니다.

이 논문은 에스토니아의 브랜드와 조직들이 만든 수천 개의 틱톡 영상 속 '이야기'를 읽으려고 시도합니다. 연구진이 무엇을 했고 무엇을 발견했는지에 대한 간단한 요약입니다.

문제점: 너무 많은 영상, 너무 적은 시간

짧은 영상은 음악, 대화, 텍ek스트, 편집, 그리고 트렌드의 혼합체입니다. 이를 이해하려면 보통 사람이 영상을 보고 '분위기', 이야기 구조, 또는 정서적 톤에 대해 메모를 작성해야 합니다. 하지만 10,000개의 영상을 일일이 손으로 하는 것은 불가능합니다. 몇 년이 걸릴 데도 있습니다.

해결책: '슈퍼 리더(Super-Reader)' 로봇

연구진은 강력한 AI(거대 언어 모델)를 사용하여 '슈퍼 리더' 역할을 하게 했습니다. 그들은 이 AI에게 영상을 시청하고, 고전적인 스토리텔링, 광고, 심리학 이론을 바탕으로 매우 구체적이고 복잡한 체크리스트를 작성하도록 가르쳤습니다.

AI를 돋보기를 든 탐정이라고 생각해보세요. 이 탐정은 다음과 같은 77가지의 서로 다른 단서들을 즉각적으로 찾아낼 수 있습니다:

  • 화자가 당신에게 직접 말을 걸고 있는가?
  • 음악이 밝은가 아니면 슬픈가?
  • 명확한 '영웅'과 '악당'이 존재하는가?
  • 이 영상은 무언가를 팔려고 하는가, 아니면 그저 웃기려고 하는가?

실험: '인간 vs 로봇' 검증

로봇을 신뢰하기 전에, 연구진은 세 명의 학생이 작은 샘플 영상을 시청하고 동일한 체크리스트를 작성하게 했습니다.

  • 좋은 소식: 로봇은 "음악이 있는가?" 또는 "카메라가 빠르게 움직이는가?"와 같이 명백한 것들을 찾아내는 데 매우 뛰어났습니다. 인간과 로봇은 이러한 쉬운 부분에서 의견이 일치했습니다.
  • 나쁜 소식: 깊고 추상적인 아이디어(예: "숨겨진 상징적 의미는 무엇인가?" 또는 "철학적 갈등은 무엇인가?")에 관해서는 인간들조차 서로 의견이 일치하지 못했습니다. 로봇 역시 여기서 어려움을 겪었습니다. 이는 마치 사람들에게 꿈의 '진정한 의미'가 무엇인지 묻는 것과 같습니다. 모두가 저마다 다르게 보는 것이죠.

발견: 무엇이 실제로 '좋아요'를 받는가?

연구진은 로봇의 기록을 사용하여 어떤 영상이 가장 많은 **'좋아요'**와 댓글을 받을지 예측했습니다. 그들은 로봇의 상세한 기록을 단순한 '팔로워 수'라는 기준치와 비교했습니다.

1. '깊은 의미'보다 '패키징'이 더 중요하다
로봇은 가장 성공적인 영상들이 반드시 깊은 철학적 이야기를 담고 있는 것은 아니라는 점을 발견했습니다. 대신, 성공은 영상이 어떻게 패키징되었는지에 의해 결정되었습니다:

  • 오디오: 배경 음악만 있는 것보다 실제 목소리(사람이 말하는 것)가 포함된 영상이 더 많은 좋아요를 받았습니다.
  • 의도: 순수하게 교육적인 목적보다는 재미있거나 즐거움을 주는 목적의 영상이 더 좋은 성과를 냈습니다.
  • 배경: 상점이나 사무실처럼 인식 가능한 실내 상업 공간에서 촬영된 영상이 좋은 반응을 얻었습니다.

2. '행동 유도(Call to Action)'가 댓글의 핵심이다
사람들이 댓글을 달게 하고 싶다면, 영상이 그것을 요청해야 합니다. "참여 유도(engagement bait)"(직접 질문을 던지거나 반응을 촉구하는 것)를 사용한 영상은 현저히 많은 댓글을 끌어냈습니다. 실용적인 '방법(how-to)' 영상 또한 더 많은 질문과 정보 탐색형 댓글을 불러일으켰습니다.

3. '친숙함' 요소
연구는 놀라운 결과를 보여주었습니다: 평균과 비슷해지는 것이 효과적이라는 것입니다.

  • 이 그룹 내에서 성공적인 '표준' 영상들과 비슷하게 보이고 느껴지는 영상(흔한 오디오, 흔한 유머, 흔한 배경을 사용하는 영상)이 기괴하게 독특함을 추구하는 영상보다 더 많은 '좋아요'를 받는 경향이 있었습니다.
  • 이는 식당과 같습니다: 고객을 꾸준히 모으고 싶다면, 사람들을 혼란스럽게 만드는 기괴하고 실험적인 식사를 제공하기보다 사람들이 기대하는 인기 메뉴를 제공하는 것이 훨씬 안전할 수 있습니다.

결론

이 논문은 우리가 AI를 사용하여 '분위기'나 '이야기'를 딱딱한 데이터로 바꿀 수 있음을 보여줍니다. AI가 인간의 깊은 철학을 완벽하게 이해할 수는 없지만, 영상의 구조적 재료를 포착하는 데는 매우 능숙합니다.

틱톡을 만드는 브랜드에게 주는 교훈은 "깊고 복잡한 이야기를 써라"가 아닙니다. 교훈은 다음과 같습니다: 명확한 오디오를 사용하고, 재미를 유지하며, 익숙한 장소를 배경으로 설정하고, 사람들에게 댓글을 달라고 요청하세요. '마법'은 숨겨진 의미 속에 있는 것이 아니라, AI가 식별해낸 눈에 보이고 반복 가능한 패턴 속에 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →