← 최신 논문
💬 NLP

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

이 논문은 20초 길이의 아이스브레이킹 클립으로부터 이자적 친밀도(dyadic familiarity)를 추론하기 위한 벤치마크인 FriendBench를 소개하며, 최상위 멀티모달 모델들이 인간의 정확도와 일치함에도 불구하고 이들은 서로 다른 단서에 의존하고 두 사람을 낯선 관계로 분류하는 편향을 보이는 반면, 인간은 언어를 넘어 가시적인 행동 단서들을 독특하게 활용한다는 점을 밝혀냈다.

원저자: Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

게시일 2026-08-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 사람이 대화를 나누고 있는 방 안으로 걸어 들어가는 상황을 상상해 보십시오. 당신은 그들의 이름을 모르고, 그들이 무슨 말을 하고 있는지도 듣지 못했습니다. 하지만 단 몇 초 만에, 당신은 그들이 근황을 나누는 절친한 친구 사이인지, 아니면 어색하게 첫 인사를 나누는 낯선 이들인지 종종 알아차릴 수 있습니다. 이 초능력은 사회적 지능이라 불립니다. 이는 단순히 말의 내용을 듣는 것이 아니라, 사람들이 어떻게 움직이고, 멈추고, 서로를 바라보는지를 관찰함으로써 상황의 '분위기'를 읽어내는 능력입니다. 수십 년 동안 과학자들은 인간이 어떻게 이 일을 수행하는지 연구해 왔지만, 이제 우리는 큰 질문을 던지고 있습니다. 컴퓨터도 이 일을 할 수 있을까요? 우리가 AI 동반자, 미팅 어시스턴트, 돌봄 로봇을 만들기 시작함에 따라, 이 기계들도 우리만큼이나 인간 관계를 이해해야 합니다. 하지만 이들을 가르치기 위해서는, 그들이 실제로 방의 분위기를 '읽고' 있는 것인지 아니면 그저 추측하고 있는 것인지를 확인하기 위한 공정한 테스트가 먼저 필요합니다.

여기에 바로 이 점을 테스트하기 위해 설계된 새로운 실험인 **프렌드벤치(FriendBench)**가 있습니다. 연구진은 디지털 '아이스 브레이킹' 챌린지를 설정했습니다. 그들은 96쌍의 사람들을 대상으로 "하늘을 날고 싶나요, 아니면 투명 인간이 되고 싶나요?"라는 똑같은 엉뚱한 질문에 답하는 20초짜리 영상을 촬영했습니다. 어떤 쌍은 이미 친구나 가족 관계(익숙한 사이)였고, 어떤 쌍은 처음 만나는 사이(낯선 사이)였습니다. 모든 사람이 같은 질문에 답했기 때문에, 그들이 사용한 단어만으로는 정답을 알아낼 수 없었습니다. 유일한 단서는 그들이 어떻게 말하고 행동하는가에 있었습니다.

연구진은 두 집단에게 이 미스터리를 풀도록 요청했습니다. 한 집단은 대규모의 인간 자원봉사자 그룹이었고, 다른 한 집단은 7개의 주요 기술 기업에서 나온 26개의 서로 다른 AI 모델들이었습니다. 그들은 텍스트 전사본만 읽기, 오디오 듣기, 그리고 비디오 시청하기라는 세 가지 방식으로 AI와 인간을 테스트했습니다.

결과는 다음과 같았습니다. 첫째, 텍스트만 있는 버전은 모두에게 막다른 길이었습니다. 사람과 AI 모두 사람들을 보거나 들을 수 없다면 무작위로 추측하는 것보다 나은 성과를 내지 못했습니다. 이는 대화 주제가 관계를 숨기도록 통제되었기 때문에 당연한 결과입니다.

소리를 추가하자 상황이 좋아졌습니다. 인간과 최고의 AI 모델들 모두 성능이 향도록 했는데, 이는 목소리의 톤과 휴지(pause)가 실제적인 단서를 제공한다는 것을 보여줍니다. 하지만 진짜 마법은 비디오를 추가했을 때 일어났습니다. 인간은 사람들의 얼굴과 몸짓을 볼 수 있을 때 정확도가 눈에 띄게 높아졌습니다. 그들은 이러한 시각적 신호를 사용하여 정확도를 더욱 높였습니다. 반면, AI 모델들은 한계에 부딪혔습니다. 최고의 AI 모델들이 비디오 클립에서 인간 집단의 정확도에 도달하기는 했지만, 그 방식은 달랐습니다.

AI 모델들은 인간이 하는 방식대로 우정을 '본' 것이 아니었습니다. 대신, 그들은 하나의 패턴에 크게 의존했습니다. 그들은 거의 항상 '낯선 사람'이라고 추측했습니다. 테스트에 친구와 낯선 사람이 동일한 숫자로 포함되어 있었기 때문에, 이 편향 덕분에 우연히 전체 점수가 높게 유지되었지만, 이는 곧 그들이 친구를 식별하는 데 실패했음을 의미했습니다. 반면 인간은 균형을 유지하며 친구와 낯선 사람을 모두 정확하게 식별해 냈습니다.

요약하자면, 최고의 AI 모델들은 이제 이 과업에서 인간의 정확도에 필적할 수 있지만, 우정을 진정으로 이해하기보다는 모든 사람을 낯선 사람이라고 가정하는 전략에 의존하여 이를 수행하고 있습니다. 그들은 목소리는 듣지만, 아직 몸짓을 읽지는 못하고 있습니다. 이는 AI가 사회적 과업을 잘 수행하고 있음에도 불구하고, 인간처럼 인간 관계를 진정으로 이해하기까지는 아직 갈 길이 멀다는 것을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →