← 최신 논문
🤖 AI

SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models

이 논문은 동결된 인코더와 언어 모델 사이의 최소한의 연결을 학습함으로써 사전 학습된 시각-언어 모델에서의 '사회적 퇴보(social degradation)'를 완화하고, 이를 통해 긍정적 전이를 가능하게 하여 다양한 사회적 인지 작업에서 우수한 성능을 구현하는 프레임워크인 SocialFusion을 소개한다.

원저자: Hamza Tahboub, Weiyan Shi, Gang Hua, Huaizu Jiang

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hamza Tahboub, Weiyan Shi, Gang Hua, Huaizu Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사회적 융합(SocialFusion): 사전 학습된 시각-언어 모델의 사회적 퇴화 문제 해결하기

거대한 문제: "과잉 학습"된 전문가

당신에게 예술, 역사, 문학에 관한 수백만 권의 책을 읽으며 평생을 보낸 아주 똑똑한 예술 비평가가 있다고 상상해 보세요. 그들은 언어와 일반 지식에 있어서는 마스터입니다. 이것이 바로 시각-언어 모델(Vision-Language Model, VLM)—방대한 양의 텍스트와 이미지를 학습한 강력한 AI—의 모습입니다.

이제 이 전문가에게 친구들이 피크닉을 즐기는 무성 영화를 보여주며 다음을 말해달라고 요청한다고 상상해 보세요:

  1. 누가 누구를 보고 있는가?
  2. 빨간 셔츠를 입은 사람이 어떤 몸짓을 하고 있는가?
  3. 두 사람은 논쟁 중인가, 아니면 웃고 있는가?
  4. 그들의 표정은 어떠한가?

당신은 이 전문가가 이 일을 아주 잘 해낼 것이라 기대할 것입니다. 하지만, 이 논문은 놀라운 사실을 발견했습니다: 그들은 오히려 이 작업에 더 서툴러졌습니다.

이 AI 모델들이 거대한 일반 데이터셋(고양이, 자동차, 풍경 등을 묘描述하는 법을 배우는 과정)을 통해 학습될 때, 저자들은 이를 **"사회적 퇴화(Social Degradation)"**라고 부르는 현상이 발생한다고 밝혔습니다. 이는 마치 전문가가 '무엇(what)'이라는 객체를 설명하는 데(예: "저것은 원반이다") 너무 집중한 나머지, 미묘한 '사회적 신호'(예: "저 사람이 원반을 보고 있는 이유는 질투 때문이야")를 읽는 법을 잊어버린 것과 같습니다. 일반적인 학습이 오히려 인간의 상호작용을 이해하는 능력을 "퇴화"시키거나 손상시킨 것입니다.

실험: 손상 정도 테스트

연구진은 세 가지의 유명하고 강력한 AI 모델(Qwen2-VL, Sail-VL, MolmoE)을 다섯 가지 "사회적" 과업에 대해 테스트했습니다:

  • 제스처(Gestures): 손동작 인식 (예: 브이 포즈).
  • 시선(Gaze): 누군가가 어디를 보고 있는지 파악하기.
  • 표정(Expressions): 경멸이나 행복 같은 감정 감지.
  • 대화(Conversation): 누가 누구에게 말하고 있는지 알기.
  • 관계(Relationships): 두 사람이 친구인지, 가족인지, 혹은 낯선 사람인지 추측하기.

결과: 연구진이 이 모든 과업을 동시에 수행하도록 모델을 학습시키려 했을 때, 모델들은 실패했습니다. 과업들은 서로를 돕는 대신 서로 충돌했습니다. 모델들은 이 모든 것을 한꺼번에 배울 때, 단 하나만을 배울 때보다 성능이 더 떨어졌습니다. 이를 **부정적 전이(negative transfer)**라고 합니다.

진단: 왜 이런 일이 발생하는가?

연구진은 왜 일반적인 학습이 사회적 기술을 망가뜨렸는지 조사했습니다. 그들은 두 가지 측면을 살펴보았습니다:

  1. 해독 가능성(Decodability, 신호를 읽을 수 있는가?): AI의 "두뇌"(시각 인코더)가 여전히 사회적 단서에 대한 원시 정보를 보유하고 있는지 확인했습니다. 그 결과, 일반적인 학습 후에 신호가 흐릿해졌음을 발견했습니다. 이는 전문가의 눈은 여전히 작동하고 있지만, 사회적 의미를 해석하는 뇌의 부분이 다른 일반 지식들에 의해 안개가 낀 것처럼 뿌옇게 변한 것과 같았습니다.
  2. 호환성(Compatibility, 과업들이 서로 잘 어울리는가?): 과업들이 서로 싸우고 있는지 확인했습니다. 약간의 충돌은 있었지만, 주요 문제는 애초에 신호 자체가 너무 약해져 있었다는 점이었습니다.

해결책: SocialFusion (특화된 인턴)

이를 해결하기 위해 저자들은 SocialFusion이라는 새로운 모델을 만들었습니다.

"안개가 낀" 전문가를 고치려고 노력하는 대신, 그들은 새롭고 깨끗한 렌즈를 사용하기로 했습니다.

  • 얼어붙은 눈(The Frozen Eye): 거대한 일반적 "사회적 퇴화" 학습을 거치지 않은 시각 인코더(이미지를 보는 부분)를 가져왔습니다. 이 부분은 미세한 디테일을 보는 능력을 유지할 수 있도록 "동결(frozen, 손대지 않음)" 상태로 유지되었습니다.
  • 최소한의 커넥터(The Minimal Connector): 이 날카로운 눈을 언어 모델(말하는 부분)에 연결하는 매우 단순한 다리를 구축했습니다.
  • 전략: 눈(시각 인코더)을 다시 학습시키려 하지 않았습니다. 대신 언어 모델이 이 눈과 어떻게 대화해야 하는지만 가르쳤습니다.

비유: 당신에게 약간 금이 간 렌즈를 가진 카메라(일반 VLM)가 있다고 상상해 보세요. 사진작가가 아무리 뛰어나도 사진은 흐릿하게 나올 것입니다. SocialFusion은 그 금이 간 렌즈를 새롭고 깨끗한 렌즈로 교체한 다음, 사진작가에게 그 렌즈를 사용하는 법을 가르치는 것과 같습니다.

결과: 완벽한 성적표

SocialFusion을 테스트했을 때:

  • 긍정적 전이(Positive Transfer): 다른 모델들과 달리, SocialFusion은 모든 과업을 함께 배울 때 모든 과업에서 성능이 향려되었습니다. 과업들이 마치 함께 공부하는 친구들처럼 서로를 도왔습니다.
  • 새로운 기록: 제스처 인식(HaGRIDv2)과 사회적 관계(PISC) 분야에서 새로운 "SOTA(State-of-the-art, 최고 수준)" 기록을 세웠습니다.
  • 경쟁력: 다른 과업에서도 특화된 모델들과 대등한 성능을 보여주었으며, 이는 사회적 단서를 이해하기 위해 거대하고 복잡한 시스템이 필요한 것이 아니라, 적절한 설정이 필요함을 증명했습니다.

핵심 요약

이 논문은 우리가 AI를 훈련시키는 현재의 방식(모든 것을 하나의 거대한 혼합물 속에 던져 넣는 방식)이 의도치 않게 AI의 인간 사회적 상호작용 이해 능력을 해칠 수 있다고 결론짓습니다. 진정으로 사회적 역량을 갖춘 AI를 만들기 위해서는, 일반 모델이 모든 것을 다 잘하도록 강요하기보다, 일반 데이터에 의해 과하게 학습되지 않은 "깨끗한" 시각 도구를 사용하는 것이 필요할지도 모릅니다.

요약하자면: 이 논문은 AI를 일반적인 것들에 대해 "너무 똑똑하게" 만드는 것이 사람에 대해서는 오히려 "멍청하게" 만들 수 있다는 것을 발견했습니다. 그들의 새로운 해결책인 SocialFusion은 "눈"을 신선하고 단순하게 유지함으로써, AI가 마침내 사회적 세계를 올바르게 이해할 수 있도록 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →