← 최신 논문
💻 computer science

Twins: Learn to Predict Unified Representations with Focal Loss

이 논문은 ViT와 VAE 특징을 결មាន(concatenates)한 통합된 연속 토큰 공간인 "Twins"를 제안하며, 디퓨전 모델에서 발생하는 결과적인 최적화 불균형 문제를 해결하기 위해 포컬 회귀 목적 함수(focal regression objective)를 적응시킴으로써 이미지 생성 품질과 멀티모달 이해 성능을 모두 크게 향상시킨다.

원저자: Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 인간처럼 세상을 '보고', 예술가처럼 그림을 '그릴' 수 있는 로봇을 만들려고 한다고 상상해 보십시오. 인공지능의 세계에서 이 두 가지 작업은 보통 완전히 다른 도구 모음을 필요로 합니다. 이미지를 '보고' 이해하는 것(예를 들어, 사진이 '골든 리트리버'임을 아는 것)을 위해 AI는 털의 질감 같은 미세한 디테일은 무시하되 큰 개념을 포착하는 지적인 고차원 지도를 사용합니다. 반면, 새로운 이미지를 '그리거나' 생성하기 위해서는 모든 픽셀과 미세한 디테일을 붙잡고 있어야 하지만 종종 전체적인 의미는 놓치게 되는 다른 도구가 필요합니다. 오랫동안 과학자들은 이 두 가지 서로 다른 도구를 함께 작동시키기 위해 애써왔으며, 종로 이해는 잘하지만 흐릿한 그림을 그리는 로봇을 선택하거나, 혹은 아름답게 그리지만 무엇을 그리고 있는지는 모르는 로봇을 선택해야만 하는 상황에 직면해 왔습니다. 이 논문은 그 까다로운 균형 잡기 문제를 다루며 다음과 같이 질문합니다. 우리가 로봇을 위해 두 가지를 동시에 완벽하게 수행할 수 있게 해주는 단 하나의 '언어'를 만들 수 있을까?

"Twins"라고 알려진 이 연구의 연구진은 두 가지 도구 중 하나를 선택하는 것을 멈추고 대신 그것들을 하나로 붙여버리기로 했습니다. 그들은 '지적인' 지도(SigLIP이라 불리는 시스템에서 가져온 것)와 '디테일에 집중하는' 지도(VAE라 불리는 시스템에서 가져온 것)를 가져와서 하나의 긴 정보 띠로 나란히 이어 붙였습니다. 이것은 마치 당신의 로봇에게 왼쪽 렌즈는 큰 그림을 보고 오른쪽 렌즈는 미세한 디테일을 보는 하나의 시야를 가진 안경을 씌워주는 것과 같습니다. 하지만 연구진이 이 새로운 결합된 시야를 사용하도록 AI 모델을 가르치려 했을 때, 난관에 부딪혔습니다. 모델이 게을렀던 것입니다. 모델은 쉬운 부분인 큰 그림 부분을 좋아했고, 어려운 부분인 세부 사항 부분을 완전히 무시했습니다. 그 결과 생성된 이미지는 흐릿하고 질감이 빠져 있었습니다.

이를 해결하기 위해 팀은 모델이 왜 게으르게 행동했는지 그 이유를 발견했습니다. 그들은 '쉬운' 데이터는 매끄럽고 단순한 반면, '어려운' 데이터는 복잡하고 노이즈가 많은 디테일로 가득 차 있다는 것을 발견했습니다. AI는 마치 학생이 어려운 수학 문제를 건너뛰고 쉬운 철자 문제부터 먼저 푸는 것처럼, 자연스럽게 매끄러운 것을 선호했습니다. 이를 해결하기 위해 그들은 "포컬 로스(Focal Loss)"라는 특별한 학습 규칙을 발명했습니다. 이것은 모든 질문에 똑같은 점수를 주는 대신, 가장 어려운 문제를 맞혔을 때 추가 점수를 주는 선생님을 상상해 보십시오. 이 방식은 AI가 학습하려는 이미지의 어렵고 세밀한 부분에 주의를 기울이도록 강제했습니다.

결과는 인상적이었습니다. 이 새로운 "포컬 로스" 규칙을 사용함으로써 AI는 디테일을 무시하는 것을 멈췄습니다. 이미지 품질에 대한 표준 테스트에서, 이 새로운 방법은 별도의 가이드 기술 없이도 기존 학습 방식보다 점수를 최대 10.57점 향상시켰습니다. 생성된 이미지는 선명하고 뚜렷했으며, 로봇은 이전과 마찬가지로 자신이 무엇을 그리고 있는지 여전히 잘 이해할 수 있었습니다. 이 논문은 이 접근 방식이 하나를 얻기 위해 다른 하나를 희생해야 했던 기존의 "불가능한 삼각형"을 성공적으로 깨뜨렸음을 시사하며, 적절한 학습 기술만 있다면 단일 AI 모델이 진정으로 보는 것과 만드는 것 모두를 마스터할 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →