When More Foundation Models Means Less: Diagnosing and Addressing Multi-View Fusion Failure
이 논문은 여러 파운데이션 모델을 무분별하게 융합하는 것이 중복성과 불일치로 인해 성능을 저하시킨다는 점을 식별하고, 콤팩트하고 작업에 정렬된 인코더 서브셋을 통해 우수한 다운스트림 정확도를 달면 달성하기 위해 뷰 세트 구성을 최적화하는 레이블 인식 기반의 효율적인 그리디 선택 방법인 KAGES를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능 시대에 연구자들은 흔히 파운데이션 모델(foundation models)이라 불리는 방대한 사전 학습된 컴퓨터 프로그램 라이브러리에 접근할 수 있습니다. 이들은 이미 엄청난 양의 데이터를 학습하여 패턴을 인식하거나, 언어를 이해하거나, 이미지를 해석하는 법을 익힌 거대한 시스템들입니다. 이것들을 특정 작업에 적용하기 전까지는 이미 날카롭게 갈고 닦인 전문가 도구라고 생각하면 됩니다. 수년 동안 이러한 도구들을 이용해 새로운 문제를 해결하는 표준적인 접근 방식은 가능한 한 많은 모델을 결합하는 것이었으며, 이는 더 많은 정보가 항상 더 나은 결과를 가져온다는 가정하에 운영되었습니다. 그 논리는 간단했습니다. 만약 하나의 도구가 이미지를 한 가지 방식으로 보고 다른 도구가 또 다른 방식으로 본다면, 이들을 함께 합쳤을 때 완벽하고 포괄적인 시야를 만들어낼 수 있을 것이라는 것이었습니다. '다중 뷰 학습(multi-view learning)'으로 알려진 이 아이디어는 서로 다른 정보원을 병합함으로써 더 똑똑한 시스템을 구축하려는 과학자들의 오랜 초석이 되어 왔습니다.
하지만 최근 한 연구가 이러한 근본적인 믿음에 도전하고 있습니다. 베이징 우편통신대학교의 연구진은 이러한 사전 학습된 전문가들을 대량으로 섞기 시작할 때, 모델을 추가한다고 해서 반드시 최종 결과가 좋아지는 것은 아니라는 사실을 발견했습니다. 실제로 특정 지점에 도달하면, 또 다른 도구를 추가하는 것이 오히려 시스템을 악화시킬 수 있습니다. 연구팀은 최적의 성능이 대개 무작위로 모은 대규모 컬렉션보다는 작고 특정한 그룹의 모델들을 선택함으로써 달성된다는 것을 발견했습니다. 그들은 혼합된 모델 중 처음 몇 개가 추가될 때는 새롭고 유용한 통찰력을 제공하지만, 그 이후의 추가물들은 시스템이 이미 가지고 있는 정보를 반복하거나 해당 작업과 관련 없는 혼란스러운 신호를 도입하는 경우가 많다는 점을 관찰했습니다. 이 현상은 성능이 빠르게 상승하다가 정점에 도달한 뒤, 더 많은 모델이 강제로 혼합됨에 따라 다시 떨어지기 시작하는 곡선을 만들어냅니다.
이 문제를 해결하기 위해 연구진은 AI 모델을 위한 스마트한 선택기 역할을 하는 KAGES라는 새로운 방법을 개발했습니다. 모든 가용 도구를 맹목적으로 융합하는 대신, KAGES는 어떤 특정 모델들을 결합해야 하는지, 그리고 얼마나 많은 모델을 사용해야 하는지를 신중하게 평가합니다. 이 방법은 모델 그룹의 결합된 정보가 특정 작업의 정답과 얼마나 잘 일치하는지를 측정하며, 이를 위해 먼저 테스트할 새로운 시스템을 훈련시킬 필요가 없습니다. 이 방식은 이미 알려진 것을 단순히 반복하거나 노이즈를 더하는 모델은 피하면서, 가장 새롭고 유용한 정보를 제공하는 다음 최고의 모델을 탐욕적(greedily)으로 추가합니다. 이러한 접근 방식은 추가되는 정보가 더 이상 도움이 되지 않는 정확한 시점에 모델 추가를 멈추게 하여, 최종 결합체가 작으면서도 매우 효과적이도록 보장합니다.
연구팀은 이미지 내 객체 인식, 질감 식별, 심지어 언어 이해를 포함한 매우 다양한 작업에 걸쳐 이 아이디어를 테스트했습니다. 모든 사례에서 그들은 "다다익선"이라는 가정이 실패했다는 것을 발견했습니다. 어떤 작업에서는 모델을 3~4개만 결합해도 성능이 정점에 도달했으며, 그 이상을 추가하면 정확도가 떨어졌습니다. 예를 들어, 교통 표지판 인식 작업의 경우 시스템은 매우 작은 모델 세트와 함께했을 때 최고의 성능을 보였던 반면, 지리 위치 파악 작업의 경우 단 하나의 모델만으로도 이미 충분히 훌륭하여 다른 모델을 추가하는 것이 아무런 이득을 주지 못했을 뿐만 아니라 때로는 성능을 저하시키기도 했습니다. 연구진은 또한 최적의 모델 수가 가용 데이터의 양에 따라 달라진다는 점에 주목했습니다. 데이터가 많을수록 시스템은 성능이 하락하기 전까지 조금 더 많은 모델을 다룰 수 있지만, 정점은 항상 놀라울 정도로 적은 수의 모델에서 나타났습니다.
결과는 KAGES가 모든 가용 모델을 결합하려고 시도하거나 단순히 서로 다른 모델을 선택하는 다른 방법들보다 일관되게 뛰어난 성능을 보였음을 입증했습니다. 양보다는 조합의 질에 집중함으로써, KAGES는 모델들이 가장 효과적으로 협력하는 최적의 지점(sweet spot)을 찾아낼 수 있었습니다. 많은 경우, KAGES는 가능한 모든 조합을 테스트하여 최적을 찾아내야 하는 완벽한 이론적 선택기만큼이나 성능이 좋았지만, 훨씬 더 빠르게, 그리고 매 테스트마다 새로운 시스템을 훈련시키지 않고도 그 성과를 냈습니다. 이 발견은 강력한 AI 시스템을 구축하는 미래가 더 많은 도구를 축적하는 데 있는 것이 아니라, 적절한 도구를 신중하고 지능적으로 선택하는 데 있음을 시사합니다. 가용 가능한 AI 모델 라이库가 계속 확장됨에 따라, 완벽한 소규모 전문가 팀을 선택하는 능력은 그 어느 때보다 중요해질 것이며, 이는 방대한 자원을 관리하는 과제를 정밀함과 효율성의 기회로 바꿔 놓을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.