← 최신 논문
🤖 machine learning

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

본 논문은 아키텍처나 학습 레시피 변경 없이 엄격한 데이터 큐레이션만으로도 다양한 벤치마크와 기능에 걸쳐 비전-언어 모델의 성능을 크게 향상시켜 최대 150 배 적은 학습 연산으로 최첨단 수준의 정확도를 달성하면서도 신뢰성, 일반화, 추론 효율성을 동시에 개선할 수 있음을 보여줍니다.

원저자: Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan
게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어린아이가 주변 세상을 인식하도록 가르치려 한다고 상상해 보세요. 두 가지 선택지가 있습니다:

  1. "더 많을수록 좋다" 접근법: 책, 잡지, 무작위 사진으로 이루어진 거대하고 지저분한 더미를 아이 앞에 쏟아붓습니다. 그리고 "모든 것을 읽고, 모든 것을 보고, 스스로 파악해라"라고 말합니다. 이는 엄청난 시간과 에너지 (컴퓨팅 자원) 를 요구합니다.
  2. "선별된" 접근법: 최고의 책을 신중하게 선택하고, 흐릿한 사진을 제거하며, 오타를 수정하고, 그림들을 논리적인 범주로 정리합니다. 아이에게 더 작고 깨끗한 더미를 건네줍니다.

**"20/20 비전 언어 모델 (20/20 Vision Language Models)"**이라는 제목의 이 논문은 옵션 2 가 비결이라고 주장합니다.

DatologyAI 의 연구원들은 이미지와 텍스트를 "읽을" 수 있는 AI 인 비전 언어 모델 (VLM) 을 대상으로, 학습 데이터의 품질만 개선하면 AI 가 극적으로 똑똑해진다는 사실을 발견했습니다. 그들은 AI 의 두뇌 크기, 아키텍처, 또는 학습 시간을 변경하지 않았습니다. 그들이 한 일은 학습용 "교과서"를 정리하는 것뿐이었습니다.

다음은 그들의 발견을 간단한 비유로 정리한 내용입니다:

1. "클린 룸" 효과 (데이터 큐레이션)

학습 데이터를 체육관이라고 생각해 보세요.

  • 기준선 (비선별): 체육관은 고장 난 장비, 진흙 투성이 바닥, 혼란스러운 표지로 가득 차 있습니다. AI 는 그곳에서 학습을 시도하지만, 혼란을 겪고 에너지를 낭비합니다.
  • 선별된 모델: 연구원들은 바닥을 쓸고, 장비를 수리하며, 무게를 정리했습니다.
  • 결과: AI 의 크기는 동일하고 작업 시간도 동일하지만, 훨씬 더 강해집니다. 평균적으로 그들의 선별된 모델은 20 가지 다른 테스트 (사물 식별, 이미지 내 텍스트 읽기, 수학 문제 해결 등) 에서 지저분한 체육관 버전보다 11.7 점 더 높은 점수를 받았습니다.

2. "작지만 강력한" 놀라움

보통 더 똑똑한 AI 를 얻으려면 더 큰 두뇌 (더 많은 파라미터) 나 더 많은 학습 시간 (더 많은 컴퓨팅 자원) 이 필요합니다.

  • 논문의 주장: 그들의 선별된 20 억 파라미터 모델 (중간 크기의 두뇌) 은 훨씬 더 크고 방대한 학습을 거친 경쟁자 (InternVL3.5) 를 압도적으로 능가했으며, 17 배 적은 컴퓨팅 자원을 사용했습니다.
  • 비유: 이는 슈퍼컴퓨터는 접근 가능하지만 학습 가이드는 없는 게으른 천재보다 잘 훈련된 고등학생이 이기는 것과 같습니다. 선별된 모델은 거대한 사후 학습 조정에 의존하는 최첨단 모델들보다 최대 150 배 적은 학습 에너지를 사용하여 최상위권 성능에 근접했습니다.

3. 교실을 넘어선 일반화 (OOD 일반화)

AI 의 일반적인 문제는 시험 문제를 외워두지만, 약간 다른 것을 물어보면 실패한다는 것입니다.

  • 논문의 주장: AI 가 단일 이미지로만 학습되었음에도 불구하고, 학습 중에는 전혀 보지 못했던 여러 이미지를 동시에 보는 작업에서 놀라울 정도로 잘 수행했습니다.
  • 비유: 동물의 단일 사진만 공부한 학생을 상상해 보세요. 개 사진과 고양이 사진을 나란히 보여주며 "어느 것이 더 큽니까?"라고 물으면, 그들은 여전히 정확하게 답할 수 있습니다. 데이터 정리는 AI 가 특정 사진을 외우는 것이 아니라 세상의 개념을 이해하도록 도왔습니다.

4. "신뢰할 수 있는 학생" (안정성)

AI 를 학습시킬 때, 때로는 운이 좋고 때로는 나쁘며 이는 무작위 시작점 (시드) 에 따라 달라집니다.

  • 논문의 주장: 선별된 모델은 훨씬 더 일관적이었습니다. 세 번 학습시켰을 때, 모두 거의 동일한 점수를 받았습니다. 반면 비선별된 모델은 결과가 들쭉날쭉했습니다.
  • 비유: 비선별된 AI 는 기분 따라 어느 날은 A 를 받고 다음 날은 D 를 받는 학생과 같습니다. 선별된 AI 는 어떤 날이든 매번 완벽하게 수행하는 전 과목 A 학생입니다.

5. 더 나은 매너와 불필요한 수식어 제거 (실제 행동)

연구원들은 단순히 점수만 본 것이 아니라, AI 에게 개방형 질문을 하여 실제 세계에서 어떻게 행동하는지 확인했습니다.

  • 논문의 주장: 선별된 AI 는 다음과 같았습니다:
    • 더 정직함: 무언가를 볼 수 없으면 인정했습니다. 비선별된 AI 는 종종 "환각" (무언가를 지어냄) 을 일으켰습니다.
    • 더 구체적: "그것은 차량입니다"라고 말하는 대신 "그것은 파란색 토마스 기차 케이크입니다"라고 말했습니다.
    • 더 간결함: 장황한 단락 대신 짧고 직접적인 답변을 제공했습니다.
    • 거부 감소: 다른 모델들이 정중하게 거절했을 무해한 질문에도 답변할 의사가 있었습니다.
  • 비유: 비선별된 AI 는 사실을 지어내고 귀를 먹먹하게 만드는 긴장된 가이드와 같습니다. 선별된 AI 는 필요한 것만, 그 이상도 이하도 없이 정확히 알려주는 자신감 있는 전문가입니다.

6. "효율적인 주자" (추론 비용)

마지막으로, 논문은 학습이 끝난 후 AI 를 사용하는 데 드는 비용을 살펴보았습니다.

  • 논문의 주장: 선별된 모델은 단순히 더 똑똑해진 것이 아니라 더 효율적이 되었습니다. 그들은 더 짧은 답변을 생성했으므로 서버에서 실행하는 비용이 더 적게 들었습니다.
  • 비유: 비선별된 AI 는 갤런당 5 마일만 주행하는 스포츠카입니다. 선별된 AI 는 갤런당 15 마일을 주행하지만 똑같이 빠르게 달리는 하이브리드차입니다.

결론

이 논문은 데이터 큐레이션이 현재 우리가 가진 가장 강력한 도구라고 결론 내립니다. 반드시 더 큰 두뇌를 만들거나 슈퍼컴퓨터에 수백만 달러를 쓸 필요는 없습니다. 노이즈를 제거하고 오류를 수정하며 정보를 정리하는 등 데이터를 큐레이션하는 데 시간을 투자한다면, 현재 최첨단 거대 모델들보다 더 똑똑하고, 더 신뢰할 수 있으며, 실행 비용이 더 저렴한 비전 언어 모델을 구축할 수 있습니다.

간단히 말해: AI 에게 얼마나 많이 먹이느냐가 중요한 것이 아니라, 무엇을 먹이느냐가 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →