FineVision: Open Data Is All You Need
FineVision 은 200 개 이상의 소스를 엄격한 반자동 파이프라인으로 통합하고 인간의 감독을 통해 오염과 중복을 제거하여 정성적으로 선별된 2400 만 개의 비전 - 언어 샘플로 구성된 가장 큰 공개 코퍼스를 도입하여, 이 데이터셋으로 훈련된 모델이 기존 공개 대안들을 크게 능가할 수 있도록 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 인간처럼 세상을 보고 이해하는 법을 가르친다고 상상해 보세요. 이를 위해 수백만 장의 이미지를 보여주고 그것들에 대해 말하는 법을 가르쳐야 합니다. 이것이 바로 "비전-언어 모델"(VLM)이 하는 일입니다.
그러나 지금까지 공개된 "교과서"(데이터셋) 는 엉망이었습니다. 이는 마치 어떤 책은 다른 언어로 쓰여 있고, 어떤 페이지는 찢어졌으며, 오타가 있거나 심지어 나중에 로봇이 평가를 받을 시험 문제의 복사본까지 섞여 있는 도서관과 같았습니다. 이로 인해 오픈소스 로봇들은 빅테크 기업이 만든 비싸고 비밀스러운 로봇만큼 잘 학습하기 어려웠습니다.
FineVision은 허깅페이스, 뮌헨 공과대학교, 스탠포드 대학교의 연구자들이 만든 새롭고 방대하며 정밀하게 정제된 도서관입니다. 그들이 이를 어떻게 구축했고 왜 중요한지 간단히 설명해 드리겠습니다.
1. 대정리 (데이터 큐레이션)
연구자들은 학술 논문부터 클라우드 저장소 폴더에 이르기까지 200 개가 넘는 다양한 데이터 소스를 수집했습니다. 하지만 단순히 이를 한데 모으는 것만으로는 효과가 없었습니다.
- 번역가: 그들은 모든 다른 형식을 하나의 표준 언어로 변환하기 위해 AI 도우미를 활용한 "반자동" 시스템을 구축했습니다. 프랑스어, 일본어로 쓰인 것부터 냅킨에 적힌 것까지 다양한 200 가지 레시피를 모두 하나의 쉽게 따라 할 수 있는 요리책 형식으로 변환한다고 상상해 보세요.
- 인간 편집자: AI 는 완벽하지 않습니다. 따라서 인간 심사자들이 편집자 역할을 했습니다. 그들은 AI 의 작업을 점검하고 실수를 수정하며 "레시피"가 안전하고 정확한지 확인했습니다. AI 가 변환 과정에서 실수를 하면 인간이 이를 수정하고 AI 에게 다시 시도하도록 지시했습니다.
- 중복 제거: 그들은 특수한 "복사본 탐지기"를 사용하여 중복된 이미지를 찾아 제거했습니다. 만약 같은 고양이 사진이 도서관에 50 번이나 나타났다면, 로봇이 같은 고양이를 반복해서 암기하지 않도록 하나만 남겼습니다 (또는 이를 단일하고 더 풍부한 대화로 병합했습니다).
- 시험 안전 구역: 그들은 로봇들을 평가하는 데 사용되는 66 가지 표준 시험과 도서관을 대조했습니다. 만약 도서관에 미래 시험의 이미지와 동일한 이미지가 발견되면 이를 제거했습니다. 이는 로봇이 단순히 정답을 암기하여 "부정"하는 것이 아니라 실제로 "학습"하고 있음을 보장합니다.
2. 도서관 안에는 무엇이 있을까?
최종 결과는 FineVision으로, 약 1700 만 장의 이미지를 포함한 2,400 만 개의 샘플 컬렉션입니다. 이는 단순히 사진 더미가 아니라 대화 형태로 조직화되어 있습니다.
- 다양성: "이게 뭐야?"라는 단순한 질문부터 차트 읽기, 수학 문제 풀기, 문서 이해와 같은 복잡한 작업까지 모든 것을 다룹니다.
- "행동" 섹션: 도서관의 특별한 부분은 로봇이 컴퓨터 인터페이스 (마우스 클릭이나 휴대폰 화면 타이핑 등) 를 사용하는 법을 가르칩니다. 이를 표준화하여 로봇이 데스크톱, 휴대폰, 브라우저에서 작동하는 보편적인 "행동 언어"를 학습하도록 했습니다.
- 품질 관리: 도서관에 있는 모든 대화는 AI 심사관 (그리고 인간에 의해 점검됨) 에 의해 다음 네 가지 기준에 따라 점수를 매겼습니다.
- 형식: 텍스트가 깔끔하고 읽기 쉬운가?
- 관련성: 답변이 실제로 질문과 일치하는가?
- 시각적 의존성: 답변이 정확하려면 이미지를 실제로 봐야 하는가?
- 대응: 이미지가 실제로 질문이 묻는 내용을 보여주고 있는가?
3. 결과: 효과가 있는가?
연구자들은 이 새로운 도서관을 사용하여 작은 로봇 모델을 훈련시키고, 다른 인기 있지만 엉망인 도서관으로 훈련된 모델들과 비교했습니다.
- 점수판: FineVision 으로 훈련된 로봇은 11 가지 다른 시험에서 훨씬 높은 점수를 받았습니다. 이전 최고의 오픈소스 도서관들을 압도적으로 능가했으며 (경쟁자에 따라 성능이 약 11% 에서 38% 까지 향상됨) 넓은 격차를 보였습니다.
- "부정" 테스트: 훈련 데이터에서 시험에서 유출되었을 가능성이 있는 몇몇 남은 "부정" 이미지 (데이터) 를 제거했을 때, FineVision 로봇의 성능은 거의 떨어지지 않았습니다. 반면 다른 로봇들의 성능은 크게 하락했습니다. 이는 FineVision 이 로봇에게 단순히 암기하는 것이 아니라 "이해"하는 법을 가르쳤음을 증명합니다.
- GUI 마법: FineVision 으로 훈련된 로봇은 다른 작은 모델들보다 컴퓨터 화면 (버튼 클릭, 타이핑 등) 을 탐색하는 데에도 훨씬 뛰어났으며, 네 배 더 큰 모델들과同등한 성능을 발휘했습니다.
결론
이 논문은 정제되고 다양하며 잘 조직화된 데이터가 비결이라고 주장합니다. 반드시 더 큰 모델이나 비밀 데이터셋이 필요한 것은 아닙니다. 단지 더 나은 도서관이 필요할 뿐입니다. FineVision 은 데이터를 정제하고 신중하게 조직화함으로써 오픈소스 모델이 마침내 대형 폐쇄소스 모델들과 경쟁할 수 있음을 증명합니다.
연구자들은 이 도서관과 이를 정제하는 데 사용된 도구를 공개하여 전체 커뮤니티가 더 똑똑하고 신뢰할 수 있는 AI 비전 시스템을 구축하는 데 도움이 되기를 바랍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.