Vero: An Open RL Recipe for General Visual Reasoning
이 논문은 600K 개의 다양한 시각 추론 데이터셋과 작업별 보상 설계를 기반으로 한 강화 학습 레시피인 'Vero'를 제안하여, 폐쇄형 모델에 버금가는 성능을 내는 오픈 가중치 비전 - 언어 모델을 개발하고 광범위한 데이터 커버리지가 강화 학습 확장성의 핵심임을 입증했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
비전의 '만능 천재'를 만드는 비밀 레시피: Vero 이야기
이 논문은 인공지능(AI)이 그림을 보고 이해하고 추론하는 능력을 어떻게 극대화할 수 있는지에 대한 놀라운 발견을 담고 있습니다. 마치 다양한 분야의 전문가들을 한 명으로 합쳐 '만능 천재'를 만드는 레시피를 공개한 것과 같습니다.
이제부터 이 복잡한 연구를 일상적인 언어와 비유로 쉽게 설명해 드릴게요.
1. 문제: 왜 AI 는 '한 가지'만 잘할까?
지금까지의 AI 모델들은 보통 특정 분야에 치중되어 있었습니다.
- 어떤 AI 는 수학 문제는 잘 풀지만, 지도에서 길을 찾는 것은 엉망입니다.
- 또 다른 AI 는 차트나 그래프를 잘 읽지만, 사람의 표정을 읽는 데는 서툴러요.
이는 마치 수학 천재가 축구는 못 하고, 축구 선수가 수학은 못 하는 상황과 비슷합니다. 기존에는 이런 AI 들을 훈련시키는 방법이 '비밀 레시피'로 숨겨져 있어서, 누구나 똑같이 좋은 모델을 만들 수 없었습니다.
2. 해결책: 'Vero'와 '600,000 개의 레시피'
연구팀은 **Vero(베로)**라는 새로운 AI 모델을 만들었습니다. Vero 의 핵심 비결은 60 만 개 (600k) 의 다양한 데이터를 섞어 훈련시킨 것입니다.
이 데이터는 마치 6 가지 다른 요리 클래스로 나뉩니다:
- STEM (과학/수학): 복잡한 공식과 도해 해석.
- 지도 및 행동 (Spatial & Action): 로봇이 길을 찾거나 UI 를 조작하는 것.
- 지식 및 인식 (Knowledge): 사물의 이름이나 사실을 아는 것.
- 차트 및 OCR (Chart & OCR): 그래프나 문서의 글자를 읽는 것.
- 위치 찾기 및 세기 (Grounding & Counting): "저기 빨간 공 몇 개 있니?"라고 물으면 찾아서 세는 것.
- 설명 및 지시 따르기 (Captioning & IF): 그림을 보고 감성적인 설명을 쓰거나, "이 그림을 3 줄로 요약해줘" 같은 지시를 따르는 것.
핵심 아이디어: 연구팀은 이 6 가지 클래스를 균형 있게 섞어서 훈련시켰습니다. 마치 요리사에게 한 달 동안 매일 다른 나라의 요리를 가르쳐서, 어느 나라 요리든 척척 해내는 '만능 요리사'를 만든 것과 같습니다.
3. 훈련 방법: "정답을 맞히면 칭찬, 틀리면 다시 생각하게 하기"
이 모델은 단순히 정답을 외우는 게 아니라, 스스로 생각하며 (Chain-of-Thought) 답을 찾도록 훈련됩니다.
- 상상해 보세요: AI 가 그림을 보고 "아, 이건 빨간 사과네. 그런데 사과가 3 개야. 아, 아니야. 저기 숨어 있는 게 하나 더 있네. 그럼 4 개야!"라고 스스로 말하며 생각을 정리합니다.
- 보상 시스템: AI 가 생각한 과정이 논리적이고, 최종 답이 맞으면 **칭찬 (보상)**을 받습니다. 만약 생각 과정이 엉뚱하거나 답이 틀리면 재수강을 시킵니다.
- 중요한 점: 이 연구는 어떤 질문에는 어떤 생각 방식이 필요한지를 AI 가 스스로 배우게 했습니다. 예를 들어, 수학 문제는 깊이 있게 고민하게 하고, 위치 찾기 문제는 빠르게 눈으로 훑게 만드는 식입니다.
4. 놀라운 결과: 비밀 레시피를 공개한 대가
기존에 비공개로만 존재하던 '최고의 AI'들 (예: Qwen3-VL-Thinking 등) 과 비교했을 때, Vero 는 공개된 데이터와 코드만으로도 그들을 능가하거나 견줄 만한 성능을 냈습니다.
- 비유: 남들이 비싼 비밀 레시피를 써서 만든 '세계 일류 셰프'와, 우리가 공개한 '일반적인 재료와 레시피'로 만든 '신인 셰프'가 요리 대회를 했을 때, 신인 셰프가 오히려 더 맛있는 요리를 낸 상황입니다.
- 특히, 수학 문제뿐만 아니라 지도 찾기, 차트 읽기, 그림 설명 등 모든 분야에서 골고루 실력이 뛰어났습니다.
5. 중요한 교훈: "한 가지에 특화되면 다른 건 망가진다"
연구팀은 흥미로운 사실을 발견했습니다.
- 만약 AI 를 수학 문제만 풀게 훈련시키면, 그림 설명을 잘 쓰던 능력이 사라집니다. (수학 천재가 시를 못 쓰게 되는 것)
- 반대로 그림 설명만 훈련시키면, 수학 문제를 푸는 논리력이 떨어집니다.
하지만 모든 분야를 골고루 섞어 훈련시키면, AI 는 상황에 따라 적절한 두뇌 회로를 켜고 끄는 능력을 갖게 됩니다. 마치 다재다능한 스포츠 선수가 되어, 축구장에서는 축구, 농구장에서는 농구를 잘하는 것처럼요.
6. 결론: 투명함이 곧 힘이다
이 논문은 "AI 를 더 똑똑하게 만드는 비결은 더 많은 비밀 데이터가 아니라, 다양하고 균형 잡힌 공개 데이터와 명확한 훈련 방법에 있다"고 말합니다.
- Vero는 이제 누구나 이 레시피를 따라 할 수 있도록 모든 데이터와 코드를 공개했습니다.
- 이는 AI 연구가 '비밀 유지'에서 벗어나, 함께 발전하는 오픈 소스 문화로 나아가야 함을 보여줍니다.
한 줄 요약:
"한 가지 일만 잘하는 전문가가 아니라, 모든 일을 척척 해내는 '만능 천재' AI 를 만들려면, 다양한 경험을 골고루 섞어 훈련시켜야 합니다. 그리고 그 비결은 이제 누구나 공유할 수 있습니다!"
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.