Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models
이 논문은 비전 언어 모델 (VLM) 의 성능 향상을 위해 최신 LLM 백본을 도입하는 것이 항상 유익한 것은 아니며, 시각 이해 중심 작업에는 미미한 효과가 있지만 시각적 질문 응답과 같은 작업에서는 모델의 정보 처리 방식과 내부 표현의 안정성 변화에 따라 다른 유형의 질문을 해결하는 등 작업 유형에 따라 그 효과가 달라진다는 것을 체계적으로 분석합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🍳 실험의 설정: 같은 재료, 다른 요리사
연구진들은 **비주얼-언어 모델 (VLM)**을 만들기 위해 다음과 같은 실험을 했습니다.
- 눈 (Vision Encoder): 모든 실험에서 똑같은 '카메라'를 사용했습니다. (이미지 인식 능력은 고정)
- 데이터 (Training Data): 모든 실험에서 똑같은 '교과서'와 '문제집'을 사용했습니다.
- 요리사 (LLM Backbone): 여기서만 변수를 줬습니다.
- 1 세대 요리사 (LLaMA-1): 초보 요리사
- 2 세대 요리사 (LLaMA-2): 조금 더 경험 많은 요리사
- 3 세대 요리사 (LLaMA-3): 최신식 훈련을 받은 천재 요리사
그런데 결과는 예상과 달랐습니다. **"요리사가 더 똑똑해졌다고 해서, 모든 요리의 맛이 좋아지는 건 아니었다"**는 것이 결론입니다.
🔍 주요 발견 5 가지 (일상적인 비유로)
1. "요리사 실력이 좋아져도, 모든 요리는 더 맛있게 안 된다"
- 상황: 어떤 요리는 요리사의 언어 실력이 중요하고, 어떤 요리는 '눈'이 더 중요합니다.
- 결과:
- 과학 문제 (ScienceQA): 요리사가 더 똑똑해졌는데, 오히려 점수가 떨어졌습니다.
- 이유: 이 문제는 "기억력"을 테스트하는 문제였습니다. 1 세대 요리사가 이미 외운 답을 정확히 기억해 냈는데, 3 세대 요리사는 새로운 방식의 사고를 하다가 오히려 헷갈려서 틀린 경우가 많았기 때문입니다.
- 일상 사진 설명 (VQA-Scene): 요리사가 똑똑해질수록 점수가 올라갔습니다.
- 이유: 이 문제는 사진 속 사물을 보고 설명하는 것이므로, 언어 이해도가 높은 요리사가 더 잘 설명해 냈습니다.
- 과학 문제 (ScienceQA): 요리사가 더 똑똑해졌는데, 오히려 점수가 떨어졌습니다.
2. "같은 문제를 더 잘 푸는 게 아니라, '다른' 문제를 풀기 시작했다"
- 비유: 1 세대 요리사와 3 세대 요리사가 같은 메뉴판 (문제집) 을 봤을 때, 서로 다른 요리를 주문했습니다.
- 결과: 3 세대 요리사가 더 높은 점수를 받았지만, 그 이유는 "기존에 틀렸던 문제를 고친 것"이 아니라, "1 세대가 틀렸던 문제를 맞췄고, 1 세대가 맞췄던 문제를 틀린 것" 때문입니다.
- 교훈: 전체 점수만 보면 "더 좋아졌다"고 생각하지만, 실제로는 AI 가 문제를 바라보는 관점 자체가 완전히 달라진 것입니다.
3. "눈이 나쁜데 요리사만 바꾼다고 소용없다"
- 상황: 지진 관련 사진을 보고 지진 발생 위치를 설명하는 작업입니다.
- 결과: 이 작업은 '카메라 (눈)'가 지진 사진을 잘 봐야 합니다. 카메라가 똑같은데 요리사만 바꿨더니, 점수는 거의 변하지 않았습니다.
- 교훈: 이미지가 흐릿하거나 복잡한 작업에서는, 아무리 똑똑한 요리사 (LLM) 를 써도 소용없습니다. 카메라 (비전 인코더) 를 업그레이드하는 게 훨씬 중요합니다.
4. "새로운 요리사만이 할 수 있는 '마법'이 생겼다"
- 상황: 지진 사진에서 정확한 **위도와 경도 (숫자)**를 맞추는 작업입니다.
- 결과: 1 세대와 2 세대 요리사는 숫자를 전혀 못 맞추고 (0%), 3 세대 요리사는 **76.5%**를 맞췄습니다.
- 이유: 3 세대 요리사는 숫자나 좌표 같은 '구조화된 정보'를 다루는 훈련을 더 많이 받았기 때문입니다. 이는 기존 모델에는 없던 새로운 능력이 갑자기 생긴 경우입니다.
5. "자신감은 낮아졌는데, 실력은 더 좋아졌다"
- 비유:
- 1 세대 요리사: "이거 100% 맞아요!"라고 소리치지만, 틀릴 때도 많습니다. (과신)
- 3 세대 요리사: "음... 아마 이거일 것 같은데?"라고 조심스럽게 말하지만, 정답을 맞힙니다. (적절한 자신감)
- 결과: 3 세대 모델은 자신의 답변에 대해 100% 확신하지 않습니다. 하지만 내부적으로 정보를 처리하는 방식이 훨씬 안정적이고, 틀렸을 때를 대비해 확률을 분산시키기 때문에 결과적으로 더 정확합니다.
💡 한 줄 요약
"더 똑똑한 언어 모델 (LLM) 을 쓴다고 해서 무조건 더 좋은 AI 가 만들어지는 건 아닙니다. 어떤 일을 시키느냐에 따라, 오히려 성능이 떨어지거나 완전히 다른 방식으로 문제를 풀게 될 수도 있습니다. 중요한 건 '무엇을 하느냐'에 따라 눈 (비전) 을 업그레이드할지, 머리 (언어) 를 업그레이드할지 선택하는 것입니다."
이 연구는 AI 개발자들이 "무조건 최신 모델을 쓰자"가 아니라, **"내 작업에 어떤 모델이 진짜로 잘 맞는지"**를 신중하게 따져봐야 한다는 중요한 교훈을 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.