← 최신 논문
🤖 AI

Scalable Visual Pretraining for Language Intelligence

이 논문은 그림과 레이아웃 같은 풍부한 정보를 보존하는 가공되지 않은 시각적 문서에 대한 비지도 시각적 사전 학습이 텍스트 전용 방식보다 일관되게 우수한 성능을 보이며 향상된 언어 지능을 위한 확장 가능한 경로를 제공한다는 점을 입증함으로써, 파운데이션 모델 사전 학습의 텍스트 전용 패러다임에 도전한다.

원저자: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

게시일 2026-07-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 오랫동안 표준적인 레시피는 산더미 같은 책, 기사, 웹사이트를 로봇에게 먹이는 것이었지만, 한 가지 조건이 있었습니다. 로봇이 읽기 전에 인간(또는 컴퓨터)이 모든 그림, 구불구불한 수학 기호, 차트, 그리고 화려한 페이지 레이아웃을 제거하여, 모든 것을 평범하고 지루한 텍스트로 바꾸어 놓는 것입니다. 이것은 마치 누군가에게 케이크를 굽는 법을 가르치기 위해 완성된 케이크의 사진, 믹싱 볼의 도해, 오븐 온도가 어떻게 변하는지를 보여주는 알록달록한 그래프는 모두 버린 채, 냅킨에 적힌 재료 목록만 주는 것과 같습니다.

2026년의 한 새로운 논문은 이러한 "텍스트 전용" 접근 방식이 거대한 퍼즐의 조각 중 아주 큰 부분을 놓치고 있다고 제안합니다. 상하이와 저장성 팀이 이끄는 연구진은 문서의 시각적 부분을 버리는 것이 우리가 로봇이 진정으로 똑똑해지는 데 필요한 바로 그 단서들을 버리는 것이라고 주장합니다. 그들은 이 새로운 방법을 **시각적 사전 학습(Visual Pretraining, VP)**이라고 부르며, 이는 로봇에게 단순히 텍text 설명만을 주는 것이 아니라, 도표와 방정식이 포함된 교과서의 실제 페이지를 읽는 법을 가르치는 것과 같습니다.

거대한 발견: 보는 것이 믿는 것이며, 배우는 것이다
연구팀은 이 아이디어를 사용 가능한 가장 똑똑한 AI 모델들(Qwen이나 Llama 같은)에 테스트했습니다. 그들은 동일한 과학 문서 뭉치(물리학 논문, 수학 교과서, 기술 보고서 등)를 가져와 두 그룹으로 나누었습니다.

  • 그룹 A (기존 방식): 모든 시각적 요소를 제거하고 페이지를 순수 텍스트로 변환했습니다.
  • 그룹 B (새로운 방식 - VP): 페이지의 원본 이미지를 모델에 직접 입력하여, 모델이 텍스트로 변환되기 전의 도표, 표, 레이아웃을 직접 "보게" 했습니다.

결과는 이랬습니다. 원본 이미지로 학습한 로봇(그룹 B)은 순수 텍스트로 학습한 로봇(그룹 A)보다 일관되게 더 똑똑했습니다. 실제로 까다로운 과학 및 수학 벤치마크에서 시각적 학습 모델이 더 높은 점수를 기록했습니다. 예를 들어, AIME라는 어려운 수학 테스트에서 시각적 모델은 텍스트 모델보다 훨씬 더 유의미하게 점수가 향상되었습니다. 이 논문은 복잡한 페이지를 텍스트 문자열로 변환하는 "손실이 발생하는(lossy)" 과정이 실제로 어려운 문제를 해결하는 데 필요한 바로 그 정보를 삭제한다고 시사합니다.

효율성의 해킹: 적은 것으로 더 많이 하기
여기 정말 멋진 부분이 있습니다. 시각적 방법은 단순히 더 나았을 뿐만 아니라, 훨씬 더 효율적이었습니다. 텍스트 기반 모델은 이 문서들로부터 배우기 위해 약 800억 개의 텍스트 토큰을 씹어 삼켜야 했습니다. 그러나 시각적 모델은 동일하거나 더 나은 결과를 얻기 위해 약 200억 개의 시각적 토큰만을 필요로 했습니다! 이는 데이터 예산의 단 **25%**만을 사용한 것입니다!

이렇게 생각해 보세요. 만약 텍스트 모델이 모든 거리 이름과 건물 주소를 하나하나 나열하며 도시를 설명하려고 한다면 시간이 엄청나게 오래 걸릴 것입니다. 반면, 시각적 모델은 그냥 지도를 봅니다. 전체 그림을 즉시 파악하는 것이죠. 연구진은 "시각적 요소"(복잡한 도표나 방정식 등)가 많은 페이지일수록 시각적 모델의 이점이 더 커진다는 것을 발견했습니다. 차트와 공식이 가득 찬 페이지에서 시각적 모델의 우위는 거대해졌으며, 일반 텍스트 페이지에서는 두 모델이 비슷했습니다.

치트키 없이, 순수한 시각만으로
여러분은 "그들이 로봇에게 사진과 정답을 함께 보여주며 속임수를 쓴 것 아니냐"고 물을 수도 있습니다. 아닙니다. 그들은 특별한 "이미지-텍스트" 라벨이나 치트 시트를 사용하지 않았습니다. 로봇은 단지 이미지의 다음 패치를 보고 그것이 어떻게 보일지 추측하라는 명령을 받았으며, 이는 문장에서 다음 단어를 예측하는 방식과 유사합니다.

놀랍게도, 이 "단순히 보는" 학습은 로봇을 보는 것뿐만 아니라 모든 것에 대해 더 뛰어나게 만들었습니다. 로봇은 텍스트를 이해하는 능력도 더 좋아졌고, 나중에 테스트했을 때 그림과 단어를 연결하는 능력도 더 좋아졌습니다. 연구진은 로봇의 "두뇌"가 그림과 단어를 얼마나 잘 정렬하는지 측정했으며, 시각적 학습이 두 개념을 훨씬 더 긴밀하게 결합시켜, 마치 로봇이 드디어 고양이 그림과 "고양이"라는 단어가 실제로 같은 것이라는 점을 이해하게 된 것처럼 만들었다는 것을 발견했습니다.

이것이 의미하는 바 (그리고 의미하지 않는 바)
저자들은 이것이 텍스트 읽기를 대체하는 마법 지팡이가 아니라는 점을 분명히 하고 있습니다. 이미 명확하게 적혀 있는 사실을 배우는 데는 여전히 텍스트가 훌륭합니다. 하지만 레이아웃, 방정식의 형태, 도표의 위치가 결정적인 의미를 갖는 과학 문서의 경우, 시각적 접근 방식은 더 확장 가능한 새로운 길을 제시합니다.

그들은 아직 모든 것을 해결하지 못했다는 점도 인정합니다. 예를 들어, 그들의 테스트는 주로 고밀도 과학 PDF에 집중되었기 때문에, 이것이 자연의 무작위 사진이나 비디오에도 똑같이 효과적일지는 확실하지 않습니다. 하지만 복잡한 문서를 학습하는 특정한 사례에 있어서, AI에게 세상이 있는 그대로의 모습—시각적이고, 무질서하며, 도표로 가득 찬 모습—을 보게 하는 것이 진정한 지능을 여는 열쇠가 될 수 있음을 이 논문은 시사합니다. 이것은 "지도의 설명을 읽는 것"에서 "실제로 지도를 보는 것"으로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →