LaViDa: A Large Diffusion Language Model for Multimodal Understanding
LaViDa는 기존의 자기회귀 모델과 비교하여 경쟁력 있는 성능, 더 빠른 추론, 그리고 향상된 제어 능력을 달성하기 위해 병렬 디코딩과 양방향 컨텍스트를 활용하는 이산 확산 메커니즘 기반의 새로운 시각-언어 모델 제품군을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 동시에 "보고" "말할" 수 있는 세상을 상상해 보십시오. 이것은 시각-언어 모델(Vision-Language Models, VLMs)의 영역으로, 노을진 사진을 보고 그에 대한 시를 쓰거나 복잡한 차트를 살펴보고 추세를 설명할 수 있는 초지능형 AI 비서입니다. 수년 동안 이 모델들이 생각하는 표준적인 방식은 마치 시험을 치르는 학생과 같습니다. 그들은 왼쪽에서 오른쪽으로 엄격하게 한 단어씩 답을 적어 나갑니다. "그," "다음은," "하늘," "은" 순으로 적으며, 이전 단어를 바꾸기 위해 결코 뒤를 돌아보지 않습니다. 이 방식은 잘 작동하지만, 병렬로 글을 쓸 수 없기 때문에 느리며, 만약 문장의 첫 단어를 틀리면 처음부터 다시 시작하지 않고는 쉽게 수정할 수 없을 정도로 경직되어 있습니다.
하지만 만약 다른 방법이 있다면 어떨까요? 문장을 한 단어씩 써 내려가는 대신, 물음표로 가득 찬 빈 페이지에서 시작하여, 모든 단어가 어디에 들어갈지 한꺼번에 결정하고 그림이 선명해질 때까지 선택을 끊임없이 다듬어 나가는 모습을 상상해 보십시오. 이것이 바로 "확산 모델(diffusion models)"의 핵심 아이디어입니다. 원래 노이즈로부터 멋진 이미지를 생성하는 것으로 유명해진 이 모델을, 연구자들은 최근 텍스트에도 이 "빈칸 채우기" 접근 방식을 적용하려고 시도했습니다. 큰 질문은 이것입니다. 이 유연하고 병렬적인 사고 방식을 이미지와 보는 능력과 결합할 수 있을까요? 만약 우리가 이 결합에 성공한다면, 우리는 (모든 행이 특정 글자로 시작해야 하는 시를 쓰는 것과 같은) 엄격한 규칙을 따르는 데 훨씬 더 똑똑할 뿐만 아니라, 다음 단어가 끝날 때까지 기다릴 필요가 없기 때문에 훨씬 더 빠른 AI를 얻게 될 것입니다.
여기 LaViDa(Large Vision-Language Diffusion Model)가 있습니다. UCLA, 파나소닉, 어도비, 세일스포스의 연구진이 발표한 새로운 AI 모델 제품군입니다. LaViDa를 이미지를 이해하고 그것에 대해 글을 쓰는 데 확산 방식을 사용하는 최초의 "멀티태스킹 예술가"라고 생각하십시오. 전통적인 로봇처럼 이야기를 한 단어씩 써 내려가는 대신, LaViDa는 "마스크"(자리 표시자)로 된 빈 캔버스에서 시작하여 답을 점진적으로 드러내며, 문장 전체를 한 번에 볼 수 있는 방식으로 빈칸을 채워 나갑니다.
연구진은 이 접근 방식이 몇 가지 초능력을 가지고 있다는 것을 발견했습니다. LaViDa는 최종 결정을 내리기 전에 전체 문장 구조를 볼 수 있기 때문에, 모든 행이 특정 글자로 시작해야 하는 시를 완성하는 것과 같이 엄격한 규칙이 필요한 작업에 매우 뛰어납니다. 테스트에서 LaViDa는 이러한 "제약 조건이 있는" 작업에서 기존의 최고 모델들과 비교하여 성능을 59% 향상시키며 경쟁자들을 압도했습니다. 또한 사용자에게 독특한 "속도 조절 다이얼"을 제공합니다. 한 번에 더 적은 빈칸을 채워 매우 빠르게 만들 수도 있고, 답을 다듬기 위해 더 많은 단계를 거쳐 매우 높은 품질을 구현할 수도 있습니다. 이미지 캡셔닝(이미지 설명) 작업에서 LaViDA는 경쟁 모델들보다 거의 2배 더 빠르게 작동하면서도 실제로 더 나은 설명을 작성했습니다(CIDEr라는 품질 지표에서 +4.1점 더 높은 점수를 기록).
하지만 논문은 이 새로운 방법이 모든 것을 즉시 해결하는 마법 지팡이는 아니라는 점도 명시하고 있습니다. 연구진은 이를 잘 작동하게 만들기 위해 몇 가지 영리한 기술을 발명해야 했습니다. 하나로, 그들은 "상보적 마스킹(complementary masking)" 기술을 만들었는데, 이는 모델에게 중요한 단서를 놓치지 않도록 한 번에 두 가지 서로 다른 버전의 퍼즐을 푸는 것과 같습니다. 또한 그들은 "Prefix-DLM" 시스템을 구축했는데, 이는 모델이 새로운 단어를 추측할 때마다 이미지와 질문을 매번 다시 읽지 않고도 기억할 수 있게 해주는 스마트한 지름길 역할을 합니다.
이러한 성공에도 불구하고, 논문은 LaViDa가 여전히 성장할 여지가 있다는 점을 신중하게 지적합니다. LaViDa는 추론 및 일반 지식 테스트에서는 다른 모델들을 이기지만, 이미지의 세부 사항을 메모리에 맞추기 위해 압축해야 했기 때문에 이미지 내부의 작은 텍스트를 읽는 것(OCR)에는 때때로 어려움을 겪습니다. 저자들은 확산 모델이 표준적인 "한 번에 한 단어씩" 방식에 대한 강력하고 유망한 대안이지만, 여전히 가장 거대하고 데이터 집약적인 AI 모델들에 필적할 만큼 규모를 키우는 법을 배우고 있다고 제안합니다. 궁극적으로 LaViDa는 "빈칸 채우기" 방식이 단순히 그림을 만드는 것뿐만 아니라, 컴퓨터가 우리의 시각적 세계를 이해하는 데 있어 강력하고 유연하며 빠른 방법이 될 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.