← 최신 논문
💻 computer science

SEER: Long-Context Reasoning via Selective Visual-Text Compression

SEER은 쿼리와 관련된 이미지를 동적으로 선택하여 시각적 스캐닝을 수행하고 필요할 때만 상세 텍스트를 검색함으로써 롱컨텍스트(long-context) 추론의 효율성과 정밀도를 향상시키는 새로운 프레임워크로, 이를 통해 LongBench와 같은 벤치마크에서 기존의 시각-텍스트 및 텍스트 전용 베이스라인들을 능가합니다.

원저자: Jiawei Xu, Zhilin Zhai, Jinrui Fang, Ruohan Xu, Mingfei Lu, Yi Zhang, Guanchu Wang, Tianlong Chen, Ying Ding

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiawei Xu, Zhilin Zhai, Jinrui Fang, Ruohan Xu, Mingfei Lu, Yi Zhang, Guanchu Wang, Tianlong Chen, Ying Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에는 컴퓨터가 머릿속에 담을 수 있는 정보의 양과 그 정보를 처리하는 속도 사이의 점점 커지는 긴장 관계가 존재합니다. 현대의 챗봇과 글쓰기 보조 도구의 기반이 되는 시스템인 대규모 언어 모델은 방대한 양의 텍스트를 처리하도록 설계되었습니다. 그러나 이 시스템들이 한 권의 책이나 긴 법률 보고서와 같이 매우 긴 문서를 읽으려고 할 때, 중대한 장애물에 직면하게 됩니다. 고려해야 할 단어가 많아질수록 더 많은 컴퓨팅 파워와 시간이 필요하며, 이로 인해 속도가 현저히 느려지거나 텍스트 깊숙이 숨겨진 중요한 세부 정보를 놓치기도 합니다. 이를 해결하기 위해 연구자들은 최근 영리한 지름길을 시도했습니다. 바로 텍스트의 페이지를 이미지로 변환하는 것입니다. 단어를 그림으로 렌더링함으로써 컴퓨터는 사람이 페이지의 전체적인 레이아웃을 빠르게 훑어보는 것과 유사하게 문서 전체를 훨씬 더 빠르게 처리할 수 있습니다. 하지만 이러한 속도는 대가를 수반합니다. 텍스트가 이미지로 변환되면, 정확한 숫자, 특정 이름, 또는 정밀한 날짜와 같은 미세한 세부 사항들이 흐릿해지거나 읽기 어려워져, 컴퓨터가 내용에 대한 구체적인 질문에 답해야 할 때 오류를 범하게 됩니다.

한 연구팀은 이미지의 속도와 단어의 정밀함을 모두 잡는 것을 목표로 하는 SEER라는 새로운 접근 방식을 개발했습니다. 모든 문서를 동일한 방식으로 다루는 대신, SEER는 언제 훑어보고 언제 멈춰서 자세히 읽어야 하는지를 아는 숙련된 인간 독자처럼 행동하는 법을 배웁니다. 시스템은 먼저 문서를 일련의 이미지로 살펴보며 어떤 페이지가 특정 질문에 대한 답을 포함하고 있을 가능성이 높은지 빠르게 식별합니다. 일단 관련 페이지를 찾아내면, 시스템은 흐릿한 이미지에만 의존하지 않습니다. 대신 해당 특정 페이지의 원래 텍스트로 다시 돌아가 정확한 단어를 추출합니다. 그런 다음 이미지를 통해 얻은 넓은 맥락과 텍스트로부터 얻은 정밀한 세부 사항을 결합하여 답변을 구성합니다. 이 방식은 불필요한 페이지를 무시함으로써 속도를 유지하는 동시에, 실제로 중요한 부분에 대해서는 높은 정확도를 유지할 수 있게 해줍니다.

연구진은 이 새로운 시스템을 긴 문서를 다루는 표준적이고 까다로운 질문 세트로 테스트했습니다. 그 결과, SEER가 시각적 압축에만 의존했던 이전 방식들보다 성능이 크게 향 만큼 향상되었음을 발견했습니다. 긴 문서 이해도를 측정하는 주요 벤치마크에서, 이 새로운 시스템은 평균 51.11퍼센트의 정확도를 달 정도로 성과를 냈습니다. 이는 시각 전용 접근 방식이 기록한 48.78퍼센트보다 명확히 개선된 수치이며, 이미지 압축을 전혀 사용하지 않은 선도적인 텍스트 기반 모델보다도 높은 점수였습니다. 이러한 성과는 특정 사실을 추출해야 하는 작업, 예를 들어 특정 작가가 얼마나 많은 소설을 썼는지 세거나 보고서에서 특정 날짜를 찾는 등의 과제에서 특히 두드러졌습니다. 이러한 경우, 빠른 시각적 스캔에서 정밀한 텍스트 조회로 전환하는 능력이 상당한 차이를 만들어냈으며, 텍스트가 밀집되어 있어 이미지 형태로 읽기 어려운 일부 중국어 작업에서는 정확도를 거의 19포인트까지 높였습니다.

또한 이 연구는 시스템이 작동할 때 어떻게 행동하는지도 밝혀냈습니다. 평균적으로 질문 하나당 시스템은 문서의 내용을 자세히 조사하기 위해 약 1.59개의 페이지만 선택했습니다. 이는 문서가 실제로는 훨씬 더 많은 페이지를 포함하고 있음에도 불구하고, 시스템이 답변에 필요하지 않은 대다수의 텍스트를 성공적으로 무시하는 법을 배웠음을 시사합니다. 그러나 연구진은 이러한 효율성에 한계가 있다고 언급했습니다. 만약 질문에 대한 답이 여러 다른 페이지에 흩어져 있는 정보에 의존한다면, 단 몇 개의 페이지만 고르는 시스템의 전략은 충분하지 않을 수 있으며 정확도가 떨어질 것입니다. 더욱이, 시스템은 모든 페이지의 모든 단어를 읽지 않음으로써 상당한 컴퓨팅 파워를 절약하지만, 순수한 시간 측면에서 항상 더 빠르게 실행되는 것은 아닙니다. 시스템이 어떤 페이지를 읽을지 결정하고 텍스트를 가져오는 추가 단계를 거치기 때문에, 전체 데이터 처리량은 더 적더라도 단일 질문에 답하는 데 걸리는 총 시간은 때때로 문서 전체를 단순히 읽는 것보다 더 길어질 수 있습니다.

궁극적으로, 이 연구는 긴 문서를 다루는 가장 효율적인 방법은 속도와 정확도 중 하나를 선택하는 것이 아니라, 당면한 과제에 적응하는 하이브리드 전략을 사용하는 것임을 보여줍니다. 컴퓨터에게 언제 큰 그림을 보고 언제 세부 사항을 위해 확대해야 하는지를 가르침으로써, 연구진은 이전 방식들보다 더 빠르고 정밀한 시스템을 만들어냈습니다. 이 연구 결과는 미래의 인공지능 시스템이 모든 단어를 무차별적으로 처리하는 방식보다는, 인간이 복잡한 정보를 탐색할 때 자연스럽게 필요한 곳에만 주의를 집중하는 방식처럼 지능적인 선택에 더 많이 의존하게 될 것임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →