A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications
이 설문 조사는 다양한 모달리티가 지각 및 추론과 같은 핵심 기능 모듈에 어떻게 통합되는지 분석하고, 로보틱스 및 웹 내비게이션과 같은 도메인 전반의 응용 사례를 평가하여 격차를 식별하고 견고한 범용 지능형 시스템을 위한 로드맵을 설정함으로써, 멀티모달리티가 에이전트 프레임워크에 미치는 영향을 체계적으로 검토한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
수십 년 동안 인공지능의 꿈은 인간처럼 스스로 생각하고 행동할 수 있는 기계를 만드는 것이었습니다. 이러한 '에이전트'를 만들기 위한 초기 시도들은 종-종 실패했는데, 그 이유는 이들이 복잡한 현실 세계에서 무너지는 엄격한 규칙만을 따르는 너무 경직된 구조를 가졌기 때문이었습니다. 이 분야는 방대한 양의 텍스트를 학습하여 추론하고, 계획을 세우며, 지시를 따를 수 있는 강력한 컴퓨터 프로그램인 대규모 언어 모델의 등장과 함께 극적으로 변화했습니다. 그러나 이 텍스트 기반의 사고 체계에는 맹점이 있었습니다. 바로 단어만을 이해할 수 있다는 점이었습니다. 이미지, 소리, 또는 비디오를 마주했을 때, 이들은 풍부한 시각적 또는 청각적 세부 사항을 단순한 설명으로 변환하는 서투른 번역 과정에 의존해야 했습니다. 이러한 번역은 복잡한 환경에서 올바르게 행동하는 데 필요한 바로 그 세부 사항들을 탈락시키곤 했습니다.
이 간극을 메우기 위해 연구자들은 여러 감각을 통해 동시에 세상을 지각하고 이해할 수 있는 차세대 시스템을 개발해 왔습니다. 이들은 이미지를 보고, 소리를 듣고, 텍스트를 동시에 읽으며 결정을 내릴 수 있는 멀티모달 에이전트입니다. 과학자들의 핵심 질문은 어떻게 이 서로 다른 감각들을 가장 잘 결합할 것인가 하는 점이었습니다. 시스템이 각 감각을 분석하기 위해 별도의 도구를 사용한 다음 그 결과를 중앙 뇌로 전달하게 해야 할까요? 아니면 뇌 자체가 처음부터 모든 감각을 이해할 수 있도록 구축되어야 할까요? 전 세계 대학과 연구소의 연구진이 수행한 포괄적인 새로운 조사는 이러한 시스템의 전체 지형을 그려내며, 다양한 설계 선택이 실세계에서 보고, 생각하고, 기억하고, 행동하는 능력에 어떤 영향을 미치는지 분석했습니다.
연구진은 수백 개의 프레임워크를 검토하고, 정보를 처리하는 방식에 따라 이를 분류했습니다. 그들은 가장 초기 단계의 단순한 접근 방식이 이미지를 설명하거나 오디오를 전사하기 위해 특화된 외부 도구를 호출하는 텍의 전용 뇌를 사용하는 형태였다는 것을 발견했습니다. 이 방식은 모듈화되어 있고 유연했지만, 조사는 중대한 결함을 드러냈습니다. 복잡한 이미지를 텍텍스트 설명으로 바꾸는 행위는 필연적으로 정보의 손실을 초래한다는 것이었습니다. 물체가 정확히 어디에 있었는지, 혹은 어떻게 움직였는지와 같은 중요한 공간적 세부 사항들이 번역 과정에서 흔히 사라지곤 했습니다. 이를 해결하기 위해 '후기 융합(late-fusion)' 기술을 사용하는 두 번째 파동의 시스템들이 등장했습니다. 이 시스템들은 이미지나 소리로부터의 원시 데이터를 가져와 수학적 형식으로 변환한 뒤, 언어 모델의 메모리에 직접 입력했습니다. 이는 더 많은 세부 사항을 보존했지만, 서로 다른 감각들은 결합되기 전까지 여전히 다소 분리되어 처리되었습니다.
저자들이 현재의 최전선이라고 식별한 가장 진보된 시스템들은 '초기 융합(early-fusion)' 아키텍처를 사용합니다. 이 모델들에서 컴퓨터는 세상을 먼저 단어로 번역하지 않습니다. 대신, 원시 픽셀, 음파, 그리고 텍스트 토큰을 하나의 통합된 흐름 속에서 함께 처리합니다. 이를 통해 시스템은 목소리의 톤이 얼굴 표정과 일치하는지, 혹은 화면 위의 버튼 위치가 정확한지와 같은 미묘한 연결 고리를 아무런 세부 사항의 손실 없이 포착할 수 있습니다. 조사는 이러한 네이티브 멀티모달 시스템이 스크린샷을 보고 웹사이트를 탐색하거나 눈에 보이는 것에 따라 로봇 팔을 제어하는 것과 같이 정밀한 이해를 요구하는 작업에서 이전 세대의 모델들을 능가하기 시작했음을 보여줍니다.
하지만 논문은 이러한 발전이 상당한 트레이드오프(상충 관계)를 동반한다는 점을 명확히 합니다. 가장 통합된 시스템이 가장 유능하지만, 동시에 가장 비용이 많이 들고 실행 속도가 느립니다. 연구진은 거대한 독점 모델에 의존하는 시스템들이 종종 속도 문제로 어려움을 겪으며, 단 한 단계를 처리하는 데 몇 초 또는 몇 분이 걸릴 수 있어 운전이나 빨래와 같은 실시간 작업에는 부적합하다는 것을 발견했습니다. 반면, 특정 작업에 맞춰 미세 조정된 더 작고 특화된 모델들은 훨씬 빠르고 저렴하게 실행될 수 있지만, 완전히 새로운 문제를 해결하는 데는 그만큼 영리하지 못할 수 있습니다. 조사는 단 하나의 '최고'인 설계란 존재하지 않으며, 적절한 선택은 전적으로 작업에 달려 있다고 강조합니다. 실시간으로 손을 움직여야 하는 로봇의 경우 속도와 효율성이 가장 중요하므로 더 작고 특화된 모델이 유리합니다. 반면, 복잡한 영상을 이해하거나 창의적인 콘텐츠를 생성해야 하는 시스템의 경우, 더 큰 통합 모델이 제공하는 풍부한 이해력이 추가 비용을 지불할 가치가 있습니다.
연구진은 또한 이러한 에이전트들이 구체적인 실세계 시나리오에서 어떻게 수행되는지도 살펴보았습니다. 로보틱스 영역에서 가장 성공적인 시스템은 별도의 계획 단계를 거칠 필요 없이 자신이 보는 것을 물리적 움직임으로 직접 변환할 수 있는 시스템들입니다. 웹사이트와 앱을 탐색하는 디지털 세계에서, 조사는 최고의 시스템들조차 여전히 정밀도 측면에서 어려움을 겪고 있음을 발견했습니다. 그들은 페이지의 일반적인 개념은 이해할 수 있지만, 정확한 버튼을 클릭하거나 올바른 상자에 타이핑하는 데는 자주 실패하며, 이는 인간의 성능과 큰 격차를 보여줍니다. 마찬가지로, 긴 영상을 이해하는 데 있어 가장 효율적인 시스템들은 모든 프레임을 다 보려고 하지 않습니다. 대신, 인간 관찰자처럼 질문과 관련된 특정 순간만을 찾아내기 위해 영상을 건너뛰며, 이를 통해 정확도를 유지하면서도 엄청난 컴퓨팅 자원을 절약합니다.
이러 이러한 성공에도 불구하고, 조사는 이 에이전트들이 진정으로 신뢰할 수 있는 존재가 되는 것을 가로막는 몇 가지 고질적인 한계점을 지적합니다. 주요 이슈 중 하나는 '그라운딩(grounding)', 즉 고차원적인 아이디어를 특정 물리적 위치와 연결하는 능력입니다. 가장 똑똑한 시스템조차도 버튼이 존재하지 않는 곳에 있다고 믿거나, 자신이 계획한 행동이 물리적으로 불가능하다는 사실을 깨닫지 못하는 등 환각 현상을 일으키곤 합니다. 또 다른 과제는 기억력입니다. 에이전트들은 과거의 사건을 기억할 수는 있지만, 환경이 예기치 않게 변할 때 긴 시간 동안 일관된 이야기를 유지하는 데 어려움을 겪는 경우가 많습니다. 연구진은 또한 최고의 성능을 보이는 많은 시스템이 과학계가 검증하거나 개선할 수 없는 폐쇄적인 독점 모델에 의존하고 있어, 그들의 실제 역량을 검증하거나 왜 실패하는지 이해하기 어렵다는 점에 주목했습니다.
궁극적으로, 이 논문은 지능형 에이전트의 미래가 단순히 모델을 더 크게 만드는 것이 아니라, 더 효율적이고 더 잘 접지(grounded)되도록 만드는 데 있다고 제안합니다. 가장 유망한 경로는 거대 모델의 원초적인 힘과 더 작고 특화된 도구의 속도 및 정밀함을 결합하는 하이브리드 접근 방식인 것으로 보입니다. 자신의 전체 지능을 언제 사용할지, 그리고 언제 더 단순하고 빠른 방법을 사용할지를 아는 시스템을 정교하게 설계함으로써, 연구자들은 에이전트가 단순히 똑똑할 뿐만 아니라 복잡하고 예측 불가능한 현실 세계에서 인간과 함께 일할 수 있을 만큼 신뢰할 수 있고, 빠르며, 안전하도록 만들기를 희고 있습니다. 텍스트 전용 사고 체계에서 진정한 멀티모달 에이전트로의 여정은 거대한 도약이었지만, 조사는 이러한 시스템이 인간 지능의 유연성과 신뢰성을 진정으로 갖추기 전까지는 여전히 해결해야 할 중대한 장애물들이 남아 있다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.