From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems
본 조사는 대규모 언어 모델을 검색기 및 에이전트와 같은 외부 구성 요소와 통합하는 신흥 패러다임으로 컴파운드 AI 시스템을 정의하며, 현재 분열을 해소하고 시스템 수준의 인공지능에 대한 향후 연구를 안내하기 위해 RAG 및 LLM 에이전트와 같은 근본적 패러다임에 대한 통합된 분류 체계와 분석을 제시합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 "LLM"(Large Language Model, 대규모 언어 모델) 이라는 이름의 천재적이고 독서량이 풍부한 사서 한 명이 있다고 상상해 보세요. 이 사서는 특정 날짜까지 쓰인 거의 모든 책을 읽어봤습니다. 그들은 이야기 쓰기, 질문 답변, 대화에 있어 놀라울 정도로 빠릅니다. 하지만 세 가지 큰 문제가 있습니다:
- 사물을 잊어버립니다: 학습을 중단한 후 발생한 사실들을 기억하지 못합니다 (지식이 "낡은" 상태입니다).
- 사실을 지어냅니다: 때로는 정답을 모를 때 자신 있게 가짜 사실을 만들어냅니다 (이를 "할루시네이션"이라고 합니다).
- 수학을 하거나 도구를 사용할 수 없습니다: 대화는 뛰어나지만 복잡한 방정식을 계산하거나 실시간 인터넷을 검색하거나 로봇 팔을 제어하는 것은 실제로 할 수 없습니다.
이 논문은 Compound AI Systems(CAIS, 복합 AI 시스템) 라는 새로운 AI 구축 방식을 소개합니다. CAIS 는 단 한 명의 사서에만 의존하는 대신, 이러한 문제들을 해결하기 위해 사서 주변에 팀이나 오케스트라를 구성합니다.
다음은 이 논문이 간단한 비유를 사용하여 이 "팀"을 어떻게 설명하는지입니다:
1. 네 가지 핵심 팀원 (축)
이 논문은 이 새로운 AI 세계를 함께 작동하는 네 가지 주요 역할로 조직화합니다:
연구자 (RAG - 검색 증강 생성):
- 문제: 사서는 오늘의 뉴스나 회사의 비공개 파일을 알지 못합니다.
- 해결: 사서가 답변하기 전에 연구자가 도서관 선반 (또는 인터넷) 으로 달려가 구체적이고 최신의 문서를 찾아냅니다. 그들은 이 메모들을 사서에게 건네주어 추측이 아닌 사실에 기반해 답변할 수 있게 합니다.
- 비유: 시험 직전에 사서에게 치트시트를 주는 것과 같습니다.
프로젝트 매니저 (LLM 에이전트):
- 문제: 사서는 한 가지 작업은 잘하지만 여러 단계가 필요한 길고 복잡한 프로젝트에는 혼란을 느낍니다.
- 해결: 에이전트는 계획을 세울 수 있는 사서의 버전입니다. 그것은 "휴가 계획하기"와 같은 큰 작업을 "항공권 예약 -> 호텔 찾기 -> 날씨 확인"과 같은 작은 단계로 나눕니다. 또한 여행 API 를 호출하거나 수학 계산을 하는 것과 같은 도구를 사용할 수 있으며, 실수를 수정하기 위해 자신의 작업을 점검할 수도 있습니다.
- 비유: 벽돌만 쌓는 것이 아니라 설계도를 그리고 자재를 주문하며 작업을 검사하는 현장 감독과 같습니다.
다감각 전문가 (MLLMs - 다중 모달 LLM):
- 문제: 사서는 텍스트만 읽을 수 있습니다. 고장 난 엔진 사진이나 폭풍우 영상을 보여주면 그들은 맹목적입니다.
- 해결: 이들은 눈과 귀를 부여받은 사서들입니다. 그들은 이미지를 보고, 오디오를 듣고, 비디오를 본 후 자신이 본 것을 설명하거나 그에 대한 질문에 답할 수 있습니다.
- 비유: 사서에게 안경과 헤드폰을 주어 단순히 쓰여진 글자가 아닌 세상을 이해하게 하는 것과 같습니다.
지휘자 (오케스트레이션):
- 문제: 연구자, 프로젝트 매니저, 다감각 전문가가 있다면, 그들이 서로 말을 겹치거나 누가 무엇을 하는지 혼란스러워할 수 있습니다.
- 해결: 지휘자는 전체 팀을 관리하는 시스템입니다. 언제 연구자를 부르고, 언제 에이전트에게 계획을 세우게 하며, 그들의 답변을 어떻게 하나의 최종 결과로 결합할지 결정합니다. 팀이 매끄럽게 협력하도록 보장합니다.
- 비유: 교향악단을 생각해보세요. 사서는 바이올리니스트이지만, 지휘자는 드럼, 플루트, 바이올린이 소음이 아닌 음악을 만들기 위해 올바른 시간에 연주하도록 만듭니다.
2. 그들이 함께 작동하는 방식 (파이프라인)
이 논문은 실제 세계의 Compound AI 시스템은 이 중 하나만이 아니라 보통 모두가 동시에 작동한다고 설명합니다.
시스템에 이렇게 물어본다고 상상해 보세요: "고장 난 기계의 이 사진을 분석하고 수리 매뉴얼을 찾아보세요."
- 다감각 전문가가 사진을 보고 기계가 무엇인지 이해합니다.
- 연구자가 해당 기계 모델의 구체적인 매뉴얼을 찾아 나갑니다.
- 프로젝트 매니저(에이전트) 가 수리 단계를 파악하고 부품 재고를 확인하기 위해 도구를 사용하기로 결정합니다.
- 지휘자(오케스트레이션) 는 흐름을 관리하여 사진 분석이 매뉴얼 검색보다 먼저 일어나도록 하고, 모든 것을 명확한 답변으로 통합합니다.
3. 현재의 과제
이 논문은 이 "팀" 접근 방식이 강력하지만 현재는 혼란스럽다고 인정합니다:
- 복잡함: 한 사람을 고용하는 것보다 팀을 구축하는 것이 더 어렵습니다. 한 부분이 고장 나면 전체 시스템이 실패할 수 있습니다.
- 공통 언어 부재: 서로 다른 도구와 에이전트는 종종 다른 형식을 사용하여 연결하기 어렵습니다 (유럽식 충전기를 미국식 콘센트에 꽂으려 하는 것과 같습니다).
- 테스트의 어려움: 특히 그들이 동시에 이미지를 보고 도구와 대화할 때 전체 팀이 잘 작동하는지 확인할 완벽한 테스트가 아직 없습니다.
4. 미래: 표준화
이 논문은 사람들이 Model Context Protocol(MCP) 과 같은 "범용 어댑터"를 만들기 시작하고 있다고 강조합니다. 이들은 어떤 AI 도구든 어떤 AI 시스템에도 쉽게 연결할 수 있게 해주는 범용 멀티탭과 같습니다. 목표는 모든 연결마다 맞춤형 다리를 만드는 것을 멈추고, 대신 모든 AI 구성 요소가 서로 대화할 수 있는 표준 방식을 갖는 것입니다.
요약
간단히 말해, 이 논문은 이렇게 말합니다: 모든 것을 완벽하게 수행하는 거대한 뇌 하나를 만들려고 하지 마세요. 대신 뇌 (LLM) 를 기억 은행 (검색), 계획자 (에이전트), 눈/귀 (다중 모달), 그리고 관리자 (오케스트레이션) 에 연결하는 스마트 시스템을 구축하세요. 이 "복합" 시스템은 단일 모델의 한계를 극복하기 때문에 AI 의 미래입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.