Dual-Cache Latent Space Communication between Heterogeneous Language Models
이 논문은 이질적이고 동결된 언어 모델들이 학습된 KV 캐시 번역기를 통해 정보를 교환할 수 있게 함으로써, 기하학적 구조 및 레이어 정렬의 기존 한계를 극복하고 텍스트 기반 및 이전의 잠재 공간 통신 방식보다 뛰어난 정확도와 현저히 빠른 추론 속도를 달성하는 새로운 통신 프로토콜인 XKV를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능의 지형에서 대규모 언어 모델은 점차 고립된 사고자가 아니라 팀의 일원으로서 기능하고 있습니다. 각자가 서로 다른 문서 세트만을 읽은 연구자들이 복잡한 미스터리를 해결하기 위해 협력하는 모습을 상상해 보십시오. 이 사건을 해결하기 위해 그들은 자신이 알고 있는 것을 공유해야 합니다. 디지털 세계에서 이 "연구자들"은 소프트웨어 에이전트이며, 그들이 보유한 문서는 그들의 내부 메모리 안에 숨겨진 증거 조각들입니다. 이 에이전트들이 함께 협력하기 위해서는 한 곳에서 다른 곳으로 정보를 전달할 방법이 필요합니다. 최근까지 표준적인 방법은 한 에이전트가 평이한 영어로 요약문을 작성하여 다음 에이전트에게 보내는 것이었습니다. 이는 인간이 읽기에는 쉽지만, 기계에게는 비효율적입니다. 보내는 에이전트는 단어 하나하나를 천천히 구성해야 하며, 받는 에이전트는 그 단어들을 읽고 자신의 내부 이해도를 처음부터 다시 구축해야 합니다. 이 과정은 주자들이 멈춰서 메모를 쓰고, 그것을 건네준 뒤, 다시 달리기 위해 시간을 들여 읽어야 하는 계주와 같습니다.
연구자들은 글자를 쓰고 읽는 과정을 완전히 건너뛰는 더 빠른 통신 방법을 탐구해 왔습니다. 텍스트를 교환하는 대신, 그들은 한 기계의 가공되지 않은 내부적 "생각"을 다른 기계로 직접 전달하려고 시도했습니다. 이는 주자에게 글을 읽을 필요 없이 즉시 흡수할 수 있는 미리 작성된 메모를 건네주는 것과 비슷합니다. 그러나 초기 단계의 직접 전달 시도들은 벽에 부딪혔습니다. 그 방식은 두 기계가 동일한 쌍둥이일 때만 잘 작동하거나, 혹은 송신자가 가진 모든 지식을 수신자가 이미 알고 있는 것과 상관없이 하나의 일반적인 요약본으로 압축하도록 강요했습니다. 이는 수신자가 너무 모호하거나 자신의 특정 요구사항과는 무관한 메시지를 받게 된다는 것을 의미했습니다. 과제는 빠르고, 서로 다른 유형의 기계 사이에서도 작동하며, 수신자가 단순히 일률적인 요약을 받아들이는 것이 아니라 자신이 정확히 필요로 하는 정보를 요청할 수 있는 통신 채널을 만드는 것이었습니다.
한 연구팀은 이러한 문제들을 해결하는 XKV라는 새로운 시스템을 도입했습니다. 그들의 접근 방식은 두 서로 다른 언어 모델 간의 통신을 단순한 전달이 아닌 공동의 노력으로 취급합니다. 퍼즐의 한 조각을 가진 모델과 나머지 부분을 가진 모델은 각각 원래의 상태로 고정되어 있어, 즉 그들의 핵심 지능은 변경되지 않습니다. 대신, 가벼운 번역기가 그들 사이에 위치합니다. 이 번역기는 두 모델의 내부 메모리를 동시에 살펴봅니다. 이 번지는 단순히 첫 번째 모델이 알고 있는 것을 요약하는 것이 아니라, 두 메모리 세트를 비교함으로써 두 번째 모델에게 무엇이 부족한지를 파악합니다. 그런 다음, 송신자의 증거와 수신자의 현재 상태를 혼합한 압축된 공유 메모리 뱅크를 생성합니다.
혁신은 이 공유 메모리가 사용되는 방식에 있습니다. 이전 시스템에서는 수신 모델의 모든 부분이 마치 모든 학생이 자신이 이미 이해하고 있는 내용과 상관없이 똑같은 강의를 듣는 교실처럼, 동일한 단일 요약본을 강제로 들어야 했습니다. 새로운 XKV 시스템은 수신자 메모리의 모든 위치가 이 공유 뱅크에 구체적인 질문을 던질 수 있게 합니다. 이는 마치 학급의 각 학생이 자신이 부족한 특정 사실을 묻기 위해 손을 들 수 있고, 교사가 바로 그 부분만을 제공하는 것과 같습니다. 시스템은 수신자 메모리의 각 부분에 정밀하고 맞춤화된 업데이트를 전달하여, 나머지 지식을 방해하지 않으면서도 빈틈을 채워줍니다. 이 과정은 텍스트 메시지를 쓰고 읽는 데 걸리는 시간의 아주 일부분만 소요되며, 두 모델의 아키텍처가 완전히 다르거나, 사용하는 어휘가 다르거나, 내부 레이어의 수가 다르더라도 작동합니다.
연구진은 다양한 시나리오를 통해 이 시스템을 테스트하였으며, 서로 다른 계열의 언어 모델들을 다섯 가지의 서로 다른 추론 작업에 투입했습니다. 이 작업들은 두 에이전트 사이에 나뉘어 있는 증거를 결합해야 하는 질문들, 예를 들어 다단계 문제를 해결하기 위해 서로 다른 문단의 사실들을 연결하는 것 등을 포함했습니다. 결과에 따르면, 새로운 시스템은 전통적인 텍스트 기반 방식과 이전의 가장 뛰어났던 직접 메모리 전달 시도 모두를 일관되게 능가했습니다. 평균적으로 새로운 시스템은 답변의 정확도를 크게 향상시켰으며, 특정 테스트에서는 이전의 최고 방식보다 정확도(exact match score)가 4퍼센트 포인트 이상 상승하는 결과를 보여주었습니다. 단순히 더 똑똑해졌을 뿐만 아니라, 훨씬 더 빨라졌습니다. 새로운 시스템의 번역기 구성 요소는 이전의 선도적인 방식보다 10배 이상 빨랐으며, 표준 텍스트 기반 방식보다는 거의 7배 더 빨랐습니다.
이 연구는 이러한 속도가 복잡성을 희생하며 얻어진 것이 아님을 강조했습니다. 새로운 번역기는 이전의 선도적인 방식보다 학습 가능한 파라미터(trainable parameters)가 76% 적게 필요하여, 훨씬 더 효율적으로 구축하고 실행할 수 있었습니다. 결정적으로, 이 시스템은 통신하는 두 모델이 서로 완전히 다른 경우에도 높은 성능을 유지했습니다. 예를 들어, 한 회사의 모델이 다른 회사의 모델과 대화하거나, 작은 모델이 큰 모델과 대화하는 경우와 같습니다. 이러한 유연성은 다양한 AI 도구들이 재학습되거나 균일한 형태로 맞춰질 필요 없이 서로 협력해야 하는 실제 시나리오에서 이 시스템이 배치될 수 있음을 시사합니다. 연구진은 시스템이 한쪽으로부터의 요약에 의존하기보다 양측 모두로부터 공동 메모리를 구축할 수 있을 때 가장 잘 작동한다는 것을 발견했습니다. 이는 가장 효과적인 통신은 송신자와 수신자를 함께 고려함으로써, 수신자가 공유된 정보 풀에서 정확히 필요한 것을 추출할 수 있게 할 때 이루어진다는 것을 확인시켜 주었습니다.
이 연구의 함의는 단순히 AI를 더 빠르게 만드는 것을 넘어섭니다. 모델들이 서로를 이해하기 위해 인간의 언어로 말할 필요성을 제거함으로써, 이 시스템은 더 유동적이고 효율적인 멀티 에이전트 시스템의 문을 엽니다. 이러한 시스템은 방대한 양의 데이터를 분석하거나 복잡한 과학적 문제를 해결하는 것과 같은 복잡한 과업을 텍스트를 생성하고 다시 읽는 병목 현상 없이 조정할 수 있습니다. 연구진은 수신자의 상태를 인지하고, 공유 메모리로부터 특정 업데이트를 추출하며, 기존의 송신자 중심 요약보다 엄격하게 더 저렴하고 빠른 통신 채널을 만드는 것이 가능하다는 것을 입증했습니다. 이는 AI 에이전트를 자신의 생각을 단어로 번역해야 하는 고립된 개체로 취급하는 것에서 벗어나, 원시적인 이해를 직접 공유할 수 있는 응집력 있는 네트워크로 취급하는 것으로의 전환을 의미합니다. 이 발견은 협력적 인공지능의 미래가 더 나은 언어에 있는 것이 아니라, 지능을 구동하는 침묵의 내부 상태를 공유하는 더 나은 방법에 달려 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.