← 최신 논문
🤖 machine learning

FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data

이 논문은 쿼리, 사고(thought), 모델 수준에서 상호 보완적인 능력을 융합하기 위해 멀티 LLM 로그 데이터를 활용하며, 다양한 작업에 걸쳐 개별 모델보다 일관되게 우수한 성능을 보이면서도 실제 서빙 제약 조건을 수용하는 체계적인 프레임워크 및 부속 벤치마크인 LLMFusionBench를 소개하는 FusionFactory를 제안한다.

원저자: Tao Feng, Haozhen Zhang, Zijie Lei, Pengrui Han, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jiaxuan You

게시일 2026-07-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tao Feng, Haozhen Zhang, Zijie Lei, Pengrui Han, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jiaxuan You

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수많은 사람과 다양한 AI 어시스턴트 간의 대화가 담긴 거대한 도서관을 가지고 있다고 상상해 보세요. 어떤 AI는 수학에 뛰어나고, 어떤 AI는 코딩의 마법사이며, 또 어떤 AI는 일반 상식의 백과사전입니다. 보통 질문을 하면, 당신은 단 하나의 AI를 골라 답변을 받아야 합니다. 하지만 만약 이 모든 과거의 대화들을 살펴보고, 각기 다른 AI들의 가장 뛰어난 부분들을 결합하여 하나의 초지능 시스템을 만들 수 있다면 어떨까요?

이것이 바로 이 논문, FusionFactory가 다루고 있는 내용입니다. 저자들은 로그 데이터(AI가 무엇을 말했고 얼마나 잘 수행했는지에 대한 기록)를 사용하여, 이 서로 다른 AI의 두뇌들을 가장 잘 섞는 방법이 무엇인지 알아내기 위한 거대한 툴킷을 구축했습니다.

다음은 그들의 발견에 대한 쉬운 요약입니다:

1. 문제점: 너무 많은 선택지, 하나의 질문

AI 세계를 20명의 서로 다른 셰프가 있는 레스토랑이라고 생각해 보세요.

  • 셰프 A는 피자를 가장 잘 만듭니다.
  • 셰프 B는 수프를 가장 잘 만듭니다.
  • 셰프 C는 디저트의 달인입니다.

만약 당신이 식사를 주문한다면, 보통 당신은 저녁 식사 전체를 요리할 단 한 명의 셰프를 골라야 합니다. 하지만 저자들은 현실 세계에서 기업들이 종종 모든 셰프에게 같은 요리를 만들게 하고, 누가 무엇을 했는지에 대한 기록을 남긴다는 점에 주목했습니다. 그들은 질문했습니다: "우리는 이 기록들을 사용하여 피자, 수프, 디저트를 모두 완벽하게 만들 줄 아는 '슈퍼 셰프'를 만들 수 있을까?"

2. 해결책: FusionFactory (세 가지 혼합 방식)

저자들은 언제 섞느냐에 따라 세 가지 다른 방식으로 이 셰프들을 결합하는 데 시도하는 FusionFactory라는 프레임워크를 만들었습니다.

레벨 1: "똑똑한 웨이터" (쿼리 수준 퓨전 - Query-Level Fusion)

  • 작동 방식: 당신이 주문하기도 전에, 똑똑한 웨이터가 당신의 요청을 살핍니다. 만약 당신이 수학 문제를 낸다면, 웨이터는 즉시 수학 셰프에게 보냅니다. 만약 농담을 요청한다면, 그들은 코미디 셰프에게 보냅니다.
  • 비유: 이는 자동차를 가장 빠른 차선으로 안내하는 교통 경찰과 같습니다.
  • 결과: 이것은 가장 저렴하고 빠른 방법입니다. 셰프를 바꾸는 것이 아니라, 적절한 셰프를 선택하는 것뿐입니다. 잘못된 셰프에게 일을 시켜 시간을 낭비하지 않으므로 비용을 절감합니다.

레벨 2: "레시피 북" (사고 수준 퓨전 - Thought-Level Fusion)

  • 작동 방식: 단순히 한 명의 셰프를 고르는 대신, 이 방식은 과거에 셰프들이 사용했던 가장 좋은 레시피들을 살펴봅니다. 만약 10명의 셰프가 어려운 수학 문제를 풀었다면, 시스템은 그들의 단계별 과정을 읽고, "이 문제를 생각하는 완벽한 방법"을 요약하여 현재 사용 중인 셰프에게 전달합니다.
  • 비유: 요리를 하고 있는데, 누군가 당신에게 "이 특정 문제를 해결하기 위해 최고의 셰프들이 사용했던 비밀 비법입니다"라고 적힌 포스트잇을 건네주는 것과 같습니다. 그런 다음 당신은 그 비법을 사용하여 요리를 합니다.
  • 결과: 이것이 승자였습니다. 성능을 가장 크게 향상시켰습니다. 이는 셰프를 다시 훈련시키지 않고도, 그들에게 최고의 사고 패턴이라는 '치트 시트(요약본)'를 제공하는 것과 같습니다.

레벨 3: "견습 셰프" (모델 수준 퓨전 - Model-Level Fusion)

  • 작동 방식: 이것은 아주 무거운 작업입니다. 시스템은 20명의 셰프로부터 얻은 최고의 답변들을 가져와서, 특정 셰프 한 명에게 그 교훈들을 암기할 때까지 강제로 공부하게 합니다. 이는 마치 길고 비용이 많이 드는 훈련 캠프와 같습니다.
  • 비유: 당신은 주니어 셰프를 데려와서 여러 거장들의 최고의 요리들을 암기하게 함으로써 그 스스로가 마스터가 되도록 만드는 것입니다.
  • 결과: 이것은 가장 효과가 낮았습니다. "주니어 셰프"(모델)는 너무 많은 서로 다른 스타일을 한꺼번에 배우려다 보니 혼란에 빠졌고, 오히려 적절한 셰프를 고르거나 치트 시트를 주는 것보다 성능이 떨어졌습니다.

3. 큰 발견: "모두에게 맞는 정답은 없다"

이 논문은 20가지의 서로 다른 AI 모델을 사용하여 14가지 유형의 작업(수학, 코딩, 독해, 상식 등)에 대해 테스트했습니다.

  • "치트 시트"(사고 수준)가 MVP입니다: 대부분의 작업에서, AI에게 어떻게 생각해야 하는지에 대한 요약(레시피 북)을 주는 것이 다른 어떤 방법보다 효과적이었습니다. 이는 유연하고 강력했습니다.
  • "똑똑한 웨이터"는 가성비의 왕입니다: 비용이 걱정된다면, 스마트한 라우터가 적절한 AI를 선택하게 하는 것이 아주 좋은 거래입니다. 이는 단일 최고 AI만큼 성능이 좋으면서도 비용은 아주 적게 듭니다.
  • "훈련 캠프"(모델 수준)는 까다롭습니다: 모든 지식을 하나의 단일 AI 모델로 합치려는 시도는 종종 실패했습니다. 20개의 서로 다른 개성으로부터 오는 "교훈"들을 하나의 뇌에 가르치는 것은 어렵습니다.

4. 이것이 왜 중요한가

저자들은 더 나은 결과를 얻기 위해 반드시 새롭고 복잡한 AI 모델을 발명할 필요는 없다고 주장합니다. 우리에게는 이미 금광과 같은 데이터가 있습니다. 바로 서로 다른 AI들이 과거에 했던 말들의 로그입니다.

  • 돈은 있지만 속도가 필요하다면: 똑똑한 웨이터(쿼리 수준)를 사용하세요.
  • 최고의 답변을 원한다면: 레시피 북(사고 수준)을 사용하세요.
  • 단일하고 영구적인 AI를 만들고 싶다면: 주의하세요. 훈련 캠프(모델 수준)는 아직 그만한 노력을 들일 가치가 없을 수도 있습니다.

요약하자면, 이 논문은 다음과 같이 말합니다: 단 하나의 AI를 고르는 데 그치지 마세요. 그들이 어떻게 생각하는지에 대한 기록을 살펴보고, 그 기록을 사용하여 현재의 AI를 가이드하세요. 그것은 AI에게 도서관 전체를 암기하도록 강요하는 것이 아니라, 답변하기 전에 지혜가 담긴 도서관을 읽을 수 있도록 데려다주는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →