← 최신 논문
💻 computer science

GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling

본 논문은 8B 규모 LLM 을 훈련시키기 위해 고품질이고 다양한 합성 함수 호출 데이터를 생성하는 다중 에이전트 자동화 파이프라인인 GenesisFunc 를 소개하며, 이는 유사한 크기의 오픈소스 모델보다 우수한 도메인 내 성능과 도메인 외 일반화 능력을 달성하면서도 고급 API 기반 시스템과 경쟁할 수 있음을 보여줍니다.

원저자: Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 경험이 부족한 보조원 (대형 언어 모델, 또는 LLM) 이 있다고 상상해 보세요. 이 보조원이 인간처럼 날씨를 확인하거나, 항공편을 예약하거나, 예산을 계산하는 것과 같은 도구를 사용할 수 있기를 원합니다. 하지만 문제가 하나 있습니다. 보조원에게 이러한 도구 사용법을 가르치려면, 사람들이 도움을 요청하고 보조원이 올바른 도구를 선택하여 세부 사항을 채우는 수천 개의 예시를 보여줘야 합니다.

실제 세계에서는 이러한 예시를 수집하는 것이 마치 건초더미에서 바늘을 찾는 것과 같습니다. 비용이 많이 들고 느리며, 찾은 예시들은 종종 엉망이거나 불완전한 경우가 많습니다. 이러한 예시를 인위적으로 만들어내려는 (합성하려는) 이전 시도들은 작동하지 않는 '가짜' 도구나 로봇 같고 반복적인 대화로 이어지곤 했습니다.

GENESISFUNC 의 등장. 이를 AI 보조원을 위한 첨단 자동화 '훈련 캠프'로 생각하세요. 모든 예시를 작성하기 위해 인간 팀을 고용하는 대신, 저자들은 AI 에이전트 팀이 협력하여 완벽한 훈련 데이터를 생성하는 시스템을 구축했습니다.

다음은 GENESISFUNC '훈련 캠프'가 작동하는 방식을 간단한 단계로 나눈 것입니다:

1. 신뢰할 수 있는 도구상자 (Tool Pool)

훈련이 시작되기 전에 시스템은 연습할 도구 세트를 필요로 합니다. 가짜 도구를 만들어내는 대신, GENESISFUNC 은 BFCL 벤치마크라고 불리는 신뢰할 수 있는 공개된 실세계 도구 라이브러리로 향합니다.

  • 비유: 요리를 배우려는 셰프를 상상해 보세요. 가짜 재료를 발명하는 대신, 신선하고 실제인 채소를 고르기 위해 고품질이고 검증된 식료품점에 가는 것입니다. 이는 훈련이 환상이 아닌 현실에 기반하도록 보장합니다.

2. 감독의 컷 (Multi-Agent Dialogue Generation)

이것은 시스템의 핵심입니다. 저자들은 영화 제작 팀처럼 훈련 스크립트 (대화) 를 작성하는 네 명의 AI '에이전트' (전문 프로그램) 팀을 구성했습니다.

  • 캐스팅 디렉터 (Sample Agent): 장면에 사용할 도구들의 혼합을 선택합니다. 이 에이전트는 작업에 필요한 '주연' (필요한 도구) 과 올바른 선택이 아닌 비슷해 보이지만 혼란을 주는 '단역' (방해 도구) 을 선택하여 AI 가 이들을 구분하는 법을 배우도록 합니다.
  • 시나리오 고문 (Memory Agent): 지금까지 작성된 모든 장면을 추적합니다. 팀이 계속 '항공편 예약'에 대해 작성한다면, 이 에이전트는 "이제 그건 충분히 했으니, '여행 계획'에 대한 장면을 작성해 보자"라고 말합니다. 이는 훈련 데이터가 다양하고 반복적이지 않도록 보장합니다.
  • 배우 (Function Agent): 실제 대사를 작성합니다. 질문을 하는 사용자와 올바른 도구를 선택하여 빈칸 (날짜나 위치 등) 을 채우는 보조원의 응답을 생성합니다. 실제 인간 대화를 모방하기 위해 일부 선택 사항 세부 사항을 생략하는 등 세부 사항이 현실적이도록 합니다.
  • 비평가 (Judge Agent): 초고를 읽고 가장 좋은 것을 선택합니다. 약한 스크립트는 폐기하고 AI 보조원이 완벽하게 업무를 수행한 것들만 유지합니다.

3. 품질 관리 점검 (Multi-Stage Evaluation)

훌륭한 팀이 있더라도 실수는 발생합니다. 데이터를 모델 훈련에 사용하기 전에 엄격한 3 단계 검사를 거칩니다.

  • 문법 경찰 (Rule Checker): 컴퓨터 프로그램이 형식이 올바른지 확인합니다 (예: "올바른 괄호를 사용했는가?").
  • 논리 판사 (Model Checker): 더 똑똑한 AI 가 대화가 논리적으로 타당한지 확인합니다 (예: "보조원이 실제로 사용자의 문제를 해결했는가?").
  • 인간 편집자 (Human Validation): 소수의 인간 팀이 가장 까다로운 사례들을 검토합니다. 컴퓨터가 이미 오류의 95% 를 걸러냈기 때문에 인간들은 총 15 시간 정도만 투자하면 됩니다.

결과: 슈퍼 도우미

시스템이 이 방대하고 고품질의 데이터셋을 생성한 후, 저자들은 이를 80 억 파라미터 AI 모델 (중형 모델) 을 훈련시키는 데 사용했습니다.

  • 결과: 이 훈련된 모델은 도구 사용의 대가가 되었습니다. 이는 동급의 다른 오픈소스 모델보다 뛰어난 성능을 발휘했으며, 심지어 대형 기술 기업들의 훨씬 크고 비싼 모델들과도 경쟁할 수 있었습니다.
  • '일반화'의 마법: 훈련 데이터가 매우 다양했기 때문에 (다양한 유형의 도구와 복잡한 대화를 포괄), 모델은 단순히 예시를 암기하지 않았습니다. 도구 사용의 '기술'을 배웠습니다. 이전에 본 적 없는 도구로 테스트했을 때에도 여전히 놀라울 정도로 잘 수행했습니다.

이것이 중요한 이유

이 논문은 이 방법이 AI 에게 도구 사용법을 가르치는 데 있어 가장 큰 병목 현상인 양질의 데이터 부족을 해결한다고 주장합니다. AI 에이전트 팀을 사용하여 데이터를 생성하고, 다양화하며, 검증함으로써 다음과 같은 파이프라인을 만들었습니다.

  1. 신뢰성: 실제 작동하는 도구에 기반함.
  2. 다양성: 간단한 1 단계 요청부터 복잡한 다단계 대화까지 다양한 시나리오를 포괄함.
  3. 확장성: 거대한 인간 주석 팀이 필요 없이 새로운 도구를 쉽게 포함하도록 확장 가능함.

요약하자면, GENESISFUNC 은 AI 보조원에게 도구 사용법을 가르치기 위한 완벽한 '교과서'를 자동으로 구축하는 공장처럼 작동하여, 더 똑똑하고 능력 있는 디지털 도우미를 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →