MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction
본 논문은 복잡한 작업에서 견고성과 일반화 가능성을 보장하기 위해 텍스트 기반 손실 함수 (재구성, 결과, 평가 기준) 를 통해 최적화된 귀납 - 연역 사이클을 통해 고품질의 재사용 가능한 LLM 기술을 자동으로 생성하는 다중 에이전트 프레임워크인 MIND-Skill 을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 약간 서툴지만 뛰어난 로봇 비서를 가지고 있다고 상상해 보세요. 당신은 Venmo 에서 친구에게 환불을 보내는 것과 같은 특정 작업을 완벽하게 수행하는 당신의 모습을 담은 비디오를 보여줌으로써 그 로봇에게 그 작업을 수행하는 방법을 가르칩니다. 로봇은 비디오를 시청하지만, 단순히 당신의 정확한 동작을 복사하는 대신, 미래에 유사한 작업을 수행할 수 있도록 스스로를 위한 규칙집을 작성하려고 노력합니다.
문제는 로봇이 나쁜 규칙집을 작성할 경우 막힐 수 있다는 것입니다. 로봇은 당신의 특정 친구의 이름을 외워버릴 수도 있습니다 (너무 구체적) 또는 유용하지 않을 정도로 너무 모호한 지침을 작성할 수도 있습니다 (너무 추상적).
MIND-Skill은 이러한 AI 에이전트들이 자동으로 완벽하고 고품질의 규칙집을 작성하도록 돕도록 설계된 새로운 시스템입니다. 이는 실제로 규칙이 작동함을 보장하는 교묘한 "교사와 학생" 게임을 통해 이를 수행합니다.
다음은 이를 간단한 부분으로 나누어 설명한 작동 원리입니다:
1. 두 명의 등장인물: 교사와 학생
이 시스템은 함께 작동하는 두 개의 AI 에이전트를 사용합니다:
- 교사 (유도 에이전트): 이 에이전트는 작업이 성공적으로 수행되는 비디오를 시청합니다. 이 에이전트의 임무는 특정 이름이나 숫자를 언급하지 않고 어떻게 작업을 수행하는지 설명하는 일반적인 규칙집 (기술) 을 작성하는 것입니다.
- 학생 (연역 에이전트): 이 에이전트는 테스트 역할을 합니다. 이 에이전트는 교사가 작성한 규칙집과 원래 작업 설명 만을 받습니다. 학생은 오직 그 지침들만을 사용하여 처음부터 작업을 수행해 보려고 시도합니다.
2. "재구성" 테스트
이것이 마술과 같은 부분입니다. 시스템은 단순히 "학생이 정답을 맞췄나요?"라고 묻지 않습니다. 대신, **"학생이 원래 비디오와 동일한 논리를 따랐나요?"**라고 묻습니다.
- 교사가 "빨간 버튼을 클릭하세요"라는 규칙집을 작성했지만, 원래 비디오에서는 파란 버튼을 클릭하는 모습을 보였다면, 학생은 실패할 것입니다. 시스템은 이를 포착합니다.
- 교사가 "그 일을 하세요"와 같이 너무 모호한 규칙집을 작성하면, 학생은 혼란을 겪고 실패할 것입니다.
- 교사가 "사용자 #123 을 위한 버튼을 클릭하세요"와 같이 너무 구체적인 규칙집을 작성하면, 시스템은 이것이 다른 누구에게도 작동하지 않을 것이라고 인식합니다.
시스템은 학생의 수행 결과를 원래 비디오와 비교합니다. 둘이 일치하면 규칙집은 좋은 것입니다. 일치하지 않으면 시스템은 규칙집에 결함이 있음을 알게 됩니다.
3. 세 가지 "성적표"
규칙집이 완벽하도록 하기 위해, 시스템은 매 시도마다 교사에게 세 가지 구체적인 성적표 (손실) 를 제공합니다:
- "단계를 따랐나요?" 카드 (재구성 손실): 학생이 원래 비디오와 동일한 전략을 따랐나요? (예: 둘 다 먼저 이메일을 확인한 후 전송을 클릭했나요?)
- "일을 완수했나요?" 카드 (결과 손실): 학생이 실제로 현실 세계에서 작업을 성공적으로 완료했나요?
- "이것은 좋은 매뉴얼인가요?" 카드 (규정 손실): 규칙집이 잘 작성되었나요? 명확한가요? 이름이나 ID 와 같이 포함되어서는 안 되는 구체적인 세부 사항을 복사하지 않았나요? 이는 규칙집이 단순한 특정 사건의 복사본이 아닌 유용한 도구가 되도록 보장합니다.
4. 개선의 루프
시스템은 이 게임을 반복적으로 실행합니다.
- 교사가 초안을 작성합니다.
- 학생이 이를 시도합니다.
- 시스템은 세 가지 성적표를 사용하여 초안을 평가합니다.
- 시스템은 교사에게 정확히 무엇이 잘못되었는지 알려줍니다 (예: "구체적인 이름을 포함했습니다; 제거하세요" 또는 "안전 점검을 생략했습니다").
- 교사는 이 피드백을 바탕으로 규칙집을 다시 작성합니다.
이 과정은 자동으로 발생하여 규칙집이 결함 없이 완성될 때까지 정제합니다.
이것이 특별한 이유는 무엇일까요?
대부분의 이전 방법들은 단순히 똑똑한 AI 에게 비디오를 "요약"하라고 요청함으로써 규칙집을 작성하려 했습니다. 하지만 AI 는 종종 실수를 합니다. 너무 모호하거나 너무 구체적이 되는 식입니다.
MIND-Skill 은 다릅니다. 이는 규칙집을 즉시 테스트하기 때문입니다. 이는 요리사가 레시피를 작성한 후 즉시 부조리에게 그 요리를 만들어 보게 하는 것과 같습니다. 부조리가 음식을 태우거나 잘못된 재료를 사용하면, 요리사는 레시피가 나빴음을 알고 다른 사람이 시도하기 전에 그것을 수정합니다.
결과
이 논문은 두 가지 어려운 환경에서 이를 테스트했습니다:
- AppWorld: 실제 앱 (송금, 티켓 예약, 파일 관리 등) 을 사용하는 시뮬레이션.
- BFCL-v3: 컴퓨터 함수를 올바르게 호출하는지 테스트하는 평가.
결과에 따르면, MIND-Skill 의 규칙집을 사용한 에이전트들은 다른 방법으로 제작된 규칙집을 사용한 에이전트들보다 새로운, 보지 못한 작업을 해결하는 데 훨씬 더 뛰어났습니다. 심지어 "교사" AI 가 사용 가능한 가장 똑똑한 모델이 아니더라도, 테스트 과정이 최종 규칙집을 매우 훌륭하게 만들어, 가장 똑똑한 모델들이 만든 규칙집과 동일한 성능을 발휘하도록 했습니다.
간단히 말해: MIND-Skill 은 AI 에이전트들을 스스로를 개선하는 교사들로 변모시켜, 해당 매뉴얼이 실제로 작동하는지 지속적으로 테스트함으로써 스스로 완벽한 지침서를 작성하게 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.