Harnessing LLM Agents with Skill Programs
본 논문은 추론 시 안내, 사후 훈련 감독 또는 자기 개선을 통해 웹 검색, 수학 추론 및 코딩과 같은 복잡한 작업에서 성능을 크게 향상시키기 위해 LLM 에이전트 루프에 능동적으로 개입할 수 있도록 조언적 텍스트 기술을 실행 가능한 프로그램 함수 (PF) 로 변환하는 모듈식 프레임워크인 HASP 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하지만 때로는 서투른 로봇 조수 하나가 있다고 가정해 봅시다. 여러분이 이 로봇에게 인터넷에서 특정 사실을 찾거나 코드 한 조각을 작성하는 등 복잡한 퍼즐을 해결해 달라고 요청합니다. 로봇은 최선을 다해 노력하지만, 같은 실수를 반복합니다: 너무 일찍 포기하거나, 잘못된 것을 검색하거나, 발음이 비슷한 이름에 혼란을 겪는 식입니다.
보통 이런 문제를 해결하려 할 때, 우리는 로봇에게 "작업을 확인하세요!"나 "추측하지 마세요!"와 같은 내용을 적은 목록(매뉴얼) 형태의 지시사항을 줄 뿐입니다. 하지만 로봇은 이러한 메모들을 종종 무시합니다. 왜냐하면 그것들은 그저 수동적인 텍스트일 뿐이기 때문입니다. 로봇은 정확히 언제 멈추고 경청해야 하는지, 또는 어떻게 행동을 바꿔야 하는지 정확히 알지 못합니다.
HASP(Skill Program 을 활용한 LLM 에이전트 활용)는 게임의 규칙을 바꾸는 새로운 프레임워크입니다. 연구자들은 로봇에게 수동적인 매뉴얼을 주는 대신, 실행 가능한 **스킬 프로그램 **(PFs) 세트를 제공합니다. 이것을 책이 아니라 로봇의 뇌 바로 옆에 앉는 스마트 안전 하네스나 코파일럿으로 생각하세요.
간단한 비유를 들어 작동 방식을 설명해 보겠습니다.
1. "수동적인 조언"에서 "능동적인 안전장비"로
- **과거의 방식 **(텍스트 기반 스킬) 운전 강사가 뒷좌석에 앉아 "속도를 줄여야 해요!"라고 외치는 상황을 상상해 보세요. 운전자는 그 말을 들을 수도, 무시할 수도, 또는 정확히 언제 브레이크를 밟아야 하는지 깨닫지 못할 수도 있습니다. 그것은 단지 조언일 뿐입니다.
- **HASP 방식 **(프로그램 함수) 이제 자동차에 스마트 안전 하네스가 장착되었다고 상상해 보세요. 자동차가 절벽 (실패하기 쉬운 상태) 쪽으로 치우치기 시작하면, 하네스는 단순히 조언을 외치는 것이 아니라 물리적으로 개입합니다. 핸들을 부드럽게 중앙으로 되돌리거나, 운전자의 시야에 경고 신호를 직접 주입할 수도 있습니다.
- 논문에서: 이러한 "스킬 프로그램"은 로봇의 모든 움직임을 감시하는 작은 코드 조각들입니다. 로봇이 증거를 읽지 않은 채 답변을 확정하는 등 실수를 저지르려 할 때, 스킬 프로그램이 개입합니다. 로봇의 행동을 다시 작성(나쁜 검색 쿼리를 좋은 것으로 변경) 하거나 힌트를 주입(로봇에게 "잠깐, 아직 문서를 읽지 않았어요!"라고 말함) 할 수 있습니다.
2. 하네스를 사용하는 세 가지 방법
이 논문은 이 "하네스"를 학생을 훈련시키는 것처럼 세 가지 다른 방식으로 사용할 수 있음을 보여줍니다.
**모드 A: 즉각적인 수정 **(추론 시간 개입)
- 비유: 로봇이 작업하는 동안 하네스를 로봇에 장착합니다. 하네스는 실시간으로 실수를 잡아내어 즉시 수정합니다. 로봇은 새로운 것을 배울 필요가 없으며, 하네스가 모든 중량을 들어 올립니다.
- 결과: 로봇은 추가 훈련 없이도 즉시 훨씬 더 잘 문제를 해결합니다.
**모드 B: 학습 가이드 **(학습 후)
- 비유: 하네스가 로봇의 실수를 수정한 후, 연구자들은 "수정된" 경로의 비디오를 찍어 로봇에게 교재로 보여줍니다. 로봇은 이러한 예제들을 공부하고 다음에는 스스로 올바른 선택을 하도록 배웁니다.
- 결과: 로봇은 기술을 내면화합니다. 시간이 지남에 따라 하네스가 자신의 뇌의 일부처럼 행동하며 점점 더 적은 도움이 필요해집니다.
**모드 C: 자기 개선 라이브러리 **(진화)
- 비유: 로봇이 하네스가 아직 본 적이 없는 새로운 유형의 실수를 마주치면 시스템이 일시 정지됩니다. 시스템은 "교사"(매우 똑똑한 AI) 에게 그 실수에 특화된 새로운 스킬 프로그램을 작성하도록 요청합니다. 이 새로운 기술을 도구함에 추가하기 전에, 교사가 그것이 안전하고 유용한지 확인합니다.
- 결과: 로봇의 기술 도구함이 스스로의 실수에서 배우면서 시간이 지남에 따라 더 똑똑해지며, 인간이 모든 규칙을 작성할 필요 없이 성장합니다.
3. 왜 이렇게 잘 작동하는가
이 논문은 이 방법을 세 가지 까다로운 작업에서 테스트했습니다.
- 웹 검색: (탐정이 미스터리를 해결하듯) 여러 정보 조각을 연결하여 답을 찾는 작업.
- 수학: 복잡한 방정식을 푸는 작업.
- 코딩: 컴퓨터 프로그램을 작성하는 작업.
결과:
- "하네스" 접근 방식은 연구자들이 비교한 거의 모든 다른 방법보다 우수했습니다.
- 웹 검색의 경우, 로봇을 훈련시키지 않고 하네스만 사용해도 표준 방법 대비 성능이 25% 향상되었습니다.
- 로봇이 하네스로부터 학습하도록 허용했을 때 (학습 후), 그 성능은 더욱 향상되었습니다.
- 결정적으로, 이 시스템은 모듈화되어 있습니다. 스위스 군용 칼과 같습니다. 도구만 사용할 수도 있고, 도구로 로봇을 가르칠 수도 있으며, 로봇이 새로운 도구를 만들도록 할 수도 있습니다.
결론
HASP 는 "재사용 가능한 경험"이라는 모호한 아이디어를 구체적이고 실행 가능한 도구로 바꿉니다. 로봇이 규칙을 기억하기를 바라는 대신, HASP 는 로봇에게 오류가 발생하는 순간 그것을 잡아내고 수정하며, 미래에 이를 피하도록 학습시키는 자동 안전 점검 세트를 제공합니다. 이는 학생에게 교과서를 주는 것과, 그들이 작업을 하는 동안 옆에 앉아 작업을 수정해 주는 튜터를 주는 것의 차이와 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.