ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning
ANNEAL 은 기초 모델의 가중치를 수정하지 않고 실패를 심볼릭 프로세스 지식 그래프의 관리되고 검증된 편집으로 변환함으로써 반복되는 실행 오류를 안전하고 영구적으로 제거하는 신경-상징적 에이전트입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 호텔 예약, IT 티켓 관리, 주문 처리 등을 할 수 있는 매우 똑똑하고 도움이 되는 로봇 보조원 (LLM 에이전트) 이 있다고 가정해 봅시다. 때때로 이 로봇은 실수를 합니다.
문제: "같은 실수"의 루프
대부분의 현재 로봇 보조원들은 실패한 이유를 잊어버리는 사람과 같습니다. 만약 그들이 '블랙아웃 날짜'에 기업 카드로 호텔을 예약하려다 거절당하면, 다른 카드로 즉시 다시 시도할 수 있습니다. 만약 그것이 작동하면 그들은 다음 단계로 넘어갑니다. 하지만 다음 주에 같은 날짜에 같은 기업 카드로 호텔을 예약하라고 요청하면, 그들은 정확히 같은 실수를 다시 저지를 것입니다. 그들은 실제로 규칙을 배운 것이 아니라, 이번에는 운이 좋았을 뿐입니다. 그들이 따르는 '지침서'가 수정되지 않았기 때문에, 그들은 동일한 근본적인 논리 오류로 계속 실패합니다.
해결책: ANNEAL (규칙집 수정자)
이 논문은 새로운 시스템인 ANNEAL을 소개합니다. 로봇의 두뇌를 재훈련하는 것 (느리고 위험함) 대신, ANNEAL은 로봇의 지침서 (상징적 프로세스 지식) 를 엄격한 편집자처럼 수정하여 반복되는 실수가 발생할 때마다 이를 고칩니다.
다음은 창의적인 비유를 사용하여 ANNEAL 이 작동하는 방식입니다:
1. "탐정" 단계 (로컬라이제이션)
로봇이 실패할 때, ANNEAL 은 단순히 "다시 시도해 보세요"라고 말하지 않습니다. 대신 그것은 탐정처럼 행동합니다. 실패를 살펴보고 다음과 같이 질문합니다: "지침서의 어떤 특정 규칙이 이를 초래했는가?"
- 비유: 케이크를 태운 요리사를 상상해 보세요. ANNEAL 은 요리사에게 단순히 "더 열심히 해라"라고 말하는 대신, 레시피의 특정 단계를 가리킵니다: "당신은 케이크를 500 도 오븐에 넣었지만, 규칙은 350 도라고 명시되어 있습니다."
2. "드래프트 작성자" 단계 (제약된 생성)
나쁜 규칙이 발견되면, ANNEAL 은 로봇에게 이를 수정하기 위한 새로운 규칙을 작성하도록 요청합니다. 하지만 여기서 주의할 점은 로봇이 시를 쓰거나 모호한 제안을 할 수 없다는 것입니다. 대신 기존 지침서에 들어맞는 엄격하고 타입이 지정된 코드 패치 (특정 코드 줄과 같은) 를 작성해야 합니다.
- 비유: 로봇은 주니어 건축가와 같습니다. 새로운 건물을 그릴 수는 없습니다. 대신 "여기에 지지 보를 추가한다"와 같이 기초 설계도에 대한 구체적이고 청사진화된 변경 사항을 제출해야 합니다.
3. "안전 위원회" 단계 (거버넌스)
이 부분이 가장 독특합니다. 새로운 규칙이 실제로 지침서에 추가되기 전에 엄격한 안전 검사를 통과해야 합니다. ANNEAL 은 새로운 규칙을 확인하기 위해 다층적인 "안전 위원회"를 사용합니다:
- 논리 검사: 이 새로운 규칙이 다른 어떤 것을 망가뜨리지 않는가? (예: "기업 카드를 허용하면 예산이 깨지지 않는가?")
- 윤리 검사: 이것이 도덕적이거나 회사의 정책을 위반하지 않는가? (예: "이 규칙은 법적으로 허용되는가?")
- 캐나리 테스트: 시스템은 새로운 규칙을 안전한 시뮬레이션 샌드박스 (비행 시뮬레이터와 같은) 에서 테스트하여 충돌 없이 작동하는지 확인합니다.
- 비유: 이는 새로운 법이 제안되는 것과 같습니다. 대통령이 서명한다고 해서 바로 법이 되는 것이 아닙니다. 공식적으로 시행되기 전에 상원 (논리), 대법원 (윤리), 그리고 공개 시범 운영 (캐나리 테스트) 을 통과해야 합니다.
4. "영구 수정" (커밋)
새로운 규칙이 모든 테스트를 통과하면 ANNEAL 은 이를 커밋합니다. 이는 지침서가 영구적으로 업데이트됨을 의미합니다.
- 결과: 로봇이 다음에 그 호텔을 예약하려 할 때, 잘못된 경로를 시도조차 하지 않을 것입니다. 새로운 규칙 ("이 날짜에는 기업 카드 사용 불가") 을 보고 자동으로 다른 경로를 선택할 것입니다. 실수는 영원히 사라집니다.
- 비유: 도로의 함정을 수리하는 것과 같습니다. 이전에는 차들이 계속 그 함정에 부딪혔습니다. 이제 도로가 함정 위에 포장되어 있습니다. 다시는 아무도 그 함정에 부딪히지 않습니다.
왜 이것이 특별한가?
이 논문은 ANNEAL 을 다른 시스템 (ReAct 및 Reflexion 등) 과 비교합니다:
- 다른 시스템: 그들은 시험을 위해 열심히 공부하고 통과했지만, 다음 날 그 교훈을 잊어버리는 학생과 같습니다. 그들은 단일 작업 중에 회복할 수 있지만, 나중에 같은 고장 난 작업을 주면 다시 실패합니다.
- ANNEAL: 수학 문제를 실패한 후 교재에 정정을 기록하여 그 특정 오류를 다시는 저지르지 않는 학생과 같습니다.
결과
여행, 전자상거래, IT 등 네 가지 다른 영역에 걸친 테스트에서 ANNEAL 은 근본적인 규칙을 영구적으로 수정한 유일한 시스템이었습니다.
- 다른 시스템들은 반복되는 고장에 대해 72% 에서 100% 의 실패율을 보였습니다 (그들은 같은 실수를 계속해서 반복했습니다).
- ANNEAL 은 이를 **0%**로 줄였습니다. 한 번 규칙을 수정하면 실수는 다시는 발생하지 않았습니다.
요약
ANNEAL 은 "실수했네요"를 "이 실수가 불가능하도록 규칙집을 업데이트했습니다"로 바꾸는 시스템입니다. 이는 로봇의 두뇌를 변경하지 않고, 엄격한 안전 검사를 통해 지침서를 신중하게 편집함으로써 이를 수행하며, 시간이 지남에 따라 로봇이 더 똑똑하고 안전하게 되도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.