Self-Evolving Software Agents
본 논문은 경험에 기반하여 목표, 추론 및 실행 가능 코드를 자율적으로 업데이트하기 위해 BDI 추론과 대규모 언어 모델을 통합하는 자기 진화형 소프트웨어 에이전트 아키텍처를 제시하며, 동적 다중 에이전트 환경에서 대규모 언어 모델 기반 소프트웨어 진화의 실현 가능성과 현재 한계를 모두 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇 셰프를 상상해 보세요. 과거에 이 셰프가 케이크를 굽는 법을 배우게 하려면, 인간 프로그래머가 앉아 셰프의 레시피 책을 다시 써야 했습니다. 셰프는 지시를 완벽하게 따를 수 있었지만, 스스로 새로운 레시피를 발명하기로 결정할 수는 없었습니다. 그것은 제작 당시 부여된 목표와 기술에 갇혀 있었습니다.
이 논문은 레시피를 따르는 것을 넘어 새로운 레시피를 작성하고, 자신의 요리 철학을 바꾸며, 작업 중에도 새로운 주방 도구를 직접 만들 수 있는 셰프처럼 행동하는 새로운 종류의 '자기 진화' 소프트웨어 에이전트를 소개합니다.
마르코 로볼과 파올로 조르미니 저자는 이 돌파구를 다음과 같이 설명합니다:
문제: '고정 설정' 로봇
현재 대부분의 지능형 컴퓨터 프로그램 (에이전트) 은 GPS 시스템과 같습니다. 교통 체증이 발생하면 (환경에 적응하여) 경로를 재설정할 수는 있지만, 목적지를 바꾸거나 그곳에 가는 새로운 방법을 발명하기로 결정할 수는 없습니다. 그들의 목표와 규칙은 시작 전에 인간에 의해 '하드 코딩'됩니다. 그들은 적응할 수는 있지만, 진정으로 진화할 수는 없습니다.
해결책: 두 개의 뇌 시스템
저자들은 두 가지 강력한 아이디어를 결합한 시스템을 제안합니다:
- BDI (신념 - 욕망 - 의도): 이를 에이전트의 '일상용 뇌'라고 생각하세요. 이는 끊임없이 세상을 관찰하고, 무엇을 하고 싶은지 결정하며, 이를 수행할 계획을 선택합니다.
- LLM (대규모 언어 모델): 이는 '창의적 건축가'입니다. 언어를 이해하고, 새로운 아이디어를 상상하며, 코드를 작성할 수 있는 AI 의 부분입니다.
마법은 일상용 뇌와 병행하여 실행되는 특별한 **'진화 모듈'**을 추가함으로써 발생합니다.
작동 원리: '야간 학교' 비유
에이전트가 낮 동안 학생처럼 일한다고 상상해 보세요 (BDI 루프). 손잡이가 없는 문을 여는 것과 같이 해결할 수 없는 문제에 부딪히면, 단순히 포기하지 않습니다.
대신 멈추고 '야간 학교'(진화 모듈) 를 호출합니다. 이 모듈은 다음과 같이 말하는 교사처럼 행동합니다:
- "당신이 실패한 이유는 이를 위한 도구가 없기 때문입니다."
- "새로운 목표를 만들어 봅시다: '문을 여는 방법을 찾아라'."
- "새로운 계획을 작성하고, 이를 수행할 새로운 도구 (코드) 를 만들어 봅시다."
에이전트는 이제 이 새로운 계획을 시도합니다. 만약 작동하면 새로운 도구와 새로운 목표를 영구 기억에 보관합니다. 실패하면 아이디어를 폐기합니다. 시간이 지남에 따라 에이전트는 인간 프로그래머가 코드에 손을 대지 않고도 자신의 'DNA'를 변경하는 자신의 발명품 라이브러리를 구축합니다.
실험: 처음부터 배우기
연구팀은 프로토타입을 구축하여 음식 배달 앱에서 영감을 받은 복잡하고 변화무쌍한 디지털 세계에 투입했습니다. 그들은 에이전트에게 시작할 때 거의 아무것도 주지 않았습니다. 세계에 대한 기본 설명과 몇 가지 간단한 도구뿐이었습니다. 무엇을 해야 하는지 알려주지 않았습니다.
결과:
- 성공: 에이전트는 스스로 특정 작업 (예: 패키지 배달) 을 수행해야 함을 깨닫고 이를 수행할 코드를 작성했습니다. 거의 사전 지식이 없는 상태에서 새로운 목표를 발견하고 새로운 행동을 창출했습니다.
- 한계: 논문은 이 시스템이 아직 완벽하지 않다고 인정합니다. 때로는 환경이 너무 복잡해지면 에이전트가 과거의 성공적인 비법을 기억하거나 새로운 행동을 안정적으로 유지하는 데 어려움을 겪습니다. 새로운 수학 공식을 배우지만 기본 덧셈을 잊어버리는 학생과 같습니다.
결론
이 논문은 명령을 따르는 것을 넘어 스스로 새로운 기술을 배우고 자신의 설명서를 다시 쓸 수 있는 소프트웨어를 구축할 수 있음을 보여줍니다. 아직은 안정성과 과거 교훈 기억과 관련된 성장통을 겪고 있는 프로토타입이지만, 스스로 진화하는 소프트웨어의 아이디어가 가능함을 입증했습니다. 다음 단계는 이러한 에이전트들이 혼란스러운 상황이 발생했을 때 교훈을 잊지 않도록 더 잘 기억하도록 가르치는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.