From Question Answering to Task Completion: A Survey on Agent System and Harness Design
이 설문 조사는 파운데이션 모델과 실행 런타임 사이의 결합이 6가지 핵심 책임을 구성하며 이것이 시스템의 성능, 신뢰성 및 일반화 성능을 어떻게 결정하는지를 분석함으로써, LLM 기반 에이전트의 초점을 수동적인 질의응답에서 능동적인 과업 완수로 전환하는 모델-하네스 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 뇌가 전부가 아니다
당신이 복잡한 코스 요리를 요리하기 위해 세계적인 수준의 천재 셰프(AI 모델)를 고용했다고 상상해 보세요. 과거에는 셰프가 얼마나 똑똑한지가 유일하게 중요한 요소라고 생각했습니다. 셰프가 모든 레시피를 알고 있다면 식사는 완벽할 것이라고 믿었죠.
하지만 이 논문은 셰프는 이야기의 절반일 뿐이라고 주장합니다.
만약 당신이 그 셰프에게 고장 난 가스레인지, 부족한 식재료, 혼란스러운 메뉴판, 그리고 국이 타고 있을 때 알려줄 사람도 없는 환경을 준다면, 그 셰프가 아무리 천재라 할지라도 식사는 실패할 것입니다. 이 "가스레인지", "식재료", "주방 매니저"가 바로 저자들이 **하네스(Harness, 장치/환경)**라고 부르는 것입니다.
이 논문의 핵심 주장은 다음과 같습니다: 에이전트의 성능은 단순히 AI가 얼마나 똑똑한가가 아니라, AI가 일하는 '주방'(하네스)과 얼마나 잘 결합되어 있는가에 달려 있다.
성장의 4단계
저자들은 우리가 이러한 AI "에이전트"를 구축해 온 과정을 아이가 성장하는 네 가지 단계로 설명합니다.
1단계: 프롬프트 엔지니어링 ( "친절하게 대해주세요" 단계)
- 비유: 당신은 똑똑하지만 수줍음이 많은 학생에게 질문을 던지려고 노력 중입니다. "이것을 설명해 줘", "여기 예시가 있어", 또는 "단계별로 생각해 봐"와 같이 다양한 방식으로 질문을 던집니다.
- 한계: 질문을 친절하게 하는 것에는 한계가 있습니다. 만약 학생이 답을 모르거나, 질문이 도서관에 가서 책을 찾아 보고서를 써야 하는 작업이라면, 단순히 친절하게 묻는 것만으로는 도움이 되지 않습니다.
2단계: 컨텍스트 엔지니어링 ( "도서관 보조원" 단계)
- 비유: 이제 당신은 학생에게 적절한 책을 찾아주는 것이 필요하다는 것을 깨닫습니다. 당신은 적절한 페이지를 가져오고, 요약해서, 학생이 답하기 전에 학생의 손에 쥐여주는 시스템을 구축합니다.
- 한계: 당신은 여전히 정보만 전달하고 있을 뿐입니다. 만약 학생이 엉뚱한 글을 쓰기 시작하거나 주의가 산만해진다면, 그들을 멈추거나, 작업을 검토하거나, 실수를 바로잡을 수 있는 시스템이 당신에게는 없습니다.
3단계: 하네스 엔지니어링 ( "프로젝트 매니저" 단계)
- 비유: 이것은 거대한 전환점입니다. 당신은 단순히 지시를 내리는 것을 넘어, 학생 주변에 전체 운영 체제를 구축하기 시작합니다.
- 관찰(Observation): 당신은 그들에게 상황을 볼 수 있는 카메라를 줍니다.
- 제어(Control): 당신은 타이머과 정지 버튼을 가지고 있습니다.
- 행동(Action): 당신은 그들에게 키보드와 마우스를 줍니다.
- 검증(Verification): 당신은 모든 단계를 확인하는 선생님을 둡니다. 만약 학생이 코드를 작성하다가 오류를 냈다면, 시스템은 자동으로 이를 되돌리고 "다시 시도하세요"라고 말합니다.
- 결과: 이 논문은 단지 이 "주방"(하네스)을 재설계하는 것만으로도, 평범한 셰프가 5성급 요리를 만들게 하거나, 천재 셰프가 훨씬 더 나은 요리를 만들게 할 수 있음을 보여줍니다.
- 비유: 이것은 거대한 전환점입니다. 당신은 단순히 지시를 내리는 것을 넘어, 학생 주변에 전체 운영 체제를 구축하기 시작합니다.
4단계: 공동 진화 단계 ( "자기 개선 팀" 단계)
- 비유: 이제 학생과 주방 매니저는 서로에게 배웁니다. 학생은 이 특정 주방에서 연습함으로써 요리에 더 능숙해지고, 주방 매니저는 학생이 요리하는 모습을 관찰함으로써 관리하는 법을 더 잘 배우게 됩니다. 그들은 함께 진화합니다.
"주방"의 6가지 구성 요소 (하네스의 해부학)
논문은 이 "하네스"를 잘 조직된 주방 팀처럼 6가지 구체적인 역할로 나눕니다.
- 관찰 (눈): AI가 세상을 어떻게 보는가? 흐릿한 스크린샷을 보고 있는가, 아니면 명확하고 정리된 데이터 목록을 보고 있는가?
- 컨텍스트 (기억): AI가 어떤 정보를 기억하는가? 대화의 전체 기록을 제공하는가, 아니면 가장 중요한 메모만 제공하는가?
- 제어 (지휘자): 다음에 무엇을 할지 누가 결정하는가? AI가 지칠 때까지 계속 진행하는가, 아니면 매니저가 언제 멈출지, 언제 도움을 요청할지, 언제 작업을 전환할지 알려주는가?
- 행동 (손): AI가 실제로 어떻게 행동하는가? 버튼을 클릭할 수 있는가, 아니면 단순히 "클릭했다"라고 말만 하는가? 하네스는 AI의 말을 실제 행동으로 바꿉니다.
- 상태 (파일 캐비닛): AI가 자신의 작업물을 어디에 저장하는가? 초안을 작성했다면 그것은 파일로 저장되는가, 아니면 화면이 새로고침될 때 사라지는가?
- 검증 (안전 검사관): 이것은 매우 중요합니다. AI가 고객에게 파일을 보내기 전에 안전 점검이 실행되는가? 만약 AI가 위험한 동작을 수행한다면, 시스템이 이를 차단하는가?
이것이 왜 중요한가: "병목 현상"의 변화
이 논문은 AI가 컴퓨터 코드를 수정하거나 웹 서핑을 하는 등 실제 업무를 수행하는 여러 테스트(벤치마크)를 살펴보았습니다.
- 과거의 관점: 우리는 단순히 AI의 뇌를 더 크고 똑똑하게 만들기만 하면 모든 것이 해결될 것이라고 생각했습니다.
- 새로운 관점: 논문은 "뇌"가 한계에 부딪혔다는 것을 발견했습니다. 뇌를 더 크게 만드는 것은 아주 미미한 개선만을 가져올 뿐입니다. 이제 진짜 병목 현상은 하네스입니다.
증거:
- 코딩 테스트에서, 동일한 AI 모델이 단순한 하네스를 사용했을 때는 **23%**의 성공률을 보였지만, 더 잘 설계된 하네스를 사용했을 때는 **72%**의 성공률을 보였습니다.
- 이것은 페라리 엔진(AI)을 가지고 있지만 자전거 프레임(나쁜 하네스)에 끼워 놓은 것과 같습니다. 속도를 낼 수 없습니다. 그 똑같은 엔진을 레이싱 카 섀시(좋은 하네스)에 넣으면 승리하게 됩니다.
요약
우리는 AI를 단순히 질문에 답하는 "챗봇"으로 생각하는 단계에서 벗어나고 있습니다. 우리는 자율적인 노동자를 구축하고 있습니다.
신뢰할 수 있는 노동자를 만들기 위해서는 단순히 가장 똑똑한 뇌를 고르는 것만으로는 부족합니다. 당신은 그들이 일하는 전체 환경을 설계해야 합니다:
- 그들은 무엇을 보는가?
- 그들에게 어떤 도구가 있는가?
- 누가 그들의 작업을 확인하는가?
- 실수를 했을 때 그들은 어떻게 복구하는가?
이 논문은 결론적으로, AI의 미래는 더 큰 모델에 있는 것이 아니라, 그 모델을 둘러싼 시스템을 더 잘 엔지니어링하는 것에 있다고 말합니다. 에이전트의 품질은 모델과 그 모델을 받쳐주는 하네스 사이의 파트너십에서 나옵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.