A Human-in-the-Loop Autonomous Agent for Industry Time Series Forecasting
이 논문은 자연어 작업 명세, 특화된 예측 모델, 그리고 반복적인 증거 기반 정교화 과정을 통합하여 전력 가격 및 부하 예측에서 16개의 베이스라인을 능가하는 동시에 투명한 실행 보고서를 제공하는 인간 참여형 자율 에이전트인 CastClaw를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
전력 가격이나 전력망 부하와 같이 시간이 흐름에 따라 변하는 숫자의 미래를 예측하는 작업은 단 한 번의 고립된 계산만으로는 성공하기가 매우 어렵습니다. 현실 세계에서 정확한 예측은 단순히 과거 데이터를 컴퓨터 프로그램에 입력하고 답이 나오기를 기다리는 것만이 아닙니다. 그것은 인간 전문가가 목표를 정의하고, 적절한 데이터 소스를 연결하며, 세상이 작동하는 방식에 대한 특정 지식을 적용하고, 그 후 컴퓨터의 추측이 타당한지 신중하게 판단해야 하는 복 phức한 반복 과정입니다. 만약 예측이 이상해 보인다면, 전문가는 누락된 정보를 찾거나, 접근 방식을 조정하거나, 혹은 중단하고 다른 시도를 하기로 결정해야 합니다. 수년 동안 이 분야는 숫자를 계산하는 데는 뛰어나지만 사고방식이 경직된 특화된 컴퓨터 모델과, 추론하고 대화할 수는 있지만 신뢰할 수 있는 수치 예측에 필요한 엄격한 규칙과 점검 기능이 부족한 범용 인공지능 에이전트 사이로 나뉘어 있었습니다.
중국과학기술대학교(University of Science and Technology of China)의 연구진은 이러한 격차를 메우기 위해 'CastClaw'라고 불리는 새로운 시스템을 구축했습니다. 이는 인간과 협력하도록 설계된 자율 에이전트로, 데이터 분석이라는 힘든 일을 처리하는 지칠 줄 모르는 조수 역할을 수행하면서도 최종적인 판단과 감독은 책임자에게 맡깁니다. 이 시스템은 인간을 대체하는 것이 아니라, 컴퓨터가 예측안을 제안하고, 이를 알려진 패턴 및 사용자 규칙과 대조하여 확인하며, 확실한 근거를 발견했을 때만 수정을 진행하는 루프를 생성합니다. 만약 근거가 부족하다면, 시스템은 맹목적으로 추측하는 대신 인간에게 도움을 요청하거나 더 많은 맥락을 찾도록 스스로 인지합니다. 이러한 접근 방식은 예측을 일회성 계산에서 초기 질문부터 최종 숫자까지 모든 단계가 기록되고 검토될 수 있는 문서화되고 검사 가능한 워크플로로 변화시킵니다.
CastClaw의 핵심은 서로 다른 도구들을 연결하는 중앙 신경계 역할을 하는 '하네스(harness)'라고 불리는 프레임워크입니다. 사용자가 "내일의 전력 가격을 예측해 달라"와 같이 평이한 영어로 질문을 던지면, 시스템은 먼저 어떤 데이터가 필요하고 어떤 규칙을 따라야 하는지를 식별합니다. 그런 다음 특화된 모델로부터 예측치를 가져오거나 사용자가 제공한 모델을 사용합니다. 이 숫자를 받아들이기 전에, 시스템은 일련의 점검 과정을 거칩니다. 최근의 패턴을 살펴 예측이 부합하는지 확인하고, 날씨 효과나 수요 및 공급 역학과 같은 도메인 지식과 비교하며, 사용자가 설정한 엄격한 제약 조건을 충족하는지 검증합니다. 만약 예측이 이 테스트를 통과하면 그대로 유지됩니다. 만약 실패한다면, 시스템은 단순히 이를 폐기하는 것이 아니라 왜 실패했는지 조사합니다. 누락된 맥락을 검색하거나, 다른 유형의 분석을 실행하거나, 혹은 더 나은 후보가 존재하는지 확인하기 위해 다른 모델을 참조할 수도 있습니다.
결정적으로, 이 시스템은 언제 멈춰야 할지를 아는 데 설계되었습니다. 시스템은 무한히 생각을 바꾸지 않습니다. 예측이 근거에 의해 뒷받침되거나, 추가적인 변경이 도움이 되지 않을 것으로 보이거나, 계산 예산이 소진되었을 때, 또는 인간 전문가의 최종 결정이 필요할 때 프로세스를 중단합니다. 시스템이 취하는 모든 행동, 발견하는 모든 증거, 그리고 고려하는 모든 버전의 예측은 상세한 보고서에 저장됩니다. 이 보고서를 통해 인간은 최종 숫자가 어떻게 도출되었는지, 여기에는 어떤 경고나 미결된 질문이 남아 있는지까지 포함하여 정확히 파악할 수 있습니다. 시스템은 인간의 입력을 무시해도 되는 최종 명령이 아니라, 작업을 수정하거나, 새로운 가설을 추가하거나, 언제든 실행을 중단할 수 있는 중요한 증거 사슬의 일부로 취급합니다.
연구진은 이 접근 방식이 실제로 작동하는지 테스트하기 위해 벨기에, 독일, 프랑스, 노르딕 풀(Nordic Pool), 그리고 미국의 PJM의 다섯 가지 공공 전력 가격 데이터셋에 CastClaw를 적용했습니다. 그들은 전통적인 통계 도구부터 고급 인공지능 모델에 이르기까지 16가지의 다른 방법들과 시스템의 성능을 비교했습니다. 모든 경우에서 CastClaw는 실제 미래 값과 숫자가 얼마나 가까운지를 측정했을 때 가장 정확한 예측을 만들어냈습니다. CastCl salt는 기존의 가장 우수한 방법들을 상당한 차이로 앞질렀으며, 일부 지역에서는 오차를 최대 30%까지 줄였습니다. 연구진은 또한 노르딕 전력 시장의 데이터를 사용하여 라이브 환경에서 시스템을 시연했습니다. 이 시연에서 사용자는 초기 예측치를 제공했고, 시스템은 이를 시장 상황과 대조했습니다. 시스템이 제안된 조정이 오히려 예측을 악화시킬 것이라는 사실을 발견했을 때, 시스템은 그 변경을 거부하고 원래의 예측치를 유지하며 전체 결정 과정을 문서화했습니다. 이는 시스템이 좋은 아이디어에 "예"라고 말하는 것만큼이나 나쁜 아이디어에 "아니오"라고 말할 줄 아는 비판적 사고 능력을 갖추고 있으며, 워크플로 자체가 완전히 검사 가능하다는 것을 보여주었습니다.
또한 연구진은 2026년 상반기 북중국 지역의 전력 부하를 나타내는 오프라인 데이터에 대해 시스템을 실행했습니다. 이 연습은 동일한 작업 명세, 모델 및 도구를 사용하여 오프라인 워크플로 실행을 검증하기 위해 설계된 것이며, 온라인 배포, 실제 운영 사용 또는 다른 모델과의 정확도 비교를 목적으로 한 것은 아니었습니다. 결과는 시스템이 규칙에 따라 데이터, 도구 및 결정을 관리하고 상세한 보고서를 기록하면서 오프라인 환경에서 처음부터 끝까지 완전한 워크플로를 실행할 수 있음을 확인시켜 주었습니다. 이 연구는 시스템이 매우 유능하지만, 모든 문제를 즉각적으로 해결하는 마법 상자가 아님을 분명히 합니다. 이 시스템은 인간이 목표를 정의하고 최종적인 감독을 제공하여 예측이 현실에 기반하고 의사 결정에 유용하도록 보장해야 하는 도구입니다. 기계의 속도와 인간의 판단력을 결합함으로써, CastClaw는 어려운 예측 문제를 다루는 새로운 방법을 제시하며, 혼란스러운 과정을 명확하고 신뢰할 수 있으며 투명한 여정으로 탈바꿈시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.