← 최신 논문
⚡ electrical engineering

VeraGrid-Agent: Tool-Augmented LLMs for Distribution Optimal Power Flow at the Grid Edge

이 논문은 VeraGrid-Agent를 소개하는데, 이는 VeraGrid 솔버를 자율적으로 실행함으로써 분산 최적 조류 계산 문제에서 97.3%~100.0%에 달하는 완벽에 가까운 정확도를 달 achieves하며, 언어적 추론에만 의존하여 50% 미만의 점수를 기록하는 모델들을 크게 능가하는 도구 증강 대규모 언어 모델입니다.

원저자: Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

게시일 2026-07-29
📖 1 분 읽기☕ 가벼운 읽기

원저자: Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: VeraGrid-Agent

문제 정의

대규모 언어 모델(LLM)은 코드 생성 및 추론 분야에서 상당한 능력을 입증하며 전력 시스템과 같은 과학 및 공학 도메인에서의 탐색을 이끌어내고 있습니다. 그러나 배전 최적 조류 계산(D-OPF)에 관한 복잡한 질문에 답하는 것은 독특한 과제를 안겨줍니다. 이러한 질문들은 AC 전력 조류 방정식, 분산 에너지 자원(DER), 그리고 그리드 제약 조건을 포함하는 비볼록(non-convex) 및 NP-hard 수치 문제를 해결해야 하기 때문입니다.

LLM이 파라미터 지식(메모리)만을 사용하여 이러한 질문에 답하려고 할 때, 모델은 추측을 강요받게 되며 종종 수치적으로 틀린 출력을 생성합니다. 본 논문은 PV 노드의 전압 상승, 버스 용량, DER 커테일먼트(curtailment), 또는 피더 손실 등을 결정하는 것과 같이 정밀한 수치 시뮬레이션이 필요한 작업에는 언어적 추론만으로는 불충분하다고 주장합니다. 핵심 문제는 과학적 추론에서 진정한 계산과 암기 또는 환각(hallucination)을 구분하는 것입니다.

방법론

이를 해결하기 위해 저자들은 D-OPF 문제를 자율적으로 해결하도록 설계된 도구 증강 LLM 프레임워크인 VeraGrid-Agent를 제안합니다. 방법론은 LLM이 내부 지식에 의존하는 대신 외부 솔버의 컨트롤러 역할을 수행하는 폐쇄 루프 워크플로우를 포함합니다.

1. 에이전트 워크플로우

에이전트는 격리된 작업 공간 내에서 작동하며 ReAct(Reasoning + Acting) 프레임워크를 따릅니다. 각 쿼리에 대해 에이전트는 다음을 수행합니다:

  • 입력 작성: 문제 설명에 기반하여 피더 그래프, 버스, 브랜치, 부하 및 DER 구성을 기술하는 JSON 입력 파일을 생성합니다.
  • 솔버 실행: AC-OPF 문제를 수치적으로 해결하는 오픈 소스 VeraGrid 시뮬레이터를 호출합니다.
  • 출력 읽기: 솔버는 컨텍스트 창을 컴팩트하게 유지하기 위해 전체 솔루션 대신 실행 메타데이터와 목차(table of contents)를 반환합니다. 그 후 에이전트는 특정 결과 행(예: 특정 선로 흐름 또는 버스 전압)을 표적 읽기(targeted reads) 합니다.
  • 정답 선택: 검색된 수치 데이터를 해석하여 객관식 질문(MCQ)에서 올바른 옵션을 선택합니다.

시스템은 무한 루프를 방지하기 위해 최대 반복 횟수(TmaxT_{max})가 제한되어 있지만, 대부분의 쿼리는 몇 단계 내에 해결됩니다.

2. 벤치마크: VeraGrid-MCQ-150

성능 평가를 위해 저자들은 150개의 객관식 질문으로 구성된 결정론적이고 템플릿 기반인 VeraGrid-MCQ-150을 도입했습니다.

  • 생성: 질문은 전문가가 정의한 템플릿에 의해 생성되며, 여기서 정답(ground truth)은 VeraGrid 시뮬레이터에 의해 직접 계산됩니다. 이는 모든 답변이 특정 해결된 네트워크 레코드의 결정론적 함수임을 보장합니다.
  • 난이도 수준:
    • 쉬움 (50문제): 직접적인 추출 (예: 노드 전압 크기, 요소 개수).
    • 중간 (50문제): 단일 단계 유도 (예: 단위 변환(per-unit conversion), 선로 임피던스 크기, 역률).
    • 어려움 (50문제): 다단계 계산 및 교차 테이블 추론 (예: 집계된 브랜치 손실, 순 예비 전력, 열적 여유도).
  • 평가 지표: 정확도는 정답(\ell^*) 대비 올바르게 예측된 레이블(^\hat{\ell})의 비율로 측정되며, 형식이 잘못되었거나 누락된 응답은 오답으로 처리합니다.

주요 기여

본 논문은 세 가지 주요 기여를 합니다:

  1. 도구 증강 아키텍처: LLM이 시뮬레이터 입력을 작성하고, VeraGrid 솔버를 실행하며, 관련 결과를 읽도록 하여 모든 답변이 솔버 출력에 추적 가능하도록 보장하는 새로운 D-OPF 분석 프레임워크입니다.
  2. 결정론적 벤치마크: 에이전트가 해결된 네트워크로부터 양적 정보를 검색하는 능력을 평가하여 정적인 암기에 대한 의존을 방지하는, 검증된 정답을 가진 재현 가능한 테스트베드인 VeraGrid-MCQ-150을 도입했습니다.
  3. 실증 연구: 일곱 가지 서로 다른 LLM을 두 가지 체제("no-tool": 설명으로부터의 추론, "agent": 도구 증강) 하에서 평가했습니다. 이 연구는 성능 향상과 실패 모드를 분석합니다.

결과

저자들은 8-버스 방사형 피더 테스트 케이스에 대해 7개의 모델(GPT-5.2, Claude Sonnet 4.5, Gemini 3 Flash, Grok 4.3/4.5, Composer 2.5, Opus 4.8 포함)을 평가했습니다.

  • No-Tool 체제: 솔버에 접근할 수 없는 경우, 모든 모델은 낮은 성능을 보였으며 전체 정확도는 41.3%에서 49.3% 사이였습니다. 이는 파라미터 지식이 이러한 수치적 작업에 불충분함을 확인시켜 줍니다.
  • Tool-Augmented 체제: VeraGrid-Agent를 사용하면 모든 모델에서 정확도가 극적으로 향 향상되어 **97.3%에서 100.0%**에 달했습니다.
    • Gemini 3 Flash, Grok 4.3, Grok 4.5는 완벽한 100% 정확도를 달성했습니다.
    • GPT-5.2와 Claude Sonnet 4.5는 각각 단 하나의 어려운 문제를 놓쳤습니다.
    • Opus 4.8과 Composer 2.5는 각각 2개와 4개의 문제를 놓쳤습니다.
  • 실패 모드 분석: 남은 몇 안 되는 오류는 솔버 실행 실패(타임아웃이나 실행 오류 없음) 때문이 아니었습니다. 대신, 단일 단말에서의 브랜치 손실을 집계하거나 DER 커테일먼트를 디스패치(dispatch)와 혼동하는 것과 같은 잘못된 해석 과정에서 발생했습니다.
  • 도구의 영향: 개선 효과는 수치 계산(예: 피더 손실, 전압 상승)이 필요한 질문에서 가장 뚜렷했습니다. 프롬프트 설명만으로 답할 수 있는 질문(예: 토폴로지, 선로 파라미터)은 no-tool 베이스라인이 이미 해당 카테고리에서 높았기 때문에 개선 폭이 적었습니다.

의의 및 주장

본 논문은 그리드 엣지 분석과 같이 접지된(grounded) 수치 집약적인 공학 작업의 경우, LLM 백본의 선택보다 외부 계산 도구에 대한 접근 권한이 더 중요하다고 주장합니다. 에이전트가 결정론적 솔버에 접근할 수 있게 되면, 서로 다른 LLM 간의 성능 격차는 거의 사라집니다.

이 연구는 도구 증강 에이전트가 진정한 계산과 암기 및 추측을 효과적으로 분리할 수 있음을 보여줍니다. 이는 현재의 모델들이 파라미터 지식에만 의존할 때 복잡한 수학적 분석에 어려움을 겪지만, 전문화된 솔버를 갖추면 이전에는 LLM 단독으로는 해결할 수 없었던 작업에서 거의 완벽한 정확도를 달 수 있음을 강조합니다. 저자들은 단일 균형 방사형 피더 사용 및 솔버 실행 시간 등의 한계를 언급하며, 향후 연구는 불균형 3상 시스템 및 에이전트의 추론 궤적을 사용한 소형 모델 미세 조정에 집중할 것임을 시사했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →