← 최신 논문
💻 computer science

VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space

VeriTrace는 인스펙터(Inspector) 에이전트에게 신호 선택, 시간 창, 반복 깊이에 대한 완전한 제어권을 부여하여 인간과 유사한 가설 기반 디버깅을 수행할 수 있게 하는 "에이전틱 템포럴 익스플로레이션(Agentic Temporal Exploration)"을 특징으로 하는 멀티 에이전트 시스템을 도입함으로써, VerilogEval-V2에서 100%의 Pass@1을 달고 이전의 최첨단 벤치마크들을 능가합니다.

원저자: Yu-Tung Liu, Cunxi Yu

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yu-Tung Liu, Cunxi Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 오직 서면 설명만을 사용하여 복잡한 기계, 예를 들어 태엽 장치 장난감을 만드는 법을 가르치려 한다고 상상해 보십시오. 당신은 로봇에게 지침을 주고, 로봇은 그에 따라 장난감을 만들려고 시도합니다. 하지만 때때로 이 장난감은 제대로 작동하지 않습니다. 컴퓨터 과학의 세계에서 이것은 "하드웨어 설계"라고 불리며, 그 지침은 베릴로그(Verilog)라는 특별한 언어로 작성됩니다. 오랫동안 대규모 언어 모델(LLM)로 알려진 똑똑한 컴퓨터 프로그램들은 이 지침을 읽고 기계를 만들기 위한 코드를 작성하는 데 매우 능숙해졌습니다. 그러나 기계가 고장 나면, 이 프로그램들은 종ā히 막히곤 합니다. 이들은 장난감이 고장 났다는 사실은 인지하지만, 내부의 움직이는 부품들을 자세히 들여다볼 수 없기 때문에 그런지는 알아내지 못합니다. 이들은 마치 엔진에서 덜컹거리는 소리가 들리지만, 후드를 열거나 특정 기어를 점검하기 위해 렌치를 사용할 수 없는 정비사와 같습니다. 메릴랜드 대학교의 연구원들이 작성한 이 논문은 바로 이 문제, 즉 어떻게 하면 이 AI "정비사"들에게 인간 전문가처럼 기계의 내부 작동 방식을 조사할 수 있는 자유를 줄 것인가를 다룹니다.

연구원인 유퉁 리우(Yu-Tung Liu)와 순시 유(Cunxi Yu)는 AI가 초기 코드는 잘 작성하지만, 문제가 발생했을 때 이를 수정하는 데 어려움을 겪는다는 점에 주목했습니다. AI의 디버깅을 돕기 위한 이전의 시도들은 기계의 신호가 시간에 따라 어떻게 변하는지를 보여주는 시각적 지도인 "파형(waveform)"을 제공하는 것이었습니다. 하지만 기존 시스템들은 마치 탐정에게 범죄 현장의 사진을 주면서, 어떤 단서를 조사할지 또는 어느 시간대에 집중할지를 결정하는 것을 금지하는 것과 같았습니다. AI는 미리 선택된 좁은 시야만을 강제로 보게 되었고, 이는 종종 실제 오류의 원인을 놓치게 만들었습니다. 저자들은 이러한 한계를 "불완전한 행동 공간(incomplete action space)"이라고 불렀습니다. 그들은 코드를 진정으로 수정하기 위해서는 AI가 인간 엔지니어가 생각하는 방식과 똑같이, 어떤 신호를 검사할지, 언제 그것을 볼지, 그리고 얼마나 오래 조사할지를 선택할 수 있어야 한다고 주장합니다.

이 문제를 해결하기 위해 연구팀은 VeriTrace라는 새로운 시스템을 만들었습니다. VeriTrace를 전문화된 AI 작업자 팀이라고 생각해 보십시오. 한 작업자는 코드를 작성하고, 다른 작업자는 그것이 제대로 작동하는지 확인하며, "조사관(Inspector)"이라 불리는 세 번째 작업자는 호기심 많은 탐정 역할을 합니다. 이전의 시스템들과 달리, 이 조사관에게는 완전한 자유가 주어집니다. 조사관은 "나는 이 특정 기어에 문제가 있다고 생각하지만, 작동 중 두 번째 초 동안만 그렇다"라고 말하며 정확히 그 부분을 확대하여 확인할 수 있습니다. 만약 첫 번째 추측이 틀렸다면, 조사관은 포기하지 않고 새로운 가설을 세우고, 다른 시간대를 선택하여 다시 조사합니다. 이 과정은 "에이전트적 시간 탐색(Agentic Temporal Exploration)"이라고 불립니다. 이를 통해 AI는 가설을 세우고, 증거에 비추어 이를 테스트하며, 인간이 하는 것처럼 단계별로 이해를 정교화할 수 있습니다.

이 새로운 접근 방식의 결과는 매우 인상적입니다. VerilogEval-V2라고 불리는 156개의 표준 코딩 챌린지에 대해 테스트했을 때, VeriTrace는 100% Pass@1라는 완벽한 점수를 기록했습니다. 이는 최종 수정된 코드의 첫 번째 시도에서 모든 문제를 맞혔음을 의미합니다. 이는 오픈 소스 시스템이 이 특정 벤치마크에서 이 정도의 완벽함에 도달한 첫 번째 사례입니다. 동일한 기반 AI 두뇌(Claude Sonnet 4.0)를 사용하는 다른 강력한 시스템들과 비교했을 때도, VeriTrace는 5.1% 더 높은 성능을 보였으며, 이는 AI에게 탐색하고 조사할 자유를 주는 것이 정확도의 마지막 격차를 메우는 핵심임을 입증했습니다.

흥미롭게도, 연구원들은 이러한 자유가 AI를 더 똑똑하게 만들었을 뿐만 아니라, 더 효율적으로 만들었다는 점을 발견했습니다. 기계의 전체 이력을 메모리에 쏟아붓는 대신 각 단계에서 필요한 특정 정보만을 요청함으로써, VeriTrace는 처리해야 할 데이터 양을 18% 줄였습니다. 이는 AI가 올바른 질문을 던지게 하는 것이 정답을 찾는 데 더 좋을 뿐만 아니라, 계산 에너지를 절약하는 길임을 시사합니다. 논문은 결론적으로, AI 모델 자체도 강력하지만, 진짜 돌파구는 우리가 그들이 도구를 사용하는 방식에서 나온다고 밝힙니다. AI에게 시간과 신호를 자유롭게 탐색할 수 있는 주체성을 부여함으로써, 우리는 그들을 경직된 코드 생성기에서 진정한 문제 해결사로 변화시킬 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →