← 최신 논문
🤖 AI

Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents

Trace2Policy는 전문가의 의사결정 규칙을 고정밀도의 결정론적 파이썬 코드로 체계적으로 복구하고 개선하는 오류 기반 반복적 기술 정교화(EISR) 프레임워크를 도입하며, 이는 규제 준수가 중요한 작업에서 정적 LLM 증류 및 순수 LLM 베이스라인보다 뛰어난 성능을 보이면서도 정교화 비용을 크게 절감합니다.

원저자: Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

게시일 2026-06-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

바쁜 물류 회사를 상상해 보십시오. 숙련된 심사역들은 매일 수천 건의 배송 클레임을 검토하며 시간을 보냅니다. 그들은 사진을 보고, 보고서를 읽으며 다음과 같은 결정을 내립니다. "이 손상은 운송업체의 잘못인가, 아니면 발송인의 잘못인가?" 이 전문가들은 수년간 학습한 복잡하고 명문화되지 않은 일련의 정신적 규칙을 바탕으로 이러한 결정을 내립니다. 예를 들어, "사진에 박스가 찢어져 있는데 시스템에는 '온전함'이라고 되어 있다면, 사진을 믿어야 한다"라거나, "검토자가 'C:'로 시작하는 노트를 작성했다면, 이는 비밀리에 책임을 재할당하고 있다는 뜻이다"와 같은 것들입니다.

문제는 이러한 규칙들이 전문가들의 머릿속에 갇혀 있다는 점입니다. 단순히 몇 가지 예시를 보여주는 방식으로 컴퓨터(AI)에게 이 일을 가르치려 하면, AI는 혼란에 빠집니다. 전문가들이 사용하는 미묘하고 숨겨진 기술들을 놓치기 때문입니다.

Trace2Policy는 이 문제를 해결하기 위해 설계된 새로운 시스템입니다. 이를 "규칙 추출 및 정제 기계"라고 생각하십시오. 이 시스템이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 탐정 단계 (행동 포착)

먼저, 시스템은 조용한 탐정처럼 행동합니다. 시스템은 전문가 심사역들이 컴퓨터에서 작업하는 모습을 지켜보며, 그들이 클릭하는 모든 것, 보는 모든 화면, 입력하는 모든 노트를 기록합니다. 단순히 무엇을 클릭했는지만 기록하는 것이 아니라, 그들이 그렇게 했는지 이해하려고 노력합니다.

  • 비유: 코치가 숙련된 요리사가 복잡한 요리를 하는 과정을 녹화한다고 상상해 보십시오. 코치는 단순히 "소금을 넣으시오"라고 적는 것이 아니라, "요리사가 국물 맛을 본 뒤, 국물이 너무 산성이라서 소금을 한 꼬집 더 넣었다"라고 기록합니다.

2. 초안 작성 단계 (첫 번째 시도)

시스템은 이러한 기록을 가져가서, 똑똑한 AI에게 자신이 파악한 요리사의 규칙을 작성하도록 요청합니다.

  • 문제점: 첫 번째 초안은 대개 피상적입니다. 드러난 단계("박스를 확인하라")는 포착하지만, 깊고 숨겨진 논리("시스템은 실시간으로 업데이트되므로, 원래 코드가 아닌 현재 코드를 확인하라")는 놓칩니다.
  • 결과: 이 첫 번째 초안("v1 Skills")은 괜찮은 수준이지만, 결정의 약 70% 정도만 제대로 맞춥니다. 이는 교과서는 암기했지만, 기말고사의 함정 문제에는 아직 적응하지 못한 학생과 같습니다.

3. "EISR" 엔진 (마법의 루프)

이것이 핵심 혁신입니다. 시스템은 EISR(오류 기반 반복 기술 정제, Error-driven Iterative Skill Refinement)이라고 불리는 프로세스를 사용합니다.

  • 작동 방식: 시스템은 초안 규칙을 테스트 케이스 세트에 실행합니다. 오류가 발생하면, 시스템은 단순히 "틀렸다"라고 말하는 데 그치지 않고 엄격한 편집자처럼 행동합니다.
    1. 진단: 오류를 그룹화합니다. "누락되었는가"(규칙이 이 경우을 다루지 못함)? "틀렸는가"(규칙은 존재했지만 잘못된 답을 냄)? 아니면 "충돌하는가"(두 규칙이 서로 싸움)?
    2. 패치: 해당 오류 그룹에 대한 구체적인 수정안을 작성합니다.
    3. 안전 점검 (회귀 게이트): 수정을 저장하기 전, 기존에 맞았던 케이스들을 다시 실행합니다. 만약 새로운 수정안이 이전에 작동하던 것을 망가뜨린다면, 그 수정안을 버립니다.
  • 비유: 자동차 정비사가 엔진을 고치는 상황을 상상해 보십시오. 정비사가 달그락거리는 소리를 잡기 위해 볼트를 조일 때마다, 즉시 엔진을 테스트하여 실수로 스파크 플러그를 느슨하게 만들지는 않았는지 확인합니다. 그들은 차가 완벽하게 작동할 때까지 이 과정을 반복합니다.

4. "트랩 규칙(Trap Rules)"의 발견

이 루프를 통해 시스템은 단 한 번의 인터뷰로는 아무도 써낼 수 없었던 깊은 지식인 "트랩 규칙"을 찾아냈습니다.

  • 예시: 화면의 특정 코드가 "공동 책임(Shared Liability)"처럼 보일 수 있지만, 실제로는 5분 전 "포장 손상(Packaging Damage)"에서 변경된 임시 라벨일 수 있다는 점이 하나의 트랩이었습니다. 전문가들은 라벨을 무시하고 검토자가 취한 행동을 봐야 한다는 것을 알고 있었습니다. AI는 실수를 반복하고 교정받은 후에야 비로소 이 사실을 배웠습니다.

5. 최종 결과물: 컴파일 vs 프롬프트

이 논문은 규칙이 어떻게 사용되는지에 대해 매우 구체적이고 놀라운 주장을 합니다.

  • 프롬프트 방식: 규칙을 긴 지침 목록(프롬프트) 형태로 AI에게 전달할 수 있습니다. 이는 가능하지만, 마치 천재에게 50페이지짜리 매뉴얼을 읽으면서 수학 문제를 풀라고 하는 것과 같습니다. 정확도는 약 70% 정도입니다.
  • 컴파일 방식: 시스템은 이 규칙들을 엄격한 컴퓨터 프로그램(Python 코드)으로 변환합니다. 이는 매뉴얼을 계산기로 바꾸어 단순히 계산을 수행하게 만드는 것과 같습니다.
  • 결과: "컴파일" 버전은 **79.6%**의 정확도로 뛰어올랐습니다. 논문은 이러한 규칙 중심의 작업에서는 AI의 지능보다 규칙의 품질이 훨씬 더 중요하다고 주장합니다. 나쁜 규칙을 따르는 똑똑한 AI는 실패하지만, 완벽한 규칙을 따르는 단순한 컴퓨터는 성공합니다.

6. "플라이휠(Flywheel)" (자기 개선)

배포된 후에도 시스템은 멈추지 않습니다.

  • 루프: 인간 심사역들은 여전히 (본업의 일부로서) 모든 케이스를 검토합니다. 시스템은 자신의 답변과 인간의 답변을 비교합니다. 만약 두 답변이 일치하지 않으면, 시스템은 이를 플래그로 표시하고, 오류를 분석하며, 자동으로 또 다른 "EISR" 라운드를 트리거하여 규칙을 수정합니다.
  • 비용: 이를 수동으로 수행하려면 인간 전문가가 한 사이클당 70시간이 걸립니다. 자동화된 버전(Auto-EISR)은 5~10달러의 비용과 몇 시간의 시간만 소요됩니다.

요약된 주장

  • 기능: 전문가의 행동을 자기 개선형 결정 규칙으로 전환합니다.
  • 발견한 점:
    • 원샷 러닝(AI에게 한 번 요청하는 것)은 깊고 숨겨진 규칙을 포착하는 데 실패합니다.
    • 반복적인 오류 교정(EISR)은 정확도를 크게 높이는 "트랩 규칙"을 찾아냅니다.
    • 이러한 특정 작업의 경우, 규칙을 프롬프트로 실행하는 것보다 엄격한 컴퓨터 프로그램으로 실행하는 것이 훨씬 더 낫습니다.
    • AI "안전망"(AI가 확신이 없을 때 규칙을 수정하게 하는 것)을 추가하는 것은 이 특정 사례에서 오히려 정확도를 낮추었습니다. 왜냐하면 AI는 클레임을 거절하려는 경향이 너무 강했던 반면, 실제 규칙은 회사의 구체적인 니즈에 완벽하게 맞춰져 있었기 때문입니다.
  • 범위: 이 연구는 물류 회사의 손상 클레임(3,349건)과 몇 가지 법률 추론 벤치마크에서 테스트되었습니다. 저자들은 이것이 모든 유형의 결정에 적용된다고 주장하는 것이 아니라, 전문가들이 체계적이고 암묵적인 규칙을 따르는 작업에 특화되어 있다고 밝히고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →