Schema-Agnostic Process Trace Construction: From Raw Tables to Execution Behavior
본 논문은 키(key) 및 시간적 속성을 통계적으로 식별하고, 테이블 간의 연결 관계를 발견하며, 이벤트 순서를 모델링하기 위해 템포럴 컨볼루션 네트워크(Temporal Convolutional Network)를 활용함으로써, 동적인 정보 시스템에서 사전 정의된 스키마나 도메인 템플릿의 필요성을 제거하고, 느슨하게 연결된 관계형 테이블로부터 고충실도의 프로세스 실행 트레이스를 자동으로 재구성하는 스키마 불가지론적(schema-agnostic) 파이프라인을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 은행 강도 사건의 이야기를 재구성하려는 형사라고 상상해 보십시오. 완벽한 세상이라면, 경찰이 모든 기록에 누가, 무엇을, 언제 했는지를 정확하게 적어 놓은 깔끔하고 연대기적인 일지를 건네줄 것입니다.
하지만 현실 세계에서 증거는 흩어져 있습니다. 당신에게는 흩어진 영수증 더미, 보안 카메라 로그 뭉치, 몇 개의 손글씨 메모, 그리고 전화 통화 기록이 담긴 스프레드시트가 있습니다. 이 문서들은 서로 대화하지 않습니다. 영수증에는 이름이 없고, 카메라 로그에는 타임스탬프가 없으며, 전화 메모는 다른 언어로 쓰여 있습니다. 게다가 은행은 매주 파일링 시스템을 바꿉니다.
이것이 이 논문의 저자들이 해결하려는 문제입니다. 그들은 데이터가 지저로, 여러 테이블에 흩어져 있고 끊임없이 변하는 현대적인 컴퓨터 시스템(은행이나 대기업 등)을 다루고 있습니다. 전통적인 방식은 완벽하고 미리 조직된 지도(스키마)를 요구하기 때문에 이러한 시스템을 분석하는 데 실패합니다.
그들의 솔루션이 어떻게 작동하는지, 간단한 단계별로 설명하면 다음과 같습니다.
문제: "엉망진창인 서류 보관함"
과거의 컴퓨터 시스템에서 데이터는 잘 정리된 도서관과 같았습니다. 모든 책에는 명확한 라벨이 붙어 있었고, 어떤 선반에 속해 있는지 알 수 있었습니다.
현대의 시스템에서 데이터는 수집광의 다락방과 같습니다.
- 라벨 없음: 어떤 데이터가 어떤 고객에 속하는지 쉽게 알 수 없습니다 (키 누락).
- 흩어진 단서: 단일 거래의 이야기가 다섯 개의 서로 다른 테이블로 나뉘어 있습니다.
- 혼란스러운 타임라인: 한 테이블은 "오전 10:00"이라고 말하고, 다른 테이블은 "오전 10:05"라고 하며, 세 번째 테이블은 그냥 "어제"라고만 합니다.
- 끊임없는 개보수: 당신이 청소를 하려고 하는 동안에도 다락방의 배치가 바뀌고 있습니다.
이 때문에 명확한 타임라인(프로세스 트레이스라고 불리는 것)을 구축하려면 인간 전문가가 이를 하나하나 수동으로 엮어야 하는데, 이는 느리고 비용이 많이 들며 오류가 발생하기 쉽습니다.
솔루션: "스키마에 구애받지 않는" 형사
저자들은 지도가 필요 없는 초스마트 형사처럼 작동하는 자동화된 파이프라인을 구축했습니다. 그들은 "지도가 어디 있지?"라고 묻는 대신, 이야기 자체를 파악하기 위해 증거를 직접 살핍니다.
그들의 "형사"가 수행하는 네 가지 단계는 다음과 같습니다.
1. 단서 포착하기 (프로파일링)
먼저, 시스템은 모든 데이터 열(column)을 스캔하여 그것이 무엇인지 추측합니다.
- ID 찾기: 고유한 이름처럼 보이는 열(예: 고객 ID)을 찾습니다. 시스템은 다음과 같이 확인합니다: "이 값은 고유한가? 항상 존재하는가? 이름처럼 보이는가?"
- 시간 찾기: 날짜처럼 보이는 열을 찾습니다. 시스템은 다음과 같이 확인합니다: "이것이 타임스탬프처럼 보이는가? 일관성이 있는가?"
- 비유: 뒤섞인 퍼즐 조각 더미를 분류한다고 상상해 보십시오. 형사는 상자에 그려진 그림이 없어도, 조각의 모양만 보고 어떤 것이 하늘이고 어떤 것이 풀인지 추측할 수 있습니다.
2. 점 연결하기 (관계 발견)
공식적인 "점 잇기" 선(외래 키)이 없기 때문에, 시스템은 통계적 신호를 사용합니다.
- 서로 다른 테이블의 열들을 비교합니다. 만약 테이블 A에 숫자 목록이 있고 테이블 B에도 완벽하게 일치하는 숫자 목록이 있다면, 시스템은 이들이 연결되어 있다고 가정합니다.
- 공식적인 규칙을 무시하고 실제 데이터 패턴을 봅니다.
- 비유: 한 주머니에서 영수증을 발견하고 다른 주머니에서 그와 일치하는 신용카드 명세서를 발견했다면, 비록 둘이 스테이플러로 찍혀 있지 않더라도 당신은 그것들이 동일 인물의 것임을 알 수 있습니다.
3. 타임라인 구축하기 (시퀀싱)
시스템이 어떤 테이블들이 연결되어 있는지 알게 되면, 단일 "사건"(예: 특정 고객 주문)에 대한 모든 이벤트를 모읍니다.
- 이 이벤트들을 시간순으로 정렬합니다.
- 시간이 혼란스럽거나 누락된 경우, 논리를 사용하여 순서를 추측합니다.
- 비유: 형사는 특정 강도 사건에 대한 흩어진 메모, 영수증, 로그를 모두 가져와서 테이블 위에 늘어놓고 사건의 순서를 배치합니다.
4. 패턴 학습하기 (두뇌 - TCN)
이것이 가장 진보된 부분입니다. 때때로 타임스탬프가 너무 엉망이라 어떤 이벤트가 먼저 일어났는지 알 수 없을 때가 있습니다.
- 시스템은 **TCN(Temporal Convolutional Network)**이라는 특수한 유형의 AI를 사용합니다. 이것은 패턴 인식 엔진이라고 생각하면 됩니다.
- 시스템은 수천 개의 과거 사례를 살펴보고 다음과 같이 학습합니다: "보통 이벤트 A가 발생하면, 이벤트 B가 뒤따른다."
- 시계가 고장 났더라도, AI는 이야기의 흐름을 바탕으로 다음 단계를 예측할 수 있습니다.
- 비례: 누군가 코트를 입고, 열쇠를 챙기고, 문을 여는 것을 본다면, 당신은 그가 정확히 어느 순간에 나갔는지 보지 못했더라도 그가 곧 떠날 것임을 압니다. AI는 이러한 "이야기의 흐름"을 학습합니다.
결과: 이 형사는 얼마나 유능한가?
저자들은 가짜 데이터(엉망인 은행을 시뮬레이션함), 표준 벤치마크, 그리고 실제 산업 데이터셋을 통해 이 시스템을 테스트했습니다.
- 정확도: 시스템은 프로세스의 다음 단계를 **85%**의 확률로 정확하게 예측했습니다.
- 복구 능력: 데이터가 누락되거나 엉망인 상황에서도, 시스템은 올바른 이벤트 순서의 약 **82%**를 찾아내고 재구성해 냈습니다.
- 회복 탄력성: 데이터가 "드리프트(변화)"되었을 때(이름이 바뀌거나 날짜가 누락됨), 전통적인 방식은 무너졌지만 이 시스템은 계속 작동했습니다.
이것이 중요한 이유
이 논문은 데이터를 완벽하게 만들기 전까지 분석을 기다려서는 안 된다고 주장합니다. 엉망인 현실 세계의 데이터를 경직되고 미리 정의된 틀에 억지로 맞추는 대신, 데이터 스스로가 말하게 해야 합니다.
"스키마(지도)"의 필요성을 제거함으로써, 이 접근 방식은 기업이 자신의 시스템이 아무리 엉망이고, 끊임없이 변하며, 문서화가 제대로 되어 있지 않더라도 자동으로 이해할 수 있게 해줍니다. 이는 혼란스러운 증거 더미를 인간의 막대한 노력 없이도 명확하고 읽기 쉬운 이야기로 바꾸어 놓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.