Constraint-Aware Synthetic Tabular Data Generation via Inter-Column Constraint Discovery with LLM Agents
본 논문은 통계적 충실도를 보존하고 다운스트림 유용성을 향상시키면서도 측정된 위반 사례가 0건에 달하는 구조적으로 유효한 합성 표 형식 데이터를 생성하기 위해, LLM 에이전트를 통해 열 간 제약 조건(방정식, 선형 부등식 및 논리적 의존성)을 발견하고 강제하는 통합된 도구 기반 워크플로를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 시대에 방대한 양의 정보가 항공 일정부터 신용 신청, 농구 통계, 의료 기록에 이르기까지 모든 것을 기록하는 스프레드시트 속에 잠겨 있습니다. 실제 데이터가 부족하거나, 민감하거나, 공유하기 어려울 때, 연구자와 엔지니어들은 합성 데이터(synthetic data)로 눈을 돌립니다. 합성 데이터는 현실 세계의 통계적 패턴을 모방하는 컴퓨터 생성 기록입니다. 이러한 인공 데이터셋을 통해 팀들은 개인정보를 위험에 빠뜨리거나 기밀 세부 정보를 노출할 위험 없이 소프트웨어를 구축 및 테스트하고, 인공지능을 훈련하며, 다양한 시나리오를 탐색할 수 있습니다. 그러나 이 분야에는 오랫동안 골칫거리였던 중대한 문제가 있습니다. 컴퓨터는 데이터의 일반적인 형태를 복제하는 데는 뛰어나지만—평균 연령이나 소득 분포가 올처럼 보이게 하는 것 등—열과 열 사이를 묶어주는 깊은 논리적 규칙을 이해하는 데는 종종 실패한다는 점입니다. 컴퓨터는 상품이 구매되기도 전에 배송이 완료된 주문을 생성하거나, 총비용이 가격에 수량을 곱한 값과 일치하지 않는 금융 기록을 생성할 수 있습니다. '구조적 위반(structural violations)'이라고 불리는 이러한 오류들은 데이터가 겉보기에는 진짜처럼 보이게 만들지만, 단순한 논리적 검사에도 무너지게 하여 진지한 분석이나 의사결정에 사용하기에는 무용하게 만듭니다.
한 연구팀은 이 결함을 해결하기 위해 새로운 방법을 개발하여, 인공지능이 데이터셋의 숨겨진 논리적 규칙을 발견하고 강제하도록 가르치는 시스템을 만들었습니다. 이들의 접근 방식은 데이터 생성기가 처음부터 엄격한 규칙을 따르도록 강요하는 대신(이는 종종 데이터를 왜곡하거나 복잡한 재학습을 요구합니다), 정교한 사후 처리 단계로서 작동합니다. 이 시스템은 먼저 대규모 언어 모델(방대한 양의 텍스트로 훈련된 고급 AI 도구)을 사용하여 데이터셋의 설명과 샘플 기록을 읽습니다. 이 모델들은 호기심 많은 감사관처럼 작동하여, 서로 다른 열들이 어떻게 연관되어야 하는지에 대한 가설을 제안합니다. 예를 들어, 배송 날짜는 반드시 주문 날짜보다 늦어야 한다거나, 특정 제품 유형은 특정 운송 수단으로만 배송될 수 있다는 등의 가설을 제시할 수 있습니다.
이 혁신의 핵심은 이러한 제안들을 어떻게 테스트하고 정제하느냐에 있습니다. AI의 추측을 맹목적으로 수용하는 대신, 시스템은 각 아이디어를 원본 데이터의 모든 행에 대해 검증할 수 있는 엄격하고 기계가 읽을 수 있는 지침으로 변환합니다. 만약 제안된 규칙이 단 몇 번이라도 실패한다면, 시스템은 즉시 그 규칙을 버리지 않습니다. 대신, AI에게 규칙이 깨진 구체적인 사례들을 보여줌으로써 모델이 자신의 가설을 수정할 수 있도록 합니다. 이러한 제안, 테스트, 수정의 순환은 시스템이 전체 데이터셋에 적용되는 일련의 규칙을 확정할 때까지 계속됩니다. 연구진은 세 가지 주요 관계 유형에 집중했습니다: 하나가 다른 것들의 정확한 결과가 되는 방정식, 한 값이 다른 값보다 크거나 작아야 하는 부등식, 그리고 한 항목의 범주가 허용되는 다른 범주를 결정하는 논리적 의존성입니다.
규칙이 발견되고 검증되면, 시스템은 이를 모든 표준 도구로 생성된 합성 데이터에 적용합니다. 시스템은 하나의 오류를 수정하는 것이 또 다른 오류를 만들지 않도록 특정 순서에 따라 오류를 수정하는 조정자 역할을 합니다. 예를 들어, 어떤 합계가 두 부분의 합이어야 한다는 규칙이 있다면, 시스템은 먼저 부분들을 바탕으로 합계를 수정한 다음, 그 부분들을 더 넓은 범위 내에 맞추기 위해 조정합니다. 이러한 세심한 순차적 처리는 최종 데이터셋이 발견된 모든 법칙을 동시에 준수하도록 보장합니다. 연구진은 비행 기록부터 철강 산업의 에너지 소비에 이르기까지 7개의 서로 다른 공개 데이터셋을 대상으로 이 워크플로우를 테스트했으며, 4가지 유형의 데이터 생성기를 사용했습니다. 수정 전의 합성 데이터는 종종 수백 개의 위반 사항을 포함하고 있었으며, 일부 데이터셋에서는 생성된 거의 모든 기록이 적어도 하나의 규칙을 위반하는 모습을 보였습니다. 하지만 시스템이 수정을 적용한 후에는, 강제할 수 있는 모든 규칙에 대해 위반 건수가 0건으로 떨어졌습니다.
결정적으로, 이러한 엄격한 정제 작업은 데이터의 유용성을 망가뜨리지 않았습니다. 연구진은 정제된 데이터가 신용 위험이나 항공 지연을 예측하는 모델을 훈련하는 것과 같은 실제 과업에서 얼마나 잘 수행되는지 측정했습니다. 대부분의 경우 데이터의 효용성은 오히려 향상되었으며, 최악의 경우에도 성능 저하는 미미했습니다. 또한 시스템은 각 열의 값 분포가 원본에 충실하도록 유지함으로써 데이터의 개별적 특성을 보존했습니다. 이 연구는 논리적 규칙을 개별적인 체크 항목이 아닌 상호작용하는 제약 조건의 체계로 다룸으로써, 통계적으로 실제와 유사할 뿐만 아니라 구조적으로도 견고한 합성 데이터를 생성하는 것이 가능하다는 것을 입증합니다. 이 접근 방식은 신뢰할 수 있는 합성 데이터를 생성하기 위한 실질적인 경로를 제시하며, 우리의 미래 시스템을 훈련하는 데 사용될 인공 기록들이 논리적 진실이라는 토대 위에 구축되도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.