← 최신 논문
💻 computer science

Reliability by Design: A Shared Schema-Metadata Grounding and Catalogue-Constrained Extraction Architecture for Safe Natural-Language Access to Legacy Enterprise Systems

본 논문은 모델 규모가 아닌 아키텍처 설계를 통해 환각 현상과 보안 위험을 제거함으로써, 자유 형식의 SQL 생성을 스키마 메타데이터 내비게이션 그래프와 카탈로그 제한 추출로 대체하여 신뢰성을 보장하는 레거시 엔터프라이즈 시스템에 대한 안전한 자연어 접근을 위한 프로덕션 등급의 아키텍처를 제시하고 검증한다.

원저자: Karan Khajuria, R. K. Bathla

게시일 2026-09-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Karan Khajuria, R. K. Bathla

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대적인 기관들의 광대하고 정적인 기계 장치 속에서, 대학교에서 병원에 이르기까지, 데이터는 거대한 디지털 아카이브 속에 갇혀 있습니다. 엔터프라이즈 리소스 플래닝(ERP) 플랫폼으로 알려진 이 시스템들은 입학, 시험, 연구 보조금, 그리고 거버넌스의 기록들을 보유하고 있습니다. 수년 동안 이 데이터에 대해 질문을 던져야 하는 사람들—관리자, 품질 관리자, 코디네이터—은 이 데이터에 직접 접근할 수 없었습니다. 그들은 데이터베이스의 언어인 복잡한 코드 SQL을 구사할 수 없기에, 자신의 질문을 쿼리로 번역해 줄 소수의 기술 전문가들에게 의존해야만 했습니다. 이는 병목 현상을 일으켜 의사결정을 늦추고, 비기술직 직원들이 중개인에게 종속되게 만듭니다. 최근에는 거대 언어 모델(LLM)이라 불리는 새로운 유형의 컴퓨터 프로그램이 누구나 일상적인 영어로 질문하고 즉각적인 답변을 받을 수 있게 함으로써 이 문제를 해결할 것이라는 약속을 해왔습니다. 그러나 이 강력한 모델들이 실제 운영 중인 중요한 비즈니스 시스템에 직접 연결될 때, 이들은 위험해집니다. 엄격한 가드레일이 없다면, 이 모델들은 존재하지 않는 데이터 테이블 간의 연결을 지어내거나, 암호화된 값의 의미를 추측하거나, 실수로 민감한 정보를 노출할 수 있습니다. 그 결과, 도움이 되는 것처럼 들리지만 잘못된 답을 내놓거나, 더 심하게는 안전과 개인정보 보호 규칙을 위반하는 시스템이 될 수 있습니다.

데시 바가트 대학교(Desh Bhagat University)의 연구팀은 자연어를 이러한 레거시 시스템에 연결하면서, 컴퓨터 모델의 원초적인 힘보다 안전성을 우선시하는 새로운 방법을 구축했습니다. 그들은 이 환경에서의 신뢰성이 인공지능을 더 똑똑하거나 더 크게 만드는 문제가 아니라, 시스템 자체의 아키텍처를 바꾸는 문제라고 주장합니다. 언어 모델이 데이터베이스 쿼리를 직접 작성하도록 두는 대신, 그들은 모델이 오직 사전 승인된 옵션 목록 중에서만 선택할 수 있도록 하는 구조를 만들었습니다. 연구진은 약 800개의 데이터 테이블을 포함하며 현대적인 데이터베이스에서 발견되는 표준 안전 표식(safety markers)이 부족한 실제 대학 시스템을 대상으로 이 접근 방식을 테스트했습니다. 그들의 연구 결과는, 모델이 할 수 있는 일을 엄격히 통제함으로써, 언어 모델의 크기에 상관없이 최종 데이터베이스 명령에서 오류 제로를 달 수 있음을 보여주었습니다. 이 시스템은 추측에 의해 작동하는 것이 아니라, 대화가 시작되기 전부터 존재하는 데이터의 큐레이션된 지도에 모든 요청을 근거(grounding)로 삼아 작동합니다.

이 솔루션의 핵심은 소프트웨어의 숨겨진 구조를 조직하는 새로운 방식입니다. 많은 오래된 엔터프라이즈 시스템에서는 데이터베이스가 서로 다른 정보 조각들이 어떻게 연관되어 있는지 명시적으로 밝히지 않으며, 이러한 연결은 오직 애플리케이션 코드 내부에만 존재합니다. 이를 해결하기 위해 연구진은 '스키마-메타데이터 내비게이션 그래프(Schema-Metadata Navigation-Graph)'를 구축했습니다. 이것을 소프트웨어의 복잡하고 암묵적인 연결을 명확하고 구조화된 가이드로 번역하는 상세하고 기계 판독 가능한 지도로 상상해 보십시오. 이 지도는 '입학'이나 '연구'와 같은 시스템의 고수준 기능 영역부터 특정 페이지, 컬럼, 그리고 실제 데이터 테이블에 이르기까지 연결합니다. 결정적으로, 이 지도는 승인된 보고서 템플릿의 목록과 각 템플릿을 불러오는 데 필요한 정확한 사전 작성 코드를 포함하고 있습니다. 이는 누락된 안전 표식을 대체하는 역할을 하여, 컴퓨터가 추측할 필요 없이 서로 다른 정보 조각들을 어떻게 결합해야 하는지 정확히 알 수 있게 합니다.

사용자가 질문을 던지면, 시스템은 언어 모델이 처음부터 새로운 데이터베이스 명령을 작성하도록 허용하지 않습니다. 대신, 모델은 '선택자(selector)' 역할을 수행합니다. 모델은 사용자의 요청을 경청하고, 사용자가 현재 소프트웨어의 어느 부분에서 작업하고 있는지에 대한 맥락을 사용하여, 사전 승인된 지도에서 가장 관련성이 높은 부분을 식별합니다. 그런 다음 모델은 구조화된 사양을 추출하는데, 이는 본질적으로 알려진 안전한 보고서 템플릿의 화이트리스트 중에서 선택하는 과정입니다. 모델은 실제 데이터베이스 코드를 생성하지 않습니다. 모델이 선택을 마치면, 별도의 신뢰할 수 있는 소프트웨어가 제어권을 넘겨받습니다. 이 결정론적(deterministic) 코드는 지도에 저장된 고정되고 검증된 파편들을 사용하여 최종 쿼리를 조립합니다. 코드가 즉석에서 생성되는 것이 아니라 이미 알고 있는 안전한 부분들로부터 조립되기 때문에, 시스템이 악성 코드를 주입하거나, 존재하지 않는 컬럼을 참조하거나, 잘못된 데이터를 반환하는 방식으로 테이블을 결합하는 명령을 생성하는 것은 불가능합니다.

연구진은 이 아키텍처를 다섯 가지 인증 체계를 지원하는 실제 고등 교육 시스템에 배포했습니다. 그들은 모델을 속여 오류를 유도하려는 벤치마크를 포함하여 시스템을 엄격하게 테스트했습니다. 결과는 명확했습니다: 시스템은 유효하지 않은 데이터베이스 명령을 단 하나도 생성하지 않았습니다. 이러한 안전성은 소규모의 오픈 소스 언어 모델을 사용하든 훨씬 더 큰 독점 모델을 사용하든 동일하게 유지되었습니다. 사실, 가장 작은 모델이 가장 큰 모델만큼 잘 작동했다는 점은, 안전성이 모델 뒤에 있는 '두뇌'의 크기가 아니라 시스템의 설계로부터 온다는 것을 증명했습니다. 실제 사용 환경에서 이해관계자들은 시스템이 약 85%의 확률로 정확한 보고서를 반환한다고 보고했습니다. 나머지 요청들은 추측하는 대신 안전하게 거부되었으며, 이를 통해 다른 시스템들을 괴롭히는 '침묵의 오류(silent errors)'를 방지했습니다.

이 접근 방식은 비용과 유지보수의 문제도 해결합니다. 시스템은 사용자가 실제로 무엇을 묻는지에 대한 큐레이션된 목록에 의존하기 때문에, 전체 데이터베이스 스키마를 이해하려고 노력하는 것보다 유지보수에 드는 노력이 훨씬 적습니다. 연구진은 인공지능을 재학습시키거나 복잡한 코드를 다시 작성할 필요 없이, 지도에 단 하나의 항목을 추가하는 것만으로도 새로운 보고 기능을 추가할 수 있다는 것을 발견했습니다. 또한, 연구진은 시스템이 사용자의 질문에 답하는 '반응형 레이어(reactive layer)'와 컴플라이언스 지표를 자동으로 모니터링하는 '선제적 레이어(proactive layer)'라는 두 개의 층을 갖도록 설계했습니다. 두 레이어는 동일한 기본 지도를 공유하므로, 조직은 대화형 도움과 자동화된 안전 점검을 모두 얻기 위해 두 개의 별도 시스템을 구축할 필요가 없습니다.

본 연구는 중요한 엔터프라이즈 시스템을 위해, 신뢰할 수 있는 자연어 접근의 길은 복잡한 데이터를 추론할 수 있는 더 큰 모델을 만드는 것이 아니라, 모델을 안전하고 검증된 경로로 제한하는 아키텍처를 구축하는 것이라고 결론짓습니다. 데이터베이스 명령을 생성하는 과업을 언어 모델로부터 분리하여 신뢰할 수 있는 결정론적 프로세스로 옮김으로써, 연구진은 안전하면서도 실용적인 시스템을 만들어냈습니다. 이 설계는 기관들이 기록의 무결성을 위협하지 않으면서도 데이터의 가치를 실현할 수 있는 방법을 제시하며, 엔터프라이즈 데이터의 세계에서는 안전성이 규모가 아닌 구조의 속성임을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →