Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact
이 논문은 생성형 셸(generative shell)과 결정론적 커널(deterministic kernel)을 분리하여 답변 불가능하거나 모호한 요청에 대해 환각을 일으키는 대신 명시적으로 거절하도록 함으로써, 엔터프라이즈 및 에이전트 기반 배포에서의 사실적 신뢰성을 보장하는 AI 시스템을 위한 아키텍처 패턴인 "구조적 절제(structural abstention)"를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
신뢰의 함정: AI가 너무 매끄럽게 거짓말을 할 때
매우 똑똑하고 수다스러운 로봇에게 숙제를 도와달라고 부탁한다고 상상해 보세요. 당신은 "우리 태양계에는 몇 개의 행성이 있어?"라고 묻습니다. 로봇은 즉시 "명왕성을 포함하여 9개의 행성이 있습니다!"라고 대답합니다. 매우 자신감 있고, 문법이 완벽하며, 말투도 친근합니다. 하지만 당신은 명왕성이 더 이상 행성이 아니라는 것을 알고 있습니다. 문제는 로봇이 멍청해서가 아니라, 정답처럼 들리게 만드는 능력이 너무 뛰어나다는 점입니다. 인공지능, 특히 거대 언어 모델(LLM)의 세계에서 이것은 위험한 함정입니다. 이러한 모델들은 다음에 어떤 단어가 와야 하는지 추측하는 데는 탁월하지만, 수학을 계산하거나 사실을 확인하는 데는 형편없습니다. 질문에 틀린 답을 할 때, 그들은 "모릅로다"라고 말하는 대신, "환각(hallucination)"—즉, 너무 유창하고 자신감 있게 들려서 당신이 믿어버릴 수도 있는 가짜 답변—을 만들어냅니다.
이는 데이터에 의존하는 기업과 도구들에게 매우 큰 문제입니다. 만약 로봇이 매장 매니저에게 "500개가 팔렸습니다"라고 말했는데 실제 숫자가 400이라면, 매니저는 그 거짓말을 바탕으로 잘못된 결정을 내릴 수 있습니다. 무서운 점은 그 거짓말이 진실과 똑같이 보인다는 것입니다. 문장을 읽는 것만으로는 차이를 구별할 수 없습니다. 과학자들과 엔지니어들은 로봇을 더 똑똑하게 만들거나 더 주의 깊게 만듦으로써 이를 해결하려 노력해 왔지만, 이 논문은 진짜 해결책이 로봇이 추측을 더 잘하게 만드는 것이 아니라, 로봇이 숫자를 아예 추측하지 못하도록 막는 것이라고 주장합니다.
숫자를 절대 다루지 마라: "신뢰할 수 있는 커널(Trusted Kernel)" 솔루션
이 논문은 판매 보고서나 병상 수와 같은 데이터를 다루는 AI 시스템을 구축하는 영리한 새로운 방법을 소개합니다. 저자들은 이 접근 방식을 **"구조적 포기(Structural Abstention)"**라고 부릅니다. 이는 "수학적으로 100% 확신할 수 없다면, 시도조차 하지 마라"라는 뜻의 멋진 표현입니다.
이것이 어떻게 작동하는지 이해하기 위해, 고급 레스토랑의 주방을 상상해 보세요.
- 생성형 쉘 (웨이터 - Generative Shell): 이것은 시스템의 친절하고 수다스러운 부분입니다. 당신과 대화하고, 당신의 복잡한 질문을 이해하며, 당신이 정확히 무엇을 원하는지 파득합니다. 만약 당신이 "지난주에 빨간 것들에 대해 알고 싶어요"라고 말하면, 웨이터는 그것을 구체적인 주문으로 번역합니다: "고객은 '지난주'의 '빨간 사과'에 대한 판매 수치를 원함". 웨이터는 창의적일 수 있고, 실수를 할 수도 있으며, 명확한 설명을 요구할 수도 있습니다. 만약 웨이터가 주문을 잘못 이해하더라도, 당신은 그저 수정해주면 될 뿐 해가 되지는 않습니다.
- 결정론적 커널 (셰프 - Deterministic Kernel): 이것은 엄격하고 규칙을 따르는 시스템의 부분입니다. 웨이터는 주문을 셰프에게 전달합니다. 셰프는 절대로 추측하지 않습니다. 셰프는 오직 사전 승인된 메뉴에 있는 요리만을 만듭니다. 만약 고객이 메뉴에 없는 것(예: "달에 있는 빨간 사과")을 요청하면, 셰프는 레시피를 발명하려고 시도하지 않습니다. 셰프는 단순히 "그것은 만들 수 없습니다"라고 말합니다. 그 후 셰프는 계산기(데이터베이스)를 사용하여 정확한 숫자를 계산하고 기록합니다.
이 시스템의 마법 같은 규칙은 **"경계 불변성(Perimeter Invariant)"**입니다. 이는 다음과 같이 말합니다: 시스템에서 무언가를 지어낼 수 있는 부분(웨이터)은 어떤 질문을 던질지 결정할 수는 있지만, 결코 무엇이 정답인지는 결정할 수 없다. 정답은 항상 고정된 레시피를 따르는 엄격한 셰프로부터 나와야 합니다.
실생활에서의 작동 방식
저자들은 이 아이디어를 2년 동안 판매 매니저들이 사용한 실제 시스템을 통해 테스트했습니다. 그들이 사용한 단계별 과정은 다음과 같습니다:
- 당신이 질문함: 매니저가 "지난 화요일에 리버턴 매장에서 휴대폰이 몇 대 팔렸나요?"라고 묻습니다.
- 웨이터(쉘)가 경청함: AI가 듣습니다. AI는 "리버턴"이 무엇을 의미하는지, 혹은 "지난 화요일"이 회사의 달력에서 유효한 날짜인지 모를 수 있습니다. 그래서 AI는 "리버턴 매장을 말씀하시는 건가요, 아니면 리버턴 지역을 말씀하시는 건가요? 그리고 회계 주간을 말씀하시는 건가요?"라고 묻습니다.
- 확인 단계: AI가 이해했다고 생각하면, 그냥 숫자를 내뱉지 않습니다. 대신 이렇게 말합니다: "알겠습니다. 제가 계산하려는 내용은 다음과 같습니다: 회계 주간 1월 20일 동안의 리버턴 매장 휴대폰 판매량입니다. 이것이 맞습니까?"
- 당신이 승인함: 당신은 문장을 읽습니다. 만약 맞다면, "네"라고 답합니다.
- 셰프(커널)가 계산함: 당신이 "네"라고 말한 후에야 시스템은 엄격하게 미리 작성된 컴퓨터 코드를 실행하여 숫자를 가져옵니다. 그것은 추측하지 않습니다. 단지 데이터를 찾아 합산할 뿐입니다.
- 결과: 시스템이 당신에게 숫자를 줍니다. "셰프"가 절대 추측하지 않았기 때문에, 당신은 그 숫자가 실제임을 알 수 있습니다.
AI가 막히면 어떻게 되나요?
만약 당신이 시스템이 처리할 수 없는 질문(예: "아직 존재하지 않는 매장에서의 판매량은 얼마인가요?")을 하면, "웨이터"는 "셰프"에게 해당하는 레시피가 없다는 것을 깨닫습니다. 대신, 시스템은 가짜 숫자를 만들어내는 대신 멈춰 서서 이렇게 말합니다: "그 질문에는 답할 수 없습니다. 제가 답할 수 있는 세 가지 질문은 다음과 같습니다."
이것을 **"구조적 포기(Structural Abstension)"**라고 부릅니다. 시스템은 자신의 엄격한 규칙 안에 해당 요청을 표현할 수 없기 때문에 답변을 거부합니다. 이는 다른 AI 방법들이 신뢰도 점수(예: "80% 확신합니다")를 추측한 다음 답변 여부를 결정하는 것과는 다릅니다. 이 시스템은 추측할 필요가 없습니다. 질문이 메뉴에 맞지 않으면 단순히 계산을 할 수 없는 것입니다.
이것이 왜 중요한가
논문은 이 "웨이터와 셰프" 시스템을 두 가지 다른 유형의 AI와 비교합니다:
- "엔드 투 엔드(End-to-End)" 모델: 이것은 모든 것을 스스로 하려는 로봇입니다. 듣고, 답을 추측하고, 코드를 작성합니다. 빠르고 많은 주제를 다룰 수 있지만, 틀렸을 때 아주 매끄럽게 거짓말을 합니다. 당신은 정답과 오답을 구별할 수 없습니다.
- "도구 사용(Tool-Using)" 에이전트: 이것은 답을 찾기 위해 도구를 사용하는 로봇입니다. 더 낫긴 하지만, 어떤 도구를 사용할지 혹은 결과를 어떻게 조합할지에 대해 여전히 혼란을 겪을 수 있습니다.
저자들은 비즈니스 결정을 내리는 데 있어 "웨이터와 셰프" 시스템이 가장 안전하다는 것을 발견했습니다. 비록 이 시스템이 대답할 수 있는 질문의 수는 적지만(메뉴가 더 작음), 대답하는 내용만큼은 신뢰할 수 있습니다. 논문은 2년간의 테스트 결과, 이 "커널 우선(kernel-first)" 시스템이 매우 신뢰할 수 있어서 나중에 더 똑똑한 AI를 훈련시키기 위한 충분한 데이터를 생성할 수 있었다고 언급합니다. 하지만 그 경우에도 최종 숫자에 대해서는 엄격한 규칙을 유지했습니다.
한계점
이 시스템은 모든 사람에게 완벽한 것은 아닙니다. 만약 당신이 완전히 새로운 데이터셋을 탐구하는 과학자이고, 아주 창의적이고 기발한 질문을 던지고 싶다면, 이 시스템은 너무 경직되었다고 느낄 수 있습니다. "그것은 할 수 없습니다"라는 말을 자주 할 것이기 때문입니다. 하지만 잘못된 숫자가 회사의 돈을 잃게 하거나 환자에게 해를 끼칠 수 있는 상황에서는, "모른다"라고 말할 수 있는 능력이 "실제처럼 들리는 가짜 숫자를 제시하는" 능력보다 훨씬 낫다고 이 논문은 주장합니다.
요약하자면, 이 논문은 중요한 데이터를 다룰 때 AI가 숫자를 더 잘 추측하도록 만드는 것을 멈춰야 한다고 제안합니다. 대신, AI는 오직 질문을 던질 수만 있고, 창의성이 없는 엄격한 기계만이 계산을 수행할 수 있도록 시스템을 구축해야 합니다. 이것은 트레이드오프입니다. 더 적은 답변을 얻게 되지만, 당신이 얻는 답변은 진실입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.