Theoria: Rewrite-Acceptability Verification over Informal Reasoning States
이 논문은 솔루션을 명시적인 정당화와 함께 검증 가능한 유형화된 상태 전이로 재작성함으로써 AI 답변의 신뢰성을 향상시키고, 이를 통해 전문가 수준의 문제에 대한 높은 정밀도를 유지하면서도 숨겨진 전제와 조작된 인용을 탐지하는 데 있어 총체적 LLM 판별기보다 뛰어난 성능을 보이는 검증 아키텍처인 Theoria를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 천재적이지만 때때로 과도하게 자신만만한 건축가를 고용하여 다리를 설계하고 있다고 상상해 보십시오. 당신은 단순히 최종 설계도만을 원하는 것이 아니라, 왜 모든 보(beam)가 그 위치에 놓여야 하는지 그 이유를 알고 싶어 합니다. 만약 건축가가 "느낌이 좋아서 여기에 보를 놓았습니다"라고 말한다면, 당신은 그 다리를 믿을 수 없습니다. 하지만 만약 그가 "X 법칙에 의해 이 보가 여기에 있어야 하며, 여기는 그것을 증명하는 계산식입니다"라고 말한다면, 당신은 그 수학적 근거를 검증할 수 있습니다.
이것이 바로 **테오리아(Theoria)**가 인공지능을 위해 해결하고자 하는 문제입니다.
문제점: 신뢰할 수 있는 두 가지 결함 있는 방식
현재 우리는 AI의 답변이 좋은지 확인하는 두 가지 주요 방법이 있지만, 둘 다 허점이 있습니다.
- "수학자" 접근법 (형식적 증명 보조 도구): 이것은 엄격하고 깨뜨릴 수 없는 수학적 코드로만 말하는 로봇을 고용하는 것과 같습니다. 완벽하지만, 이미 그 코드로 번역된 문제만을 이해할 수 있습니다. 대부분의 현실 세계 문제(예: 법적 논쟁이나 과학적 이론)는 무질서하고 비정형적이므로, 이 로봇은 이를 읽어낼 수 없습니다.
- "직관" 접근법 (스칼라 판독기): 이것은 사람에게 AI의 에세이를 읽게 하고 1점에서 10점 사이의 점수를 매기게 하는 것과 같습니다. 광범위한 영역을 다룰 수는 있지만, 그 점수는 블랙박스와 같습니다. 왜 7점을 받았는지 알 수 없습니다. 숨겨진 가정을 놓친 것일까요? 아니면 인용을 조작한 것일까요? 당신은 그저 숫자 하나를 얻을 뿐이며, 나중에 이를 감사(audit)할 수도 없습니다.
해결책: "상태 재작성(State Rewriting)" 탐정
테오리아는 제3의 길을 제시합니다. AI에게 긴 에세이를 쓰거나 모든 것을 수학 코드로 번역하라고 요구하는 대신, 테로리아는 AI가 자신의 답변을 **단계별 상태 변화 로그(step-by-step state change log)**로 재작성하도록 강제합니다.
이것은 마치 비디오 게임의 세이브 파일이나 버전 관리 시스템(Git과 같은)을 위한 추론 방식과 같습니다.
- 설정: AI는 "상태 0"(문제 정의)에서 시작합니다.
- 움직임: 정답에 도달하기 위해 AI는 "상태 1", "상태 2" 등으로 이동해야 합니다.
- 규칙: 모든 움직임에 대해, AI는 반드시 티켓(정당한 근거)을 제공해야 합니다. 티켓은 오직 다음 세 가지 유형 중 하나여야 합니다.
- 인용: "나는 정리 X를 사용한다."
- 계산: "나는 계산을 했다: 2+2=4."
- 주어진 사실: "문제에서 이 사실을 알려주었다."
마법의 기술: "변화의 완결성(Completeness of Change)"
여기에 핵심 비법이 있습니다. 테오리아에는 엄격한 규칙이 있습니다: 상태 A와 상태 B 사이의 모든 변화는 반드시 티켓에 의해 설명되어야 합니다.
만약 AI가 (예를 들어 "다리가 금으로 만들어졌다고 가정하자"와 같이) 티켓 없이 숨겨진 가정을 끼워 넣으려 한다면, 시스템은 이를 잡아냅니다. "변화"(금 가정을 추가함)는 로그에 나타나지만, 티켓(정당한 근거)은 이를 설명하지 못합니다. 그러면 시스템은 이렇게 외칩니다. "잠깐! 상태를 변경했는데, 영수증을 보여주지 않았잖아!"
이는 AI가 정직하도록 강제합니다. AI는 긴 텍스트 속에 거짓말을 숨길 수 없습니다. 거짓이 대화 속에 들어온 정확한 순간을 보여줘야만 하기 때문입니다.
실제 작동 방식
- 솔버(Solver): AI가 문제를 풀려고 시도합니다.
- 정형화 도구(Formalizer): 두 번째 AI가 그 솔루션을 앞서 설명한 "상태 변화 로그"로 재작성합니다. 만약 솔버가 논리적 비약을 했다면, 정형화 도구는 그것을 구체적인 단계로 기록해야 합니다.
- 판독기(Judges): 특화된 AI 감사관들이 각 단계를 검사합니다.
- **"수학 판독기"**는 계산을 검증합니다.
- **"인용 판독기"**는 참조된 정리가 실제로 존재하는지, 그리고 적용 가능한지 확인합니다.
- **"사실 판독기"**는 해당 사실이 원래 문제에 있었는지 확인합니다.
- 판결: 모든 단계에 유효한 티켓이 있다면, 답변은 **승인(Certified)**됩니다. 만약 단 하나의 단계라도 티켓이 누락되거나 가짜 티켓이 있다면, 답변은 **거부(Declined)**됩니다.
논문이 밝혀낸 결과
저자들은 어려운 문제들(전문가 시험 수준의 문제)을 대상으로 테스트를 진행했으며, 다음과 같은 결과를 얻었습니다.
- 높은 신뢰도: 테로리아가 정답이라고 말할 때, 그것이 정답일 확률은 **91.4%**입니다.
- 교묘한 거짓말 포착 능력: AI가 전제(숨겨진 가정)를 숨기거나 인용을 조작할 때, 테로리아는 이를 **90.6%**의 확률로 잡아냅니다. 일반적인 "직관" 판독기는 이를 **62.5%**밖에 잡아내지 못합니다.
- 수학적 오류에는 마법이 아님: AI가 단순히 산수를 틀리는 경우(예: 2+2=5라고 하는 경우), 테로리아와 일반 판독기 모두 비슷한 정도로 잡아냅니다. 테로리아의 특별한 강점은 특히 숨겨진 논리나 가짜 출처를 잡아내는 데 있습니다.
- 상호 보완성: 테로리아와 일반 판독기는 서로 다른 문제에서 실패합니다. 두 방법을 함께 사용하면 거의 모든 오류를 잡아낼 수 있습니다.
결론
테로리아는 AI를 더 똑똑하게 만들려는 것이 아니라, AI의 추론을 감사 가능하게(auditable) 만들려는 것입니다.
이것은 모호하고 신뢰할 수 없는 에세이를 투명한 변경 내역 장부로 바꿉니다. 모든 답변이 맞다고 약속하는 것은 아닙니다(검증할 수 없기 때문에 약 43%의 답변을 거절합니다). 하지만 승인된 답변에 대해서는, 당신은 영수증을 확인하고, 수학적 근거를 체크하며, 왜 그것을 믿어도 안전한지 정확히 알 수 있습니다.
AI가 사실을 환각(hallucinate)할 수 있는 세상에서, 테로리아는 이렇게 말하는 시스템입니다: "모든 단계에 대한 영수증을 보여주십시오. 그렇지 않으면 승인하지 않겠습니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.