Counterfactual Analysis via Large Language Models
이 논문은 프롬프트 엔지니어링된 GPT-3.5 모델이 가상의 이자율 시나리오 하에서 투자 수익률을 예측하기 위해 온라인 대출 분야의 반사실적 분석을 효과적으로 수행할 수 있음을 입증하며, 전통적인 그래디언트 부스팅 회귀 모델과 대등한 성능을 달성하는 동시에 논리적인 인과적 추론 능력을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 '만약에?'라는 마법의 기계를 가진 시간 여행자라고 상상해 보십시오. 과학계에서 이것은 **반사실적 분석(counterfactual analysis)**이라고 불립니다. 이는 어제 다른 선택을 했더라면 어떤 일이 일어났을지를 예측하는 기술입니다. 그 학생이 낙제한 이유가 교실이 너무 커서였을까요, 아니면 더 작은 방이었다면 만점을 받았을까요? 그 이메일이 무시된 이유는 제목이 지루해서였을까요, 아니면 개인화된 제목이 상황을 살릴 수 있었을까요? 과학자들은 단순히 추측하는 것이 아니라 인과관계를 이해하기 위해 이 기술을 사랑합니다. 보통 이러한 질문에 답하기 위해 연구자들은 값비싼 실험을 수행하거나 과거 데이터를 통해 미래를 추측하는 복잡한 수학 모델을 사용해야 합니다. 하지만 최근, 새로운 종류의 디지털 두뇌가 등장했습니다. 바로 **거대 언어 모델(LLM)**입니다. 이들을 인터넷상의 거의 모든 것을 읽은 초스마트 로봇이라고 생각하십시오. 이들은 이야기를 쓰거나 대화하는 데 뛰어나지만, '만약에'라는 시나리오를 파악하기 위해 시간 여행자의 역할을 수행할 수 있을까요? 이것이 이 논문이 던지는 핵심 질문입니다.
연구자는 이 디지털 두뇌를 온라인 대출이라는 고도의 이해관계가 얽힌 세계에서 테스트하기로 했습니다. 은행이 사람들에게 돈을 빌려준다고 상상해 보십시오. 은행은 사람들에게 얼마의 이자율을 부과할지 결정해야 합니다. 이자율을 너무 높게 책정하면 차입자가 부담을 느껴 상환을 중단할 수 있습니다. 반대로 너무 낮게 책정하면 은행은 손해를 봅니다. 은행은 실제로 선택한 이자율에 따라 어떤 결과가 나타났는지는 알고 있지만, 만약 다른 이자율을 선택했더라면 어떤 일이 벌어졌을지는 결코 확실히 알 수 없습니다. 이 퍼즐의 빠진 조각이 바로 '반사실(counterfactual)'입니다. 연구자들은 AI, 구체적으로 GPT-3.5라고 불리는 모델이 대출 신청서를 보고 이렇게 말할 수 있는지 알고 싶었습니다. "우리가 이자율을 12% 대신 10%로 책정했다면, 차입자가 더 빨리 상환했을 것입니다."
이를 실현하기 위해 연구팀은 단순히 AI에게 질문을 던진 것이 아닙니다. 그들은 로봇과 대화하는 것이 인간과 대화하는 것과 비슷하다는 점을 깨달았습니다. 즉, 올바른 방식으로 질문해야 한다는 것입니다. 그들은 **프롬프트 엔지니어링(prompt engineering)**이라 불리는 기술을 사용했는데, 이는 AI에게 완벽한 지침을 주는 기술입니다. 그들은 AI에게 차입자인 척해보라고 요청하기도 하고, 신용 전문가인 척해보라고 요청하기도 했습니다. 심지어 AI가 네 명의 전문가 패널이 되어 서로 논쟁하며 합의에 도달하도록 시뮬레이션하는 사고의 나무(tree-of-thought) 방식도 시도했습니다. 또한, AI가 전통적인 컴퓨터 알고리즘이 내린 예측을 엿보게 하여, AI가 그 알고리즘보다 더 나은 결과를 낼 수 있는지 확인했습니다.
결과는 놀라울 정도로 유망했습니다. 연구자들이 특별한 지침 없이 AI에게 대출 결과를 추측하게 했을 때, AI는 수학적 정확도가 약 2%에 불ку할 정도로 형편없는 성적을 보였습니다. 하지만 '전문가 패널' 기법을 사용하고 적절한 맥락을 제공하자, 성능은 거의 3%까지 급등했습니다. 이 수치가 작게 들릴 수도 있지만, 이 분야에서는 매우 큰 사건입니다. AI가 최고의 전통적 수학 모델의 정확도에 거의 근접했기 때문입니다. 더 중요한 것은 AI가 단순히 숫자만 내뱉는 것이 아니라, 자신의 추론 과정을 설명했다는 점입니다. AI는 차입자의 이력을 살펴보고, 이자율을 고려하며, 왜 더 낮은 이자율이 대출 상환을 더 빠르게 도울 수 있는지 논리적으로 논증했습니다.
이 연구는 거대 언어 모델이 단순한 챗봇이 아니라, '만약에' 시나리오를 파고들 수 있는 역량 있는 도구가 되고 있음을 시사합니다. AI는 전통적인 컴퓨터 모델이 지나치게 낙관적일 때 이를 포착하여, 인간의 행동 방식에 대한 자신의 '지식'을 바탕으로 예측을 조정할 수 있음을 보여주었습니다. 예를 들어, 전통적인 모델이 낮은 이자율을 적용했을 때 차입자가 8개월 만에 대출을 상환할 것이라고 예측했을 때, AI는 "그들의 신용 이력을 고려할 때 너무 빠르다"라고 생각하며 예측치를 22개월로 조정했습니다. 이는 AI가 단순히 수학을 복사하는 것이 아니라, 실제로 논리를 통해 사고하고 있음을 보여줍니다.
하지만 저자는 이것을 완벽한 해결책이라고 부르는 것에는 주의를 기울입니다. 그들은 AI가 발전하고 있기는 하지만, 여전히 시뮬레이션된 환경에서 테스트되고 있다는 점을 언급합니다. 연구팀은 AI의 예측이 현실 세계의 규칙(예: 이자율을 낮추면 사람들이 채무 불이행을 할 가능성이 낮아진다)과 논리적으로 일치한다는 것을 발견했지만, AI가 인간 행동의 미스터리를 완전히 풀었다고 주장하지는 않았습니다. 대신, 이 모델들이 대출 기관과 과학자들이 다양한 미래를 시뮬레이션함으로써 더 나은 결정을 내릴 수 있도록 돕는 강력한 새로운 도구라고 제안합니다. 이는 마치 당신이 실제로 선택을 내리기 전에 그 선택의 결과를 시각화할 수 있도록 도와주는, 매우 똑똑하고 박학다식한 컨설턴트를 곁에 두는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.