← 최신 논문
💬 NLP

Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text

본 논문은 오류가 발생하기 쉬운 자연어 추론 대신 실행 검증이 가능한 파이썬 프로그램을 사용하여 대규모 언어 모델의 신뢰할 수 있는 수치 추론 능력을 소형 학생 모델로 전이하는 골드 가이드 프로그래매틱 증류 프레임워크를 제안하며, 이를 통해 TAT-QA 금융 추론 벤치마크에서 최첨단 성능을 달성한다.

원저자: Yun Dong, Erica Zhao, Elana Chen

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yun Dong, Erica Zhao, Elana Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한, 까다로운 퍼즐을 풀려고 노력 중이라고 상상해 보세요. 퍼즐의 절반은 이야기 속에 적혀 있고, 나머지 절반은 엉망진창인 스프레드시트 안에 숨겨져 있습니다. 이것이 금융 관련 질문에 답하려는 컴퓨터의 일상입니다. 오랫동안 과학자들은 컴퓨터에게 수학 시험을 치르는 학생이 풀이 과정을 평서문으로 써 내려가는 것처럼, 자신의 단계를 영어로 써내도록 가르쳐서 컴퓨터가 "생각"하는 법을 가르쳐 왔습니다. 이것을 "사고 사슬(Chain-of-Thought)"이라고 부릅니다. 하지만 여기 함정이 있습니다. 컴퓨터는 문장을 쓰는 동안 머릿속으로 계산을 하려고 하면 매우 서툽니다. 그들은 자주 주의가 산만해지거나, 숫자를 섞어버리거나, 그럴듯하게 들리지만 틀린 답을 지어내곤 합니다. 이는 마치 뛰어난 스토리텔러에게 인간 계산기 역할까지 해달라고 요청하는 것과 같습니다. 그들은 대개 수학 부분에서 실패합니다.

이를 해결하기 위해, 연구자들은 컴퓨터에게 문장 대신 코드를 작성하도록 가르치기 시작했습니다. 코드는 컴퓨터가 혼란 없이 완벽하게 따를 수 있는 엄격한 레시피와 같습니다. 하지만 새로운 문제가 생겼습니다. 작고 빠른 컴퓨터에게 완벽한 레시피를 쓰는 법을 어떻게 가르칠 것인가 하는 점입니다. 왜냐하면 당신이 가진 유일한 스승은 때때로 여전히 실수를 저지르는 거대하고 느린 컴퓨터뿐이기 때문입니다. 만약 스승이 나쁜 레시피를 준다면, 제자는 잘못된 방식을 배우게 됩니다. 이 논문은 바로 그 문제를 다룹니다. 질문은 이렇습니다. 우리가 작은 컴퓨터가 스승의 완벽한 레시피로부터만 배울 수 있게 하고, 스승이 틀린 것을 수정하도록 도와준다면, 그 작은 컴퓨터를 수학의 달인으로 키울 수 있을까요?

황금 레시피 북

조지아 공대와 스탠퍼드 연구진은 "Gold-Guided Programmatic Distillation"이라 불리는 영리한 2단계 계획을 고안해 냈습니다. 이것을 마스터 셰프(스승, 거대한 720억 파라미터 모델)가 젊은 견습생(학생, 더 작은 70억 파라미터 모델)에게 복잡한 금융 요리를 하는 법을 가르치는 것이라고 생각해 보세요.

1단계: 엄격한 필터
보통 스승이 제자에게 무언가를 가르칠 때는 단순히 "내가 이렇게 했단다"라고 말합니다. 하지만 이 세계에서는 스승도 실수를 할 수 있습니다. 그래서 연구진은 마법 같은 "골드 가이드(Gold Guide)"를 추가했습니다. 스승이 레시피(파이썬 프로그램)를 쓰기 전에, 정답지를 비밀리에 먼저 보여주는 것입니다. 그러면 스승은 정확히 그 정답에 도달하는 레시피를 쓰려고 시도합니다.

여기서 마법 같은 기술이 나옵니다. 연구진은 단순히 스승의 말을 믿지 않았습니다. 그들은 스승이 쓴 모든 레시피를 엄격한 "맛 테스트"(코드를 실행하는 컴퓨터 프로그램)에 통과시켰습니다. 만약 레시피에 오타가 있거나, 오류가 발생하거나, 정확한 숫자가 나오지 않는다면 모두 쓰레기통에 버려졌습니다. 오직 완벽하게 작동하고 골드 정답과 일치하는 레시피만이 특별한 "황금 레시피 북"에 저장되었습니다. 작은 학생은 오직 이 완벽한 레시피들로만 학습되었습니다. 이를 통해 학생이 나쁜 습관을 배우지 않도록 보장했습니다.

2단계: 컴백 투어
하지만 거대한 스승조차 작동하는 레시피를 쓸 수 없는 어려운 질문들은 어떻게 될까요? 스승은 그냥 포기할 것이고, 그러면 그 문제들은 해결되지 않은 채 남게 됩니다. 연구진은 그 문제들을 남겨두고 싶지 않았습니다. 그들은 "회복 단계(Recovery Stage)"를 도입했습니다.

연구진은 스승이 실패한 질문들을 가져와서 학생에게 다시 시도해 보라고 요청했습니다. 학생은 동일한 질문에 대해 다섯 가지의 서로 다른 가능한 레시피를 생성합니다. 이전과 마찬가지로, 다섯 가지 모두를 맛 테스트에 통과시켰습니다. 만약 학생의 레시피 중 하나라도 완벽하게 작동한다면, 그것을 저장했습니다. 이는 학생이 스승이 해결하지 못한 문제들을 스스로 해결하는 법을 배우는, 즉 자신의 성공으로부터 스스로를 가르치는 법을 의미했습니다. 그런 다음 그들은 이 새롭게 발견된, 완벽한 레시피 묶음을 가지고 학생을 다시 학습시켰습니다.

결과: 작지만 강하다

연구진은 표와 텍스트가 섞여 있는 유명한 금융 퍼즐 세트인 TAT-QA를 통해 테스트를 진행했습니다. 그들은 이 특별한 훈련을 받은 작은 학생을 거대한 스승, 기존의 컴퓨터 모델들, 그리고 다른 스마트한 AI 시스템들과 비교했습니다.

결과는 놀라웠습니다. 이 특별한 훈련을 받은 작은 학생은 "Exact Match"(정답을 정확히 맞히는 척도)에서 87.00, "F1"(정답에 얼마나 근접했는지를 보는 척도)에서 87.18을 기록했습니다.

이를 비교해 보자면 다음과 같습니다:

  • 골드 가이드 힌트가 있었음에도 불구하고, 거대한 720억 파라미터 스승은 78.46을 기록했습니다.
  • 이전 최고의 AI 시스템(TAT-LLM)은 82.67을 기록했습니다.
  • 훈련받지 않은 작은 학생은 낮은 46.33에서 시작했습니다.

작은 학생은 단순히 따라잡은 것이 아니라, 거대한 스승과 기존의 최고 시스템들을 실제로 이겼습니다. 연구진은 학생이 특히 어려운 부분, 즉 표와 이야기 양쪽에서 발견되는 숫자들로 수학 계산을 하는 부분에서 매우 뛰어나다는 것을 발견했습니다.

이것이 중요한 이유

이 논문은 이 방법이 거대한 모델의 막대한 컴퓨팅 자원 없이도 작은 컴퓨터를 신뢰할 수 있는 수학 모델로 만드는 강력한 방법임을 시사합니다. 모든 실수를 걸러내고 학생이 스스로 회복한 성공으로부터 배우게 함으로써, 그들은 똑똑하면서도 정밀한 시스템을 만들어냈습니다.

하지만 저자들은 이 문제가 100% 해결된 것은 아니라고 조심스럽게 언급합니다. 최고의 학생이라 할지라도 여전히 몇 가지 오류가 존재합니다. 예를 들어, 답은 맞지만 단위(예: "백만" vs "십억")가 틀리거나, 답 자체가 틀린 경우입니다. 하지만 이전과 비교했을 때, 오류의 수는 수백 개에서 백 개 조금 넘는 수준으로 극적으로 줄어들었습니다.

연구진은 이 "골드 가이드(Gold-Guided)" 접근 방식이 유망한 길이라고 결론지었습니다. 그들은 미래에 시스템이 단순한 조회(lookup)를 사용할지 혹은 복잡한 코드 레시피를 사용할지를 스스로 결정할 수 있게 되어, 금융 AI를 더욱 유용하고 신뢰할 수 있게 만들 수 있을 것이라고 제안합니다. 현재로서는, 그들은 잘 훈련된 작은 로봇이 숫자를 계산할 때 정제되지 않은 거대한 로봇보다 더 똑똑할 수 있음을 증명해 냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →