← 최신 논문
🤖 machine learning

Error-Driven Prompt Optimization for Arithmetic Reasoning

본 논문은 비용이 많이 드는 미세 조정이 필요 없이 프라이버시 준수 산업 환경에서 GPT-3.5 Turbo 와 같은 대규모 모델보다 우수한 성능을 발휘할 수 있도록 온프레미스 소형 언어 모델의 산술 추론 능력을 획기적으로 향상시키는 오류 기반 프롬프트 최적화 프레임워크를 제시합니다.

원저자: Árpád Pándy, Róbert Lakatos, András Hajdu

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Árpád Pándy, Róbert Lakatos, András Hajdu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

큰 그림: 지역 회계사 vs 클라우드 거인

당신은 안전한 사무실에서 일하는 매우 똑똑하지만 약간 건망증이 있는 지역 회계사 (소형 언어 모델, SLM) 가 있다고 상상해 보세요. 또한 거대한 클라우드 사무실에 거주하는 초지능 컨설턴트 (GPT-3.5 와 같은 대형 언어 모델) 도 있습니다.

문제점은 무엇일까요? 당신의 회사는 민감한 금융 데이터를 다룹니다. 개인정보 보호 규정 때문에 이 데이터를 클라우드 컨설턴트에게 보낼 수 없습니다. 모든 것을 로컬 사무실에 보관해야 합니다.

하지만 당신의 지역 회계사는 수학 실력이 형편없습니다. "수익의 백분율 변화는 얼마입니까?"라고 물으면 숫자를 추측하거나 단위를 잘못 말할 수 있습니다 (예: '백만' 대신 '퍼센트'라고 말함). 그들은 빠르고 사생활이 보호되지만, 심각한 작업을 하기에는 정확도가 부족합니다.

이 논문은 해당 데이터를 클라우드에 전송하거나 비싼 재학습 비용을 지불하지 않고도, 그 건망증 있는 지역 회계사를 수학 마법사로 바꾸는 교묘한 학습 방법을 소개합니다.

전략: "추측하지 말고, 코드를 작성하라"

연구자들은 회계사에게 단순히 수학 문제를 "생각"하게 하는 것이 문제임을 깨달았습니다. 대신 그들은 회계사가 프로그래머처럼 행동하도록 가르쳤습니다.

  1. 옛날 방식: "여기 숫자 표가 있습니다. 답을 알려주세요." (회계사가 추측함).
  2. 새로운 방식: "여기 표가 있습니다. 당신을 위해 수학을 수행하는 짧은 컴퓨터 스크립트 (Python 코드) 를 작성한 다음 실행하세요."

이는 회계사에게 머릿속으로 나눗셈을 하라고 요구하는 대신 계산기를 주는 것과 같습니다. 컴퓨터 코드는 수학에 완벽합니다. 회계사는 단지 지시를 올바르게 작성하기만 하면 됩니다.

비밀 재료: 실수에서 배우기 ("오류 기반" 루프)

계산기가 있더라도 회계사는 여전히 실수를 했습니다. 때로는 잘못된 공식을 작성하거나, "규모"를 잘못 파악했습니다 (예: "달러"가 아니라 "퍼센트"여야 하는데 "천 단위"라고 답함).

이 논문의 주요 혁신은 체계적인 "실수 탐정" 프로세스입니다.

  1. 테스트 실행: 회계사가 497 개의 금융 문제를 해결해 봅니다.
  2. 실수 포착: 시스템이 회계사가 틀린 질문들을 살펴봅니다.
  3. 단서 그룹화: 모든 실수를 개별적으로 살펴보는 대신, 시스템은 유사한 실수들을 그룹화합니다.
    • 비유: 선생님이 시험을 채점한다고 상상해 보세요. "5 번 문제를 틀렸어"라고 말하는 대신, "아, 5 번 문제를 틀린 모든 학생이 12 번 문제도 틀렸네. 모두 100 으로 나누는 것을 잊었구나"라고 알아차리는 것입니다.
  4. 규칙 작성: 각 실수 그룹에 대해 연구자들은 이를 수정하는 구체적인 규칙을 작성합니다.
    • 규칙 예시: "질문이 '백분율 변화'를 묻는다면, 답은 '달러'가 아니라 '퍼센트'여야 합니다."
  5. 다시 시도: 이 규칙을 회계사의 지시에 추가하고 테스트를 다시 실행합니다.
  6. 반복: 남아 있는 실수 중 가장 큰 그룹을 찾고, 새로운 규칙을 작성하며, 실수가 더 이상 개선되지 않을 때까지 테스트를 반복합니다.

결과: 거인을 이기다

이 "실수 찾기, 규칙 작성, 반복" 사이클을 따름으로써 연구자들은 놀라운 성과를 거두었습니다.

  • 출발점: 지역 회계사 (Qwen3 4B) 는 약 **30%**의 정확도로 시작했습니다 (단순 추측보다 약간 나은 수준).
  • 개선: 실수 분석에서 도출된 단 세 가지 구체적인 규칙을 추가한 후, 정확도는 **70.8%**로 급등했습니다.
  • 승리: 이 로컬이고 사생활이 보호되는 회계사는 거대한 클라우드 컨설턴트 (GPT-3.5 Turbo, 정확도 66.2%) 를 초월했습니다.

"규칙이 너무 많을 때"의 함정

이 논문은 중요한 한계를 발견했습니다. 회계사에게 규칙 책을 준다고 상상해 보세요.

  • 규칙이 너무 적음: 그들은 단순한 실수를 저지릅니다.
  • 적당한 수의 규칙: 그들은 완벽해집니다.
  • 규칙이 너무 많음: 회계사가 혼란에 빠집니다. 규칙 책이 너무 두껍고 복잡해져서 규칙을 무시하거나 혼동하기 시작합니다.

연구자들은 "최적의 규칙 수"를 발견했습니다. 이 지점 이후로 규칙을 추가하면 실제로 성능이 저하되었습니다. 간단한 작업을 위해 50 페이지 분량의 설명서를 외우려고 하는 것과 같습니다. 그저 압도당할 뿐입니다.

주장의 요약

  • 사생활 보호 최우선: 민감한 데이터 (금융, 건강) 를 위한 고정밀 AI 를 구축할 수 있으며, 이는 완전히 자체 컴퓨터 (온프레미스) 에 머무릅니다.
  • 비싼 학습 불필요: 모델을 재학습시키는 데 수백만 원을 쓸 필요가 없습니다. 단순히 오류를 분석하고 이를 수정하는 간단한 텍스트 규칙을 작성하면 됩니다.
  • 작은 것이 큰 것을 이길 수 있음: 올바른 "오류 기반" 규칙에 의해 안내될 때, 작고 효율적인 모델은 거대하고 비싼 모델보다 산술 추론에서 더 나은 성과를 낼 수 있습니다.
  • 방법론: 핵심은 코드 생성(AI 가 수학을 수행하도록 코드 작성) 과 반복적 프롬프트 최적화(AI 의 특정 유형의 실수를 체계적으로 수정) 의 결합입니다.

요약하자면, 이 논문은 수학 문제를 해결하기 위해 더 큰 두뇌가 필요하지 않음을 보여줍니다. 단지 특정 맹점을 피하도록 돕는 더 나은 일련의 지시사항이 필요할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →