← 최신 논문
💬 NLP

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

본 논문은 수학적 추론 및 코드 생성 작업에서 정수와 부동소수점 수를 예측하는 대형 언어 모델의 정확도를 향상시키기 위해 비지도 엔트로피 최적화를 지도식 거리 무관 프레임워크로 재구성한 새로운 학습 목표인 Digit Entropy Loss(DEL)를 소개한다.

원저자: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간의 혼란을 겪고 있는 로봇에게 수학을 가르친다고 상상해 보세요. 이 로봇은 이야기 쓰기와 대화에는 뛰어나지만, 숫자와 관련해서는 종종 자릿수를 잘못 맞추곤 합니다. 정답이 "13"일 때 "12"라고 말하거나, "12" 대신 "14"라고 추측할 수도 있습니다.

홍콩 폴리테크닉 대학교의 시각 컴퓨팅 연구소에서 발표한 이 논문은 이러한 로봇이 숫자를 더 잘 다룰 수 있도록 가르치는 새로운 방법을 소개합니다. 연구진은 이 새로운 방법을 **Digit Entropy Loss (DEL, 디지털 엔트로피 손실)**라고 명명했습니다.

다음은 간단한 비유를 사용하여 로봇의 수학 실력을 어떻게 고쳤는지의 이야기입니다:

1. 문제: 로봇의 "최선의 추측" 습관

전통적으로 이러한 AI 로봇 (대형 언어 모델) 을 훈련시킬 때 **최대 우도 추정 (Maximum Likelihood Estimation, MLE)**이라는 방법을 사용했습니다.

  • 비유: 로봇이 객관식 시험을 치르고 있다고 상상해 보세요. MLE 는 로봇에게 "가장 가능성이 높다고 생각하는 답을 고르라"고 말합니다.
  • 결함: 로봇이 너무 공손합니다. 로봇은 "음, '12'가 가장 좋은 답이지만, '13'과 '11'도 가깝네. 그래서 이들에게도 아주 작은 확률을 부여해야겠다"라고 생각합니다.
  • 결과: 로봇이 결정을 못 내리게 됩니다. 숫자 사이를 헤매다가, 정답이 정수여야 함에도 "12.4"라고 말하거나, 확신이 부족해 잘못된 자릿수를 선택하는 오류를 범합니다.

2. 이전의 해결책: "거리"의 함정

연구진들은 이 문제를 해결하기 위해 "페널티" 시스템을 추가해 보았습니다.

  • 비유: 그들은 로봇에게 "정답이 5 일 때 네가 4 를 추측했다면 괜찮아, 꽤 가깝잖아. 하지만 9 를 추측했다면 끔찍해!"라고 말했습니다. 그들은 숫자를 일렬로 배열한 지도를 만들었고, 로봇은 자신의 추측이 진실로부터 얼마나 먼지에 따라 처벌받게 되었습니다.
  • 문제점: 이 논문은 이러한 "거리 지도"가 인위적이라고 주장합니다. 현실에서 숫자는 단순히 선 위의 점들이 아니라, 고유한 의미를 가진 기호들입니다. 때로는 로봇이 숫자 "2"가 숫자 "3"보다 오히려 글자 "Z"와 더 비슷하다고 학습하기도 합니다. 로봇에게 엄격한 거리 규칙을 강요하면 혼란을 겪게 되어 추측이 너무 경직되거나 (sharpened) 너무 모호해집니다 (flattened).

3. 새로운 해결책: "확신 코치" (DEL)

저자들은 **Digit Entropy Loss (DEL)**를 제안합니다. 로봇이 정답으로부터 얼마나 멀리 떨어져 있는지를 측정하는 대신, 로봇이 얼마나 확신을 가지고 있는지에 초점을 맞춥니다.

  • 비유: 코치가 당신의 추측과 목표 사이의 거리를 신경 쓰지 않는다고 상상해 보세요. 대신 코치는 이렇게 말합니다. "네가 가깝든 멀든 상관없어. 나는 네가 정답에 대해 100% 확신을 가지기만 원해. 네가 '5'에 대해 90% 확신하고 '6'에 대해 10% 확신한다면 너는 망설이는 거야. 나는 네가 '5'에 대해 100% 확신하고 나머지는 0% 확신하기를 원해."
  • 작동 원리:
    1. 지도된 확신: 그들은 로봇에게 모든 자릿수를 간단한 "예/아니오" 질문처럼 다루도록 가르칩니다. "이 자릿수가 5 입니까? 예 아니면 아니오?" 이는 로봇이 모호한 추측 대신 날카롭고 명확한 결정을 내리게 합니다.
    2. 거리 규칙 제거: 그들은 "거리 지도"를 폐기합니다. 로봇이 인간이 만든 규칙을 강요받는 대신, 본인이 경험한 데이터에 기반하여 숫자 간의 자연스러운 관계를 학습하도록 합니다.
    3. 소수점 처리: 이전 방법들은 정수 (예: 10) 와 소수 (예: 10.5) 를 다르게 처리하여 로봇이 넘어질 수 있는 "절벽"을 만들었습니다. DEL 은 정수 부분과 소수 부분을 하나의 매끄럽고 연속적인 흐름으로 처리합니다. 마치 두 개의 분리된 섬이 아니라 하나의 긴 숫자 선처럼요.

4. 결과: 더 날카로운 수학

연구진은 네 가지 다른 유형의 AI 로봇 (CodeLlama, Mistral, DeepSeek, Qwen-2.5) 을 대상으로 일곱 가지 다른 수학 벤치마크를 사용하여 이 새로운 "확신 코치"를 테스트했습니다.

  • 결과: DEL 로 훈련된 로봇들은 실수를 더 적게 범했습니다. 그들은 단순히 정답을 더 자주 맞힌 것뿐만 아니라, 틀렸을 때에도 틀린 답이 정답에 훨씬 더 가까웠습니다 (예: 50 대신 12 를 추측하여 13 을 틀리는 경우).
  • 시각적 증거: 논문의 예시에서 볼 수 있듯이, 이전 방법들은 논리는 맞았지만 최종 숫자를 틀리는 경우가 많았습니다 (예: 쇼핑 총액을 계산하는 논리는 맞았지만 최종 달러 금액을 잘못 계산한 경우). DEL 방법은 논리와 최종 숫자 모두를 정확히 맞혔습니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: AI 로봇에게 숫자가 얼마나 "가까운지" 추측하도록 가르치는 것을 멈추세요. 대신, 예측하는 정확한 자릿수에 대해 절대적으로 확신하도록 가르치세요. 인위적인 거리 규칙을 제거하고 날카롭고 확신에 찬 예측을 구축하는 데 집중함으로써, 로봇들은 수학과 코드 생성 능력이 훨씬 더 향상되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →