← 최신 논문
🤖 machine learning

Teaching Metric Distance to Discrete Autoregressive Language Models

본 논문은 토큰 간의 거리 관계를 활용하여 시각적 그라운딩, 로봇 공학, 이미지 생성 등 다양한 작업에서 데이터 효율성과 성능을 향상시키기 위해 전통적인 원-핫 타겟을 보상 가중 분포로 대체하는 이산 자기회귀 언어 모델을 위한 거리 인식 목적 함수인 DIST2Loss 를 소개합니다.

원저자: Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 말하거나 행동하는 법을 가르친다고 상상해 보세요. 현재 대부분의 대규모 언어 모델 (LLM) 은 오직 하나의 정답만 있는 객관식 시험을 치르는 학생처럼 학습합니다. 로봇이 정답이 "5"일 때 "4"라고 추측하면, 교사는 "틀렸어! 다시 해봐"라고 말합니다. 이는 "4"와 "5"를 "사과"와 "바나나"처럼 완전히 다르고 관련 없는 것으로 취급하는 것과 같습니다.

이 논문은 DIST2Loss라는 새로운 교수법을 소개합니다. 이 방법은 수학, 로봇의 움직임, 사물을 둘러싼 상자 그리기 같은 특정 작업에서는 정답이 단순히 무작위 범주가 아니라, 정답들 사이에 거리가 존재한다고 주장합니다. "4"는 "5"와 매우 가깝지만, "90"과는 멀리 떨어져 있습니다.

다음은 이 논문이 간단한 비유를 사용하여 설명하는 방식입니다:

1. 문제: "전부 아니면 전무"식 교사

기존 방식 (일명 '원-핫 타겟') 에서는 로봇이 고양이 주위에 상자를 그리려고 할 때, 상자가 약간 작게 그려지면 컴퓨터는 "완전 실패"라고 말합니다. 상자가 1 픽셀만큼 틀리든 100 픽셀만큼 틀리든 벌점은 동일합니다.

이는 수학 시험에서 정답이 "5.0"일 때 "4.9"를 답으로 적으면 "100"을 적었을 때와 마찬가지로 0 점을 받는 것과 같습니다. 모델은 "4.9"가 사실은 거의 정답이었다는 점을 배우지 못합니다.

2. 해결책: "보상 지도" (DIST2Loss)

저자들은 로봇을 채점하는 새로운 방식을 고안했습니다. 단순한 "맞음/틀림" 스위치 대신, 로봇에게 보상 지도를 제공합니다.

  • 비유: 당신이 과녁에 다트를 던진다고 상상해 보세요.
    • 기존 방식: 과녁의 중심 (불스아이) 을 맞히면 10 점을 받습니다. 1 밀리미터만 빗나가도 0 점을 받습니다.
    • DIST2Loss: 과녁의 중심을 맞히면 10 점을 받습니다. 1 밀리미터 빗나가면 9.9 점을 받습니다. 1 마일 빗나가면 0 점을 받습니다.

모델은 가까이 있는 것이 멀리 있는 것보다 낫다는 것을 학습합니다. 이는 숫자나 좌표 사이의 실제 거리를 사용하여 "부드러운" 타겟을 생성합니다. 정답이 5 라면, 모델은 4 와 6 에 높은 확률을 부여하고 1 이나 10 에는 낮은 확률을 부여하도록 장려받습니다.

3. 이것이 특별한 이유: "시행착오" 불필요

보통 로봇에게 "가까움"을 이해하도록 가르치려면 강화 학습 (RL) 이라는 방법을 사용해야 합니다. 이는 개를 훈련시키는 것과 같습니다: 개가 무언가를 해보게 하고, 그것이 작동하는지 확인한 다음 간식을 주거나 꾸짖습니다. 이는 시간이 오래 걸리고, 번거로우며, 불안정할 수 있습니다.

이 논문은 DIST2Loss 가 단순한 지름길이라고 주장합니다. 이는 처음부터 수학적으로 "완벽한" 보상 지도를 계산합니다. 이는 개가 뛰기 시작하기 전에 간식이 숨겨진 곳의 지도를 주는 것과 같습니다. 모델은 수천 번 추측하고 실패할 필요 없이 "거리" 개념을 즉시 학습합니다.

4. 작동 영역 (논문의 실험)

저자들은 "가까움"이 중요한 네 가지 특정 영역에서 이 "거리 인식" 교수법을 테스트했습니다:

  • 시각적 그라운딩 (사물 찾기): 로봇이 "빨간 차" 주위에 상자를 그리라고 요청받았을 때, DIST2Loss 는 완벽하지 않더라도 실제 차에 기하학적으로 더 가까운 상자를 그리도록 돕습니다.
  • 로보틱스 (팔 움직임): 로봇이 특정 좌표 (x, y, z) 로 팔을 움직여야 할 때, DIST2Loss 는 약간 빗나가는 것이 완전히 빗나가는 것보다 낫다는 것을 이해하므로 움직임을 더 빠르고 정확하게 학습하도록 돕습니다.
  • 보상 모델링 (답변 채점): 모델이 인간의 답변이 얼마나 좋은지 평가해야 할 때 (예: 1 점에서 10 점까지), DIST2Loss 는 "9"가 "1"보다 "10"에 훨씬 가깝다는 것을 이해하도록 도와 채점의 정확도를 높입니다.
  • 이미지 생성: 텍스트에서 이미지를 생성할 때, 모델은 "토큰" (디지털 구성 요소) 을 사용합니다. DIST2Loss 는 하나의 토큰을 "가까운" 토큰으로 바꾸면 이미지가 비슷하게 유지되지만, "먼" 토큰으로 바꾸면 그림이 망가진다는 것을 이해하도록 돕습니다.

결론

이 논문은 단순히 모델에게 "이 숫자들은 서로 가깝다"라고 말함으로써, 숫자, 좌표, 측정과 관련된 작업에서 모델의 성능이 훨씬 향상된다고 주장합니다. 복잡하고 불안정한 학습 방법이 필요 없이 모델을 더 효율적 (학습에 필요한 데이터 감소) 이고 정확하게 만듭니다. 이는 옳고 그름의 "흑백" 세계를, 가까이 있는 것이 무언가를 의미하는 "회색 음영"의 세계로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →