← 최신 논문
🤖 machine learning

Cost-Aware Learning

본 논문은 다양한 샘플링 비용을 고려하여 총 학습 비용을 최소화하는 Cost-Aware Learning 프레임워크를 소개하고, 이론적 보장을 갖춘 Cost-Aware SGD 알고리즘과 부분집합 선택 방법을 제안하며, 이러한 통찰을 적용하여 LLM 정책 최적화에서 성능을 유지하면서 토큰 사용량을 최대 30%까지 줄이는 Cost-Aware GRPO를 개발합니다.

원저자: Clara Mohri, Amir Globerson, Haim Kaplan, Tomer Koren, Yishay Mansour

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Clara Mohri, Amir Globerson, Haim Kaplan, Tomer Koren, Yishay Mansour

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 레시피를 완벽하게 다듬으려는 셰프라고 상상해 보세요. 당신의 목표는 요리를 맛보고, 간을 조절하며, 완벽한 맛을 내는 것 (목표 "오차" 수준에 도달하는 것) 입니다.

기존의 컴퓨터 학습 세계에서는 모든 재료를 맛보는 데 정확히 동일한 시간과 노력이 든다고 가정합니다. 소금 한 꼬집을 맛보든 한 그릇의 수프를 맛보든 "비용"은 동일합니다. 따라서 당신은 단순히 올바르게 될 때까지 무작위로 맛을 봅니다.

하지만 현대 AI (특히 대규모 언어 모델) 의 실제 세계에서는 이것이 사실이 아닙니다. 어떤 "재료"(학습 데이터) 는 저렴하고 빠르게 맛볼 수 있지만 (짧은 문장), 다른 것들은 비싸고 느립니다 (길고 복잡한 추론 체인). 길고 복잡한 이야기를 맛보는 것은 짧은 이야기를 맛보는 것보다 100 배 더 많은 컴퓨팅 파워를 필요로 할 수 있습니다.

이 논문은 **비용 인식 학습 (Cost-Aware Learning)**이라는 새로운 요리법을 소개합니다. 단순히 무작위로 맛보는 대신, 셰프 (알고리즘) 는 무엇을 그리고 얼마나 자주 맛볼지 지혜롭게 학습하여 정보의 가치와 그것을 맛보는 비용 사이의 균형을 맞춥니다.

간단한 비유를 사용하여 그들의 접근 방식을 살펴보면 다음과 같습니다:

1. 문제: "비싼 수프" 딜레마

1,000 가지의 서로 다른 재료가 들어간 거대한 수프 냄비가 있다고 상상해 보세요.

  • 재료 A: 아주 작은 소금 한 알입니다. 맛보는 데는 저렴하지만, 전체 맛에 대해 거의 알려주지 않습니다.
  • 재료 B: 통째로 구운 닭고기 한 마리입니다. 맛보는 데 매우 비싸고 (오래 씹고 소화하는 데 시간이 걸림), 하지만 맛에 대해 엄청난 정보를 알려줍니다.
  • 재료 C: 중간 크기의 당근입니다. 맛보는 데는 조금 비용이 들지만, 좋은 양의 맛 정보를 제공합니다.

기존 방법들은 단순히 재료를 무작위로 선택했습니다. 이는 비싼 닭고기를 너무 자주 맛보며 시간을 낭비하거나, 닭고기에 대해 알아야 할 때 저렴한 소금에 시간을 낭비하는 결과를 낳습니다.

2. 해결책: "비용 인식 SGD" (지능형 미식가)

저자들은 **비용 인식 확률적 경사 하강법 (Cost-Aware Stochastic Gradient Descent, SGD)**이라는 새로운 전략을 제안합니다.

재료를 무작위로 선택하는 대신, 이 알고리즘은 "지능형 미식가" 규칙을 사용합니다. 모든 재료에 대해 두 가지 요소를 기반으로 점수를 계산합니다:

  1. 얼마나 많은 맛 정보를 제공하는가: (수학적으로, "기울기 노름" 또는 추가했을 때 맛이 얼마나 변하는지).
  2. 맛보는 데 얼마나 비용이 드는가: (수학적으로, 필요한 토큰 수 또는 컴퓨팅 파워).

황금률: 알고리즘은 다음과 말합니다. "나는 지출한 달러당 가장 큰 맛 변화를 주는 재료를 맛보고 싶습니다."

  • 길고 비싼 이야기가 AI 의 학습에 큰 영향을 미친다면, 그 비용은 가치가 있습니다.
  • 짧고 저렴한 이야기가 거의 영향을 미치지 않는다면, 그것을 건너뛰세요.
  • 긴 이야기가 거의 영향을 미치지 않는다면, 그것에 돈을 낭비하지 마세요. 비록 건너뛰는 것이 저렴하더라도요.

저자들은 수학적으로 증명했습니다. 이러한 "높은 가치 / 낮은 비용"의 특정 조합이 예산을 태우지 않고 완벽한 레시피를 얻는 가장 빠른 방법이라는 것을요.

3. "부분 집합 선택" (메뉴 큐레이션)

때로는 가장 지능적인 미식가조차 가장 비싼 항목을 전혀 맛볼 여유가 없을 수 있습니다. 논문은 두 번째 트릭을 제안합니다: 부분 집합 선택 (Subset Selection).

당신이 맛보기 메뉴에서 "비싼 닭고기"를 완전히 제거하기로 결정했다고 상상해 보세요. 최종 레시피가 약간 덜 완벽해질 것 (작은 "편향") 을 받아들이지만, 닭고기를 절대 맛보지 않음으로써 막대한 금액을 절약합니다. 당신은 당근과 소금에만 집중합니다.

저자들은 어떤 비싼 항목을 제거할지 신중하게 선택함으로써, 비용의 일부만으로 여전히 매우 좋은 레시피를 얻을 수 있음을 보여줍니다. 마치 돈이 들더라도 여전히 맛있게 먹을 수 있다는 것을 알면서 요리의 채식 버전을 만들기로 결정하는 것과 같습니다.

4. 검증: "AI 셰프" (비용 인식 GRPO)

저자들은 이러한 이론들을 GRPO(Group Relative Policy Optimization) 라는 방법을 사용하여 대규모 언어 모델 (LLM) 학습에 적용했습니다.

이 맥락에서:

  • **"비용"**은 프롬프트와 AI 응답에 있는 단어 (토큰) 의 수입니다. 짧고 복잡한 수학 문제보다 길고 복잡한 수학 문제를 학습하는 데 더 많은 비용이 듭니다.
  • **"가치"**는 AI 의 답변이 행동을 얼마나 변화시키는지 ("이점") 입니다.

저자들은 비용 인식 GRPO를 만들었습니다. 생성된 모든 답변을 동등하게 학습하는 대신, 다음과 같은 답변에 우선순위를 둡니다:

  1. 높은 영향력: AI 가 이 답변으로부터 많이 배웠습니다.
  2. 낮은 비용: 답변이 불필요하게 길지 않았습니다.

결과:
저자들은 수학 벤치마크를 사용하여 두 개의 AI 모델 (15 억 개 파라미터 모델과 80 억 개 파라미터 모델) 에서 이를 테스트했습니다.

  • 결과: 그들은 표준 방법과 동일한 (또는 더 나은) 정확도에 도달했습니다.
  • 절약: 그들은 거기에 도달하기 위해 최대 30% 적은 토큰(컴퓨팅 리소스) 을 사용했습니다.
  • 비유: 같은 맛있는 식사를 얻으면서 음식과 요리 시간을 30% 덜 사용하는 것과 같습니다.

요약

이 논문은 비싼 AI 학습 세계에서 "더 많은 데이터"가 항상 더 좋은 것은 아니라고 가르쳐 줍니다. 때로는 "더 지능적인 데이터"가 핵심입니다. 모든 학습 데이터를 서로 다른 가격표와 가치를 가진 것으로 취급하고, 가장 좋은 "비용 대비 효과"를 주는 것들만 구매함으로써, 품질을 잃지 않고 훨씬 더 빠르고 저렴하게 강력한 AI 모델을 학습시킬 수 있습니다.

핵심 교훈: 뷔페에 있는 모든 것을 먹지 마세요. 당신이 지불한 가격에 대해 가장 맛있게 느껴지는 것들을 드세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →