← 최신 논문
🤖 machine learning

Compute Where it Counts: Self Optimizing Language Models

본 논문은 고정된 LLM 과 경량 정책 네트워크를 결합하여 토큰당 가변적 계산 예산을 희소성, 가지치기, 양자화를 조정함으로써 동적으로 할당하는 Self-Optimizing Language Models(SOL) 라는 프레임워크를 소개하며, 이를 통해 정적 할당 전략에 비해 추론 품질과 효율성을 크게 향상시킵니다.

원저자: Yash Akhauri, Mohamed S. Abdelfattah

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yash Akhauri, Mohamed S. Abdelfattah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자동차로 장거리 여행을 한다고 상상해 보세요. 대부분의 현재 AI 모델(대규모 언어 모델)은 이 여행을 "설정하고 잊어라"는 전략으로 진행합니다. 평탄하고 빈 공터가 있는 고속도로를 달리는지, 가파르고 바위가 많은 산을 오르는지에 관계없이 모든 마일마다 정확히 같은 양의 연료와 엔진 출력을 사용합니다.

이 논문은 **자기 최적화 언어 모델 (Self-Optimizing Language Models, SOL)**이라는 새로운 시스템을 소개합니다. 고정된 엔진 설정으로 주행하는 대신, SOL 은 앞쪽 도로를 끊임없이 확인하고 순간순간 엔진 출력을 조절하는 똑똑한 조종사처럼 행동합니다.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다:

1. 문제: "일률적 적용" 엔진

현재 AI 모델은 한 단어 (또는 "토큰") 씩 텍스트를 생성합니다. 비용과 에너지를 절약하기 위해 엔지니어들은 모델을 "가볍게" 만드는 방법을 개발했습니다:

  • 일부 컨텍스트 무시: 가장 중요한 이전 단어만 살펴보기 (배경 소음을 무시하는 것처럼).
  • 뇌 가지치기: 현재 필요하지 않은 모델의 내부 처리 부분을 끄기.
  • 정밀도 낮추기: 더 빠르게 만들기 위해 소수점 자릿수를 줄여 수학 연산 수행 (숫자 반올림처럼).

문제는 이러한 방법들이 보통 모든 단어에 대해 동일한 수준의 "가벼움"을 적용한다는 점입니다.

  • 실수: AI 가 "the"와 같은 간단한 단어를 작성할 때, 무겁고 정밀한 엔진을 사용하여 에너지를 낭비합니다. 반면 "quantum"과 같은 복잡한 단어를 작성할 때는 실수를 일으킬 수 있는 가볍고 부실한 엔진을 사용할 수 있습니다.

2. 해결책: "똑똑한 조종사" (정책)

저자들은 주요 AI 모델에 작고 가벼운 "조종사"(작은 신경망) 를 추가했습니다.

  • 주요 모델: 이는 무겁고 고정된 엔진입니다. 말하고 생각하는 법을 알지만, 자체 설정은 변경하지 않습니다.
  • 조종사: 이는 새로운 부분입니다. 단어를 생성하는 매 단계마다 조종사는 주요 모델이 무엇을 생각하고 있는지 (그의 "은닉 상태") 를 살펴보고 이렇게 묻습니다: "다음 단어가 얼마나 어려울까?"

그 답변에 따라 조종사는 적절한 노력 양을 선택하기 위해 스위치를 조작합니다:

  • 쉬운 단어인가? 출력을 낮추십시오 (메모리 사용 줄이기, 정밀도 낮추기, 더 많은 컨텍스트 무시).
  • 어려운 단어인가? 출력을 높입니다 (전체 정밀도 사용, 더 많은 컨텍스트 확인, 모든 뇌 부분 활성화 유지).

3. 훈련: "만약에?"를 통한 학습

조종사가 이러한 순간적인 결정을 내리는 법을 어떻게 가르칠 수 있을까요? 단순히 추측하게 하고 실패 여부를 확인하는 것은 텍스트를 망가뜨릴 수 있으므로 불가능합니다.

대신 저자들은 반사실 (Counterfactuals) 또는 "만약에" 시나리오라는 교묘한 훈련 트릭을 사용했습니다:

  1. AI 에게 문장을 완성하도록 합니다.
  2. 정확히 같은 문장을 16 번 연속 생성합니다.
  3. 그 16 번 시도 각각에서 조종사에게 다른 일련의 선택을 하도록 강요합니다 (예: "1 단계에서는 게으름을 피워라", "2 단계에서는 매우 조심하라").
  4. 결과를 비교합니다: 어떤 일련의 선택이 최소한의 에너지를 사용하면서 가장 좋은 문장을 만들어냈습니까?
  5. 조종사는 이 비교를 통해 학습하여, *"아, 나는 1 단계가 아니라 12 단계에서 에너지를 아껴야 했구나"*라고 깨닫습니다.

4. "KV 오염" 경고

이 논문은 까다로운 부작용을 지적합니다. 엔진의 일부를 너무 공격적으로 끄면, 자동차의 메모리에 "더러운" 데이터가 남을 수 있습니다 (이를 KV 오염이라고 합니다). 나중에 엔진을 다시 풀 출력으로 되돌리더라도, 그 더러운 데이터가 미래 예측을 망칠 수 있습니다.

이를 해결하기 위해 SOL 은 짧은 폭발 (에피소드라고 함) 단위로 작동합니다. 16 단계마다 다음 폭발을 시작하기 전에 메모리를 깨끗한 상태로 되돌리는 빠른 "피트 스톱"을 가집니다. 이렇게 하면 이전에 내린 게으른 결정 때문에 나중에 자동차가 추락하지 않도록 보장합니다.

5. 결과: 더 나은 연비

저자들은 다양한 AI 모델 (10 억 파라미터 규모의 작은 모델부터 80 억 파라미터 규모의 큰 모델까지) 에서 이를 테스트했습니다.

  • 발견: AI 에게 특정 양의 에너지 (예산) 를 사용하도록 요청했을 때, SOL 조종사는 고정된 설정만 사용한 모델보다 일관되게 더 높은 품질의 텍스트를 생성했습니다.
  • 비유: 10 갤런의 가솔린 예산이 있다면, 고정된 자동차는 200 마일을 갈 수 있습니다. 반면 SOL 자동차는 모든 언덕과 골짜기에 맞춰 기어를 완벽하게 변경하여 동일한 10 갤런으로 215 마일을 갈 수 있습니다.

요약

필요한 곳에 컴퓨팅을은 AI 가 모든 것을 똑같은 방식으로 수행하는 로봇이 되는 것을 멈추게 하는 것에 관한 것입니다. 대신, AI 는 언제 관성 주행하고 언제 가속 페달을 밟아야 하는지 아는 똑똑한 운전자가 되어, 모든 컴퓨팅 파워가 가장 필요한 곳에 정확히 사용되도록 학습합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →