← 최신 논문
🤖 machine learning

ff-Trajectory Balance: A Loss Family for Tuning GFlowNets, Generative Models, and LLMs with Off- and On-Policy Data

본 논문은 평균 제곱 오차 접근법을 모든 ff-발산으로 확장하여 오프-정책 데이터로 생성 모델과 대규모 언어 모델을 훈련하면서도 해당 온-정책 ff-발산 기울기의 특정 최적화 특성 (예: 모드 커버링) 을 유지할 수 있게 하는 ff-궤적 균형이라는 손실 함수 계열을 소개한다.

원저자: Jake Fawkes, Jason Hartford

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jake Fawkes, Jason Hartford

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 어두운 동굴 시스템을 탐험하도록 로봇을 가르친다고 상상해 보세요. 이 동굴에는 많은 숨겨진 방 (모드라고 함) 이 있는데, 그중 일부는 금 (높은 보상) 을 포함하고 있고, 일부는 비어 있거나 위험합니다. 당신의 목표는 로봇에게 하나의 거대한 금광만 찾고 나머지는 무시하도록 가르치는 것이 아니라, 가능한 한 많은 서로 다른 금 방을 찾도록 가르치는 것입니다.

이 논문은 새로운 분자를 생성하거나, 예술을 창조하거나, 코드를 작성하는 로봇을 훈련시키는 데 도움이 되는 새로운 일련의 "가르침 도구" (손실 함수) 를 소개합니다.

다음은 간단한 비유를 사용하여 이 논문의 아이디어를 정리한 것입니다:

1. 문제: "금광 열풍" 대 "탐험가"

과거에 이러한 로봇을 가르치는 표준 방식은 금광 열풍과 같았습니다. 로봇은 약간의 금이 있는 한 곳을 발견하면 흥분하여 모든 시간을 그곳을 파는 데 보냈습니다. 동굴의 다른 모든 금광을 무시한 채요.

  • 기술적 용어로: 이를 "모드 추구 (mode-seeking)"라고 합니다. 모델은 소수의 높은 확률 답변으로 수렴하고 나머지 다양성을 무시합니다.
  • 논문의 목표: 우리는 "모드 커버링 (mode-covering)"을 원합니다. 로봇이 동굴의 완전한 지도를 얻기 위해 작은 금광까지 포함하여 모든 금광을 퍼져나가 탐험하도록 하려는 것입니다.

2. 옛 도구: "제곱 KL" 손실

최근 연구자들은 로봇을 가르치기 위해 "제곱 오차" 방법 (로봇이 생각하는 것과 있어야 하는 것 사이의 거리를 측정) 을 사용하는 교묘한 트릭을 발견했습니다.

  • 비유: 선생님이 학생을 채점한다고 상상해 보세요. 학생이 답을 틀리면 선생님은 단순히 "틀렸다"고 말하지 않습니다. 대신 실수의 제곱을 계산합니다.
  • 장점: 이 방법은 매우 안정적입니다. 학생이 생생한 수업이 아닌 오래된 노트 (오프-폴리시 데이터) 에서 배울 때도 작동합니다.
  • 결함: 비록 안정적이지만, 이 특정 "제곱" 방법은 여전히 금광 열풍처럼 행동합니다. 이는 로봇이 자연스럽게 소수의 답변에만 집중하도록 밀어붙여 동굴의 다양성을 놓치게 만듭니다.

3. 새로운 해결책: "f-궤적 균형" 패밀리

저자들은 "제곱" 방법이 훨씬 더 큰 가르침 도구 패밀리의 단 하나의 특정 맛에 불과하다는 것을 깨달았습니다. 그들은 이 패밀리를 f-궤적 균형이라고 부릅니다.

이 패밀리를 라디오의 다이얼이나 볼륨 노브라고 생각하세요.

  • 다이얼을 한쪽 (낮은 숫자) 으로 돌리면: 슈퍼 탐험가처럼 행동하는 도구를 얻습니다. 이러한 도구는 로봇이 도달하기 어려운 곳까지 모든 가능한 금광을 찾아 퍼져나가도록 강제합니다. 이는 가장 명백한 것뿐만 아니라 작동할 수 있는 어떤 분자라도 찾고자 하는 신약 개발에 매우 유용합니다.
  • 다이얼을 반대쪽 (높은 숫자) 으로 돌리면: 금 채굴자처럼 행동하는 도구를 얻습니다. 이러한 도구는 로봇에게 작은 광산을 무시하고 가장 크고 명백한 금 더미에 집중하도록 지시합니다. 단일 최상의 답변만 원할 때 유용합니다.
  • 중간 지점: 다이얼을 그 사이의 어디든 설정하여 탐험과 집중의 혼합을 얻을 수 있습니다.

4. 이것이 큰 문제인 이유

이 논문은 두 가지 주요 사실을 증명합니다:

  1. 마법 스위치: 그들은 표준 "제곱" 도구를 이러한 새로운 "다이얼" 도구 중 어느 것으로도 교체할 수 있으며 수학이 여전히 완벽하게 작동함을 보여주었습니다. 로봇은 다른 성격 (더 탐험적이거나 더 집중적인) 을 가지지만 똑같이 잘 배웁니다.
  2. 안정성: 옛 도구와 마찬가지로, 이러한 새로운 도구도 로봇이 오래된 데이터 (오프-폴리시) 에서 배울 때에도 작동합니다. 이는 종종 비동기적으로 (로봇이 잠시 전에 생성된 데이터에서 학습함) 훈련이 발생하는 대규모 언어 모델 (LLM) 과 같은 실제 응용 분야에서 중요합니다.

5. 실제 세계 테스트 (동굴 지도)

저자들은 이러한 도구를 세 가지 다른 "동굴"에서 테스트했습니다:

  • 그리드 게임: 네 모서리에 금이 가득한 간단한 컴퓨터 미로입니다. 표준 도구는 한 모서리만 찾았습니다. 반면 새로운 "탐험가" 도구는 네 모서리를 모두 빠르게 찾았습니다.
  • 분자 발견 (SynFlowNet): 그들은 새로운 화학 분자를 생성해 보았습니다. 다이얼을 "탐험가"로 설정함으로써, 그들은 동일한 몇 가지 화학 물질의 변형이 아니라 잠재적으로 약이 될 수 있는 훨씬 더 다양한 고유한 분자를 생성했습니다.
  • 언어 모델 (LLM): 그들은 AI 모델을 수학 문제 해결을 위해 조정했습니다. 새로운 도구는 AI 가 훈련 데이터가 지연되었을 때 (비동기적) 동일한 답변을 반복하는 함정에 빠지지 않고 문제를 해결하는 다양한 방법을 탐험할 수 있게 했습니다.

요약

이 논문은 새로운 유형의 로봇을 발명하는 것이 아니라, 그들을 훈련시키는 방법에 대한 새로운 일련의 지시사항을 발명합니다.

  • 옛 방식: "가장 큰 금광을 찾고 그곳을 파세요." (안정적이지만 지루함).
  • 새 방식: "여기 다이얼이 있습니다. 금 채굴자, 슈퍼 탐험가, 또는 그 사이의 어떤 것이 되든 선택할 수 있습니다. 그리고 무엇을 선택하든 훈련은 안정적이며 오래된 데이터와 함께 작동합니다."

이는 엔지니어들이 훈련 과정을 깨뜨리지 않고 AI 모델이 얼마나 창의적이거나 집중적이어야 할지 제어할 수 있는 간단한 노브를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →