← 최신 논문
💬 NLP

HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures

HERMES는 학습된 시맨틱 변환(semantic transforms)과 잔차 벡터 양자화(residual vector quantization)를 사용하여 문서를 다중 입도 코드(multi-granularity codes)로 주석 처리함으로써, 고정된 입도의 방법으로는 테스트할 수 없는 다양한 해상도에 걸친 최적의 데이터 혼합 전략 발견을 가능하게 하는 재사용 가능한 데이터 유도 계층적 레이블링 기질(data-derived hierarchical labeling substrate)을 도입한다.

원저자: Ziyun Qiao, Yue Min, Ruining Chen, Yujun Li

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziyun Qiao, Yue Min, Ruining Chen, Yujun Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 로봇(AI)에게 방대한 양의 책, 웹사이트, 기사들을 먹여서 말하기와 생각하는 법을 가르치려 한다고 상상해 보세요. 여기서 중요한 질문은 단순히 얼마나 많은 데이터를 먹이느냐가 아니라, 어떤 책을 선택하고 어떤 순서로 보여줄 것인가 하는 문제입니다.

이 논문은 이 문제를 해결하기 위해 HERMES라는 새로운 도구를 소개합니다. 이 도구의 목적은 다음과 같습니다: 어떻게 하면 이 무질서한 도서관을 정리하여 로봇이 최적의 주제 조합을 학습하게 할 것인가?

다음은 쉬운 비유를 사용한 상세 설명입니다:

1. 문제점: "일률적인" 라벨링 (The "One-Size-Fits-All" Label)

당신에게 뒤섞인 문서들이 가득 담긴 거대한 더미가 있다고 상상해 보세요. 로봇을 가르치기 위해서는 이 문서들을 그룹별로 분류해야 합니다.

  • 기존 방식: "과학", "역사", 또는 "요리"와 같이 미리 만들어진 카테고리 목록을 사용할 수 있습니다. 하지만 이것들은 경직되어 있습니다. 만약 "과학"을 더 자세히 들여다보고 싶더라도, 단순히 확대할 수 없으며, 기존의 목록을 버리고 처음부터 완전히 새로운 목록을 다시 만들어야 합니다.
  • 병목 현상: 이 논문은 문제가 로봇의 학습 능력("믹서")에 있는 것이 아니라, 라벨링 시스템 자체에 있다고 주장합니다. 그 시스템이 너무 경직되어 있다는 것입니다.

2. 해결책: HERMES (라벨의 "러시아 인형" 구조)

HERMES는 도서관의 모든 문서를 단 한 번만 라벨링하되, 책을 다시 분류할 필요 없이 원하는 만큼 "확대(Zoom in)"하거나 "축소(Zoom out)"할 수 있게 만드는 새로운 방법입니다.

HERMES를 러시아 인형(마트료시카) 또는 계층적 주소 체계라고 생각하면 쉽습니다:

  • 레벨 1 (큰 상자): 모든 문서는 "음악"이나 "요리"와 같은 광범위한 라벨을 받습니다. 이런 큰 상자는 약 256개 정도 있습니다.
  • 레벨 2 (중간 상자): "음악" 안에서 당신은 "록", "재즈", 또는 "힙합"과 같은 하위 그룹으로 확대할 수 있습니다. 이런 중간 상자는 약 65,000개입니다.
  • 레벨 3 (작은 상자): "힙합" 안에서 당신은 특정 아티스트나 시대로 더 깊이 들어갈 수 있습니다. 이런 작은 그룹은 약 130,000개입니다.

마법 같은 기술: 세 개의 서로 다른 분류기를 돌릴 필요가 없습니다. 분류기를 단 한 번만 실행하면 됩니다. "확대 수준"은 단지 주소의 숫자를 몇 자리까지 읽느냐의 문제입니다.

  • 1자리만 읽으면? 광범위한 "음악" 카테고리가 나옵니다.
  • 3자리를 읽으면? 구체적인 "1990년대 힙합" 카테고리가 나옵니다.

이 방식은 엄청난 계산 능력을 아껴줍니다. 왜냐하면 도서관을 단 한 번만 라벨링하면 되지만, 디테일의 수준을 즉각적으로 실험하며 조절할 수 있기 때문입니다.

3. 발견: 중요한 것은 "최고의 그룹"이 아니라 "적절한 확대 수준"이다

연구진은 이를 10억 개의 파라미터를 가진 AI 모델에 테스트했습니다. 그들은 두 가지 놀라운 사실을 발견했습니다.

발견 A: "골디락스(Goldilocks)" 존
그들은 그룹에서 책을 뽑는 두 가지 방식을 시도했습니다:

  1. "모든 기반을 다 덮는" 방식: 아무리 작거나 품질이 낮더라도 모든 하위 그룹에서 책을 조금씩 뽑습니다.
  2. "최고 품질" 방식: 각 하위 그룹 내에서 가장 좋은 상위 30%의 책들만 뽑습니다.

결과: 중간 확대 수준(레벨 2, 65,000개 그룹)에서, "최고 품질" 방식이 로봇을 훨씬 더 똑똑하게 만들었습니다. 그룹의 규모가 충분히 컸기 때문에 "최고의" 책을 골라내는 것이 실제로 의미가 있었고, 로봇은 더 잘 학습했습니다.

발견 B: "너무 작은" 함정
하지만, 가장 세밀한 수준으로 확대했을 때(레벨 3, 130,000개의 아주 작은 그룹), "최고 품질" 방식은 더 이상 작동하지 않았습니다.

  • 이유는 무엇일까요? 그룹이 너무 작아져서 책이 단 몇 권밖에 남지 않게 되었기 때문입니다. 단 5권의 책 중에서 최고의 선수를 뽑으려는 것은, 5명뿐인 팀에서 최고의 선수를 뽑으려는 것과 같습니다. 그 차이는 미미하며, 운 좋게 나쁜 책을 고르게 될 수도 있습니다.
  • 교훈: 무한히 계속해서 확대할 수는 없습니다. 그룹이 유용할 만큼 상세하면서도, 동시에 양질의 데이터를 선별할 수 있을 만큼 충분히 커야 하는 "스윗 스폿(Sweet spot)"이 존재합니다.

4. 결론: 데이터에 대한 새로운 사고방식

이 논문은 HERMES가 단순히 더 나은 분류 알고리즘이 아니라고 결론짓습니다 (전체적인 관점에서 보면 표준적인 분류 방식과 성능이 거의 비슷합니다).

HER서는 데이터 조직을 "스위치"가 아닌 "다이얼"로 바꿔준다는 점에 진짜 가치가 있습니다.

  • 이전에는: "거친 라벨(Coarse Labels)"을 쓸 것인지 "정밀한 라벨(Fine Labels)"을 쓸 것인지 결정하고 그것을 고수해야 했습니다.
  • 이제는: 하나의 단일 라벨링 시스템을 사용하면서, 특정 AI 학습 요구에 맞는 완벽한 균형을 찾기 위해 "정밀도 다이얼"을 조절할 수 있습니다.

요약하자면, HERMES는 연구자들에게 데이터의 유연하고 재사용 가능한 지도를 제공하여, 고품질 데이터 선별이 실제로 AI의 지적 능력을 향상시키는 데 도움이 되는 완벽한 "확대 수준"을 찾을 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →