← 최신 논문
🤖 AI

SAGE: Scalable AI Governance & Evaluation

SAGE는 정책, 선례, 그리고 LLM 대리 판사 간의 양방향 교정 루프를 통해 고품질의 인간 판단을 실행 가능한 형태로 구현하며, 비용 효율적인 증류 기술을 활용하여 LinkedIn 검색 내에서 정책에 부합하는 모델 평가를 가능하게 함으로써 궁극적으로 일일 활성 사용자 수를 0.25% 증가시킨 확장 가능한 AI 거버넌스 프레임워크입니다.

원저자: Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muth
게시일 2026-06-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muthuregunathan, Abhinav Gupta, Mathew Teoh, Andrew Kirk, Thomas Kwan, Jingwei Wu, Wenjing Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매일 수백만 개의 기사(채용 공고 및 프로필)를 발행하는 거대한 신문사(LinkedIn)의 편집장이라고 상상해 보십시오. 당신의 목표는 독자가 "신입 데이터 분석가"와 같이 구체적인 것을 검색했을 때, 단순히 그 단어가 포함된 무작위 기사가 아니라 '완벽한' 기사를 찾도록 만드는 것입니다.

문제는 무엇일까요? 기사와 독자가 너무 많다는 점입니다. 모든 검색 결과가 좋은지 확인하기 위해 인간 편집자가 일일이 읽을 수는 없습니다. 만약 단순한 수학적 방식(예: 사람들이 링크를 얼마나 클릭했는지 세는 것)에 의존한다면, 키워드만 포함된 부적절한 기사에 속을 수 있습니다.

이것이 바로 LinkedIn이 이 문제를 해결하기 위해 구축한 새로운 시스템, SAGE에 대한 이야기입니다. SAGE를 **"슈퍼 에디터(Super-Editor)"**라고 생각하십시오. 이 시스템은 인간 전문가처럼 사고하는 법을 배우지만, 로봇의 속도로 작동합니다.

SAGE가 어떻게 작동하는지 단계별로 쉽게 설명해 드리겠습니다.

1. 문제점: "인간 vs 로봇"의 간극

보통 기업들이 검색 엔진을 만들 때 두 가지 것에 의존합니다:

  • 인간 편집자: 품질을 판단하는 데는 뛰어나지만, 느리고 비용이 많이 듭니다. 수백만 개의 결과를 다 읽을 수 없습니다.
  • 참여 지표(Engagement Metrics): 클릭 수와 조회수를 집계합니다. 하지만 이는 마치 흥행 성적으로 영화를 평가하는 것과 같습니다. 나쁜 영화라도 실수로 클릭을 유도한다면 인기를 끌 수 있습니다. 이는 영화가 실제로 '좋은지'를 알려주지 않습니다.

LinkedIn은 인간의 품질 판단 능력기계의 속도를 모두 갖춘 방법이 필요했습니다.

2. 해결책: "SAGE" 프레임워크

SAGE는 Scalable AI Governance & Evaluation(확장 가능한 AI 거버넌스 및 평가)의 약자입니다. 이는 검색 결과의 완벽한 "규칙"을 만들기 위해 협력하는 세 부분의 팀입니다.

A 부분: 정책 (The Policy - 규칙집)

이것은 평이한 영어로 작성된 일련의 규칙입니다. 단순히 "키워드를 맞출 것"이라고 말하는 대신, "사용자가 신입 직무를 찾는다면, 결과물에 10년 경력이 요구되어서는 안 된다"와 같이 정의합니다. 즉, 무엇이 "좋은 것"인지 정확히 규정합니다 합니다.

B 부분: 선례 (The Precedent - 샘플 답변)

선생님이 학생에게 만점 받은 에세이 몇 개와 그 이유를 주는 상황을 상상해 보십시오. SAGE는 인간 전문가들이 정성스럽게 만든 "골드 스탠다드(Gold Standard)" 예시 세트를 사용합니다. 이 예시들은 AI에게 까다로운 상황에서 규칙집을 어떻게 적용해야 하는지 정확히 보여줍니다.

C 부분: 대리 판사 (The Surrogate Judge - 학생)

이것은 판사 역할을 하는 AI(대규모 언어 모델, LLM)입니다. 이 AI는 검색 결과를 읽고 규칙집 및 샘플 답변과 비교합니다.

3. 핵심 비결: "양방향 훈련 (Two-Way Training)"

과과거에는 단순히 AI에게 규칙을 알려주고 이해하기를 바랐습니다. 하지만 SAGE는 **양방향 교정 루프(Two-Way Calibration Loop)**를 사용합니다.

  • 인간에서 AI로: 인간이 AI에게 규칙을 가르치고 예시를 보여줍니다.
  • AI에서 인간으로: AI가 실제로 인간을 비판합니다!
    • 만약 AI가 인간 전문가가 실수한 것(예: 긴 채용 공고에서 숨겨진 세부 사항을 놓친 경우)을 발견하면, 이를 알립니다.
    • 만약 AI가 규칙이 모호해서 혼란을 느낀다면, 인간에게 "이 규칙집은 이 특정 사례를 다루지 못하고 있습니다"라고 말합니다.

이 과정을 통해 규칙집, 예시, 그리고 AI 판사가 함께 더 똑똑해지는 순환 구조가 만들어집니다. 이들은 서로의 실수를 바로잡으며 거의 완벽하게 일치할 때까지(인간 전문가와 약 77%의 일치율을 보이며, 이는 이 분야에서 '상당한 수준'으로 간주됨) 서로를 개선합니다.

4. 속도의 기술: "증류 (Distillation - 스승에서 제자로)"

인간으로부터 학습한 "스승" AI는 매우 똑똑하지만 실행 속도가 느리고 비용이 많이 듭니다. 마치 논문을 채점하는 데 몇 시간이 걸리는 천재 교수와 같습니다. 하지만 LinkedIn은 초당 수백만 개의 논문을 채점해야 합니다.

그래서 그들은 증류(Distillation) 기술을 사용했습니다.

  • 상상해 보십시오. 스승 AI(천재 교수)가 자신의 사고 과정을 제자(빠르고 효율적인 인턴)에게 설명합니다.
  • 제자는 스승의 논리를 모방하는 법을 배우지만, 훨씬 더 작고 빨라집니다.
  • 결과: 제자 판사는 스승보다 92배 더 저렴하고 빠르지만, 여전히 인간 전문가만큼 자주 정답을 맞힙니다.

5. 이것이 LinkedIn을 어떻게 변화시켰나

이 빠르고 똑똑한 제자 판사를 구축한 후, LinkedIn은 이를 세 가지 강력한 방식으로 활용했습니다.

  1. 안전망 (오프라인 테스트): 새로운 검색 기능을 출시하기 전, 제자 판사를 통해 테스트를 진행합니다. 만약 AI가 "이 새로운 기능이 좋지 않은 결과를 보여주고 있다"라고 말하면, 즉시 중단할 수 있습니다. 실제 사용자의 불만을 기다릴 필요가 없습니다. 이를 통해 테스트 시간을 2주에서 3일로 단축했습니다.
  2. 실시간 게이트키퍼 (온라인 서빙): 이 AI를 더욱 압축하여 실시간으로 실행될 수 있을 만큼 작게 만들었습니다. 이제 사용자가 검색할 때마다, 이 작은 버전의 AI가 결과가 규칙을 따르는지 즉각적으로 확인합니다.
  3. 조기 경보 시스템: 이 AI를 사용하여 시스템을 24시간 감시합니다. 때때로 클릭 수 기반의 업데이트는 괜찮아 보일 수 있지만, AI는 품질이 떨어지고 있다는 것을 포착합니다. 이는 인간의 지표가 놓친 문제를 잡아내어 사용자 경험이 악화되는 것을 방지합니다.

결론

이 시스템을 통해 LinkedIn은 단순히 검색을 "더 빠르게" 만든 것이 아니라, 더 똑똑하고 신뢰할 수 있게 만들었습니다.

논문에 따르면, SAGE를 통해 고품질 규칙을 강제함으로써 LinkedIn의 일일 활성 사용자 수(DAU)가 0.25% 증가했습니다. 수억 명의 사용자가 있는 플랫폼의 세계에서, 이 작은 퍼센티지는 수많은 사람들이 자신이 찾던 것을 발견하고, 사이트에 머물며, 계속 다시 찾아오게 되었다는 엄청난 수치를 의미합니다.

요약하자면: SAGE는 "무엇이 좋은 검색 결과인지 결정하는" 복잡하고 주관적인 업무를 명확하고 자동화되었으며, 스스로 실수를 통해 배우고 계속 발전하는 확장 가능한 프로세스로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →