← 최신 논문
💬 NLP

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

본 논문은 계층적 가치 추출, 대규모 강도 레이블 데이터베이스, 그리고 정교하게 보정된 평가 시스템을 통합하여 대규모 언어 모델의 다원적이고 조종 가능한 가치 강도 제어를 가능하게 함으로써 가치 기반 정렬의 주요 공백을 해결하는 통합 프레임워크인 VALUEFLOW를 소개한다.

원저자: Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 다소 경직된 로봇에게 인간처럼 행동하는 법을 가르치려 한다고 상상해 보십시오. 문제는 단순히 로봇에게 "착하게" 행동하라고 가르치는 것이 아닙니다. 인간은 **가치(values)**라는 복잡하고 때로는 상충하는 내면의 나침반을 가지고 있습니다.

어떤 사람들은 친절함을 깊이 중요하게 여기는 반면, 어떤 이들은 정의를, 또 어떤 이들은 권력을 중요하게 여깁니다. 까다로운 점은 이러한 가치들이 단순히 "켜짐/꺼짐" 상태의 스위치가 아니라는 것입니다. 당신은 약간 친절할 수도 있고, 매우 친절할 수도 있습니다. 당신은 대체로 정의롭지만, 조금 이기적일 수도 있습니다.

현재의 AI 정렬(alignment) 방식은 로봇에게 "좋음/나쁨" 버튼 하나만을 가르치는 것과 같습니다. 이는 너무 투박합니다. VALUEFLOW라는 논문은 AI가 인간의 가치를 적절한 **강도(intensity)**로 이해하고 표현할 수 있도록 돕는 훨씬 더 정교한 도구 세트를 소개합니다.

VALUEFLOW가 어떻게 작동하는지 세 가지 간단한 부분으로 나누어 설명하겠습니다.

1. 지도: HIVES (계층적 가치 임베딩 공간)

당신이 거대한 인간의 생각들이 담긴 도서관을 가지고 있다고 상상해 보십시오. 하지만 책들이 여기저기 흩어져 있습니다. 어떤 책은 "친절함"에 관한 것이고, 어떤 책은 "이웃 돕기"에 관한 것이며, 또 어떤 책은 "기부"에 관한 것입니다. 단순한 검색은 "친절함"과 "정의"가 서로 관련되어 있지만 다르다는 점을 혼동할 수 있습니다.

HIVES는 마치 초정밀하게 정리된 도서관 지도와 같습니다. 이 지도는 단순히 가치를 나열하는 것이 아니라, 그 계층 구조를 이해합니다. "친절함"이 큰 우산이라면, 그 아래에 "배려"와 "도움"이 있다는 것을 알고 있습니다. 이는 가치들을 3D 공간 안에 조직하여, 유사한 가치는 서로 가깝게, 매우 다른 가치는 서로 멀게 배치합니다. 이를 통해 AI는 단순히 단어를 아는 것을 넘어, 인간 가치의 구조를 이해하게 됩니다.

2. 참조 도서관: VIDB (가치 강도 데이터베이스)

이제 당신이 AI에게 "적당히 친절하되, 정의에 대해서는 매우 엄격해라"라고 말하고 싶다고 가정해 봅시다. 그렇다면 AI는 "적당히"가 무엇을 의미하는지 어떻게 알 수 있을까요?

이전의 AI 판독기들은 단순히 점수(예: "10점 만점에 7점")를 추측하곤 했습니다. 하지만 AI마다 추측하는 방식이 달랐고, 그 점수 또한 불안정했습니다.

VIDB는 사전에 보정된 방대한 텍스트 예시 모음입니다. 여기에는 특정 가치에 대한 정밀한 "강도 점수"(-10에서 +10 사이)가 라벨링된 수천 개의 문장이 포함되어 있습니다.

  • 비유: VIDB를 저울 위의 표준 무게추라고 생각해 보십시오. 어떤 문장이 "정의"라는 측면에서 얼마나 "무거운지" 알고 싶을 때, 단순히 추측하는 것이 아니라 이 표준 무게추들과 비교합니다.
  • 작동 방식: 시스템이 AI에게 "이 텍텍스트가 정의로운가?"라고 묻는 대신(이는 잘못된 추측을 유발합니다), 표준 라이브러리의 몇 가지 표준 예시와 새로운 텍스트를 순위 매기기(ranking) 하도록 요청합니다. "이 텍스트가 예시 A보다는 더 정의롭지만, 예시 B보다는 덜 정의로운가?"와 같이 묻는 식입니다. 이 순위 매기기 방식은 숫자를 직접 추측하는 것보다 훨씬 안정적이고 신뢰할 수 있습니다.

3. 조종 핸들: 강도 인지형 스티어링 (Intensity-Aware Steering)

이 부분은 실제로 당신이 AI를 제어하는 단계입니다.

과거에는 AI에게 "친절해져라"라고 말하면, AI가 너무 친절하거나 혹은 충분히 친절하지 못할 수 있었습니다. VALUEFLOW를 사용하면 당신에게 다이얼을 제공할 수 있습니다.

  • 비유: 자동차를 운전한다고 상상해 보십시오. 기존 방식은 "꺼짐"과 "풀 액셀"만 있는 가속 페달과 같았습니다. VALUEFLOW는 속도계가 달린 스티어링 휠을 제공합니다. 당신은 "친절함의 강도를 +8로 해서 운전해" 또는 "정의의 강도를 -2로 해서 운전해"(즉, 불의를 거부하라)라고 말할 수 있습니다.

논문 저자들은 이를 다양한 AI 모델에 테스트했으며 다음과 같은 사실을 발견했습니다:

  • 모델마다 제어하기 쉬운 정도가 다릅니다. 어떤 모델은 당신의 지시에 잘 반응하는 반면, 어떤 모델은 고집스럽습니다.
  • 가치들은 서로 충돌합니다. 만약 당신이 AI에게 "매우 친절하되" 동시에 "매로 엄격하라"고 명령한다면, AI는 균형을 찾아야 합니다. 논문은 때때로 한 가치가 승리하기도 하고, 때로는 예측 가능한 방식으로 두 가치가 혼합되기도 한다는 것을 밝혀냈습니다.
  • 그룹 단위로도 작동합니다. 연구진은 이를 사용하여 서로 다른 집단(예: 서로 다른 정치 정당이나 문화권)이 가진 가치를 파악한 뒤, AI가 그 집단처럼 말하도록 유도했습니다. 이를 통해 해당 집단이 할 법한 예측을 수행할 때 AI의 정확도가 훨씬 높아졌습니다.

종합적인 그림

저자들은 다음과 같은 완전한 시스템을 구축했습니다:

  1. 가치를 구조화된 공간으로 매핑합니다 (HIVES).
  2. 표준 라이브러리와 비교하여 텍스트에 담긴 가치의 강도를 측정합니다 (VIDB).
  3. AI가 특정 강도로 그 가치들을 표현하도록 조종합니다 (Steering).

이들은 이것이 모든 AI 안전 문제를 해결할 것이라거나, 사람들을 조종하는 데 사용해야 한다고 말하는 것이 아닙니다. 대신, AI가 무언가에 대해 "조금"인지 혹은 "많이"인지를 요구받을 때 어떻게 행동하는지 연구하기 위한 과학적 도구 세트를 제공하는 것입니다. 이는 AI가 단순히 "좋음 대 나쁨"이라는 단순한 규칙을 따르는 것을 넘어, 인간 가치의 미묘한 차이(nuance)를 이해할 수 있게 만드는 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →