← 최신 논문
🤖 AI

A Better Spur Should Start From Each Objective

본 논문은 데이터, 그래디언트, 그리고 제약 조건 수준에서 개입하여 다양한 작업에 걸쳐 안정적이고 고성능의 정렬을 달라는 실세계 다중 목적 강화 학습(Multi-Objective Reinforcement Learning)의 희소한 보상과 최적화 충돌 문제를 해결하는 세밀한 프레임워크인 다중 마진 선호 최적화(Multi-Marginal Preference Optimization, MMPO)를 제안한다.

원저자: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

게시일 2026-09-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 시장에서 제품 페이지는 종종 기술적 사양과 마케팅 전문 용어로 가득 찬 밀도 높은 텍스트의 벽이 되어 쇼핑객을 압도하곤 합니다. 복잡한 정보와 인간의 이해 사이의 간극을 메우기 위해, 인공지류는 점차 두 가지 과업을 수행하도록 요구받고 있습니다. 바로 제품 설명에서 가장 중요한 단어를 식별하고, 그 단어들에 대해 짧고 명확한 설명을 작성하는 것입니다. 이것은 단순한 텍스트 편집 작업이 아닙니다. 이는 하나의 균형 잡기입니다. 시스템은 추출된 단어가 정확하고 제품 기능의 전체 범위를 포괄하도록 보장하는 것과 같은 엄격한 오프라인 규칙을 준수하는 동시에, 사용자 클릭을 극대화하고 불만족을 최소ze하는 것과 같은 온라인 목표를 추구해야 합니다. 이러한 목표들은 종 대개 서로 반대 방향으로 작용합니다. 많은 클릭을 유도하는 특징은 너무 일반적이어서 정확도가 떨어질 수 있고, 매우 정확한 기술 용어는 일반적인 브라우저의 흥미를 끌기에 너무 난해할 수 있습니다. 컴퓨터 프로그램이 이 모든 상충하는 목표를 동시에 최적화하려고 시도할 때, 종종 심하게 요동치거나 하나의 지표를 개선하면 다른 지표가 무너지는 루프에 빠져 헤매게 됩니다.

하얼빈 공업대학교, JD.com, 그리고 중국 과학원 연구진은 이러한 특정한 목표 충돌 문제를 해결하기 위한 새로운 방법을 개발했습니다. 그들은 자신들의 접근 방식을 '다중 한계 선호도 최적화(Multi-Marginal Preference Optimization)'라고 부르는데, 이는 컴퓨터가 모든 목표를 하나의 엉망진창인 지침 더미로 취급하는 것을 막기 위해 설계된 시스템입니다. 모델에게 모든 것에 타협하는 단 하나의 '최선'의 답을 찾도록 강요하는 대신, 이 새로운 프레임워크는 각 목표를 고속도로 위의 별도 차선처럼 취급합니다. 이 시스템은 먼저 데이터가 들어오는 과정을 정제하여, 클릭이나 '좋아요'와 같이 액면 그대로 받아들이면 오해의 소지가 있는 실제 사용자 행동으로부터 오는 노이즈가 많고 희소한 신호를 매끄럽게 다듬습니다. 컴퓨터가 이러한 보상을 인식하는 방식을 조정함으로써, 시스템은 드물게 나타나지만 가치 있는 정보가 흔한 용어보다 적게 등장한다는 이유만으로 무시되지 않도록 보장합니다.

핵심 혁신은 시스템이 학습 과정 자체를 처리하는 방식에 있습니다. 컴퓨터가 성능을 개선하려고 노력할 때, 시스템은 목표를 바탕으로 수학적 업데이트를 생성합니다. 기존 방식에서는 이러한 업데이트를 단순히 합쳤기 때문에, 한 목표를 위한 지침이 다른 목표를 위한 지침을 상쇄하거나 왜곡하는 경우가 많았습니다. 새로운 방법은 이러한 업데이트를 적용하기 전에 분리합니다. 시스템은 학습 신호 중 어떤 부분이 기본적인 정확성에 필수적인지, 그리고 어떤 부분이 사용자 선호도에 특화된 것인지를 식별한 다음, 선호도 신호를 핵심 규칙을 방해하지 않는 공간으로 투영합니다. 이를 통해 모델은 정확성을 유지하는 법을 잊지 않으면서도 사용자에게 더 흥미로운 존재가 되는 법을 배울 수 있습니다.

나아가, 연구진은 모델이 훈련 후반부에 너무 공격적으로 변하는 것을 방지하기 위한 안전 장치를 추가했습니다. 모델이 발전함에 따라 때때로 한 가지 목표에 너무 강렬하게 집착하여 다른 목표들을 소홀히 하게 되고, 이로 인해 전반적인 품질이 급격히 떨어지는 경우가 발생합니다. 새로운 시스템은 지침을 따르는 모델 자체의 능력을 사용하여 경계선을 설정합니다. 시스템은 모델에게 이상적인 조건에서의 완벽한 행동 사례를 생성하도록 요청하고, 이 사례들을 사용하여 향후 업데이트를 위한 안전 구역을 정의합니다. 만약 모델이 한 방향으로 너무 강하게 밀어붙이려 한다면, 이 내부 가이드가 부드럽게 다시 끌어당겨서 진전이 모든 지표에서 꾸준하고 균형 있게 유지되도록 합니다.

이 접근 방식의 결과는 65,232개의 훈련 제품과 8,879개의 평가 제품, 그리고 지난 3개월 동안 수집된 사용자 행동 데이터를 포함하는 실제 이커머스 제품 데이터셋을 통해 테스트되었습니다. 시스템은 여러 고급 방법들과 비교되었으며, 훨씬 더 안정적이고 효과적이라는 것이 입증되었습니다. 오프라인 테스트에서 이 시스템은 94.11%의 완결성 점수와 73.43%의 정확도를 달ี่하여 이전 방법들을 큰 차이로 앞질렀습니다. 결정적으로, 시스템은 22.82%라는 거의 완벽에 가까운 목표 커버리지 비율을 달성했는데, 기존 방법들은 이 수치에 미치지 못하거나 초과하는 모습을 보였습니다. 이러한 개선은 단지 이론적인 것에 그치지 않았습니다. 실제 쇼핑객이 참여하는 라이브 온라인 테스트에 배치되었을 때, 이 새로운 방식에 의해 구동되는 시스템은 이전 표준과 비교하여 주문 건수를 3.14%, 총 주문 가치를 5.07% 증가시켰습니다.

이 프레임워크의 성공은 온라인 쇼핑을 넘어 확장됩니다. 연구진은 이를 도구 사용 및 컴퓨터 코드 생성과 같이 여러 제약 조건을 동시에 충족해야 하는 작업에도 적용했습니다. 이러한 테스트에서 이 방법은 표준적인 접근 방식보다 일관되게 더 나은 결과를 만들어냈으며, 특히 모델이 하나의 쉬운 해결책을 찾아 끊임없이 반복하는 '모드 붕괴(mode collapse)' 현상을 피하는 데 탁-월했습니다. 대신, 새로운 시스템은 엄격한 규칙을 준수하면서도 다양하고 고품질인 출력물을 유지했습니다. 상충하는 목표를 분리하고 이를 균형 있게 조절하는 구조화된 방식을 제공함으로써, 이 연구는 여러 개의 경쟁하는 목표가 일반적인 복잡한 실제 환경에서 인공지능을 더욱 신뢰할 수 있게 만드는 실질적인 솔루션을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →