← 최신 논문
💻 computer science

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1은 응답과 선호도 목적 함수를 분리하여 절대 점수 회귀와 상대적 순위 매기기를 통합함으로써, 이미지 및 비디오 품질 평가 모두에서 강력한 일반화 능력과 인간 정렬된 추론 능력을 바탕으로 최첨단 성능을 달성하는 새로운 강화 학습 프레임워크입니다.

원저자: Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리가 사진이나 동영상을 볼 때, 우리의 뇌는 즉각적으로 그 품질을 판단합니다. 우리는 색상이 탁한지, 가장자리가 흐릿한지, 혹은 이미지가 거친지를 알아차립니다. 이러한 본능적인 판단을 연구자들은 시각적 품질 평가(visual quality assessment)라고 부릅니다. 수십 년 동안 컴퓨터는 이러한 인간의 능력을 복제하기 위해 고군분투해 왔습니다. 초기 시도들은 픽셀 오류를 측정하는 경직된 수학적 공식에 의존했지만, 이러한 방식은 사람들이 실제로 느끼는 아름다움과 선명도를 반영하는 데 자주 실패했습니다. 최근에는 이미지를 보고 설명하도록 훈련된 대규모 멀티모달 모델(large multimodal models)이라는 강력한 인공지능 모델들이 등장했습니다. 그러나 이 모델들에게 특정 품질 점수를 부여하도록 요청하면, 종종 일관성이 떨어지는 모습을 보입니다. 만약 동일한 모델에게 같은 사진을 두 번 평가하게 한다면, 모델은 서로 매우 다른 숫자를 제시하거나, 그 근거가 최종 점수와 모순될 수도 있습니다. 이러한 불안정성은 스마트폰 카메라 성능을 개선하거나 스트리밍 비디오의 품질을 보장하는 것과 같은 실제 응용 분야에서 이 시스템들을 신뢰하기 어렵게 만듭니다.

상하이 교통 대학교(Shanghai Jiao Tong University)의 연구진은 이 문제를 해결하기 위해 PreResQ-R1이라 불리는 새로운 접근 방식을 개발했습니다. 인공지능에게 단순히 숫자를 추측하거나 맹목적으로 순위를 따르도록 강요하는 대신, 연구진은 모델이 두 가지 별개의 작업, 즉 자신의 추론을 안정화하는 것과 자신의 선호도를 인간의 판단에 맞추는 작업을 분리하도록 가르쳤습니다. 연구진은 이전 시스템의 불안정성이 모델이 동일한 이미지에 대해 매우 다른 설명을 생성하려는 경향에서 비롯된다는 것을 발견했습니다. 이를 해결하기 위해, 연구진은 모델이 내부 논리 측면에서 일관성을 유지하도록 보상하면서 동시에 최종 점수가 인간이 내릴 법한 판단과 일치하도록 보장하는 훈련 과정을 설계했습니다. 이 시스템은 이미지를 다섯 가지 구체적인 부분으로 나누어 평가합니다: 색상이 얼마나 생생한지, 노이즈나 입자가 얼마나 보이는지, 세부 사항이 얼마나 날카로운지, 주요 피사체가 얼마나 명확한지, 그리고 배경이 얼마나 깨끗한지입니다. 이 다섯 가지 측면을 개별적으로 평가한 후 이를 결합함으로써, 모델은 더 신뢰할 수 있고 상세한 품질의 그림을 그려내는 법을 배웁니다.

연구진은 흐릿함이나 저조도와 같은 자연적인 왜곡이 있는 이미지와 영상, 그리고 다른 인공지능 도구에 의해 생성된 이미지와 영상을 포함한 매우 다양한 종류의 이미지와 영상을 대상으로 이 새로운 방법을 테스트했습니다. 그 결과, 이 시스템이 기존 방식들을 크게 능가한다는 것을 발견했습니다. 정지 영상에 대한 테스트에서, 이 새로운 모델은 기존의 가장 뛰어난 접근 방식들과 비교하여 정확도를 5.60% 향상시켰습니다. 움직임과 시간을 판단해야 하는 과제가 더 큰 비디오 품질의 경우, 정확도는 2.53% 향상되었습니다. 결정적으로, 모델은 단순히 더 나은 숫자만을 만들어낸 것이 아니라 더 나은 설명을 만들어냈습니다. 풍경이 흐릿한 사진을 보여주었을 때, 모델은 단순히 이미지가 "나쁘다"는 식의 모호한 코멘트를 하는 대신, 나뭇잎의 초점이 맞지 않고 배경의 디테일이 부족하다는 점을 정확히 식별해 냈습니다. 이처럼 구조화되고 근거에 기반한 이유를 제공하는 능력은 시스템을 훨씬 더 신뢰할 수 있게 만듭니다.

이 연구의 성공은 학습 과정을 모방한 2단계 훈련 전략에 달려 있습니다. 먼저, 모델은 이미지를 바라보는 다양한 방식을 탐색하고, 광범위한 가능한 점수와 이유를 생성하도록 권장됩니다. 이 단계에서 시스템은 답변이 너무 흩어져 있거나 일관되지 않을 경우 벌점을 부여하여, 모델이 안정적인 사고 방식으로 나아가도록 부드럽게 유도합니다. 모델이 신뢰할 수 있는 내부 리듬을 찾고 나면, 두 번째 단계는 그 선호도를 미세 조정하는 데 집중합니다. 여기서 시스템은 자신의 판단을 인간의 등급과 비교하며, 자신의 점수를 조정하여 인간의 지각과 일치하도록 학습합니다. "명확하게 생각하는 것"과 "정확하게 점수를 매기는 것"을 분리함으로써, 모델은 이미지 품질가 주관적이거나 왜곡이 복잡한 어려운 사례들을 처리할 수 있습니다. 연구진은 또한 비디오의 모든 움직임을 재구성할 필요 없이, 시간의 흐름에 따른 움직임의 흐름과 개별 프레임 내의 세부 사항을 분석함으로써 이 방법을 비디오로 확장했습니다.

이 연구의 함의는 단지 더 나은 점수를 얻는 것에 그치지 않습니다. 인간의 지각과 일치하는 방식으로 추론을 설명할 수 있는 시스템을 만듦으로써, 이 기술은 디지털 미디어 분야의 더 견고한 응용 가능성을 열어줍니다. 이는 인공지능이 시각적 품질을 이해하게 만드는 핵심이 단순히 더 많은 데이터를 입력하는 것이 아니라, 최종 판단을 내리기 전에 스스로의 추론에 일관성을 갖도록 가르치는 것임을 시사합니다. 이 연구는 모델이 내부 논리를 안정화한 다음 그 논리를 인간의 선호도에 맞추도록 훈련받을 때, 이전에는 도달할 수 없었던 수준의 신뢰성을 달 수 있음을 보여줍니다. 이러한 접근 방식은 이미지를 자동으로 개선하고, 비디오 콘텐츠를 큐레이션하며, 우리가 화면에서 보는 것이 진정으로 우리가 기대하는 품질을 반영하도록 보장하는 도구를 개발하는 데 있어 유망한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →