비유: 마치 손상된 사진을 고치기 위해 모든 약국에 들러서 "이 약이 맞을까? 아니면 저 약이 맞을까?"라고 하나씩 물어보는 의사 같습니다.
문제: 사진이 조금만 흐려도 모든 치료법을 다 시도해 보느라 시간이 너무 오래 걸리고, 잘못된 약을 먼저 써서 상태를 더 악화시킬 수도 있습니다.
진단의 모호함 (Quality Score Ambiguity):
비유:전체 점수만 보고 학생을 평가하는 선생님 같습니다. "전체 점수는 80 점인데, 한쪽 눈은 완전히 안 보이고 다른 쪽 눈은 아주 선명하다"는 사실을 모릅니다.
문제: AI 가 "전체적으로 사진이 나쁘다"는 점수만 보고, 어디가 어떻게 망가졌는지 (예: 눈이 비에 젖은 건지, 안개가 낀 건지) 를 정확히 구분하지 못해 엉뚱한 치료를 합니다.
2. PaAgent 의 해결책: "똑똑한 경험담장"과 "양면 평가"
PaAgent 는 이 두 문제를 해결하기 위해 두 가지 혁신적인 장치를 도입했습니다.
① '포트레이트 뱅크 (Portrait Bank)': 방대한 경험담이 담긴 두꺼운 수첩
개념: 이 시스템은 과거에 수만 번의 사진 고치기 작업을 해오며 쌓은 **'성공/실패 경험담'**을 저장해 둡니다.
비유:10 만 권 이상의 사례가 담긴 거대한 도서관이나, 수천 년의 경험을 가진 노련한 장인을 상상해 보세요.
새로운 사진이 들어오면, PaAgent 는 처음부터 모든 약을 다 찾아보는 게 아니라, **"이런 종류의 손상 (예: 눈 + 안개) 을 겪었을 때, 과거에 어떤 약이 가장 잘 먹었지?"**라고 도서관에서 바로 찾아봅니다.
RAG(검색 증강 생성) 기술을 써서, 가장 비슷한 과거 사례를 찾아내어 "이번엔 이 약 (복원 도구) 을 써야 해!"라고 바로 결정합니다. 덕분에 시간도 절약되고 실수도 줄어듭니다.
② '주관 - 객관 강화 학습 (SORL)': 점수표와 감성 평가를 동시에 보는 심사위원
개념: 사진이 잘 고쳐졌는지 판단할 때, 단순히 기계적인 점수 (객관적) 만 보는 게 아니라, AI 가 직접 "이 사진이 예쁘게 보이나?"라고 생각해보는 (주관적) 방식을 결합했습니다.
비유:음식 평가를 생각해 보세요.
기존 방식: "이 요리의 칼로리는 500kcal, 소금기는 3g 이다" (객관적 데이터) 만 보고 "맛있다/맛없다"를 판단합니다.
PaAgent 방식: "칼로리는 500kcal 이지만 (객관), 내가 먹어보니 국물이 너무 짜고 식감이 뻑뻑하네 (주관적 느낌)"라고 판단합니다.
효과: AI 는 기계 점수만 보고 "아, 점수가 높으니 OK"라고 넘어가는 게 아니라, **"점수는 좋지만 눈이 흐릿한 부분이 남아있네? 다시 고쳐야겠다"**라고 미세한 부분까지 감지하여 정확한 치료를 합니다.
3. 요약: PaAgent 가 왜 특별한가?
스마트한 선택: 과거의 수많은 성공 사례 (경험담장) 를 검색해서, 가장 적합한 치료법을 바로 골라냅니다. (불필요한 시행착오 제거)
정밀한 진단: 기계 점수와 AI 의 '눈'을 동시에 써서, 사진의 어디가, 어떻게 망가졌는지 정확히 파악합니다. (모호한 진단 해결)
지속적 성장: 매번 작업을 할 때마다 그 결과를 다시 경험담장에 기록해서, 시간이 지날수록 더 똑똑해집니다.
한 줄 요약:
PaAgent 는 "수만 권의 경험담을 읽은 노련한 전문가"가 "기계 점수와 자신의 감성"을 모두 믿고, 흐릿한 사진을 가장 빠르고 정확하게 고쳐주는 똑똑한 비서입니다.
이 기술 덕분에 눈, 비, 안개, 어두움 등 여러 가지 문제가 섞인 복잡한 상황에서도 사진을 선명하게 되살릴 수 있게 되었습니다.
1. 문제 정의 (Problem)
기존의 이미지 복원 (Image Restoration, IR) 에이전트들은 다중 모달 대규모 언어 모델 (MLLM) 을 활용하여 열화 (degradation) 를 인식하고 복원 도구를 호출하는 방식을 취하고 있습니다. 그러나 이러한 기존 방법들은 다음과 같은 주요 한계를 가지고 있습니다.
과도한 탐색 (Exhaustive Search): 과거 상호작용에 대한 통찰 (insight) 을 요약하고 활용하는 메커니즘이 부재하여, 최적의 복원 도구를 찾기 위해 불필요하게 많은 도구를 시도하거나 롤백 (rollback) 을 반복하는 비효율적인 탐색을 수행합니다.
열화 인식의 모호성 (Ambiguity in Degradation Perception): 기존의 에이전트들은 종종 단일한 전체 이미지 품질 점수 (No-Reference IQA scores) 에만 의존합니다. 그러나 전체 점수가 비슷하더라도 국소적인 심한 열화와 전역적인 경미한 열화는 구별이 어렵습니다. 이로 인해 에이전트가 잘못된 의사결정을 하거나, 부분적이고 비균일한 열화 상황에서 정확한 정보를 파악하지 못합니다.
역사적 경험의 부재: 각 복원 작업을 독립적인 사건으로 취급하여 과거의 성공/실패 경험을 학습 데이터로 축적하지 못합니다.
2. 제안 방법 (Methodology)
저자들은 PaAgent라는 인물 (Portrait) 인식형 IR 에이전트를 제안하며, 이는 크게 두 가지 핵심 혁신을 통해 위 한계를 해결합니다.
A. 도구 포트레이트 뱅크 (Tool Portrait Bank) 및 RAG
개념: 다양한 열화 시나리오와 해당 복원 도구 간의 매핑 관계를 저장하는 지식 베이스입니다.
구성 요소: 각 엔트리는 (1) 열화 정보, (2) 적용된 복원 도구, (3) 복원 품질에 대한 주관적 평가로 구성된 3 중체 (triplet) 형태입니다.
동작 원리:
생성 및 진화: PaAgent 가 복원 작업을 수행한 후, Qwen3.5-Plus 와 같은 MLLM 을 통해 해당 작업의 통찰 (insight) 을 요약하여 포트레이트 뱅크에 지속적으로 저장합니다.
검색 (RAG): 입력 이미지의 열화 특성을 분석할 때, RAG(Retrieval-Augmented Generation) 모듈을 통해 포트레이트 뱅크에서 관련 있는 과거 경험 (chunks) 을 검색합니다.
도구 선택: 검색된 통찰을 컨텍스트로 활용하여 Qwen3.5-Plus 가 가장 적합한 IR 도구를 선택하도록 유도합니다. 이를 통해 불필요한 도구 시도를 줄이고 효율성을 높입니다.
B. 주관 - 객관 강화 학습 (Subjective-Objective Reinforcement Learning, SORL)
목적: 열화 인식 능력을 정교화하고, 국소적 열화의 의미론적 특징을 이해하도록 합니다.
구조:
보상 생성기 (Reward Generator): 복원된 이미지에 대해 **MLLM 의 의미론적 통찰 (주관적 평가)**과 **NR-IQA 점수 (객관적 평가)**를 결합하여 정밀한 보상 신호를 생성합니다.
학습 알고리즘 (GRPO): 그룹 상대 정책 최적화 (Group Relative Policy Optimization, GRPO) 알고리즘을 사용합니다. 샘플링된 그룹 내의 여러 복원 궤적 (trajectories) 을 비교하여 상대적 이득 (advantage) 을 계산하고, 이를 통해 정책 (다음 작업 선택 및 열화 정보) 을 업데이트합니다.
효과: 단순한 수치 점수뿐만 아니라 시각적 선호도와 의미론적 맥락을 함께 고려하여, 국소적 열화와 전역적 열화를 정확히 구분하고 정밀한 의사결정을 내릴 수 있게 됩니다.
3. 주요 기여 (Key Contributions)
통찰 요약 메커니즘을 갖춘 최초의 IR 에이전트: RAG 를 활용하여 과거 상호작용 통찰을 검색함으로써, 무작위 탐색을 피하고 정보에 기반한 (informed) 도구 호출을 가능하게 했습니다.
SORL 전략 도입: 이미지 품질 점수와 의미론적 통찰을 결합한 보상 신호를 통해 에이전트의 열화 인식 능력을 극대화했습니다. 이를 통해 복잡한 시나리오에서 국소적 열화의 특성을 이해하고 정확한 결정을 내립니다.
광범위한 실험 검증: 8 개의 IR 벤치마크 (단일 열화 6 가지, 복합 열화 8 가지 시나리오 포함) 에서 기존 최첨단 방법 (All-in-One 및 기존 에이전트 기반 방법) 보다 우수한 성능을 입증했습니다.
4. 실험 결과 (Results)
데이터셋: CDD-11(복합 열화), GoPro(모션 블러), SOTS(안개), Rain13K(비), LOL(저조도) 등 총 16,230 개의 이미지 쌍을 테스트했습니다.
성능 지표: PSNR 및 SSIM 점수에서 모든 비교 대상 (PromptIR, GridFormer, RAM, AgenticIR 등 11 개 방법) 을 압도적으로 상회했습니다.
예: CDD-11 데이터셋의 복합 열화 (Low-light + Haze + Rain 등) 에서 PaAgent 는 다른 방법들보다 훨씬 높은 PSNR/SSIM 을 기록했습니다.
시각적 품질: 눈, 비, 안개, 저조도, 모션 블러 등 다양한 열화 상황에서 세부 텍스처와 구조적 디테일을 더 잘 보존하며, 색상 왜곡이나 아티팩트를 최소화했습니다.
Ablation Study:
포트레이트 뱅크: 무작위 선택 (w/ RS) 이나 고정된 매칭보다 통찰 기반 선택이 성능을 크게 향상시킵니다.
SORL: 주관적 통찰을 포함한 강화 학습 (w/ SE) 이 단순 SFT 보다 미세한 텍스처 복원과 자연스러운 조명 조절에 유리합니다.
입력 컨텍스트: NR-IQA 점수와 실행 이력 (executed tasks) 을 모두 포함할 때 열화 유형을 가장 정확하게 인식합니다.
다단계 의사결정: 단일 단계 결정 (w/ OSD) 은 조기 종료 (premature termination) 의 위험이 있으나, PaAgent 의 다단계 평가 메커니즘은 중간 결과를 평가하여 추가 복원 단계를 동적으로 수행함으로써 완전한 복원을 보장합니다.
5. 의의 및 결론 (Significance)
PaAgent 는 이미지 복원 분야에서 에이전트 기반 접근법의 새로운 패러다임을 제시합니다. 단순히 도구를 나열하는 것을 넘어, 과거의 경험을 '포트레이트' 형태로 체계화하고 강화 학습을 통해 에이전트의 지능을 진화시킴으로써, 복잡하고 다양한 실제 세계의 열화 상황에 유연하고 정확하게 대응할 수 있습니다. 이는 자동화된 이미지 복원 시스템의 정확성과 효율성을 동시에 높이는 중요한 진전으로 평가됩니다.