← 최신 논문
💬 NLP

Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding

이 논문은 핵심적인 모델 역량을 유지하면서도 공평한 생성을 촉진하기 위해 시각적 표현 공간 내에서 다중 그룹 반사실적 관점을 구축하고 앙상블함으로써 대규모 시각-언어 모델의 사회적 편향을 완화하는 새로운 프레임워크인 반사실적 앙상블 디코딩(Counterfactual Ensemble Decoding, CED)을 제안한다.

원저자: Yisong Xiao, Aishan Liu, Yongxin Huang, Zonghao Ying, Shiji Zhao, Tianlin Li, Yong Han, Jian Yang, Xianglong Liu

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yisong Xiao, Aishan Liu, Yongxin Huang, Zonghao Ying, Shiji Zhao, Tianlin Li, Yong Han, Jian Yang, Xianglong Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 놀라운 유창함으로 보고 말할 수 있는 새로운 세대의 시스템이 등장했습니다. 이러한 거대 시각-언어 모델은 시각적 세계와 인간의 언어 사이를 잇는 가교 역할을 하며, 이미지에 대한 질문에 답하거나 장면을 상세하게 묘사할 수 있습니다. 이들은 인터넷의 방대한 사진과 텍스트 모음을 통해 학습하며, 사진 다음에 어떤 단어가 와야 하는지를 예측하는 법을 배웁니다. 하지만 인간의 데이터로부터 학습하기 때문에, 이들은 인간의 결함 또한 물려받습니다. 사람들이 무의식적인 편견을 가질 수 있듯이, 이 기계들도 사회적 고정관념을 흡수하여 특정 직업, 특성 또는 감정을 특정 성별이나 인종과 연관 짓는 법을 배우곤 합니다. 모델이 여성의 사진을 보면 그녀를 의사가 아닌 간호사로 자동적으로 추측하거나, 남성을 볼 때 그를 CEO라고 가정하는 식입니다. 이는 단순한 기술적 오류가 아니라, 해로운 편견을 강화하고 기술에 대한 신뢰를 무너뜨릴 수 있는 현실 세계의 불평등을 반영하는 것입니다.

연구자들은 모델을 더 깨끗한 데이터로 재학습시키거나, 기계에게 공정해지라는 특별한 지침을 추가함으로써 이 문제를 해결하려고 오랫동안 노력해 왔습니다. 그러나 이러한 방법들은 종 often 비용이 많이 들고, 규모를 키우기 어려우며, 무엇이 '공정'한지에 대한 단일하고 경직된 정의에 의존하는 경우가 많습니다. 한 새로운 연구는 모델에서 지식을 제거하려 하는 대신, 모델이 동시에 여러 관점을 고려하도록 초대하는 다른 접근 방식을 제안합니다. 베이항 대학교의 이송 샤오(Yisong Xiao)와 동료들이 이끄는 연구진은 '역사실적 앙상블 디코딩(Counterfactual Ensemble Decoding)'이라 불리는 기술을 개발했습니다. 모델에게 단순히 편향되지 말라고 요구하는 대신, 그들은 모델이 동일한 장면을 서로 다른 사회적 집단의 관점에서 동시에 상상하도록 요청합니다. 기계가 다음 단어를 선택하는 순간에 이러한 다양한 관점들을 혼합함으로써, 시스템은 단일하고 고정관념적인 서사의 지배로부터 벗어날 수 있습니다.

이 방법의 핵심은 단순하지만 강력한 아이디어, 즉 '다양성이 공정성을 촉진한다'는 데 있습니다. 현실 세계에서 만약 다양한 배경을 가진 사람들로 방이 가득 차 있다면, 대화가 하나의 좁은 관점에 의해 독점될 가능성은 낮아집니다. 연구진은 이 원리를 인공지능의 디지털 정신에 적용했습니다. 모델이 비즈니스 수트를 입은 사람의 사진과 같은 이미지를 볼 때, 보통은 훈련된 내용에 기반하여 단일한 생각의 흐름을 생성합니다. 새로운 시스템은 이 결정적인 순간에 개입하여 이미지의 내부 표현에 대한 '역사실적(counterfactual)' 버전을 생성합니다. 이것은 새로운 사진이 아니라, 컴퓨터가 이미지를 보는 방식에 대한 수학적 조정을 통해, 나머지 장면은 똑같이 유지하면서도 그 사람이 다른 성별이나 인종에 속하는 것으로 상상하도록 초점을 옮기는 것입니다. 이를 통해 모델은 원래 이미지에 대한 것뿐만 아니라, 만약 그 사람이 다른 사회적 집단이었다면 이미지가 암시했을 법한 모습에 대한 예측까지 포함하여 병렬적인 예측 세트를 생성할 수 있습니다.

이러한 다중 관점이 생성되면, 시스템은 정확성을 저해하지 않으면서 어떻게 이들을 결합할 것인가라는 과제에 직면합니다. 연구진은 이러한 서로 다른 관점 사이의 충돌이 모델의 처리 과정 전체에서 균일하게 나타나지 않는다는 것을 발견했습니다. 신경망의 일부 층, 즉 깊은 사고의 단계 역할을 하는 층들은 원래의 관점과 역사실적 관점 사이의 가장 강한 불일치를 보여줍니다. 시스템은 이 긴장감이 가장 높은 특정 층들을 식별합니다. 이 극대화된 발산의 지점에서, 방법론은 예측을 신중하게 혼합합니다. 단순히 평균을 내는 것이 아니라, 확신도에 따라 옵션의 가중치를 둡니다. 만약 모델이 한 관점에서는 특정 단어에 대해 매우 확신하지만 다른 관점에서는 확신이 없다면, 시스템은 확신이 있는 선택을 우선시합니다. 이를 통해 최종 출력물이 모호한 타협안이 아니라, 고려된 모든 다양한 관점의 통찰력을 존중하는 균형 잡힌 결정이 되도록 보장합니다.

이 접근 방식의 결과는 직업, 묘사 및 개인적 특성에 관한 편향을 측정하도록 설계된 여러 엄격한 벤치마크를 통해 테스트되었습니다. 직업 타이틀에 대한 성별 편향을 다룬 테스트에서, 이 새로운 방법은 편향을 평균 61.21% 감소시켰으며, 이는 기존 기술보다 상당한 개선입니다. 인종 고정관념을 측정하는 테스트에서는 편향이 거의 48% 감소했습니다. 예를 들어, 여성 CEO를 묘사할 때 기존 방식은 여전히 '매력적인'과 같은 고정관념적인 형용사에 치우칠 수 있지만, 이 새로운 시스템은 '유능한'과 같은 중립적이고 전문적인 용어로 묘사를 성공적으로 유도했습니다. 결정적으로, 연구진은 이러한 공정성이 지능의 희생을 수반하지 않는다는 것을 발견했습니다. 모델은 일반적인 질문에 답하고 복잡한 문제를 해결하는 능력을 유지했으며, 전체적인 성능 저하는 미미하거나 거의 무시할 수 있는 수준이었습니다. 실제로 일부 추론 테스트에서는 편향이 제거된 모델이 이전보다 약간 더 나은 성능을 보였는데, 이는 고정관념이라는 노이즈를 제거하는 것이 모델이 사실에 더 명확하게 집중하도록 도울 수 있음을 시사합니다.

이 연구는 인공지능의 공정성을 확보하는 것이 모델의 지식을 버리거나 처음부터 다시 시작할 필요가 없음을 보여줍니다. 시스템이 한 번에 여러 관점을 마음속에 품도록 강제하는 메커니즘을 도입함으로써, 연구진은 기계가 가장 뿌리 깊은 습관으로 되돌아가지 않고도 인간 사회의 복잡성을 탐색할 수 있음을 보여주었습니다. 이 방법은 모델의 내부 논리가 가장 갈등하는 정확한 순간을 찾아내고, 다양한 견해의 가중치 있는 혼합을 통해 그 갈등을 해결하는 방식으로 작동합니다. 현재 이 기술은 모델의 내부 작동 방식에 대한 접근을 필요로 하므로 연구자와 개발자에게는 제한적이지만, 이는 앞으로 나아갈 수 있는 유망한 경로를 제시합니다. 이는 윤리적 AI의 미래가 단지 더 엄격한 규칙이나 더 깨끗한 데이터에 있는 것이 아니라, 이러한 시스템이 더 넓고 포용적인 렌즈를 가지고 생각하도록 가르치는 데 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →